Skip to main content
  1. Home
  2. Computación
  3. Noticias
  4. News

Con la actualización de voz de OpenAI, Siri y Alexa deben ir a la universidad

Add as a preferred source on Google
Computer, Electronics, Laptop
DTES

OpenAI ha lanzado tres nuevos modelos de audio en su API en tiempo real, y son un gran acontecimiento para cualquiera que desarrolle aplicaciones basadas en voz. Los tres modelos son GPT-Realtime-2, GPT-Realtime-Translate y GPT-Realtime-Whisper.

Juntos, llevan la IA de voz más allá de simples respuestas de ida y vuelta hacia algo que pueda entenderte, actuar y mantener una conversación real.

Recommended Videos

Si su demo sirve de referencia, acabamos de ver la siguiente evolución en cómo funcionan los modelos de IA de voz.

¿Entonces, qué pueden hacer realmente estos modelos?

GPT-Realtime-2 es el acto principal. Incorpora razonamiento de clase GPT-5 a interacciones de voz en directo, lo que significa que puede gestionar peticiones más difíciles sin perder el hilo de la conversación.

Puede llamar a varias herramientas a la vez e incluso narrar lo que hace con frases como «mirando tu calendario» o «déjame mirar eso». Además, tiene una ventana de contexto más amplia de 128K tokens, lo que significa sesiones más largas y coherentes. Los desarrolladores incluso pueden ajustar el esfuerzo de razonamiento según la complejidad de la solicitud.

GPT-Realtime-Translate es probablemente mi favorito. Es lo más cerca que hemos estado de tener el Universal Translator de Star Trek en la vida real. Soporta traducción de voz en directo a través de 70+ idiomas de entrada y 13 idiomas de salida.

Lo mejor de la demo fue que, incluso cuando una persona nueva se unió y hablaba otro idioma, GPT-Realtime-Translate no tuvo problemas para traducir a ambos hablantes al inglés en tiempo real.

Por último, está el susurro en tiempo real de GPT. La mayoría de los modelos de reconocimiento de voz esperan a que el hablante termine antes de proporcionar la traducción completa. Este es un modelo de transcripción en streaming que convierte el habla en texto mientras el hablante habla. Es útil para subtítulos en directo, notas de reuniones y cualquier flujo de trabajo basado en voz donde esperar una transcripción no sea una opción.

¿Alguien puede usar estos nuevos modelos de IA de voz?

Actualmente, OpenAI ha lanzado estos modelos para desarrolladores. Pero las aplicaciones que creen afectarán a todos. Por ejemplo, un desarrollador puede crear una aplicación traductora en tiempo real, permitiendo a los usuarios conversar con personas en diferentes idiomas.

Muchas empresas ya están probando estos nuevos modelos. Zillow está desarrollando un asistente de voz que puede registrar viviendas y programar visitas a partir de una sola solicitud hablada. Priceline puede revisar tus vuelos y hoteles, cancelarlos y reservar nuevos. Vimeo lo está usando para transcripción en tiempo real, y así sucesivamente.

El precio comienza en 0,017 $ por minuto para Whisper, 0,034 $ por minuto para Translate y 32 $ por cada token de entrada de audio de 1 millón para GPT-Realtime-2.

Diego Bastarrica
Diego Bastarrica es Senior Editor y Head of Content en Digital Trends en Español, donde lidera la estrategia editorial, SEO…
Los computadores «reales» que hicieron creíble a Jurassic Park
Computer, Computer Hardware, Computer Keyboard

Cuando Steven Spielberg estrenó Jurassic Park en 1993, buena parte de la magia de la película no estaba solo en los dinosaurios generados por computadora, sino en el atrezo tecnológico real que llenaba la Sala de Control del parque. El programador Fabien Sanglard decidió revisar la cinta cuadro por cuadro para identificar, con precisión casi obsesiva, cada equipo y software que aparece en pantalla, y el resultado es un catálogo fascinante de la informática de principios de los años 90.

El primer computador no está en la isla

Read more
NotebookLM cambia de nombre y se convierte en Gemini Notebook
Logo, Text

Google anunció que NotebookLM, la herramienta de investigación e inteligencia artificial que debutó en 2023 bajo el nombre Project Tailwind, pasará a llamarse oficialmente Gemini Notebook. La compañía informó que la plataforma ya supera los 30 millones de usuarios y más de 600.000 organizaciones que la emplean para tareas que van desde crear materiales de capacitación hasta transformar apuntes en resúmenes de audio y video.

Hoy vamos a renombrar NotebookLM como Gemini Notebook. Sigue siendo un producto independiente centrado en ser tu herramienta de investigación principal, pero ahora hará más en todo el ecosistema de Google, incluyendo la app Gemini y Google Search.

Read more
El 75% de los títulos de PS3 ahora se pueden jugar en PC
PS3 juegos

Sony se está preparando para cerrar la PlayStation Store en PS3, poniendo fin a las nuevas compras a nivel mundial para julio de 2027. Menos de dos semanas después de ese anuncio, el equipo detrás de RPCS3 reveló un hito muy diferente.

El emulador de PS3 de código abierto ahora lista el 75% de la biblioteca rastreada de la consola como jugable en PC. Eso cubre 2.681 de 3.559 partidos, y la calificación significa que pueden completarse con un rendimiento aceptable y sin fallos que rompan el juego.

Read more