Skip to main content
  1. Home
  2. Computación
  3. Noticias
  4. News

Con la actualización de voz de OpenAI, Siri y Alexa deben ir a la universidad

Add as a preferred source on Google
Computer, Electronics, Laptop
DTES

OpenAI ha lanzado tres nuevos modelos de audio en su API en tiempo real, y son un gran acontecimiento para cualquiera que desarrolle aplicaciones basadas en voz. Los tres modelos son GPT-Realtime-2, GPT-Realtime-Translate y GPT-Realtime-Whisper.

Juntos, llevan la IA de voz más allá de simples respuestas de ida y vuelta hacia algo que pueda entenderte, actuar y mantener una conversación real.

Recommended Videos

Si su demo sirve de referencia, acabamos de ver la siguiente evolución en cómo funcionan los modelos de IA de voz.

¿Entonces, qué pueden hacer realmente estos modelos?

GPT-Realtime-2 es el acto principal. Incorpora razonamiento de clase GPT-5 a interacciones de voz en directo, lo que significa que puede gestionar peticiones más difíciles sin perder el hilo de la conversación.

Puede llamar a varias herramientas a la vez e incluso narrar lo que hace con frases como «mirando tu calendario» o «déjame mirar eso». Además, tiene una ventana de contexto más amplia de 128K tokens, lo que significa sesiones más largas y coherentes. Los desarrolladores incluso pueden ajustar el esfuerzo de razonamiento según la complejidad de la solicitud.

GPT-Realtime-Translate es probablemente mi favorito. Es lo más cerca que hemos estado de tener el Universal Translator de Star Trek en la vida real. Soporta traducción de voz en directo a través de 70+ idiomas de entrada y 13 idiomas de salida.

Lo mejor de la demo fue que, incluso cuando una persona nueva se unió y hablaba otro idioma, GPT-Realtime-Translate no tuvo problemas para traducir a ambos hablantes al inglés en tiempo real.

Por último, está el susurro en tiempo real de GPT. La mayoría de los modelos de reconocimiento de voz esperan a que el hablante termine antes de proporcionar la traducción completa. Este es un modelo de transcripción en streaming que convierte el habla en texto mientras el hablante habla. Es útil para subtítulos en directo, notas de reuniones y cualquier flujo de trabajo basado en voz donde esperar una transcripción no sea una opción.

¿Alguien puede usar estos nuevos modelos de IA de voz?

Actualmente, OpenAI ha lanzado estos modelos para desarrolladores. Pero las aplicaciones que creen afectarán a todos. Por ejemplo, un desarrollador puede crear una aplicación traductora en tiempo real, permitiendo a los usuarios conversar con personas en diferentes idiomas.

Muchas empresas ya están probando estos nuevos modelos. Zillow está desarrollando un asistente de voz que puede registrar viviendas y programar visitas a partir de una sola solicitud hablada. Priceline puede revisar tus vuelos y hoteles, cancelarlos y reservar nuevos. Vimeo lo está usando para transcripción en tiempo real, y así sucesivamente.

El precio comienza en 0,017 $ por minuto para Whisper, 0,034 $ por minuto para Translate y 32 $ por cada token de entrada de audio de 1 millón para GPT-Realtime-2.

Diego Bastarrica
Diego Bastarrica es Senior Editor y Head of Content en Digital Trends en Español, donde lidera la estrategia editorial, SEO…
GeForce Now de Nvidia sale de la beta en Linux con un rendimiento mejorado
Computer, Electronics, Laptop

Los jugadores de Linux han esperado siete meses para este momento. La app nativa GeForce NOW de Nvidia para Linux ha salido oficialmente de la beta, ofreciendo a los escritorios Linux acceso completo al servicio de juegos en la nube sin necesidad de una potente GPU local.

Este es el último paso en los planes de Nvidia para llevar GeForce NOW a más dispositivos. El momento coincide perfectamente con la temporada de vuelta al colegio, cuando Nvidia también está impulsando GeForce NOW como una forma de convertir los Chromebooks cotidianos en máquinas de juego capaces.

Read more
Samsung está utilizando Claude para acelerar el diseño de chips
Computer, Electronics, Laptop

Según se informa, Samsung ha recurrido a la IA para acelerar una de las partes más lentas y exigentes del diseño de chips. Según un informe de Chosun Biz, los ingenieros de la empresa están utilizando Claude de Anthropic para acelerar drásticamente ciertas tareas, con un proyecto supuestamente completado unas quince veces más rápido de lo habitual.

Samsung redujo la tarea de verificación de un chip de más de un mes a dos días

Read more
OpenAI presenta Ultrafast: acelera hasta 14 veces la velocidad de GPT-5.6 Sol
Computer, Electronics, Laptop

OpenAI anunció Ultrafast, un nuevo nivel de servicio dentro de su API que permite que el modelo GPT-5.6 Sol procese información hasta 14 veces más rápido que el modo estándar, alcanzando una velocidad de hasta 750 tokens de salida por segundo. La compañía explicó que esta capacidad es posible gracias a su alianza con Cerebras, el fabricante de chips especializados en inferencia de baja latencia con el que OpenAI ya venía colaborando desde meses antes.

Velocidad sin perder inteligencia

Read more