Skip to main content
  1. Home
  2. Computación
  3. Noticias
  4. News

Con la actualización de voz de OpenAI, Siri y Alexa deben ir a la universidad

Add as a preferred source on Google
Computer, Electronics, Laptop
DTES

OpenAI ha lanzado tres nuevos modelos de audio en su API en tiempo real, y son un gran acontecimiento para cualquiera que desarrolle aplicaciones basadas en voz. Los tres modelos son GPT-Realtime-2, GPT-Realtime-Translate y GPT-Realtime-Whisper.

Juntos, llevan la IA de voz más allá de simples respuestas de ida y vuelta hacia algo que pueda entenderte, actuar y mantener una conversación real.

Recommended Videos

Si su demo sirve de referencia, acabamos de ver la siguiente evolución en cómo funcionan los modelos de IA de voz.

¿Entonces, qué pueden hacer realmente estos modelos?

GPT-Realtime-2 es el acto principal. Incorpora razonamiento de clase GPT-5 a interacciones de voz en directo, lo que significa que puede gestionar peticiones más difíciles sin perder el hilo de la conversación.

Puede llamar a varias herramientas a la vez e incluso narrar lo que hace con frases como «mirando tu calendario» o «déjame mirar eso». Además, tiene una ventana de contexto más amplia de 128K tokens, lo que significa sesiones más largas y coherentes. Los desarrolladores incluso pueden ajustar el esfuerzo de razonamiento según la complejidad de la solicitud.

GPT-Realtime-Translate es probablemente mi favorito. Es lo más cerca que hemos estado de tener el Universal Translator de Star Trek en la vida real. Soporta traducción de voz en directo a través de 70+ idiomas de entrada y 13 idiomas de salida.

Lo mejor de la demo fue que, incluso cuando una persona nueva se unió y hablaba otro idioma, GPT-Realtime-Translate no tuvo problemas para traducir a ambos hablantes al inglés en tiempo real.

Por último, está el susurro en tiempo real de GPT. La mayoría de los modelos de reconocimiento de voz esperan a que el hablante termine antes de proporcionar la traducción completa. Este es un modelo de transcripción en streaming que convierte el habla en texto mientras el hablante habla. Es útil para subtítulos en directo, notas de reuniones y cualquier flujo de trabajo basado en voz donde esperar una transcripción no sea una opción.

¿Alguien puede usar estos nuevos modelos de IA de voz?

Actualmente, OpenAI ha lanzado estos modelos para desarrolladores. Pero las aplicaciones que creen afectarán a todos. Por ejemplo, un desarrollador puede crear una aplicación traductora en tiempo real, permitiendo a los usuarios conversar con personas en diferentes idiomas.

Muchas empresas ya están probando estos nuevos modelos. Zillow está desarrollando un asistente de voz que puede registrar viviendas y programar visitas a partir de una sola solicitud hablada. Priceline puede revisar tus vuelos y hoteles, cancelarlos y reservar nuevos. Vimeo lo está usando para transcripción en tiempo real, y así sucesivamente.

El precio comienza en 0,017 $ por minuto para Whisper, 0,034 $ por minuto para Translate y 32 $ por cada token de entrada de audio de 1 millón para GPT-Realtime-2.

Diego Bastarrica
Diego Bastarrica es Senior Editor y Head of Content en Digital Trends en Español, donde lidera la estrategia editorial, SEO…
Resuelto fallo que devoraba almacenamiento en Windows 11: ¿Cómo comprobar?
Computer, Electronics, Laptop

Microsoft confirmó la solución de un error crítico en Windows 11 que había alarmado a miles de usuarios al llenar sus discos duros con hasta 500 GB de datos innecesarios. El origen del problema estaba en un archivo del sistema llamado "CapabilityAccessManager.db-wal", vinculado al componente que administra los permisos de aplicaciones para funciones como el micrófono, la cámara, la ubicación y las capturas de pantalla.

En condiciones normales, ese archivo debería pesar apenas unos pocos megabytes, ya que se trata del registro de escritura anticipada ("write-ahead log") de una base de datos interna. Sin embargo, distintos usuarios reportaron en foros de soporte y en comunidades como Reddit que el archivo llegó a crecer hasta 200 GB, e incluso se documentó un caso extremo que alcanzó los 513 GB al medirlo con herramientas como TreeSize.

Read more
Tenemos más detalles sobre el primer hardware de OpenAI
Sphere, Machine, Wheel

Durante meses, los rumores han sugerido que el primer producto de hardware de OpenAI podría ser un dispositivo de IA vestible, o quizás incluso el inicio de sus ambiciones a largo plazo con los smartphones. Resulta que el primer dispositivo de la compañía puede ser algo mucho más sencillo, pero posiblemente mucho más ambicioso. Según personas familiarizadas con el tema, ayudará a controlar electrodomésticos inteligentes, reproducir contenidos, responder a preguntas, responder mensajes y aprovechar la variedad de capacidades que ofrece ChatGPT de OpenAI.

El primer dispositivo de IA de OpenAI podría acabar siendo un altavoz, tras mucho bombo sobre que la compañía está trabajando en un dispositivo de IA vestible e incluso podría lanzar un smartphone en el futuro. Según un informe de Bloomberg, el altavoz servirá como un compañero de IA similar al humano que se integrará directamente con el ecosistema del hogar inteligente.

Read more
Los usuarios de Windows ahora pueden elegir cuándo cesan las actualizaciones
Computer, Electronics, Laptop

Las actualizaciones del Patch Tuesday suelen ser un asunto de encogimiento de hombros e instalación, pero el lanzamiento de Microsoft de julio de 2026 realmente te da algo que te entusiasma.

Puedes descargar esta actualización, etiquetada KB5101650, ahora mismo a través de Configuración, o manualmente a través del Catálogo de Actualizaciones de Microsoft si prefieres no esperar a que se lance el lanzamiento.

Read more