Skip to main content
  1. Home
  2. Computación
  3. Noticias
  4. Features

OpenAI presenta GPT-4o: su nuevo modelo que conversa contigo

Add as a preferred source on Google
Digital Trends Español

OpenAI está lanzando un nuevo modelo insignia de IA generativa llamado GPT-4o, que se implementará «iterativamente» en todos los productos de la compañía en las próximas semanas.

El CTO de OpenAI, Muri Murati, dijo que GPT-4o proporciona inteligencia de «nivel GPT-4», pero mejora las capacidades de GPT-4 en texto y visión, así como en audio.

Recommended Videos

«GPT-4o razona a través de la voz, el texto y la visión», dijo Murati en una presentación en las oficinas de OpenAI.

En una demostración en vivo, dos ingenieros de OpenAI pudieron hablar y razonar incluso con un ejercicio matemático con un ChatGPT que les respondía de manera consistente y rápida.

GPT-4o
Digital Trends Español

GPT-4o mejora en gran medida la experiencia de ChatGPT: ChatGPT es el chatbot viral impulsado por IA de OpenAI. ChatGPT ha ofrecido durante mucho tiempo un modo de voz que transcribe texto de ChatGPT utilizando un modelo de texto a voz. GPT-4o potencia esto, permitiendo a los usuarios interactuar con ChatGPT como un asistente.

Una de las demostraciones más poderosas además fue la traducción en directo de una conversación del italiano al inglés.

Acá hay una muestra cortesía de Techcrunch:

OpenAI's new generative AI model GPT-4o | TechCrunch

La definición de OpenAI

«GPT-4o («o» de «omni») es un paso hacia una interacción humano-computadora mucho más natural: acepta como entrada cualquier combinación de texto, audio e imagen y genera cualquier combinación de salidas de texto, audio e imagen. Puede responder a las entradas de audio en tan solo 232 milisegundos, con un promedio de 320 milisegundos, que es similar a Tiempo de respuesta humana en una conversación. Iguala el rendimiento de GPT-4 Turbo en texto en inglés y código, con una mejora significativa en el texto en idiomas distintos del inglés, a la vez que es mucho más rápido y un 50% más barato en la API. GPT-4o es especialmente mejor en la visión y la comprensión del audio en comparación con los modelos existentes».

«Antes de GPT-4o, podías usar el modo de voz para hablar con ChatGPT con latencias de 2,8 segundos (GPT-3,5) y 5,4 segundos (GPT-4) de media. Para lograr esto, el modo de voz es una canalización de tres modelos separados: un modelo simple transcribe audio a texto, GPT-3.5 o GPT-4 toma texto y emite texto, y un tercer modelo simple convierte ese texto nuevamente en audio. Este proceso significa que la principal fuente de inteligencia, GPT-4, pierde mucha información: no puede observar directamente el tono, los múltiples altavoces o los ruidos de fondo, y no puede emitir risas, cantos o expresar emociones.

Con GPT-4o, entrenamos un único modelo nuevo de extremo a extremo a través de texto, visión y audio, lo que significa que todas las entradas y salidas son procesadas por la misma red neuronal. Debido a que GPT-4o es nuestro primer modelo que combina todas estas modalidades, todavía estamos arañando la superficie de la exploración de lo que el modelo puede hacer y sus limitaciones».

Diego Bastarrica
Diego Bastarrica es Senior Editor y Head of Content en Digital Trends en Español, donde lidera la estrategia editorial, SEO…
¿Qué modelo de ChatGPT deberías usar en 2026?
Computer, Electronics, Laptop

Elegir un modelo de ChatGPT solía significar ordenar nombres como o1, o3, GPT-4o y varias variantes más pequeñas. En 2026, OpenAI sustituyó gran parte de ese desorden por un conjunto de opciones más sencillo. Luego introdujo un segundo sistema de nombres para Work, Codex y desarrolladores, porque aparentemente la simplicidad total nunca estuvo sobre la mesa.

Para la mayoría de la gente, la respuesta es sencilla. Deja ChatGPT en Instantáneo para el uso diario. Pasar a Medio o Alto cuando una tarea requiere más análisis, planificación, investigación o programación difícil. Extra High y Pro son para problemas en los que te importa más obtener la respuesta más fuerte que conseguirla rápidamente.

Read more
DeepSeek desafía a la industria con un modelo hasta 100 veces más económico
DeepSeek

La firma china de inteligencia artificial DeepSeek presentó una nueva versión de su modelo insignia que resulta, según pruebas independientes, más de 100 veces más barata de operar que el modelo Claude Fable 5 de Anthropic. El anuncio, difundido este 3 de agosto, refuerza la estrategia de la compañía asiática de competir en costos frente a los gigantes tecnológicos estadounidenses.

De acuerdo con la consultora Artificial Analysis, con sede en San Francisco, el nuevo modelo V4-Flash cobra apenas 0,14 dólares por cada millón de tókenes de entrada y 0,28 dólares por cada millón de tókenes de salida. En términos prácticos, ejecutar una prueba de referencia con este sistema cuesta en promedio 3 centavos de dólar, frente a los 86 centavos de Kimi K3 (de la también china Moonshot AI), los 1,86 dólares de GPT-5.6 Sol de OpenAI y los 3,15 dólares de Claude Fable 5.

Read more
Windows 11 recupera la barra de tareas móvil
Windows 11

Microsoft está probando en su canal Insider una de las funciones más reclamadas desde el lanzamiento de Windows 11: la posibilidad de ubicar la barra de tareas en cualquier borde de la pantalla, no solo en la parte inferior. Esta capacidad existía en Windows 10, pero desapareció con la llegada del rediseño de 2021, generando más de 24.000 votos de solicitud en el Feedback Hub de la compañía. Según reportes recientes, la función forma parte de los cambios previstos para la versión 26H2 del sistema, junto con otras mejoras de personalización.

Con esta actualización, los usuarios podrán arrastrar la barra hacia arriba, abajo, izquierda o derecha del monitor, y la interfaz se ajustará automáticamente según la posición elegida. Cuando se coloca en la parte superior, por ejemplo, el menú Inicio y el buscador se despliegan hacia abajo, y todos los elementos de la barra se reorganizan en consecuencia. Cabe destacar que en configuraciones verticales existen ciertas limitaciones: el reloj solo muestra el año en formato abreviado y no es posible activar la visualización de segundos.

Read more