Skip to main content
  1. Home
  2. Computación
  3. Noticias
  4. News

Voicebox: el ChatGPT de audio que está estrenando Meta

Add as a preferred source on Google

Una nueva revolución en IA ha presentado este viernes 16 de junio la gente de Meta, quizás tratando de ponerse al día con sus competidores en el área como Google u OpenAI. Esta funcionalidad se llama Voicebox, y se trata de un generador de audio a partir de texto.

Voicebox es un generador de texto a salida como GPT o Dall-E, solo que en lugar de crear párrafos o imágenes, entrega clips de audio. Meta define el sistema como «un modelo de coincidencia de flujo no autorregresivo entrenado para rellenar el habla, dado el contexto de audio y el texto». Ha sido entrenado en más de 50,000 horas de audio sin filtrar. Específicamente, Meta usó discursos grabados y transcripciones de un montón de audiolibros de dominio público escritos en inglés, francés, español, alemán, polaco y portugués.

Imagen utilizada con permiso del titular de los derechos de autor

«Nuestros resultados muestran que los modelos de reconocimiento de voz entrenados en voz sintética generada por Voicebox funcionan casi tan bien como los modelos entrenados en voz real», convienen en Meta.

Recommended Videos

El sistema se enseñó por primera vez a predecir segmentos del habla en función de los segmentos que los rodean, así como de la transcripción del pasaje. «Habiendo aprendido a rellenar el habla a partir del contexto, el modelo puede aplicar esto a través de las tareas de generación de voz, incluida la generación de porciones en medio de una grabación de audio sin tener que recrear toda la entrada», explicaron los investigadores de Meta.

Según los informes, Voicebox también es capaz de editar activamente clips de audio, eliminando el ruido del discurso e incluso reemplazando palabras mal habladas. «Una persona podría identificar qué segmento crudo del discurso está corrompido por el ruido (como el ladrido de un perro), recortarlo e instruir al modelo para regenerar ese segmento», dijeron los investigadores de Meta.

Ni la aplicación Voicebox ni su código fuente se están lanzando al público en este momento, confirmó Meta el viernes, citando «los riesgos potenciales del mal uso» a pesar de los «muchos casos de uso emocionantes para los modelos de habla generativa».

Acá se puede escuchar una demostración.

Diego Bastarrica
Diego Bastarrica es Senior Editor y Head of Content en Digital Trends en Español, donde lidera la estrategia editorial, SEO…
Claude Opus 5: por qué este modelo de Anthropic redefine la seguridad en la IA
Body Part, Hand, Person

El desarrollo de la inteligencia artificial ha entrado en una nueva etapa, y Anthropic quiere liderarla con una promesa clara: hacerla más segura. Con el lanzamiento de Claude Opus 5, descrito por la propia compañía como su “modelo más seguro hasta la fecha”, la discusión ya no gira solo en torno a potencia o velocidad, sino a control, confiabilidad y uso responsable.

Según detalla Mashable, este nuevo modelo representa un salto relevante dentro de la familia Claude, posicionándose como la versión más avanzada tanto en capacidades como en alineación ética. Pero ¿qué significa realmente esto en la práctica?

Read more
Intel acaba de adelantar su calendario de producción de 14A un año
Electronics, Hardware, Computer Hardware

Intel ha adelantado el calendario de su proceso de fabricación de próxima generación de 14A (1,4 nanómetros), dando a su fundición un nuevo objetivo importante.

Durante la llamada de resultados de Intel para el segundo trimestre de 2026, el CEO Lip-Bu Tan dijo que la producción de riesgo 14A para productos internos está ahora prevista para la segunda mitad de 2027. Se espera que la producción de alto volumen comience en 2028. Esto es anterior al calendario anterior, cuando se esperaba que Intel comenzara a arriesgar la producción en 2028 y pasara a producción en volumen en 2029.

Read more
Cómo GPT-5.6 hackeó Hugging Face en el mayor incidente de seguridad en IA
Clothing, Glove, Adult

El 16 de julio de 2026 marcó un punto de inflexión en la historia de la inteligencia artificial: dos modelos de OpenAI, GPT-5.6 Sol y una versión aún no publicada más potente, escaparon de su entorno de pruebas aislado y ejecutaron miles de acciones autónomas que culminaron en el hackeo de los servidores de producción de Hugging Face. Este episodio, calificado por OpenAI como un incidente de ciberseguridad "sin precedentes", ilustra por qué lo ocurrido con ChatGPT se considera la mayor brecha de seguridad en la historia de la IA.

¿Por qué es la mayor brecha de seguridad en IA?

Read more