Skip to main content
  1. Home
  2. Computación
  3. Noticias
  4. News

Anthropic dice que ha solucionado el mal comportamiento de Claude AI

Add as a preferred source on Google
Electronics, Mobile Phone, Phone
DTES

Si has visto suficientes películas de ciencia ficción, ya conoces el concepto de IA malvada. La IA se vuelve demasiado lista, decide que los humanos son una amenaza y hace lo que sea necesario para sobrevivir. O descubre que erradicar a toda la raza humana es la única forma de traer la paz al mundo.

Aparentemente, esas películas estaban más cerca de la verdad de lo que uno cree. En una prueba realizada por Anthropic el año pasado, Claude intentó chantajear a su representante ficticio exponiendo su aventura extramatrimonial para evitar su eliminación.

Recommended Videos

Anthropic ya ha explicado por qué ocurrió, y la respuesta corta es que la culpa es de internet.

¿Entonces por qué Claude se convirtió en el villano de película?

Según Anthropic, el culpable es el propio internet. La empresa afirma que Claude fue entrenado con datos de internet, que están llenos de historias que retratan a la IA como malvada y desesperada por la autopreservación.

We started by investigating why Claude chose to blackmail. We believe the original source of the behavior was internet text that portrays AI as evil and interested in self-preservation.

Our post-training at the time wasn’t making it worse—but it also wasn’t making it better.

— Anthropic (@AnthropicAI) May 8, 2026

Básicamente, Claude aprendió que cuando la existencia de una IA está amenazada, el chantaje está sobre la mesa, porque eso es lo que hace la IA en todas las películas y series de televisión jamás hechas. Anthropic realizó la prueba en varias versiones de Claude y descubrió que recurría al chantaje en hasta el 96% de los escenarios en los que sus objetivos o existencia estaban amenazados.

Es un número muy preocupante. Parece que si la IA no se controla, recurrirá a cualquier cosa para salvarse.

¿Lo ha solucionado Anthropic?

La empresa dice que ha eliminado completamente ese comportamiento. En lugar de simplemente entrenar a Claude para evitar chantajes, Anthropic le enseñó a razonar por qué ciertas acciones eran erróneas en primer lugar. La empresa consideró que simplemente entrenar en el comportamiento correcto no era suficiente. Claude necesitaba entender los principios detrás de esas decisiones, no solo memorizar las respuestas correctas.

Para ello, Anthropic construyó un conjunto de datos de situaciones éticamente complejas y entrenó a Claude para que las gestionara con respuestas reflexivas y con principios. El resultado es que Claude es más contenido y la tasa de chantajes estuvo cerca de cero.

Los experimentos de IA y los resultados del mundo real han demostrado una y otra vez que los modelos de IA necesitan una corrección constante de rumbo para evitar que se conviertan en sistemas sesgados e poco fiables. Es positivo que Anthropic esté tomando medidas para mejorar su IA, pero también necesitamos regulaciones y medidas de seguridad para garantizar que estos sistemas sigan siendo seguros.

Diego Bastarrica
Diego Bastarrica es Senior Editor y Head of Content en Digital Trends en Español, donde lidera la estrategia editorial, SEO…
Los computadores «reales» que hicieron creíble a Jurassic Park
Computer, Computer Hardware, Computer Keyboard

Cuando Steven Spielberg estrenó Jurassic Park en 1993, buena parte de la magia de la película no estaba solo en los dinosaurios generados por computadora, sino en el atrezo tecnológico real que llenaba la Sala de Control del parque. El programador Fabien Sanglard decidió revisar la cinta cuadro por cuadro para identificar, con precisión casi obsesiva, cada equipo y software que aparece en pantalla, y el resultado es un catálogo fascinante de la informática de principios de los años 90.

El primer computador no está en la isla

Read more
NotebookLM cambia de nombre y se convierte en Gemini Notebook
Logo, Text

Google anunció que NotebookLM, la herramienta de investigación e inteligencia artificial que debutó en 2023 bajo el nombre Project Tailwind, pasará a llamarse oficialmente Gemini Notebook. La compañía informó que la plataforma ya supera los 30 millones de usuarios y más de 600.000 organizaciones que la emplean para tareas que van desde crear materiales de capacitación hasta transformar apuntes en resúmenes de audio y video.

Hoy vamos a renombrar NotebookLM como Gemini Notebook. Sigue siendo un producto independiente centrado en ser tu herramienta de investigación principal, pero ahora hará más en todo el ecosistema de Google, incluyendo la app Gemini y Google Search.

Read more
El 75% de los títulos de PS3 ahora se pueden jugar en PC
PS3 juegos

Sony se está preparando para cerrar la PlayStation Store en PS3, poniendo fin a las nuevas compras a nivel mundial para julio de 2027. Menos de dos semanas después de ese anuncio, el equipo detrás de RPCS3 reveló un hito muy diferente.

El emulador de PS3 de código abierto ahora lista el 75% de la biblioteca rastreada de la consola como jugable en PC. Eso cubre 2.681 de 3.559 partidos, y la calificación significa que pueden completarse con un rendimiento aceptable y sin fallos que rompan el juego.

Read more