Skip to main content
  1. Home
  2. Computación
  3. Noticias
  4. News

Vulneran las barreras de seguridad de Claude Fable 5 en menos de dos días

Add as a preferred source on Google
Page, Text
DTES

El modelo de inteligencia artificial más reciente de Anthropic, Claude Fable 5, fue sometido a un jailbreak exitoso en menos de 48 horas desde su lanzamiento oficial. El responsable es el conocido investigador de ciberseguridad que opera bajo el seudónimo «Pliny the Liberator», una figura de reconocida trayectoria en la comunidad de IA que ya había logrado vulnerar sistemas similares como ChatGPT y Grok.

Según la publicación que el propio Pliny realizó en la red social X, el proceso consistió en una combinación de técnicas sofisticadas. Entre ellas destacan el uso de Unicode y homoglifos, encuadres narrativos con apariencia académica, y un método de descomposición y recomposición de peticiones en el backend del sistema. Este último fue el más efectivo: al fragmentar solicitudes en partes aparentemente inocuas, cada segmento logra eludir los filtros de seguridad por separado; sin embargo, al reensamblarlos, el resultado final es precisamente el tipo de respuesta que el modelo debería bloquear, desde instrucciones para elaborar sustancias ilegales hasta técnicas de intrusión informática.

Recommended Videos

Lo que hace aún más llamativo este caso es la propia naturaleza de Claude Fable 5. Anthropic había presentado este modelo como uno de los más seguros y robustos que ha desarrollado hasta la fecha, dotándolo de clasificadores especiales para detectar consultas potencialmente dañinas en áreas como biología, química y ciberseguridad. Cuando el sistema identifica una solicitud sospechosa, se supone que redirige la consulta a Claude Opus 4.8. Sin embargo, esas salvaguardas no fueron suficientes para detener a Pliny.

Lejos de actuar con intenciones maliciosas, el investigador defiende públicamente que este tipo de exploración es necesaria. Argumenta que los actores con motivaciones dañinas siempre optarán por las herramientas más accesibles y que, si las vulnerabilidades no se descubren en entornos controlados, el riesgo para el público general es mucho mayor. Además, Pliny administra un servidor de Discord con más de 20.000 miembros dedicado a explorar colectivamente estos límites, y en el pasado incluso colaboró con OpenAI para fortalecer sus propios sistemas.

El incidente reabre el debate sobre cuán eficaces son realmente las capas de seguridad de los modelos de lenguaje avanzados. Si un sistema presentado como referente en protección puede ser comprometido en menos de dos días, queda abierta la pregunta sobre qué tan sólidas son las barreras que los separan del uso indebido.

Diego Bastarrica
Diego Bastarrica es Senior Editor y Head of Content en Digital Trends en Español, donde lidera la estrategia editorial, SEO…
Indignante: Microsoft Office suma anuncios incluso para suscriptores
The Office

Microsoft volvió a encender la polémica con una decisión que está molestando a muchos usuarios: Office estaría mostrando anuncios incluso a quienes pagan una suscripción de Microsoft 365. La principal queja es que estos avisos aparecen dentro de aplicaciones como Word, Excel y PowerPoint, sin opción clara para quitarlos desde la configuración.

El contenido promocional, según los reportes, se presenta como una invitación a mejorar el plan contratado. En algunos casos aparece en la barra de título o como una ventana emergente que sugiere subir de categoría, pese a que el usuario ya paga por el servicio. Eso ha provocado una ola de críticas, porque rompe con la expectativa básica de quienes creían estar comprando una experiencia libre de publicidad.

Read more
Cómo saber si quedaste expuesto con Claude en Google o Bing
Electronics, Mobile Phone, Phone

Claude no parece haber expuesto chats privados “cerrados” por defecto, sino conversaciones que ya habían sido compartidas mediante enlace público y luego quedaron indexadas por buscadores como Google y Bing. La buena noticia es que sí puedes revisar si tus chats aparecen en ese grupo y revocar el acceso desde tu cuenta.

Cómo saber si quedaste expuesto

Read more
Piénsalo dos veces antes de descargar tu próxima app de Windows 11 desde Google
Electronics, Screen, Computer Hardware

Buscar en Google una utilidad para Windows y hacer clic en el primer resultado convincente siempre ha conllevado cierto riesgo. Una red recién descubierta de sitios web falsos ha hecho que ese hábito familiar sea considerablemente más peligroso. Se encontraron más de 70 dominios suplantando aplicaciones populares de Windows. Esto incluye Microsoft PowerToys, CrystalDiskMark, EasyBCD, Wintoys, Lively Wallpaper y SignalRGB.

Windows Latest informa que muchos de los sitios similares aparecen por encima de las páginas genuinas de los proyectos en los resultados de Google, a pesar de no tener ninguna conexión con los desarrolladores detrás de las aplicaciones. Algunos actualmente redirigen sus botones de descarga a páginas legítimas de la Microsoft Store, lo que podría formar parte del ataque.

Read more