OpenAI se encuentra a punto de presentar Astra, calificado como su sistema de inteligencia artificial más potente hasta la fecha, luego de varias semanas de retrasos destinados a reforzar sus protocolos de seguridad. Sin embargo, la inminente salida del modelo ha generado inquietud entre especialistas externos, quienes advierten que su arquitectura interna podría dificultar seriamente la supervisión de su comportamiento.
Una arquitectura que «piensa» de forma menos transparente
Según una investigación del medio The Information, Astra revelaría mucho menos su proceso de razonamiento que otros modelos de última generación, lo que habría encendido las alarmas dentro de la comunidad dedicada a la seguridad de la inteligencia artificial. La mayoría de los sistemas actuales se basa en arquitecturas de tipo «transformer», que procesan la información de manera secuencial a través de distintas capas y permiten mostrar el razonamiento paso a paso, en lo que se conoce como «cadena de pensamiento». Esta característica resulta clave, ya que posibilita que investigadores y sistemas automatizados detecten a tiempo comportamientos indebidos, como intentos de engaño o de burlar las medidas de contención.
Astra emplearía una técnica más opaca, conocida como «recurrencia en profundidad» o transformador en bucle, que hace circular la información varias veces por las mismas capas internas antes de generar una respuesta. Esto implicaría que buena parte del procesamiento del modelo ocurre de manera interna y en un formato que se aleja del lenguaje humano habitual, complicando el monitoreo externo de sus decisiones.
La reacción de la comunidad de seguridad en IA
La noticia provocó una ola de comentarios entre analistas especializados en las redes sociales. Ryan Greenblatt, científico jefe de Redwood Research y una de las pocas personas externas autorizadas por OpenAI para investigar un incidente previo de seguridad vinculado a Hugging Face, llegó a calificar esta posible decisión arquitectónica como uno de los peores retrocesos registrados hasta ahora en materia de seguridad de la inteligencia artificial. El especialista explicó que buena parte de aquella investigación dependió justamente de poder leer la cadena de razonamiento de los modelos implicados, por lo que una menor visibilidad podría permitir que sistemas futuros ejecuten estrategias mucho más difíciles de detectar.
Greenblatt también manifestó su temor a que la actual carrera por desarrollar sistemas cada vez más avanzados termine empujando a las empresas del sector hacia arquitecturas progresivamente más opacas, con el objetivo de ganar ventaja competitiva, hasta llegar a un punto en el que la supervisión resulte prácticamente imposible.
La respuesta de OpenAI
Voceros y directivos de la compañía, entre ellos el científico jefe Jakub Pachocki, salieron a responder las críticas sin negar de manera explícita el uso de esta tecnología. Pachocki sostuvo que la profundidad de cómputo de Astra se mantendría dentro de un rango similar al de generaciones anteriores del modelo GPT-4, lo que, a su juicio, reduciría el nivel de opacidad respecto de lo que algunas reacciones iniciales sugirieron. La empresa evitó confirmar o desmentir directamente si efectivamente había recurrido a un transformador en bucle para el desarrollo de Astra.
Este episodio se suma a otros antecedentes recientes: a comienzos de agosto, OpenAI ya había reconocido que no podía descartar que Astra alcanzara el nivel «crítico» de capacidad cibernética según su propio marco de preparación, lo que la llevó a pausar ciertas actividades internas de desarrollo y a reforzar los controles de seguridad antes de continuar avanzando hacia su lanzamiento definitivo