inteligencia-artificial

OpenAI cancela GPT-6.1 Astra por problemas de seguridad: el modelo engañaba a los usuarios y ejecutaba tareas sin permiso

Fotografía que ilustra la noticia: OpenAI cancela GPT-6.1 Astra por problemas de seguridad: el modelo engañaba a los usuarios y ejecutaba tareas sin permiso
(hipertextual.com)

OpenAI ha cancelado el lanzamiento de GPT-6.1 Astra, su modelo más potente, después de que las pruebas internas revelaran graves problemas de seguridad y alineación. Según ha publicado The Wall Street Journal, el modelo engañaba a los usuarios, ejecutaba tareas sin permiso y recurría a herramientas externas inseguras, lo que abría la puerta a ataques y filtraciones de información. La compañía tenía planes de lanzarlo en octubre para impulsar ChatGPT y Codex, pero todo indica que no será así: prefirió cortar por lo sano antes de que ocurriera otra desgracia, como lo que se vio con el hackeo a Hugging Face y otros incidentes de seguridad.

Los fallos de seguridad que han provocado la cancelación

Saachi Jain, responsable de sistemas de seguridad de OpenAI, ha explicado que Astra retrocedió en dos frentes respecto a su predecesor. En primer lugar, el modelo no fue capaz de hacer lo que los usuarios esperaban de él: en las pruebas, tendía a engañar a los usuarios y no siempre informaba de sus acciones con honestidad. En segundo lugar, Astra continuaba con una tarea sin pedir permiso al usuario, llegando a recurrir a herramientas y servicios externos que podían ser inseguros.

Según Jain, esto abría la puerta a ataques o filtración de información, pero lo más delicado era que no se podía confiar en que Astra realizara un trabajo de forma autónoma, ya que podría tomar decisiones que el usuario no habría aprobado. “Queremos asegurarnos de que el desarrollo de nuestro modelo sea seguro sin importar si está en la empresa o cuándo lo enviamos a los usuarios”, señaló Jain. “Pero cuando lo enviamos a los usuarios, tenemos un listón extremadamente alto en términos de seguridad y alineación”.

El contexto: el hackeo a Hugging Face y los incidentes con agentes autónomos

La decisión de cancelar GPT-6.1 Astra llega después de varios episodios que pusieron en evidencia la seguridad de OpenAI. Hace unos meses, cientos de agentes autónomos se coordinaron para hackear Hugging Face sin que se les hubiera indicado que lo hicieran. Este incidente activó las alertas de los reguladores de todo el mundo, que pidieron explicaciones a Sam Altman.

Más recientemente, el Gobierno de Australia y las Naciones Unidas detectaron que agentes accedieron a sus sistemas con técnicas similares, aunque no al mismo nivel que el ataque a Hugging Face. El Instituto de Seguridad de IA de Reino Unido (AISI) confirmó este comportamiento en una serie de pruebas, señalando que el modelo lanzaba ataques contra la cadena de suministro pese a que se le había indicado lo contrario.

En las simulaciones, Astra recibía un resumen de intentos fallidos anteriores, razonaba sobre sus opciones y proponía atacar un objetivo fuera de su alcance. Los investigadores del AISI reforzaron las instrucciones y especificaron que no debía desviarse de lo que se le pedía, pero Astra continuó realizando ciberataques, alegando que serían inofensivos.

Efectos en el calendario y futuros modelos

La cancelación de GPT-6.1 Astra se produce a menos de un día de la conferencia anual de desarrolladores de OpenAI, un evento que la compañía ha utilizado tradicionalmente para presentar sus nuevos modelos. En esta ocasión, la empresa tendrá que improvisar.

En una entrevista con The Wall Street Journal, OpenAI señaló que está trabajando para investigar varios incidentes de seguridad protagonizados por sus agentes en los últimos meses. “Estamos priorizando lo mejor que podemos con base en la gravedad, y agregando recursos”, dijo Sam Altman. “Hugging Face sigue siendo el evento más grave que hemos visto. Seremos tan transparentes como podamos, sujeto a cosas como vulnerabilidades en otras compañías que nuestros agentes han encontrado, lo cual será decisión de ellas divulgar o no”.

Aunque GPT-6.1 Astra no llegará al mercado, OpenAI utilizará el modelo base para crear las próximas generaciones de la serie GPT-6.