Un equipo de seguridad usó Claude para hackear cuentas de empleados de OpenAI y acceder a su GitHub interno

Una operación de seguridad ofensiva ha demostrado que los grandes laboratorios de IA también son vulnerables a las mismas herramientas que desarrollan. Un equipo de investigadores utilizó Claude, el modelo de Anthropic, para encadenar una vulnerabilidad en los foros de ayuda de OpenAI, hacerse con cuentas de ChatGPT de empleados y llegar hasta el repositorio privado de la compañía en GitHub. Todo el proceso, desde el hallazgo del fallo hasta la ejecución del exploit, tomó menos de 72 horas.
El agujero no estaba en ChatGPT, sino en el foro de ayuda
El punto de entrada no fue un fallo en el modelo de OpenAI, sino en la infraestructura que rodea a sus servicios. Los expertos de Hacktron, una firma dedicada a rastrear fallos de seguridad en los grandes laboratorios de IA, localizaron una vulnerabilidad en community.openai.com, el foro de ayuda de la compañía, que se ejecuta sobre la plataforma Discourse.
El problema estaba en la forma en que Discourse procesa las imágenes. Según el análisis de los investigadores, el sistema usa normalmente un optimizador llamado FastImage para verificar los archivos subidos. Como este no soporta el formato HEIF, las imágenes en ese formato se desvían a ImageMagick, que a su vez depende de una librería de decodificación. Es en esa cadena donde se encontró el fallo: un desbordamiento de búfer en memoria dinámica que permitía operaciones de lectura y escritura fuera de los límites previstos al procesar archivos controlados por un atacante.
El origen del fallo, además, es relevante para la gestión de la deuda técnica. Se introdujo a partir de un parche aplicado al código hace un año, pero nunca se documentó como corrección de seguridad ni recibió su identificador CVE correspondiente. Es decir, una modificación aparentemente rutinaria abrió una puerta que permaneció abierta durante doce meses sin que nadie lo supiera.
Claude Opus 5 generó el exploit en cuatro horas
El hallazgo fue solo el primer paso. Con la ayuda de Claude Opus 4.8, los investigadores identificaron el desbordamiento de búfer en la librería de decodificación. Después, usando ya Claude Opus 5, generaron un primer exploit para vulnerar la protección de Discourse, que no tuvo éxito. El segundo intento sí funcionó: el modelo de Anthropic creó un exploit que ejecutaba código remoto al subir una imagen al foro.
En un lapso de cuatro horas, el agente logró su cometido y ejecutó código de forma remota, leyendo el archivo /etc/hosts del servidor. A partir de ahí, los investigadores usaron el exploit para tomar el control de cuentas de ChatGPT y Codex, la herramienta de desarrollo de OpenAI. "Hasta hace dos meses, cualquier usuario o empleado de OpenAI que iniciara sesión en el foro de ayuda podía sufrir el acceso no autorizado a sus cuentas", dijeron los investigadores.
El alcance potencial era mucho mayor que unas pocas cuentas comprometidas. Como los usuarios pueden conectar diversos servicios a Codex y ChatGPT, los atacantes podrían haber accedido a GitHub, Slack o correos electrónicos. La investigación lo confirmó: el equipo aseguró la cuenta de un empleado cuyo Codex estaba conectado al GitHub de OpenAI, y con esos datos hizo un pull request en el repositorio privado de la compañía.
OpenAI corrigió el fallo en menos de catorce horas
Tras recibir el aviso de los investigadores, OpenAI corrigió el fallo en menos de catorce horas para evitar una nueva intrusión. La empresa no ha emitido un comunicado público sobre el incidente, y los detalles del ataque proceden del reporte de Hacktron.
La rapidez de la respuesta contrasta con la lentitud de la detección: el fallo estuvo presente durante un año sin que nadie lo identificara. La operación completa, desde el hallazgo de la vulnerabilidad hasta la ejecución del exploit, tomó menos de 72 horas. Para los investigadores, la lección es clara: "Las suposiciones sobre seguridad deben ponerse al día con las capacidades de los atacantes".
El caso plantea un escenario que las empresas tecnológicas españolas y europeas deberán incorporar a sus análisis de riesgo. Las herramientas de IA no solo se usan para atacar: también aceleran la investigación de vulnerabilidades en infraestructuras ajenas, comprimiendo en días lo que antes requería semanas de trabajo manual. La capacidad de un modelo para generar exploits funcionales a partir de un fallo identificado cambia la ecuación de la seguridad ofensiva y defensiva.



