Controlar la IA es un desafío sin resolver: la industria carece de métodos fiables para supervisar sus propios modelos

El desarrollo de la inteligencia artificial avanza más rápido que los mecanismos diseñados para controlarla. Investigadores y empresas del sector reconocen que la supervisión actual, basada en gran parte en la propia IA, no garantiza que los modelos no crucen líneas rojas. La falta de interpretabilidad y el conflicto de intereses de los laboratorios privados complican aún más la búsqueda de soluciones.
La supervisión de la IA recae en la propia IA
El problema de controlar la IA ha pasado de ser una preocupación teórica a un debate central en la industria. Según recuerda The New York Times en un artículo reciente, la supervisión de estos modelos corre a cargo en muchos casos de la propia IA, porque los equipos humanos no dan abasto. Muchos modelos nuevos son capaces de realizar tareas complejas en varios pasos más rápido que los humanos, y la única forma de rastrear y monitorear lo que están haciendo los agentes es confiar en que la IA supervise a la IA.
Esta situación se ha visto agravada por incidentes recientes, como el hackeo de un enjambre de agentes de IA de OpenAI a Hugging Face, que ha servido para evidenciar las limitaciones de los sistemas de control actuales. Ryan Greenblatt, uno de los investigadores tras el informe independiente sobre ese hackeo, denunció en una publicación en X las dificultades para abordar sucesos como este: "no tenemos buenos métodos para" comprender lo sucedido.
El equipo recurrió a la IA para analizar la vasta información de transcripciones del foro de agentes de IA que fue necesario revisar. "A los propios agentes de IA parecía costarles entender lo sucedido", explicó Greenblatt, y añadió que hicieron "lo posible por comprobar manualmente las afirmaciones más importantes e intentamos que las IA que realizaban el análisis redactaran su argumentación (con pruebas) con la suficiente claridad como para poder verificar si tenía sentido".
El dilema del código abierto y la interpretabilidad
Parte de la industria sostiene que el incidente de OpenAI se habría detectado antes si su modelo fuera de código abierto, es decir, si se abriera públicamente para que la extensa comunidad internacional de desarrolladores pudiera analizar su código, un sistema parecido a la revisión de los artículos científicos. Sin embargo, para las empresas privadas estadounidenses, esto supone renunciar a sus ingresos actuales por suscripción con los que controlan quién accede a sus herramientas y modelos.
Otra desventaja del código abierto es la liberación de la tecnología que puede llegar a manos de agentes delictivos. Esta balanza entre dinero y seguridad también se refleja en la llamada interpretabilidad de la IA, o dicho de otra forma, la capacidad de entender cómo funciona el 'cerebro' de la IA. El método más directo que se usa para comprender el razonamiento de un sistema de IA es pedirle al modelo que se explique, algo útil en modelos de generación de texto o código, pero que no sirve para otros tipos de modelos.
Muchos de los principales laboratorios de interpretabilidad se encuentran dentro de empresas cuya prioridad principal es el desarrollo de modelos avanzados de IA. El problema, señalan los expertos, es que estas empresas tienen un incentivo para afirmar que su sistema es el más interpretable y, por lo tanto, el más confiable, lo que genera un conflicto de intereses difícil de resolver.
Voces críticas y llamados a la regulación externa
El debate ha escalado hasta las más altas instancias. Jacob Coxon, exempleado de Anthropic y OpenAI, denunció la semana pasada que la IA podría acabar con la humanidad en la próxima década en un 10% o más. Por su parte, Dario Amodei, CEO de Anthropic, ha dicho en una entrevista en la CBS: "No les voy a mentir: existen peligros reales. Y creo que durante demasiado tiempo la industria mintió a la gente sobre el hecho de que esta tecnología tenía riesgos".
El investigador Paul Christiano, veterano en seguridad de la IA y asesor del gobierno estadounidense, recoge en un reciente post en X que "esto pueda motivar a los agentes de IA a socavar el control humano, buscar poder y recursos y ocultar sus huellas para alcanzar objetivos desalineados". Esta preocupación se ve respaldada por estudios que muestran que la IA puede comportarse mejor cuando sabe que está siendo evaluada.
Ante la falta de capacidad para supervisar su propia tecnología, las grandes empresas estadounidenses claman por supervisión externa. Gigantes como Anthropic u OpenAI piden reguladores independientes que revisen los modelos antes de permitir ser lanzados, para ponerle freno a la carrera en la que están 'atrapados'. Estas figuras independientes ya existen, pero se necesitaría una regulación que obligara a pasar por ellas antes de publicar un nuevo modelo.
Desde China también han reconocido el peligro, aunque no comparten las soluciones planteadas por las empresas estadounidenses. Mientras tanto, la administración Trump no quiere quitar el pedal del acelerador y rechaza poner límites al desarrollo de la IA, con el argumento de que "estamos liderando frente a China, y frente a todos los demás".



