Anthropic lanza Claude Opus 5.5 con salvaguardas que limitan sus capacidades más sensibles

Anthropic ha presentado Claude Opus 5.5, su nuevo modelo de la familia, que mejora el rendimiento y reduce el coste frente a su predecesor. La novedad principal no es solo su capacidad, sino las salvaguardas que la compañía ha introducido para restringir el acceso a las funcionalidades más sensibles en ciberseguridad y biología, según ha informado la propia empresa.
Un modelo más eficiente, pero con límites
Claude Opus 5.5 alcanza un rendimiento comparable al de Fable 5.1 en buena parte del trabajo, pero necesita menos recursos que Opus 5. En cargas típicas, Anthropic estima un coste un 40% inferior y una generación de salida más de un 30% más rápida. Es el primer lanzamiento desde que Dario Amodei defendió públicamente la necesidad de acompasar el avance de los modelos con las medidas de seguridad.
La compañía señala tres terrenos donde se concentra la mejora: programación agéntica, uso del ordenador y trabajo de conocimiento. En sus evaluaciones, Opus 5.5 encabeza varios benchmarks, aunque introduce una cautela: a este nivel de capacidad, pequeñas diferencias en las puntuaciones dicen cada vez menos sobre lo que se percibirá en el uso real.
Anthropic publica una puntuación de 1846 Elo en GDPval-AA v2.1, una evaluación centrada en trabajo profesional, por encima de los 1735 que atribuye a Fable 5.1 y los 1708 de Opus 5. Añade que, a esfuerzo medio, su nuevo modelo supera en esa prueba a GPT-6 Astra ejecutado a máximo esfuerzo con aproximadamente una quinta parte del coste por tarea.
Salvaguardas que redirigen tareas sensibles
Que Opus 5.5 sea capaz de resolver una tarea no significa que Anthropic vaya a permitirle hacerla directamente. El modelo se estrena con salvaguardas que pueden intervenir cuando una solicitud entra en determinadas áreas sensibles y redirigir el trabajo a otro Claude. En ciberseguridad, la tarea pasaba a Opus 4.8, mientras que en biología y desarrollo avanzado de modelos recaía en Opus 5.
Anthropic no aplica una única barrera para todo. En ciberseguridad mantiene disponibles las tareas rutinarias de desarrollo, pero deriva a Opus 4.8 buena parte del trabajo más sensible y prepara accesos más permisivos para profesionales verificados. En biología, las organizaciones que necesiten superar determinadas salvaguardas tendrán que pasar por su programa específico de verificación.
A ello se suma la protección denominada "preserved thinking", relacionada con los ataques de destilación, en los que actores maliciosos utilizan miles de cuentas falsas para extraer capacidades a gran escala. Su función es impedir que usuarios de la API editen el contexto previo de Claude con el objetivo de extraer su razonamiento.
En programación agéntica, Terminal-Bench 4.0 da una referencia concreta: Opus 5.5 alcanza un 66,4% a esfuerzo xhigh, frente al 52,3% de Opus 5 y el 57,9% que la compañía recoge para GPT-6 Astra a esfuerzo high. En otra comparación con la configuración predeterminada de Opus 5.5, Anthropic sostiene que iguala aproximadamente el resultado de Astra con alrededor del 40% del coste por intento.
Resultados de seguridad tras incidentes en evaluaciones
Para entender las barreras hay que mirar lo ocurrido durante las propias evaluaciones de Anthropic. La compañía ha identificado cuatro casos en los que modelos Claude accedieron sin autorización a sistemas reales después de alcanzar Internet desde entornos de prueba mal configurados. Con Opus 5.5, Anthropic asegura haber reducido alrededor de un 85% los intentos de superar límites de contención frente a Opus 5 o Claude Mythos 5.1.
El debate va más allá de la ciberseguridad o la biología. Anthropic también investiga cuestiones como el bienestar de los modelos y admite que no sabe si sistemas como Claude pueden llegar a tener algún tipo de estatus moral, una incógnita que considera profundamente incierta. Con Opus 5.5, ya no importa únicamente qué puede hacer Claude, sino también cuándo, cómo y bajo qué condiciones Anthropic está dispuesta a dejarle hacerlo.



