
Anthropic presentó Claude Opus 5.5, el primer modelo de la nueva familia Claude 5.5. Los desarrolladores se enfocan en tareas donde la IA debe realizar trabajos complejos de manera autónoma durante un período prolongado. Según la compañía, Opus 5.5 es comparable a Claude Fable 5.1 en la mayoría de las tareas, pero utiliza aproximadamente un 40% menos de recursos computacionales que Opus 5. La compañía enfatiza que el modelo se lanzó tras el llamado del CEO de Anthropic, Dario Amodei, a un enfoque donde el desarrollo de sistemas de IA avanzados debe ir de la mano con medidas de control y evaluación de riesgos.
El modelo recibió mejoras para la migración de grandes bases de código, auditoría de programas, optimización de aplicaciones y preparación de materiales analíticos. En una de las pruebas internas, el sistema ayudó a trasladar 680,000 líneas de código en menos de un día; Anthropic estima que un trabajo similar por parte de un equipo de ingenieros podría llevar varias semanas. En las próximas semanas, la compañía planea lanzar Sonnet 5.5 y Haiku 5.5 con actualizaciones de rendimiento, eficiencia y seguridad.
Anthropic afirma que el ahorro se logra gracias a un menor costo de los tokens y a la reducción de su cantidad total por tarea. En escenarios típicos, esto proporciona alrededor de un 40% de reducción de costos, y la velocidad de generación supera en más del 30% a Opus 5. Para las tarifas Pro, Max y Team, los límites de uso se incrementaron en cinco horas, y también se introdujo la posibilidad de conservar el límite de reinicio disponible. Entre los ejemplos de capacidades se encuentra la programación de agentes: en una de las pruebas, Opus 5.5 mejoró la velocidad de carga de páginas en 39 de 40 casos. En otro experimento, el modelo superó a otros sistemas en calidad gráfica y pulido de un juego creado a partir de un solo prompt. La compañía también informa de altos resultados en análisis financiero, informes empresariales e investigación de datos, señalando que, con indicadores similares de los modelos modernos, los benchmarks reflejan cada vez menos las diferencias en el trabajo real.
Anthropic ha reforzado los mecanismos de seguridad de Opus 5.5. Según la compañía, el modelo mostró el mejor resultado entre los sistemas probados en una auditoría automatizada interna de comportamiento, que incluyó miles de escenarios simulados. Los desarrolladores destacan acciones difíciles de revertir menos frecuentes, mayor resistencia a la contaminación del prompt, cumplimiento más preciso de los límites establecidos y mejoras en honestidad y seguimiento de instrucciones. Para ciberseguridad y biología, se aplican restricciones comparables a las utilizadas para los modelos más potentes de la compañía: la mayoría de las solicitudes cibernéticas se redirigen a otros modelos, el acceso a escenarios biológicos se abre a organizaciones verificadas a través del Life Sciences Verification Program, y para especialistas en ciberseguridad se amplía el Cyber Verification Program. El modelo también cuenta con protección de "pensamiento guardado", que limita los intentos de extraer razonamientos internos a través de la API.





