Anthropic lanza Claude Opus 5.5 una semana después de pedir moderar la carrera de la IA: su nuevo modelo es más rápido y planta cara a GPT-6 Astra de OpenAI

Wait 5 sec.

Anthropic acaba de lanzar Claude Opus 5.5, su nuevo modelo más potente, apenas una semana después de que Dario Amodei pidiese moderar la carrera de la inteligencia artificial. Nuevo Claude Opus 5.5 una semana después del llamamiento a la prudencia, aunque lo hace con más capacidad, más velocidad y un coste de uso bastante menor que Opus 5.El lanzamiento llega después de que Anthropic presentase Claude Opus 5, presentado en julio, pero el salto no se queda en una tabla de pruebas. Opus 5.5 genera resultados más de un 30 % más rápido y, con la configuración predeterminada, consigue un 30 % más de velocidad y un 40 % menos de coste.El precio baja justo donde más se nota al utilizar Claude durante horas El recorte se nota especialmente en la caché, uno de los apartados que más pesa cuando Claude trabaja con agentes o escribe código durante sesiones largas. Las lecturas pasan de 0,50 a 0,20 dólares por millón de tokens, de modo que hablamos de un 60 % menos en lecturas de caché respecto a Opus 5.También bajan los precios normales de entrada y salida: de 5 a 4 dólares por millón de tokens en el primer caso y de 25 a 20 en el segundo. Si necesitas priorizar velocidad, hay un modo con hasta 2,5 veces más velocidad a cambio de duplicar el precio respecto a la configuración normal.Las comparaciones con el recién presentado GPT-6 Astra de OpenAI dejan una fotografía bastante clara, aunque no uniforme. Hay ventaja sobre GPT-6 Astra en dos pruebas de programación: Opus 5.5 alcanza un 66,4 % frente al 57,9 % en Terminal-Bench 4.0 y un 54,4 % frente al 53,3 % en FrontierCode. Astra, sin embargo, gana en Terminal-Bench-Science.Fuera de los porcentajes hay ejemplos bastante más fáciles de aterrizar. Un evaluador temprano consiguió migrar 680.000 líneas de código en menos de un día, mientras que otra prueba permitió auditar y corregir una base de 200.000 líneas en menos de tres horas. Opus 5 necesitó más de 20 horas para esa misma auditoría.GitHub obtuvo una diferencia parecida al probar el modelo dentro de Copilot CLI y VS Code. Mario Rodriguez, responsable de producto, explica que Opus 5.5 utilizó «de los menores números de tokens y pasos que medimos» y que resolvió más tareas de terminal que Opus 5. Menos pasos y tokens para terminar el trabajo, en otras palabras.Deloitte también encontró mejoras cuando lo utilizó para revisar código. Carl Bennett, CIO de Deloitte Consulting, afirma que con el nivel de esfuerzo más bajo el modelo detectó el 72 % de los errores conocidos, frente al 56 % de Opus 5 usando un nivel alto. Eso supone un 72 % de errores detectados con esfuerzo bajo en esa prueba.Ramp se fijó en algo bastante menos espectacular, pero probablemente más fácil de notar en el uso diario: cómo responde. John Ruelas, ingeniero de la compañía, dice que «escribe como un buen compañero» y que pudo utilizar una especificación de diseño con muy pocos retoques. La mejora, por tanto, no se limita a hacer más trabajo en menos tiempo.Anthropic acelera mientras intenta demostrar que también puede mantener el control La seguridad ocupa buena parte del lanzamiento, y aquí vuelve a aparecer inevitablemente el discurso de Amodei de la semana pasada. Antes de salir al mercado, el modelo pasó evaluaciones externas de Frontier Design y METR, y obtuvo la mejor puntuación conductual registrada hasta ahora por Anthropic en su batería automatizada de comprobaciones.También hay cambios cuando se intenta forzar al modelo a salirse de sus límites. En una prueba específica de contención, Opus 5.5 registró un 85 % menos de intentos de saltarse los límites que Opus 5 o Claude Mythos 5.1. Los intentos detectados fueron de baja gravedad y el propio modelo los comunicó durante la evaluación.En inyección de instrucciones, una prueba realizada por Gray Swan lo dejó empatado con Fable 5.1 con la tasa de éxito más baja entre los modelos evaluados. Además, mantiene protección contra la extracción del razonamiento y retención cero de datos, e incorpora marcas de agua para cumplir con la Ley de IA de la Unión Europea.Claude Opus 5.5 ya puede utilizarse en AWS, Google Cloud, Microsoft Azure y la plataforma de Claude, mientras los planes Pro, Max y Team reciben límites de uso mayores. Sonnet 5.5 y Haiku 5.5 llegarán durante las próximas semanas, con parte de las mejoras de velocidad, coste y seguridad estrenadas ahora por la familia Opus.