Claude Sonnet 5.5 — el modelo mid-range que supera a Opus en coding agentivo

Wait 5 sec.

Claude Sonnet 5.5 llega hoy un 30% más rápido y un 30% más barato que Sonnet 5, y en el benchmark de programación agentiva supera al flagship de AnthropicAnthropic lanza hoy Claude Sonnet 5.5, y los números rompen el esquema habitual de los modelos de gama media: en el test de coding agentivo Terminal-Bench 4.0 alcanza un 70,6% frente al 66,4% de Opus 5.5 —su propio modelo flagship— al tiempo que cuesta la mitad por token. No es solo una actualización de rendimiento. Sonnet 5.5 es el primer modelo de la familia Sonnet que llega con las mismas protecciones de ciberseguridad que hasta ahora Anthropic reservaba exclusivamente a Fable y Opus, y el primero en bloquear activamente la extracción del razonamiento encadenado.El precio se mantiene en 2 dólares por millón de tokens de entrada y 10 dólares por millón de tokens de salida —mismos precios que Sonnet 5— con una velocidad de respuesta un 30% superior y un consumo de tokens por tarea un 30% inferior. Para empresas que despliegan agentes a escala, esa diferencia acumulada se convierte rápidamente en dinero.¿Qué tiene Sonnet 5.5 que no tenía Sonnet 5 en materia de seguridad?La novedad más relevante no está en los benchmarks sino en la capa de protección. Sonnet 5.5 incorpora dos mecanismos que Anthropic no había llevado antes a un modelo Sonnet.El primero son los cyber safeguards de nivel Opus. Las capacidades ofensivas en ciberseguridad de Sonnet 5.5 son, según Anthropic, comparables a las de Opus 5, lo que obliga a tratarlo con el mismo nivel de restricciones. Las solicitudes de mayor riesgo harán un fallback visible a Sonnet 5, no a una respuesta genérica: el usuario sabrá que su petición ha sido redirigida y por qué. Es el primer Sonnet que funciona así.El segundo son los anti-distillation classifiers. En agosto, investigadores consiguieron decodificar 315.320 bloques de razonamiento de 6.708 trazas públicas de agentes de OpenAI, Anthropic y Google, recuperando en el proceso 62 claves de API, 33 contraseñas y 7 claves privadas. La técnica —extraer el pensamiento encadenado del modelo para replicar su lógica o robar credenciales— llevaba tiempo siendo un vector de ataque teórico. En agosto quedó demostrado que era un vector real. Sonnet 5.5 incorpora clasificadores que bloquean esa extracción y vincula el razonamiento a la cuenta que lo produce —lo que Anthropic llama preserved thinking.La razón de que este nivel de protección llegue ahora al tier mid-range es en parte regulatoria. El artículo 55 del AI Act europeo, en vigor desde agosto de 2025, obliga a los proveedores de modelos de propósito general con riesgo sistémico a proteger el modelo y su infraestructura, realizar pruebas adversariales e informar de incidentes graves sin demora. Desde agosto de 2026, la Comisión Europea tiene potestad para imponer multas por incumplimiento. El debate sobre si hace falta un organismo de seguridad conjunto para los labs frontera lleva meses encima de la mesa sin llegar a ningún acuerdo formal. Anthropic prefiere resolver eso por su cuenta.¿Por qué Sonnet 5.5 supera a Opus 5.5 en coding agentivo y qué significa eso?La jerarquía de modelos de Anthropic no ha cambiado en términos generales: Opus sigue siendo más capaz en razonamiento abierto sostenido. En el test GDPval-AA, que mide desempeño en 44 ocupaciones diferentes, Sonnet 5.5 obtiene 1.844 puntos frente a los 1.846 de Opus 5.5 —básicamente un empate—, mientras Sonnet 5 se quedaba en 1.449.Lo que cambia en coding agentivo es la naturaleza de la tarea. Para lanzar múltiples agentes en paralelo, procesar código en pasos breves e iterativos y mantener el coste dentro de los límites operativos de una empresa, la velocidad y el precio por token importan más que la profundidad de razonamiento. Sonnet 5.5 completa más ciclos en menos tiempo y sin que el presupuesto de cómputo salte por los aires. Desde que cubrimos el enfrentamiento entre Claude Opus 5.5 y los equipos de hacking en el Hacktron hace unos días, la pregunta era si Anthropic iba a dejar a Sonnet recuperar terreno en ese tipo de tareas. La respuesta es sí, y con un margen que nadie esperaba.Para contextualizar: OpenAI lanzó Sol y Luna —sus modelos mid y low-tier— la semana pasada. Meta anunció el modelo que alimentará Muse hace pocos días. La carrera por la capa media de modelos está siendo tan competitiva como la de los modelos frontier, y probablemente con más impacto económico directo porque es donde las empresas realmente despliegan agentes a escala.¿Qué cambios prácticos llegan con Sonnet 5.5 y qué viene después?Para desarrolladores, Sonnet 5.5 sustituye a Sonnet 5 como la opción natural para agentes de trabajo intensivo en código. El modelo ya está disponible en la API con el mismo precio que su predecesor —mientras la expansión de la IA hacia dispositivos con agentes anticipatorios como las Snap Specs Intelligence ilustra el tipo de uso agentivo que requiere exactamente estas salvaguardas de nivel Opus.Anthropic también ha confirmado que en las próximas semanas lanzará una nueva versión de Haiku, su modelo más pequeño. No ha dado fecha concreta. La lógica es la misma que con Sonnet 5.5: los mecanismos de protección van permeando hacia abajo en la jerarquía de modelos a medida que las capacidades los justifican.La parte incómoda del anuncio —que TNW señala y que merece atención— es la ambigüedad en el precio. Anthropic afirma que Sonnet 5.5 mantiene los 2 y 10 dólares de Sonnet 5, pero el informe original de TNW en junio indicaba que esos precios eran introductoros hasta el 31 de agosto, con una subida posterior a 3 y 15 dólares. Anthropic no ha aclarado si el incremento nunca llegó a aplicarse o si está comparando con el precio introductorio original. Para quienes usen Sonnet 5.5 en producción, vale la pena verificarlo en el panel de facturación.El lanzamiento de Sonnet 5.5 demuestra que el nivel mid-range no es el escalón de entrada para quienes no pueden pagar Opus: es donde ocurre la mayor parte del trabajo real. Que ese tier lleve ahora las mismas salvaguardas que los modelos más capaces no es un gesto de marketing; es el reconocimiento de que las capacidades peligrosas ya no están confinadas en la capa flagship. Si ese reconocimiento tardó demasiado o llegó a tiempo es algo que los próximos meses de incidentes —o su ausencia— terminarán de responder.La noticia Claude Sonnet 5.5 — el modelo mid-range que supera a Opus en coding agentivo fue publicada originalmente en Wwwhatsnew.com por Natalia Polo.