Anthropic presentó Claude Sonnet 5.5, el segundo modelo de la familia Claude 5.5. Es una actualización clara del modelo Sonnet 5: corre más de 30% más rápido y cuesta hasta 30% menos en la mayoría de las tareas.
La compañía ya había lanzado Claude Sonnet 5 y Claude Opus 5.5. Sonnet 5.5 es un complemento más rápido y económico de Opus 5.5, pensado para tareas cotidianas bien definidas, corrección de errores y creación de documentos, diapositivas y hojas de cálculo pulidas. También destaca por su ojo para el diseño.
Claude Haiku 5.5, orientado a aplicaciones de alto volumen y sensibles al costo, se unirá a la familia en las próximas semanas.
Claude Sonnet 5.5: rendimiento y velocidad
Los números muestran una mejora importante. En Terminal-Bench 4.0, una evaluación de codificación agéntica, Sonnet 5.5 obtiene 70.6% frente al 10.3% de Sonnet 5. En GDPval-AA, que mide trabajo real en varias ocupaciones, queda a dos puntos de Opus 5.5. Es el primer modelo Sonnet en superar Pokémon Red usando solo capturas de pantalla, lo que refleja avances en tareas de largo plazo y comprensión de imágenes.

En colaboración, escribe con más claridad que la generación anterior. Los primeros probadores lo describen como un mejor compañero de trabajo que Sonnet 5. Su velocidad favorece la iteración rápida en tareas menos complejas.
El costo es igual al de Sonnet 5: 2 dólares por millón de tokens de entrada, 10 dólares por millón de tokens de salida y 0.20 dólares por millón para lecturas de caché. Pero como necesita muchos menos tokens para hacer el mismo trabajo, en las pruebas de Anthropic cuesta hasta 30% menos por tarea que su predecesor.
La velocidad de generación es más de 30% superior a Sonnet 5; es el modelo Sonnet más rápido hasta la fecha. Jamil Valliani, jefe de producto de IA en Atlassian, afirmó que los agentes Rovo podrán ejecutarse hasta 30% más rápido que con Sonnet 5.

Codificación: mejora notable en benchmarks
El salto en programación es evidente. En FrontierCode, Sonnet 5.5 con esfuerzo alto puntúa 10 puntos más que Sonnet 5 en el mismo ajuste, con un costo por tarea unas 15 veces menor. Hay una excepción: a esfuerzo máximo, el puntaje es inferior al de Xhigh porque el modelo ejecuta con más frecuencia la habilidad de revisión de código, lo que puede causar tiempos de espera o ediciones fuera del alcance de la tarea. En CursorBench, que evalúa tareas ambiguas de múltiples archivos tomadas de sesiones reales de Cursor, su mejor puntaje queda a unos dos puntos de Opus 5.5.
Los evaluadores notaron que Sonnet 5.5 entiende más rápido una base de código y agrupa llamadas a herramientas con más eficiencia que Sonnet 5. Eso reduce el número de pasos y el costo.
Daniel Vogel, director de operaciones de Epic Games, dijo que en las pruebas tempranas el modelo «despejó la misma barra de calidad que se esperaría de un modelo de nivel superior» en una auditoría de diseño de sistema y una revisión de flujo de datos. Sualeh Asif, director de ML en SpaceXAI, agregó que en 118 compilaciones reales de aplicaciones, Sonnet 5.5 produjo apps que puntuaron al nivel de Opus 5 con un promedio de 3.6 iteraciones por compilación frente a 7.7 de Opus 5.
Trabajo de conocimiento y diseño
En GDPval-AA, Sonnet 5.5 queda casi a la par de Opus 5.5 y unos 400 puntos por encima de Sonnet 5. También está cerca de Opus 5.5 en uso de computadora y reconocimiento de gráficos, y supera a Sonnet 5 y GPT-6 Sol en trabajo de conocimiento de largo plazo. Anthropic aclara que una versión preliminar con un bug en las salidas estructuradas pudo subestimar ligeramente los puntajes en GDPval-AA y AA-Briefcase; ese bug ya se corrigió.
Los probadores destacan mejoras menos cuantificables: es un interlocutor más natural y tiene talento para el diseño. Añade pulido a interfaces de usuario y puede seguir plantillas de diapositivas para crear presentaciones que requieren mínima edición. En una prueba interna, Anthropic le entregó los estados financieros trimestrales de una empresa pública, transcripciones de llamadas y una plantilla. El primer borrador de una revisión operativa de 10 diapositivas estuvo listo para enviarse sin cambios, según dos expertos.
Curtis Allen, ingeniero principal de Slack, explicó que sin cambiar ninguna instrucción, Sonnet 5.5 superó a Sonnet 5 en casi todas las evaluaciones offline del Slackbot, con menos pasos y 14% menos tokens de salida. Yashodha Bhavnani, vicepresidenta de productos de IA en Box, señaló que Sonnet 5.5 «revisa los datos de los documentos fuente y detecta errores que Sonnet 5 pasó por alto».
Seguridad y salvaguardas
En la auditoría conductual automatizada de Anthropic, que prueba a Claude en unos 1.850 escenarios, Sonnet 5.5 mejora o iguala a Sonnet 5 en la mayoría de las medidas de alineación, resistencia al mal uso y honestidad. En las evaluaciones de contención más nuevas, se acerca a Opus 5.5 y es el modelo menos propenso a explorar los límites de sus contenedores.
Sus capacidades de ciberseguridad son comparables a las de Opus 5, así que es el primer modelo Sonnet que se lanza con salvaguardas cibernéticas y mecanismos de respaldo. Las solicitudes de ciberseguridad de mayor riesgo desviarán visiblemente a Sonnet 5. Los defensores podrán solicitar acceso escalonado a capacidades más avanzadas mediante el programa de verificación cibernética ampliado.
Las salvaguardas biológicas son las mismas que las de Sonnet 5 y apuntan solo a un conjunto reducido de solicitudes de alto riesgo. La investigación, la educación y el trabajo clínico no se ven afectados, aunque algunas solicitudes de microbiología y virología podrían marcarse por error.
Sonnet 5.5 también es el primer modelo Sonnet con clasificadores de seguridad que evitan la extracción de razonamiento en ataques de destilación. La función de pensamiento preservado se amplía para que el razonamiento de Claude no pueda desvincularse de la cuenta que lo creó.
Disponibilidad y precios

Claude Sonnet 5.5 ya está disponible en todas las plataformas, incluidas Amazon Web Services, Google Cloud y Microsoft Azure. Los desarrolladores pueden usarlo en la plataforma Claude con el identificador claude-sonnet-5-5. Si ejecutas Sonnet con el pensamiento desactivado, tendrás que cambiar al nuevo ajuste between_tools antes de migrar. La guía de migración está disponible en la documentación oficial.
Los precios por millón de tokens son: 0.20 dólares para lecturas de caché, 2.50 dólares para escrituras de caché, 2 dólares para entrada y 10 dólares para salida. En comparación, Opus 5.5 cobra 0.20, 5, 4 y 20 dólares respectivamente. El nivel de esfuerzo se puede ajustar para equilibrar costo y velocidad con la calidad.
Con información de Anthropic.