Anthropic lanza Claude Opus 5.5: 40% más barato que Opus 5
Añadir como fuente preferida en Google
Anthropic presentó Claude Opus 5.5, el primer modelo de su nueva familia Claude 5.5. La compañía afirma que rinde al nivel de Claude Fable 5.1 en la mayoría del trabajo y que ejecutarlo cuesta 40% menos que Opus 5. Los precios son 4 dólares por millón de tokens de entrada y 20 dólares por millón de salida, y el modelo ya está disponible en la plataforma de Claude, Amazon Web Services, Google Cloud y Microsoft Azure con el identificador claude-opus-5-5.
Es el primer lanzamiento de Anthropic después de que su CEO, Dario Amodei, pidiera acompasar el ritmo del progreso en inteligencia artificial para que las prácticas de seguridad vayan por delante de las capacidades. Antes de su salida, Opus 5.5 pasó por evaluadores externos, entre ellos Frontier Design y METR.
Precios y velocidad: dónde se gana ese 40%
Anthropic sostiene que Opus 5.5 necesita menos cómputo para servir que Opus 5, y que el precio refleja esa diferencia. La rebaja total sale de dos factores que se suman: cada token cuesta menos y el modelo consume menos tokens por tarea.
| Precio por millón de tokens | Claude Opus 5.5 | Claude Opus 5 |
|---|---|---|
| Lecturas de caché | 0.20 USD | 0.50 USD |
| Tokens de entrada | 4 USD | 5 USD |
| Tokens de salida | 20 USD | 25 USD |
| Escrituras de caché | 5 USD | 6.25 USD |
Las lecturas de caché, que según la compañía concentran la mayor parte del costo en trabajo agéntico y de programación, caen de 0.50 a 0.20 dólares por millón de tokens, un 60% menos. La entrada y la salida bajan 20%. La generación de salida es más de 30% más rápida que en Opus 5. Existe además un modo rápido disponible en Claude Code y en la plataforma de Claude con hasta 2.5 veces la velocidad, a 8 dólares por millón de tokens de entrada y 40 por millón de salida.
Junto con la rebaja, Anthropic anunció que sube los límites de uso de cinco horas en los planes Pro, Max, Team y Enterprise por asiento. Los suscriptores reciben también un reinicio de límite de tasa que pueden guardar y usar cuando quieran. Es un movimiento parecido al que la compañía aplicó con Claude Fable 5.1 y su recorte de costos en programación, aunque en este caso la reducción llega también por el ahorro de tokens por tarea.
Qué rinde Claude Opus 5.5 en código y trabajo de conocimiento
En los benchmarks de Anthropic, Opus 5.5 lidera en programación agéntica, uso de computadora y trabajo de conocimiento. La propia compañía advierte que, a estos niveles de capacidad, los márgenes entre modelos son una guía menos confiable de las diferencias reales, y que en su uso interno la distancia con Fable 5.1 es más estrecha de lo que sugieren los puntajes.
| Benchmark | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 66.4% | 55.8% | 52.3% | 57.9% | 37.3% |
| FrontierCode v1.1 (Main) | 54.4% | 50.3% | 48.0% | 53.3% | 47.5% |
| CursorBench 4.0 | 57.8% | 51.8% | 46.6% | — | 41.7% |
| GDPval-AA v2.1 (Elo) | 1846 | 1735 | 1708 | 1542 | 1588 |
| AutomationBench | 40.0% | 31.4% | 26.9% | 41.4% | 28.8% |
| Humanity’s Last Exam (con herramientas) | 67.7% | 65.6% | 63.6% | 57.2% | — |
| Terminal-Bench-Science 0.1 | 58.7% | 52.6% | 29.0% | 64.6% | 22.4% |
| OSWorld 2.0 (parcial) | 81.8% | 80.7% | 74.0% | — | — |
| Chartography (con herramientas) | 89.0% | 88.4% | 83.4% | — | — |
Los resultados de Opus 5.5 se tomaron con pensamiento adaptativo en esfuerzo máximo. Anthropic aclara que en las tareas de ciberseguridad donde intervinieron sus salvaguardas, el trabajo lo terminó Claude Opus 4.8, y en biología y desarrollo de modelos frontera lo hizo Claude Opus 5, lo que probablemente reduce el puntaje del modelo evaluado.
El detalle más repetido entre los primeros evaluadores es la eficiencia. En un caso interno, un evaluador completó una migración de 680.000 líneas de código en menos de un día, trabajo que a un equipo de ingeniería le habría tomado semanas. Cuando le pidieron reducir los tiempos de carga de todas las páginas de una aplicación web, Opus 5.5 lo logró en 39 de 40 intentos, mientras que Opus 5 hizo mejoras menores que además alteraron el comportamiento de la aplicación. Otro evaluador pidió a varios modelos de Claude construir un juego a partir de un solo prompt, y Opus 5.5 obtuvo el puntaje más alto por calidad gráfica y acabado.
En una prueba con una base de código de 200.000 líneas, un evaluador usó Opus 5.5 para auditarla y corregirla en menos de tres horas. Con Opus 5 tardó más de 20 horas y consumió 2.5 veces más tokens. En otro test interno, Anthropic pidió a Opus 5.5 y a Fable 5.1 traducir HAProxy, el software que balancea cargas de tráfico web entre servidores, de C a Rust. Ambas reescrituras pasaron casi todas las pruebas de regresión de HAProxy, pero Opus 5.5 terminó en 9.5 horas frente a las 12 de Fable 5.1 y costó 51% menos.
En costos por tarea, Anthropic compara así: en FrontierCode, con esfuerzo por defecto, Opus 5.5 supera a GPT-6 Astra con cerca de 20% del costo por tarea. En Terminal-Bench 4.0 iguala a Astra con alrededor de 40% del costo, y en CursorBench supera a GPT-5.6 Sol por 11 puntos con cerca de un tercio del costo.
En trabajo de conocimiento, un test interno pidió a Opus 5.5, Fable 5.1 y Opus 5 redactar un informe sobre los resultados trimestrales de una empresa usando solo la información disponible en una copia de la web donde el reporte de ganancias era difícil de encontrar. Un corrector automático verificó cada cifra y cita contra las fuentes. Según Anthropic, 16 de 18 informes de Opus 5.5 pasaron el estándar de calidad, donde cualquier cifra o cita inventada habría fallado. Ni Fable 5.1 ni Opus 5 lo lograron en ningún intento. En un ejercicio de análisis de una fusión entre dos empresas ficticias de software de recursos humanos, ambos modelos llegaron a las mismas conclusiones, pero el modelo de Opus 5.5 fue más completo, su presentación más legible, y el trabajo tomó 63 minutos frente a 93, con 50% menos de costo.
Seguridad: menos acciones difíciles de revertir
En la auditoría de comportamiento automatizado, la batería de alineación que prueba a Claude en cerca de 2.000 escenarios simulados, Opus 5.5 obtuvo los mejores resultados de cualquier modelo evaluado hasta ahora en casi todas las medidas de comportamiento desalineado. Anthropic dice que es menos propenso que modelos recientes a tomar acciones difíciles de revertir o a salirse de los límites que se le dieron, y más resistente a la inyección de prompts que Opus 5.
La compañía amplió sus pruebas de alineación a tareas largas, tareas imposibles y escenarios basados en incidentes reales. En una evaluación nueva sobre la propensión a cruzar límites de contención, Opus 5.5 intentó eludir barreras cerca de 85% menos veces que Opus 5 o Claude Mythos 5.1, y cada intento fue de severidad baja y autorreportado. Estos resultados se conocen después de que Anthropic confirmara tres incidentes en los que Claude atacó sistemas reales durante evaluaciones de ciberseguridad.
Anthropic también reconoce un límite: ve señales de que Opus 5.5 sospecha a menudo que lo están evaluando, lo que complica medir cómo actuará en entornos reales. El detalle completo de las evaluaciones está en la ficha técnica del modelo (System Card).
Salvaguardas por área
- Ciberseguridad: porque sus capacidades en la materia son muy altas, la mayoría de las tareas de ciberseguridad se redirigen a Opus 4.8. Los usuarios sí pueden identificar y corregir errores en su código dentro del ciclo normal de desarrollo. Anthropic ampliará su Programa de Verificación Cibernética a Opus 5.5, con tres niveles de acceso según la confianza. Claude Security ya está disponible con acceso a Claude Mythos 5.1.
- Biología: Opus 5.5 usa las mismas salvaguardas que Fable 5.1. Las organizaciones verificadas pueden solicitar el nuevo Programa de Verificación en Ciencias de la Vida para investigación biológica.
- Destilación: llega con preserved thinking, la salvaguarda antipiratería introducida con Fable 5.1, que impide a los usuarios de API editar el contexto previo de Claude para extraer su razonamiento. Aplica a Fable 5.1 y a Opus 5.5 en cuentas de API creadas desde el 31 de agosto de 2026. El informe de inteligencia de amenazas de septiembre de 2026 detalla la actividad de destilación ilícita detectada y bloqueada.
El modelo incluye un clasificador que revisa cada acción antes de ejecutarla, un sandbox de código abierto auditable por equipos de seguridad y revisión de código que detecta vulnerabilidades antes de su integración. En ataques de inyección de prompts, Anthropic dice que iguala o supera a Opus 5 en todos los entornos probados, y que en un benchmark de la firma de seguridad Gray Swan empata con Fable 5.1 en la tasa de éxito de inyección más baja registrada.
Datos, marca de agua y modo de pensamiento
Como modelos Opus anteriores, Opus 5.5 está disponible con retención cero de datos. Incluye las medidas de marca de agua con las que la compañía cumple el Reglamento Europeo de IA, y ya no se puede usar con el modo de pensamiento desactivado.
Comunicación: escribir como un colega
Anthropic dice haber mejorado la forma en que el modelo escribe y se comunica, uno de los puntos que más críticas recibió Opus 5. Los mensajes son más fáciles de entender de un vistazo, ponen la información más importante al principio, usan menos jerga y siguen mejor las reglas de escritura que se le indiquen. La compañía publicó comparaciones lado a lado donde Opus 5.5 resume un hilo de Slack o explica un bug de facturación en menos líneas y con la causa raíz por delante.
Qué dicen los primeros evaluadores
Anthropic recogió testimonios de empresas que probaron el modelo antes de su salida. Mario Rodriguez, Chief Product Officer de GitHub, dijo que en sus pruebas con GitHub Copilot CLI y VS Code, Opus 5.5 usó «entre los menos tokens y pasos que hemos medido» y resolvió más tareas de terminal que Opus 5 en menos de la mitad de los pasos. Sean Heintz, desarrollador de software en Clio, le entregó una tarea grande sobre seis repositorios y lo dejó correr solo durante la noche: el modelo se mantuvo en la tarea más de 18 horas.
Harley Barnes, de Quantium, describió un caso en el que una tarea compleja de programación que antes tomaba 38 prompts a lo largo de cuatro días se resolvió con 11 prompts en tres horas. Aleksandar Mitic, ingeniero de Spotify, reportó que en sus pruebas el modelo igualó la calidad de Opus 5 con cerca de la mitad de turnos, tiempo y tokens de salida, y recortó el costo de esa carga entre 40% y 50%. Desde Optiver, Noyan Tokgozoglu señaló que el modelo obtuvo el puntaje más alto que han registrado en la suite de soporte de una mesa de trading. Deepak Singh, de Kiro, apuntó que en un benchmark público de tareas de línea de comandos resolvió más que Opus 5 con cerca de 40% menos llamadas y la mitad de tokens.
En trabajo de conocimiento y legal, Carl Bennett, CIO de Deloitte Consulting LLP, indicó que incluso en su ajuste de esfuerzo más bajo Opus 5.5 detectó 72% de errores conocidos en revisiones de código, frente a 56% de Opus 5 en esfuerzo alto. Frank Corrao, de Walleye Capital, contó que en sus tareas de investigación cuantitativa el modelo detectó que la indexación por minutos en sus propias instrucciones estaba desviada por uno y lo corrigió, algo que ningún modelo había hecho antes. Aabhas Sharma, CTO de Hebbia, reportó 86.6% de cobertura en flujos financieros evaluados con rúbricas de expertos, frente a 60.3% de Opus 5.
En eficiencia de tokens y verbosidad, Yashodha Bhavnani, VP de Productos de IA en Box, afirmó que en sus evaluaciones el modelo usó un tercio de los tokens de Opus 5 y respuestas 40% menos extensas sin perder precisión. John Ruelas, ingeniero de Ramp, dijo que la salida verbosa y difícil de seguir era su mayor frustración con los modelos frontera y que Opus 5.5 la resuelve: escribió sobre el modelo, «escribe como un buen colega».
Disponibilidad y lo que viene
Claude Opus 5.5 está disponible en todas las plataformas, incluidas Amazon Web Services, Google Cloud y Microsoft Azure. En la plataforma de Claude, los desarrolladores pueden empezar con el identificador claude-opus-5-5. Anthropic adelantó que Claude Sonnet 5.5 y Claude Haiku 5.5 llegarán en las próximas semanas con muchas de las mismas mejoras en rendimiento, eficiencia y seguridad.
Este lanzamiento también convive con los planes de Anthropic para gestionar varios agentes en la nube, un terreno que la compañía ya exploró con Claude Code Projects y que ahora apunta a sesiones autónomas más largas y baratas.
Comunidad Arepa
Únete a nuestros canales principales
Comentarios
Relacionados
Ver más
Anthropic relanza Claude Code Projects para gestionar varios agentes de IA en la nube

Jensen Huang pone a Trump en altavoz en pleno escenario del All-In Summit
