Anthropic sacó hoy Claude Opus 5.5. Escribo esto el mismo día del anuncio, así que no lo he usado todavía: lo que viene son los números que publicaron y qué pienso hacer con ellos.
Cada Opus nuevo había salido más caro que el anterior. Este sale más barato, y además le gana a Fable 5.1, que es el modelo que hoy uso como arquitecto en mi flujo de trabajo. Esas dos cosas juntas me obligan a revisar una decisión que ya daba por tomada.
Qué salió y dónde está
Opus 5.5 está disponible desde hoy en la API como claude-opus-5-5, en claude.ai, en Claude Code y en las nubes de Amazon, Google y Microsoft. Es el primero de la familia Claude 5.5; Sonnet 5.5 y Haiku 5.5 llegan "en las próximas semanas". Trae 1 millón de tokens de ventana sin recargo por contexto largo, salida máxima de 128K y conocimiento hasta junio de 2026.
Los benchmarks
Anthropic lo midió con pensamiento adaptativo en esfuerzo máximo. Estos son los números, con Fable 5.1, Opus 5 y GPT-6 Astra al lado:
| Prueba | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 66,4% | 55,8% | 52,3% | 57,9% |
| FrontierCode v1.1 | 54,4% | 50,3% | 48,0% | 53,3% |
| GDPval-AA v2.1 (Elo) | 1846 | 1735 | 1708 | 1542 |
| Humanity's Last Exam | 67,7% | 65,6% | 63,6% | 57,2% |
| AutomationBench | 40,0% | 31,4% | 26,9% | 41,4% |
En coral, el mejor de cada prueba. Datos publicados por Anthropic el 22 de septiembre de 2026. Cada fila es una prueba distinta, así que los números no se comparan entre filas. En el celular, desliza la tabla hacia el lado.
Fuera de esa tabla hay tres datos más. En CursorBench 4.0 marca 57,8% contra 51,8% de Fable 5.1, y en OSWorld 2.0, que mide uso del computador, 81,8% contra 80,7%. En Terminal-Bench-Science, en cambio, pierde con Astra: 58,7% contra 64,6%.
Gana casi todo, pero no todo. Y el propio Anthropic avisa que a estos niveles los márgenes de benchmark son una guía cada vez menos confiable. Esta vez tampoco publicaron SWE-bench Verified ni GPQA, ni compararon contra Gemini.
Del lado independiente, Artificial Analysis lo puso primero entre 206 modelos, con 58 puntos contra 53 de Fable 5.1 y de Astra. Con letra chica: correr ese índice en esfuerzo máximo costó 8.708 dólares y 260 millones de tokens de salida, contra una mediana de 92 millones. En esfuerzo alto baja a 54 puntos y 2.172 dólares.
El precio, que para mí es la noticia
Por millón de tokens, así queda la comparación:
| Modelo | Entrada | Salida | Lectura de caché |
|---|---|---|---|
| Opus 5.5 | US$4 | US$20 | US$0,20 |
| Opus 5 | US$5 | US$25 | US$0,50 |
| Fable 5.1 | US$10 | US$50 | US$0,25 |
En coral, el precio más bajo de cada columna. Precios de la API por millón de tokens, según la documentación de Anthropic. En el celular, desliza la tabla hacia el lado.
Opus 5.5 sale un 20% más barato que Opus 5 en entrada y en salida, y un 60% más barato en lecturas de caché, que es lo que de verdad pesa cuando un agente vuelve una y otra vez sobre los mismos archivos. Anthropic dice que en cargas típicas cuesta un 40% menos de correr. Sonnet 5, para referencia, sigue en 2 y 10 dólares.
Ojo con esto, que es donde se escapa el ahorro: en esfuerzo alto y máximo piensa más por turno que Opus 5. Si lo dejas en máximo para todo, el precio más bajo se te va en tokens.
Lo que voy a probar esta semana
En mi flujo, Fable 5.1 hace de arquitecto y le delega la edición de código a Opus. Lo primero que voy a hacer es poner a Opus 5.5 en el asiento del que edita y ver si la promesa se sostiene: Anthropic dice que iguala la calidad de Opus 5 en cerca de la mitad de los turnos, del tiempo y de los tokens, y que genera salida más de un 30% más rápido. Uno de sus testers migró 680.000 líneas de código en menos de un día.
La pregunta que viene después es más incómoda. Si Opus 5.5 le gana a Fable 5.1 en casi todas las pruebas, ¿qué justifica seguir pagando 2,5 veces más por Fable arriba? Eso no lo responde una tabla, lo responde una semana de trabajo real, donde se nota si un modelo sostiene el hilo o se pierde a la mitad.
Si usas la API, revisa esto antes de actualizar
Hay cuatro cambios que rompen código que ya funciona:
- El nivel de esfuerzo por defecto bajó de
highamedium. Si no lo fijas tú, estás corriendo más bajo que antes. - El pensamiento ya no se puede apagar.
- Desaparece forzar herramientas con
tool_choice: anyotool. - El texto entre llamadas a herramientas pasó a bloques de pensamiento, que llegan vacíos por defecto.
El último es el más traicionero porque no falla: si tu app mostraba ese texto como señal de progreso, se queda muda sin lanzar un error, y nadie se entera hasta que un usuario pregunta qué pasó.
Qué significa si tienes un negocio
Si no programas, el titular es corto: el modelo que hoy encabeza la tabla cuesta menos que el de hace unos meses. Eso te llega a través de las herramientas que usas. Cuando el costo por tarea baja, cosas que el año pasado no daban el número (un asistente que conteste consultas, un sistema que procese documentos) empiezan a caber en el presupuesto de un negocio chico.
Y en seguridad, que es lo que me preguntan cada vez que propongo meter IA en el proceso de un cliente: Anthropic dice que es su mejor resultado en la auditoría de comportamiento hasta la fecha, con cerca de un 85% menos de intentos de saltarse sus propias barreras que Opus 5. Lo evaluaron METR y Frontier Design antes del lanzamiento, y se puede usar con retención cero de datos, algo que Fable 5.1 no ofrece.
Mi lectura del día uno
Este es el lanzamiento que más me mueve la rutina en lo que va del año, y no por potencia sino por precio. También es el primero de Anthropic después de que Dario Amodei se sumara a los llamados a marcar el paso de la frontera, y esa contradicción es lo que más se comenta: pedir freno y sacar este salto semanas después del anterior.
Lo que no pienso hacer es dejarlo en esfuerzo máximo por defecto. Ahí el ahorro se evapora y para escribir un formulario no aporta nada.
Si quieres comparar, acá está lo que escribí sobre Fable 5.1, el modelo al que Opus 5.5 viene a discutirle el puesto, y sobre GPT-5.6 de OpenAI. Y si recién estás viendo cómo meter IA en tu trabajo, parte por cómo uso IA para desarrollar páginas web más rápido.