Hoy Anthropic lanzó Claude Opus 5 y, como siempre que aparece un modelo nuevo, la tabla de benchmarks se llenó de porcentajes que suenan impresionantes. Mi primera reacción fue mirar dónde realmente mejora y dónde no. Porque una cosa es ganar una prueba y otra bastante distinta es ayudarte a terminar un proyecto sin dejar errores escondidos.

La promesa de Opus 5 me parece más interesante por eso último. Anthropic lo describe como un modelo más cuidadoso y proactivo, capaz de verificar su trabajo, usar herramientas durante tareas largas y corregirse antes de dar algo por terminado. Para quienes trabajamos con código todos los días, esa conducta vale más que subir dos puntos en una tabla.

Tabla de benchmarks de Claude Opus 5 frente a Fable 5, Opus 4.8 y GPT-5.6 Sol
Resultados publicados por Anthropic. Cada fila usa una prueba distinta, así que los números no se comparan entre sí de forma directa.

Qué cambia con Claude Opus 5

Opus 5 cuesta lo mismo que Opus 4.8: 5 dólares por millón de tokens de entrada y 25 dólares por millón de salida. La comparación que hace Anthropic es con Fable 5. Opus se acerca a su rendimiento en varias tareas, pero cuesta la mitad. También existe un modo Fast que corre cerca de 2,5 veces más rápido y cobra el doble del precio base.

Está disponible en todos los planes pagados y en la API como claude-opus-5. Pasa a ser el modelo por defecto en Claude Max y el más potente disponible en Claude Pro.

Hasta ahí, bien. Lo que me importa más es que el modelo parece tener mejor criterio durante el trabajo. En las pruebas de Anthropic no se limita a ejecutar una instrucción: arma sus propias validaciones, revisa el resultado y vuelve atrás si algo no cuadra. En un caso creó un pipeline de visión para reconstruir una pieza en 3D porque no podía ver directamente el plano. En otro encontró la causa real de un bug y además corrigió un caso borde que el parche de la comunidad había dejado pasar.

Ese comportamiento se acerca más a cómo uno espera trabajar con un agente. No quiero que escriba código rápido y declare victoria. Quiero que abra la página, pruebe escritorio y móvil, corra los tests y me diga si encontró algo raro.

Qué significa cada benchmark de la tabla

La tabla mezcla programación, búsqueda, trabajo profesional y ciencias. Acá va una traducción corta de cada fila, porque el nombre por sí solo dice poco.

  • Agentic terminal coding (Frontier-Bench v0.1), 43,3%. Mide si el modelo puede resolver tareas reales de ingeniería usando una terminal: explorar archivos, ejecutar comandos, programar, probar y corregir. Opus 5 más que duplica el resultado de Opus 4.8.
  • Knowledge work (GDPval-AA v2), 1861. Evalúa trabajo profesional parecido al que haría una persona en una empresa: analizar información, preparar documentos y resolver tareas de distintas áreas. El resultado se expresa como un puntaje comparativo, no como porcentaje.
  • Novel problem-solving (ARC-AGI-3), 30,2%. Es resolución de problemas nuevos, no "Nobel Problem". La prueba muestra patrones visuales desconocidos y exige descubrir la regla sin apoyarse sólo en conocimiento memorizado. Opus 5 triplica al siguiente modelo de la comparación.
  • Agentic search (BrowseComp), 90,8%. Mide qué tan bien investiga en la web cuando la respuesta está repartida entre varias fuentes. Tiene que buscar, abrir páginas, cruzar datos y llegar a una respuesta verificable.
  • Multidisciplinary reasoning (Humanity's Last Exam), 56,3% sin herramientas y 64,7% con herramientas. Reúne preguntas difíciles de ciencias, humanidades y otras disciplinas. La diferencia entre ambos resultados muestra cuánto mejora cuando puede buscar o usar herramientas durante el razonamiento.
  • Computer use (OSWorld 2.0), 70,6%. Prueba si puede manejar un computador mediante la interfaz gráfica: hacer clic, escribir, navegar entre ventanas y completar tareas en aplicaciones reales.
  • Agentic coding (DeepSWE v1.1), 68,8%. Evalúa tareas largas de desarrollo de software donde el agente debe entender un repositorio y producir una solución funcional. Acá GPT-5.6 Sol lidera con 72,7%.
  • Agentic coding (FrontierCode v1.1 Main), 53,4%. Otra prueba de programación autónoma, enfocada en problemas complejos y ejecución de varios pasos. Fable 5 queda apenas arriba con 53,5%.
  • Business workflows (AutomationBench), 26%. Mide si el modelo puede completar un flujo de negocio de principio a fin. Por ejemplo, revisar una planilla, detectar clientes en riesgo, avisar al responsable y dejar un resumen listo.
  • Legal, 11,7%. Evalúa agentes sobre tareas legales completas, no sólo preguntas sueltas: revisar documentos, detectar problemas y producir un resultado que pase todos los criterios de la prueba. Fable 5 mantiene la ventaja con 13,3%.
  • Health (HealthBench Professional), 59,8%. Mide la calidad de respuestas ante casos médicos profesionales. No convierte al modelo en médico ni reemplaza una revisión humana; sirve para comparar precisión, criterio y manejo de información clínica.
  • Biology (BioMysteryBench), 49,4% en casos difíciles y 90,1% en casos resueltos por humanos. Evalúa investigación biológica a partir de evidencia incompleta. Opus 5 mejora bastante frente a Opus 4.8, aunque Fable y Mythos siguen teniendo ventaja en ciertas tareas científicas.

Ojo con esto: un benchmark mide una capacidad bajo condiciones controladas. No te asegura que el modelo vaya a rendir igual en tu proyecto, con tu documentación y tus restricciones. También hay diferencias de costo, nivel de esfuerzo y herramientas disponibles. La tabla sirve para orientarse, no para elegir modelo mirando quién tiene más casillas coloreadas.

Lo que más me interesa: que revise antes de entregar

Si tengo que elegir una mejora, me quedo con la verificación. Anthropic cuenta que Opus 5 puede sostener tareas abiertas durante más tiempo y que insiste hasta encontrar una solución. Clientes que lo probaron antes del lanzamiento mencionan mejor análisis de causa raíz, cambios grandes en bases de código y menos variación entre una ejecución y otra.

Eso importa harto en trabajo real. Un agente puede generar una interfaz bonita en cinco minutos y aun así dejar un botón fuera de la pantalla en móvil. Según uno de los casos publicados, Opus 5 abrió su propio resultado en resoluciones de escritorio y teléfono, detectó elementos escondidos y los corrigió antes de entregar. Ese tipo de revisión es exactamente lo que uno termina haciendo a mano cuando el modelo se apura.

Mi cautela está en el consumo. Un modelo que usa más herramientas y verifica más veces también puede gastar más tokens o demorarse más. Que sea más eficiente por tarea no significa necesariamente que cada respuesta sea más corta. Antes de mover un flujo de producción completo, yo mediría calidad, costo total y cantidad de reintentos con casos propios.

No gana en todo, y eso está bien

La misma tabla deja claro que Opus 5 no barre con todos. GPT-5.6 Sol sigue arriba en DeepSWE. Fable 5 gana por poco en FrontierCode, razonamiento sin herramientas y legal, mientras Mythos mantiene resultados más altos en salud y algunas áreas científicas.

Para mí eso hace más creíble el lanzamiento. Opus 5 no parece pensado para ser el número uno en cada benchmark, sino para quedar cerca de los modelos más caros y especializados con un costo más razonable para usarlo todos los días. Si esa consistencia se mantiene fuera de las pruebas, ahí está el avance de verdad.

Seguridad y dos funciones nuevas para la API

Anthropic dice que Opus 5 es su modelo más alineado hasta ahora: detectaron menos conductas engañosas, menos acciones imprudentes y mejor adherencia a la Constitución de Claude. En ciberseguridad mantiene restricciones para pruebas de penetración, análisis de binarios y generación de exploits. Cuando una solicitud queda marcada, Claude puede volver automáticamente a Opus 4.8.

Junto al modelo llegaron dos funciones beta para desarrolladores. La primera permite cambiar las herramientas disponibles durante una conversación sin romper la caché del prompt. La segunda habilita fallbacks automáticos en la API, para dirigir una solicitud marcada hacia otro modelo en vez de bloquear todo el flujo.

¿Vale la pena cambiar a Opus 5?

Si ya usas Opus 4.8, sí vale la pena probarlo: mantiene el precio y mejora bastante en terminal, búsqueda, uso del computador y flujos de negocio. En la API el cambio es pequeño, pero yo no migraría a ciegas. Tomaría cinco o diez tareas representativas, compararía resultados y revisaría cuánto costó completar cada una, incluyendo reintentos.

Si usas Fable 5 para todo, Opus 5 puede ser una alternativa mucho más sensata para el día a día. Fable sigue teniendo sentido en problemas donde necesitas exprimir el último punto de razonamiento. Para programación habitual, investigación y agentes que trabajan con herramientas, Opus parece quedar en un punto bien atractivo entre capacidad y costo.

La prueba real empieza ahora. Los benchmarks dicen que el modelo puede hacer más cosas solo. Lo que falta ver es si también sabe cuándo detenerse, preguntar y no tocar lo que no corresponde. Ahí es donde un agente deja de ser una demo bonita y empieza a ser realmente útil.

Para seguir comparando modelos

Si quieres mirar la evolución completa, puedes leer lo que escribí sobre Claude Opus 4.8, la llegada de Claude Sonnet 5 y mi análisis de Fable 5. También dejé una comparación con GPT-5.6 Sol, Terra y Luna, que aparece en varios de los resultados de esta nueva tabla.

Fuente principal: anuncio oficial de Claude Opus 5 en Anthropic.