Anthropic le puso una trampa a su propio modelo. Le dieron a Claude Opus 5 el dibujo en 2D de una pieza mecánica y una orden sencilla: reconstrúyela en 3D dentro de FreeCAD, el programa gratuito de diseño e ingeniería. El detalle cruel estaba en la letra pequeña: le apagaron la visión. El modelo no podía “ver” la imagen que tenía que reconstruir.
Un modelo cualquiera se rinde ahí, o se inventa la respuesta y sigue como si nada. Opus 5 hizo otra cosa. Se escribió su propio programa de visión por computadora desde cero: código para leer los píxeles en bruto, encontrar los bordes y las formas, y sacar la geometría de una imagen que técnicamente no podía mirar. Con esa información reconstruyó la pieza completa en 3D. Y no fue suerte de una vez, lo repitió una y otra vez. Según Anthropic, ningún modelo rival resolvió la prueba en cinco intentos.
Ahí está lo interesante, y es la idea que vale la pena que te lleves de todo esto: cuando Opus 5 chocó contra un muro, no pidió permiso ni se quedó pegado. Se fabricó su propia herramienta para rodearlo.
Qué es Claude Opus 5
Opus 5 es el modelo más nuevo de Anthropic, la empresa detrás de Claude. Salió el 24 de julio de 2026 y ya está funcionando en Claude.ai, en la API de Claude, en Claude Code y en Claude Cowork. Su identificador para desarrolladores es claude-opus-5.
Para ubicarte rápido dentro de la familia: arriba de todo está Fable 5, el modelo de frontera de Anthropic, el más inteligente y también el más caro. Un peldaño abajo vive la línea Opus, el caballo de batalla del día a día. Lo que hace especial a esta versión es que Opus 5 se acerca muchísimo a la inteligencia de Fable 5, pero al precio y la velocidad de un Opus. Un fundador de Cursor lo resumió mejor que nadie: “inteligencia cercana a Fable 5, a velocidad y costo de Opus”. En español, Hipertextual lo tituló sin rodeos: Opus 5 “se acerca a Fable 5, pero sin ser tan cara”.
¿Y cuánto cuesta? Cinco dólares por millón de tokens de entrada y 25 por millón de tokens de salida (un token es más o menos tres cuartos de una palabra, así que un millón de tokens rondan las 750.000 palabras). Ojo con esto, porque es justo donde casi todos se confunden: son exactamente los mismos números que cobraba Opus 4.8, el modelo al que reemplaza. Cuando lees “la mitad de precio”, el punto de comparación es la frontera, o sea Fable 5, que cuesta el doble. No es que Opus 5 sea más barato que su antecesor. Es que te da casi lo de arriba pagando lo de siempre.
En la práctica, Opus 5 es el nuevo modelo por defecto en Claude Max y la opción más potente que puedes elegir si pagas Claude Pro. Junto al modelo llegaron dos funciones que suenan chiquitas pero se agradecen: ahora puedes cambiarle a un modelo las herramientas que tiene a mano en plena conversación, sin reiniciar nada; y la API puede recurrir automáticamente al viejo Opus 4.8 si una petición a Opus 5 sale mal, una red de seguridad pensada para las apps que están en producción.

Por qué importa que resuelva problemas nuevos
La historia de FreeCAD no es una anécdota suelta para el show del lanzamiento. Apunta a lo que de verdad mide el valor de un modelo: qué hace cuando se topa con algo que nadie escribió antes. En la prueba ARC-AGI-3, pensada justo para eso (resolver problemas novedosos en lugar de repetir lo aprendido), Opus 5 sacó alrededor del triple que el siguiente mejor modelo.
Y eso pega donde duele, porque la mayor parte del trabajo real es precisamente el caso raro: el reporte con un formato que nadie previó, la hoja de cálculo hecha un nudo, el error que no aparece en ningún tutorial. Un modelo que se defiende ahí termina valiendo más que uno que solo brilla en las preguntas de examen.
Los benchmarks, sin maquillaje
Acá toca ser claro con una cosa antes de soltar los números: todos estos resultados los reporta Anthropic. Son sus pruebas, con su rival elegido, GPT-5.6 “Sol” de OpenAI. Dicho eso, vamos a verlos.

En la mayoría de las pruebas que eligió Anthropic, Opus 5 le gana a GPT-5.6 Sol:
- Programación agéntica en terminal (Frontier-Bench): 43,3 % contra 34,4 %.
- Trabajo de conocimiento (GDPval-AA): 1.861 contra 1.736.
- Problemas nuevos (ARC-AGI-3): 30,2 % contra 7,8 %.
- Uso de la computadora (OSWorld 2.0): 70,6 % contra 62,6 %.
- Flujos de trabajo de negocio (AutomationBench): 26,0 % contra 18,1 %.
- Búsqueda web autónoma (BrowseComp): casi empate, 90,8 % contra 90,4 %.
Hasta ahí, un barrido. Pero si el post terminara acá te estaría vendiendo humo, porque GPT-5.6 Sol gana justo donde viven muchísimos desarrolladores. En DeepSWE, la prueba de programación del mundo real, GPT saca 72,7 % contra el 68,8 % de Opus 5 (y ojo, ahí GPT le gana también a Fable 5). Y en HealthBench, de salud profesional, GPT se impone por poquito: 60,5 % contra 59,8 %.
Con eso sobre la mesa, hay dos advertencias que conviene no soltar:
- Anthropic eligió las pruebas y el rival. Es lo que hace cualquier laboratorio: se mide bajo su mejor luz. No es trampa, pero es exactamente la razón por la que uno espera a la gente de afuera.
- Los jueces independientes todavía no evaluaron a Opus 5. En el índice de inteligencia de Artificial Analysis, que no pertenece a ninguna de las dos empresas, hoy están Fable 5 con 60, GPT-5.6 Sol con 59 y Opus 4.8 con 56. Opus 5 aún no aparece. Cuando aterrice ahí, hazle más caso a ese número que a cualquier gráfico del día del lanzamiento.
Y ya que estamos: circula por ahí un post que asegura que “Opus 5 le gana a GPT en SWE-Bench Pro”. Trátalo como un rumor sin confirmar. La tabla de Anthropic ni siquiera usa SWE-Bench Pro, y en la prueba de código que sí muestra, DeepSWE, quien gana es GPT. Sin una fuente que lo respalde, no es un dato: es un rumor.
Lo que (todavía) no puede, y lo que no sabemos
Que quede claro: Opus 5 no es el modelo más potente de Anthropic. Ese sigue siendo Fable 5. Para tareas que se ejecutan de forma autónoma durante horas, la propia Anthropic te sigue mandando a Fable 5. Opus 5 es la jugada de valor, no el techo.
Hay un terreno donde es más flojo, y es a propósito: la ciberseguridad. Opus 5 es tan bueno como un modelo especializado llamado Mythos 5 para encontrar fallos de software, pero se queda muy por detrás a la hora de construir un exploit que los aproveche. Ese hueco está puesto adrede: la idea es que sepa detectar la puerta abierta sin volverse un experto en tirarla abajo.
Un punto que mucha gente da por hecho y que todavía no está confirmado: la ventana de contexto. La línea Opus lleva meses trabajando con un millón de tokens (unas 750.000 palabras), y se supone que Opus 5 la mantiene, pero la documentación de Anthropic aún no menciona a Opus 5 por su nombre. O sea, es muy probable que siga en un millón, pero hasta que lo pongan por escrito, tómalo como probable y no como un hecho cerrado. Y recuerda que, hasta acá, todos los números salen del propio Anthropic. Marcan la dirección, no la palabra final.
Qué significa esto para ti
Depende bastante de para qué uses la IA, así que vamos por casos.
Si ya pagas Pro o Max: no tienes que hacer nada, ya te actualizaron. El mejor uso es confiarle las tareas difíciles de verdad (ese reporte hecho un nudo, la hoja de cálculo que nadie entiende) en lugar de andar con pies de plomo pidiéndole solo cosas simples.
Si escribes, planificas o analizas para vivir: tienes un modelo fuerte para el día a día a un precio que no le va a dar un infarto al área de finanzas. Y se luce justo en lo raro, en eso que no viene con plantilla.
Si programas o montas automatizaciones: los números de código y de agentes son los que más gritan (rendimiento casi de frontera a mitad de costo, más el cambio de herramientas a mitad de conversación). Vale la pena probarlo en tu código real, no en una demo de laboratorio. Eso sí, vigila el gasto de tokens: un modelo más barato por token puede salir más caro si necesita “pensar” más para llegar a la respuesta.
Si estás decidiendo entre Claude y ChatGPT: no elijas por el benchmark de esta semana. Están tan parejos que lo que manda es el encaje: la interfaz con la que te sientes cómodo, la voz con la que escribes, las herramientas donde ya vives. Si quieres ordenar esa decisión con la cabeza en lugar de a puro hype, te sirve el curso Qué IA elegir: ChatGPT, Claude o Gemini.
En resumen
Claude Opus 5 no es la IA más inteligente del planeta, y Anthropic tampoco lo vende como tal. Lo que hace es más útil de lo que suena en un titular: baja la frontera a un precio de caballo de batalla y, de paso, demostró que cuando algo se le atraviesa, se construye su propio camino para pasar.
La lección que queda no es “cámbiate a Opus 5 ya mismo”. Es otra: vuélvete lo bastante bueno con las herramientas que ya tienes en las manos como para juzgar una nueva por tu cuenta, con tu propio trabajo, sin esperar a que un gráfico decida por ti. Esa habilidad te va a servir sin importar qué laboratorio vaya ganando este mes. Y si quieres empezar por ahí, el curso Claude para todos te lleva de cero a manejarlo con soltura.
Fuentes: Introducing Claude Opus 5 — Anthropic, Hipertextual y Artificial Analysis.