Radar IA · Edición 002 · 24 de julio de 2026
Anthropic lanzó Claude Opus 5 el 24 de julio de 2026 y lo dejó disponible ese mismo día en Claude, Claude Code y la API. Conservó el precio base de Opus 4.8: US$5 por millón de tokens de entrada y US$25 por millón de salida. La mejora importante aparece en tareas donde el modelo debe investigar, usar herramientas, navegar interfaces o sostener una ejecución larga. Ese detalle le daña la calculadora a cualquiera que todavía compare modelos mirando únicamente el precio del token.
Dónde está disponible Claude Opus 5
Claude Opus 5 aparece como modelo activo con el identificador claude-opus-5. Anthropic lo convirtió en el modelo predeterminado de Claude Max y en la opción más potente de Claude Pro. También está en Claude Code y en la API. La tabla oficial de deprecaciones garantiza actividad como mínimo hasta el 24 de julio de 2027.
La ficha de Google Cloud lo registra como GA, con entrada de texto, imágenes y PDF, contexto máximo de un millón de tokens y salida máxima de 128.000. Está disponible hoy. Aun así, una cuenta empresarial debe revisar región, consola y contrato: cada despliegue puede activarlo con políticas distintas.
Anthropic lo posiciona cerca de la inteligencia de frontera de Claude Fable 5 por la mitad del precio. Esa comparación pertenece al anuncio del proveedor. La parte comprobable es más simple: mantiene la tarifa de Opus 4.8 y mejora varios resultados publicados. Las tareas propias deciden el caso de compra; los adjetivos del fabricante apenas proponen la hipótesis.
Qué dicen los benchmarks de trabajo útil
La tabla sí muerde. Opus 5 marca 43,3% en Frontier-Bench v0.1, frente a 33,7% de Fable 5, 21,1% de Opus 4.8 y 34,4% de GPT-5.6 Sol. En GDPval-AA v2 llega a 1861, por encima de 1747, 1593 y 1736, respectivamente. Son evaluaciones orientadas a trabajo con valor económico y tareas complejas. Quedan bastante lejos del concurso de trivia con esteroides que todavía domina muchos lanzamientos.
En navegación e interacción con interfaces, Opus 5 obtiene 90,8% en BrowseComp y 70,6% en OSWorld 2.0. GPT-5.6 Sol queda muy cerca en BrowseComp, con 90,4%, y registra 62,6% en OSWorld. En Humanity’s Last Exam con herramientas, Opus 5 llega a 64,7%, frente a 63,9% de Fable 5 y 57,9% de Opus 4.8.
La cifra que merece más atención operativa es AutomationBench. Opus 5 alcanza 26,0%; Opus 4.8, 17,0%; Fable 5, 17,4%; GPT-5.6 Sol, 18,1%. El system card de Anthropic añade una vista de costo: con esfuerzo medio, Opus 5 logra 24% a US$0,89 por tarea. Todavía es una evaluación del fabricante, pero permite comparar resultado y gasto dentro del mismo protocolo.
Eso cambia la pregunta de compra. Un token barato puede salir caro si el sistema necesita tres intentos, supervisión constante y una corrección humana al final. Un modelo más caro por token puede costar menos por entrega aceptada. La ecuación sigue abierta para cada empresa; Opus 5 ofrece material suficiente para medirla con datos propios.
Las filas que pierde
Aquí se acaba la coronación. En DeepSWE v1.1, Opus 5 obtiene 68,8%, debajo de 69,7% de Fable 5 y 72,7% de GPT-5.6 Sol. En FrontierCode v1.1 Main marca 53,4%, una décima por debajo de Fable 5. En Legal Agent Benchmark held-out llega a 11,7%, mientras Fable 5 consigue 13,3%.
Incluso en Humanity’s Last Exam cambia el orden cuando se retiran las herramientas: Opus 5 marca 56,3% y Fable 5, 56,5%. La diferencia es pequeña y deja la ventaja agentic circunscrita a ciertas modalidades.
La fila de salud también exige cuidado. Opus 5 registra 59,8% en HealthBench Professional. GPT-5.6 Sol llega a 60,5% y Anthropic coloca 66,0% para Mythos 5. La columna cambia de Fable a Mythos en esa evaluación. En BioMysteryBench hard, Opus 5 sí lidera con 49,4%, frente a 46,5% de Fable 5 y 42,4% de Opus 4.8.
Los benchmarks usan herramientas, presupuestos de razonamiento y harnesses distintos. Una ventaja de dos puntos puede desaparecer si el flujo real tiene otras APIs, archivos más sucios o un criterio de aceptación diferente. Por eso la tabla sirve para formar una hipótesis: Opus 5 parece especialmente fuerte en trabajo agentic, automatización e interacción con computadores. Cualquier declaración de “mejor modelo” necesita un apellido que nombre la tarea.
El 95% de los pilotos de IA fallan. Este sistema es para el otro 5%.
Inmersión presencial con tus datos, tus campañas y tu equipo. Salen operando agentes desde la primera sesión, no con apuntes.
Ver si aplica para mi equipo →La honestidad aquí tiene valor comercial. Un equipo de software puede preferir GPT-5.6 Sol para una prueba parecida a DeepSWE y Opus 5 para una automatización larga con navegador. Un área legal debería probar su propio conjunto antes de interpretar el nombre Opus como una ventaja. Comprar un único modelo para todo simplifica compras y puede empeorar el trabajo.
Qué añade la verificación de ARC Prize
ARC Prize verificó resultados de Opus 5 por separado. El modelo alcanzó 97,5% máximo en ARC-AGI-1 y 90,4% máximo en ARC-AGI-2. En ARC-AGI-3 obtuvo 30,16% con esfuerzo alto. Anthropic redondea ese resultado a 30,2% en su tabla.
La ventana corta de pruebas dejó ARC-AGI-3 sin resultado de esfuerzo máximo. Esa ausencia importa. La cifra comparable termina en 30,16% con esfuerzo alto; extrapolarla sería inventar. En la misma tabla de Anthropic, Opus 4.8 tiene 1,5% y GPT-5.6 Sol, 7,8%.
ARC-AGI mide adaptación a problemas visuales nuevos. Su protocolo queda lejos de una empresa, aunque pone presión sobre una capacidad útil: descubrir una regla sin recibir cientos de ejemplos. La distancia frente a Opus 4.8 sugiere un salto en razonamiento adaptativo. El efecto real aparecerá cuando esa capacidad sobreviva a permisos, herramientas frágiles, información contradictoria y criterios de negocio.
Esfuerzo, velocidad y precio
La tarifa base de Opus 5 es de US$5 por millón de tokens de entrada y US$25 por millón de salida. Anthropic mantuvo la misma tarifa de Opus 4.8. El modelo ofrece niveles de esfuerzo low, medium, high, xhigh y max. Esa perilla decide cuánto presupuesto de razonamiento recibe una tarea.
Fast mode controla otra cosa. Anthropic promete aproximadamente 2,5 veces la velocidad de salida por el doble del precio base. Acelera la salida y deja intacta la inteligencia del modelo. Una revisión de código que bloquea un despliegue puede justificarla. Una investigación nocturna que será leída a la mañana siguiente puede quedarse en la ruta normal.
El botón caro es muy fácil de encontrar. Poner max y fast en todo compra más razonamiento y menos latencia antes de saber si la tarea los necesita. La ruta sana empieza con un conjunto representativo, un criterio de aceptación y un presupuesto por resultado. Después se escala el esfuerzo solo donde la calidad adicional supera el costo.
El precio por token sigue siendo útil para presupuestar y resulta insuficiente para comparar modelos agentic. Conviene medir costo por tarea aceptada, tiempo hasta aceptación, número de reintentos y minutos de revisión humana. Si un modelo completa más en el primer intento, su tarifa nominal puede ser secundaria. Si produce entregas largas imposibles de verificar, la autonomía se convierte en deuda.
Qué cambia en herramientas y API
Junto con Opus 5, Anthropic lanzó en beta cambios de herramientas a mitad de conversación y fallbacks automáticos opt-in para solicitudes marcadas por clasificadores de seguridad. Para un agente largo, el cambio de herramientas puede evitar un reinicio cuando aparece una capacidad nueva. Ambas funciones abren más estados que el sistema debe registrar: qué herramienta estaba disponible, cuál se sustituyó, qué clasificador intervino y qué modelo produjo cada salida.
Anthropic publica un testimonio de acceso temprano donde el modelo abrió una aplicación en navegador, la probó en escritorio y móvil, y encontró un producto oculto y un checkout fuera de pantalla. La conducta es atractiva porque combina construcción con control de calidad. La demo vende; la tasa de éxito todavía falta. El caso fue seleccionado por el proveedor y carece de una medición independiente.
Para quienes siguen los agentes de desarrollo, la noticia se conecta con las correcciones recientes de permisos y verificaciones en Claude Code. Un modelo más capaz vuelve más importante el gobierno. Si puede sostener trabajos más largos, también puede acumular más cambios antes de que alguien mire.
La competencia está acercando los flujos. Codex ya importa historiales desde Cursor y Claude Code, una señal de que el contexto de trabajo empieza a ser portable entre agentes. Prompts, reglas y trazas deben permanecer fuera de cualquier callejón de proveedor. Guardarlos en formatos legibles reduce el costo de cambiar.
La letra pequeña de seguridad
Anthropic reporta una puntuación general de conducta desalineada de 2,3, la menor entre sus modelos recientes según su auditoría. Es una buena señal dentro de esa metodología. Su alcance termina en una auditoría interna y cada integración conserva sus propios riesgos.
En ciberseguridad, Opus 5 queda por detrás de Mythos 5. Anthropic espera que sus clasificadores intervengan aproximadamente 85% menos que con Fable 5. Cuando una solicitud activa los controles en Claude.ai, Claude Code o Cowork, el sistema puede pasar la tarea a Opus 4.8. En la API, ese fallback es opcional.
La menor tasa de intervención esperada puede reducir la fricción del trabajo legítimo de seguridad. También hace más importante registrar cuándo se activó un control y qué modelo terminó la tarea. Si una evaluación mezcla Opus 5 con fallbacks silenciosos, el equipo puede atribuir calidad, costo o rechazo al modelo equivocado.
La recomendación es aburrida y útil: permisos mínimos, entornos aislados, secretos fuera del prompt, revisión de cambios materiales y rollback probado. La autonomía necesita llaves, frenos y reversa. Un error también aprovecha la velocidad nueva.
Un millón de tokens también guarda basura
Google Cloud documenta un contexto máximo de un millón de tokens y una salida de hasta 128.000. Ese tamaño permite cargar repositorios, documentos y conversaciones extensas. La atención uniforme y la utilidad de una salida enorme siguen fuera de la garantía.
Un contexto largo funciona mejor cuando tiene estructura: fuentes canónicas, instrucciones separadas de datos, versiones visibles y criterios de finalización. Meter todo el repositorio, todas las reuniones y todos los dashboards en una sola ventana puede aumentar ruido y costo. La capacidad evita cortar información valiosa; una mala arquitectura de contexto conserva todos sus problemas.
Para tareas largas conviene guardar checkpoints fuera del chat. El estado real debe vivir en archivos, tickets, pruebas o bases de datos que otro modelo y una persona puedan leer. Si la única memoria del proyecto está dentro de una conversación de un millón de tokens, la recuperación sigue dependiendo de una caja negra.
Qué debería hacer un equipo antes de migrar
Si lo vas a probar, escoge entre 20 y 50 tareas reales y reserva las demos para el lanzamiento. Incluye casos fáciles, casos caros y fallos conocidos. Cada tarea necesita una respuesta aceptable, un límite de tiempo y una persona responsable de juzgarla. Así aparece una línea base para comparar Opus 4.8, Opus 5 y el modelo alternativo que ya usa el equipo.
Separa calidad de velocidad. Prueba esfuerzo medium y high antes de max, y reserva Fast para tareas sensibles a latencia. Registra tokens, costo, tiempo, reintentos, herramientas llamadas y correcciones humanas. La cifra central es el costo total por tarea aceptada.
La prueba también debe romper el flujo: retirar una herramienta a mitad de ejecución, devolver una API lenta, introducir un documento contradictorio y revocar un permiso. Opus 5 promete sostener mejor el trabajo largo. Eso se demuestra en el momento en que el trabajo se tuerce; una demo limpia deja la pregunta abierta.
Guarda la memoria de tu operación fuera del proveedor. Las instrucciones, suites de evaluación y trazas deben sobrevivirle. La ganancia de un modelo nuevo se puede medir en días; el bloqueo de una arquitectura cerrada puede durar años.
La lectura de Radar IA
Claude Opus 5 es un lanzamiento importante porque mejora varias tareas agentic sin estrenar una tarifa base. Frontier-Bench, GDPval-AA, ARC-AGI-3, OSWorld y AutomationBench apuntan hacia más trabajo terminado por ejecución. ARC Prize confirma una de las mejoras más llamativas fuera de la tabla de Anthropic.
La misma evidencia impide escribir una coronación. DeepSWE, FrontierCode, Legal Agent y HealthBench muestran rivales por delante. El modo rápido duplica precio. El esfuerzo máximo puede aumentar costo y latencia. Los controles de ciberseguridad pueden introducir fallbacks. Un millón de tokens puede cargar más contexto y también más basura.
Cambiar el nombre del modelo dentro de una configuración apenas estrena el selector. La oportunidad consiste en medir el trabajo aceptado: qué terminó, cuánto costó, cuánta supervisión necesitó y qué tan fácil fue revertirlo. Opus 5 llega con argumentos suficientes para esa prueba. La calculadora seria empieza después del benchmark.
Fuentes primarias: anuncio de Claude Opus 5, system card, resultados verificados de ARC Prize, estado del modelo y ficha de Google Cloud.
© 2026 Andres Ospina
