El lanzamiento que no cubrimos: Anthropic saco Claude Opus 5 el viernes 24 de julio, y la cifra que importa es dos, el factor de precio entre el y el buque insignia al que sombrea. El posicionamiento de Anthropic es 'cercano a la inteligencia frontier de Claude Fable 5 a mitad de precio', a los mismos 5 dolares por millon de tokens de entrada y 25 de salida que Opus 4.8, con un modo Fast al doble de coste por unas 2,5 veces la velocidad. Ahora es el modelo por defecto en Claude Max, el mas fuerte en Pro, y estuvo disponible en AWS Bedrock el mismo dia con un contexto de un millon de tokens.

Las cifras reclamadas, del articulo de lanzamiento de Anthropic: nuevo estado del arte en Frontier-Bench y GDPval-AA, una puntuacion en CursorBench 3.2 dentro del 0,5 % del pico de Fable 5 a mitad de coste por tarea, un resultado en OSWorld 2.0 por encima del mejor de Fable 5 a poco mas de un tercio del coste, y una puntuacion en ARC-AGI-3 que Anthropic describio como el triple del siguiente mejor modelo, 30,2 % en el conjunto publico de tareas. La lectura independiente fue mas amable que el marketing: Artificial Analysis lo pone justo por delante en su Intelligence Index, 61 a 60 de Fable 5, en empate de hecho, y claramente por delante en AA-Briefcase, su benchmark agentico, 1.720 a 1.574, con un coste por tarea alrededor de un 20 % menor ; Epoch puso su puntuacion de ingenieria de software a la par de Fable 5. Anthropic tambien afirma que evito deliberadamente entrenar a Opus 5 en tareas ciberneticas; sigue bien detras de Mythos 5 en ese terreno. Un detalle que destaco Simon Willison del lanzamiento: en una tarea de Frontier-Bench sin forma de ver el plano de una pieza de maquina, Opus 5 escribio su propio pipeline de vision por computadora para extraer la geometria de los pixeles crudos.

La respuesta tardo cinco dias. El 29 de julio, OpenAI publico 'How enabling two settings tripled our scores on the ARC-AGI-3 benchmark': GPT-5.6 Sol marca 13,3 % en la re-ejecucion del conjunto publico por la propia OpenAI, frente al 7,8 % de la tabla oficial, pero 38,3 %, por encima del 30,2 % de Opus 5, una vez activados dos ajustes de la API Responses, retained reasoning, que conserva el razonamiento privado entre llamadas a herramientas en lugar de descartarlo, y compaction, que resume contextos largos en lugar de truncarlos. Mismos pesos del modelo, unas seis veces menos tokens de salida, casi el triple de puntuacion. Francois Chollet, de ARC Prize, trazo la linea donde vive ahora el debate: los arneses hechos a medida para una puntuacion quedan fuera, los ajustes de API de proposito general que cualquier cliente puede activar quedan dentro, y las cifras de OpenAI se sostienen mientras los ajustes y el coste se indiquen con claridad. Tambien reconocio la cuestion de paridad: el arnes oficial descarta razonamiento que el propio modelo produjo, lo que es una decision sobre la prueba, no sobre los pesos.

Archiven, pues, las dos cifras. Opus 5 con 30,2 % en un arnes que tira su razonamiento entre pasos, y GPT-5.6 Sol con 38,3 % en uno que no lo tira, son ambas verdaderas, y no describen la misma prueba. La leccion util de esta semana de lanzamiento no es quien gano; es que de ahora en adelante, cada resultado de benchmark frontier llega en dos columnas, el modelo y el andamiaje a su alrededor, y la segunda columna se esta convirtiendo en la que mueve la cifra. Cuando un vendedor te cite una puntuacion, la primera pregunta de seguimiento ya tiene forma fija: con que arnes, y de quien.