Le chiffre qui compte est 80. Le 30 juillet, OpenAI a baisse le prix API de GPT-5.6 Luna de 80 %, a 0,20 $ par million de tokens en entree et 1,20 $ en sortie, et celui de GPT-5.6 Terra de 20 %, a 2 $ et 12 $. Sol, le haut de gamme, garde son prix mais gagne un mode Fast : jusqu'a 2,5 fois plus rapide pour deux fois le cout, en remplacement du Priority Processing. Les baisses ont ete annoncees dans un billet intitule 'Advancing the price-performance frontier with GPT-5.6', un jour apres qu'un billet jumeau a explique d'ou la marge venait, selon l'entreprise.

Cette explication est la partie inhabituelle. OpenAI dit que GPT-5.6 Sol, execute dans Codex, a recrit et optimise de facon autonome des kernels de production ecrits en Triton et Gluon, ses propres langages GPU open source, reduisant le cout de service de bout en bout de 20 %. Le modele a aussi concu et mene des centaines d'experiences sur le modele brouillon de decodage speculatif qui accelere sa propre generation de tokens, ameliorant cette efficacite de plus de 15 %, et est intervenu sur des pannes materielles et des instabilites d'entrainement en cours de route. OpenAI prend soin de presenter cela comme 'un processus dirige par des humains', et dit que les kernels ecrits par l'IA ont ete valides avec FpSan, un outil open source de detection d'erreurs de virgule flottante.

La distribution a suivi le rythme des prix. Les trois modeles GPT-5.6 sont desormais disponibles en general sur Amazon Bedrock, avec un nouveau mode de cache de prompts explicite : lectures facturees avec 90 % de reduction, ecritures a 1,25 fois le tarif normal, TTL de 30 minutes et jusqu'a quatre points de cache par requete. Les revendications benchmark de la semaine : Sol au raisonnement maximal bat Claude Fable 5 d'Anthropic sur l'indice Coding Agent d'Artificial Analysis 'a moins de la moitie du cout', Terra egale GPT-5.5 sur les benchmarks d'intelligence a moitie prix, et Luna depasse Fable 5 sur Agents' Last Exam pour un cout par tache estime 99 % plus bas.

Pour les builders, la partie pratique est simple : tout modele de cout ecrit au deuxieme trimestre est perime aujourd'hui, et la nouvelle economie du cache recompense les prefixes de prompts stables. Les petites lignes prennent plus de temps. Le chiffre tres cite selon lequel l'intelligence vedette de mars se vend un treizieme du prix est une arithmetique tierce, comparant le score de GPT-5.4 sur un indice public a celui de Luna, pas un chiffre d'OpenAI. Les gains d'auto-optimisation sont OpenAI mesurant OpenAI, dans un processus qu'elle definit. Et 'le modele s'est rendu moins cher' est une affirmation sur une infrastructure que l'acheteur ne peut inspecter. Rien de tout cela ne rend les factures moins reelles. Cela signifie que l'histoire d'efficacite qui fixe desormais les prix merite la meme lecture ligne par ligne que les benchmarks avant elle.