O numero que importa e 80. No dia 30 de julho, a OpenAI cortou o preco de API do GPT-5.6 Luna em 80%, para US$ 0,20 por milhao de tokens de entrada e US$ 1,20 de saida, e o do GPT-5.6 Terra em 20%, para US$ 2 e US$ 12. O Sol, a camada de topo, mantem o preco mas ganha um modo Fast: ate 2,5 vezes mais rapido pelo dobro do custo, substituindo o Priority Processing. Os cortes foram anunciados num texto intitulado 'Advancing the price-performance frontier with GPT-5.6', um dia depois de um artigo irmao explicar de onde a empresa diz que veio a margem.
Essa explicacao e a parte incomum. A OpenAI diz que o GPT-5.6 Sol, rodando dentro do Codex, reescreveu e otimizou de forma autonoma kernels de producao escritos em Triton e Gluon, suas proprias linguagens GPU de codigo aberto, cortando o custo de servico de ponta a ponta em 20%. O modelo tambem desenhou e rodou centenas de experimentos sobre o modelo rascunho de decodificacao especulativa que acelera sua propria geracao de tokens, melhorando essa eficiencia em mais de 15%, e interveio em falhas de hardware e instabilidades de treinamento no caminho. A OpenAI faz questao de apresentar isso como 'um processo liderado por humanos', e diz que os kernels escritos pela IA foram validados com o FpSan, uma ferramenta aberta de deteccao de erros de ponto flutuante.
A distribuicao andou na velocidade do preco. Os tres modelos GPT-5.6 estao agora disponiveis em geral no Amazon Bedrock, com um novo modo de cache explicito de prompts: leituras cobradas com 90% de desconto, escritas a 1,25 vez a tarifa sem cache, TTL de 30 minutos e ate quatro pontos de cache por requisicao. As alegacoes de benchmark da semana: o Sol com raciocinio maximo vence o Claude Fable 5 da Anthropic no indice Coding Agent da Artificial Analysis 'por menos da metade do custo', o Terra empata com o GPT-5.5 em benchmarks de inteligencia pela metade do preco, e o Luna supera o Fable 5 no Agents' Last Exam com custo por tarefa estimado 99% menor.
Para quem constroi, a parte pratica e simples: qualquer modelo de custo escrito no segundo trimestre esta velho hoje, e a nova economia de cache recompensa prefixos de prompt estaveis. As letras miudas levam mais tempo. A cifra muito citada de que a inteligencia top de marco se vende hoje por um decimo terco do preco e aritmetica de terceiros, comparando o placar do GPT-5.4 num indice publico com o do Luna, nao um numero da OpenAI. Os ganhos de auto-otimizacao sao a OpenAI medindo a OpenAI, dentro de um processo que ela define. E 'o modelo se tornou mais barato' e uma afirmacao sobre infraestrutura que o comprador nao pode inspecionar. Nada disso torna as faturas menos reais. Significa que a historia de eficiencia que agora define os precos merece a mesma leitura linha por linha que os benchmarks antes dela.
