A Moonshot AI lancou o Kimi K3 em 27 de julho, e o numero que importa e 2,8 trilhoes: o total de parametros de um projeto de mistura de especialistas com 896 especialistas, dos quais 16 se ativam por token para 104 bilhoes de parametros ativos. A janela de contexto e de um milhao de tokens, o modelo e nativamente multimodal, e os pesos estao no Hugging Face sob moonshotai/Kimi-K3 em MXFP4 de 4 bits, o que faz dele o maior modelo publicado abertamente ate hoje. No indice de inteligencia da Artificial Analysis fica em terceiro, atras do Claude Fable 5 da Anthropic e do GPT-5.6 da OpenAI.

O preco conta a propria historia. A analise da ChinAI chama a estrategia de luxo acessivel: igualar o desempenho das naus capitanias estrangeiras ancorando o preco no teto do mercado interno chines. A tarifa mista do K3 fica em torno de 2,30 $ por milhao de tokens, com entrada em cache a um decimo da tarifa sem cache, e o preco de saida e 3,5 vezes o do antecessor K2.6. A concorrencia domestica fica bem abaixo: Qwen3.7 Max da Alibaba a 1,40 $, GLM-5.2 da Zhipu a 0,90 $, DeepSeek V4 Pro a 0,18 $. A aposta e que os laboratorios chineses de fronteira podem parar de correr para baixo, e a demanda inicial confirmou isso da maneira menos confortavel possivel: dois dias apos o lancamento, a Moonshot suspendeu novas assinaturas por falta de capacidade de computacao e impos limites de uso.

O resto da semana foi infraestrutura. Em 29 de julho a Moonshot publicou o MoonEP sob licenca MIT, a biblioteca de comunicacao de paralelismo de especialistas a que atribui um ganho de eficiencia de escala de 2,5x no K3. Sua promessa central e equilibrio de carga exato, cada rank recebe o mesmo numero de tokens por mais enviesado que o roteamento esteja, o que elimina a sincronizacao por camada que estrangula o treinamento de grandes MoE; FlashKDA e AgentEnv sairam junto. Em 30 de julho, a AWS publicou seu guia oficial de implantacao, que define sem dizer o que significa aberto nessa escala: a configuracao de referencia e uma unica instancia ml.p6-b300.48xlarge com oito GPUs NVIDIA B300 Blackwell Ultra, servidas via vLLM com paralelismo tensorial nas oito.

Para quem constroi, a semana se resume a tres fatos. O maior modelo de pesos abertos da historia existe e pode ser baixado hoje. Roda-lo por conta propria comeca em um rack dos aceleradores mais novos que a NVIDIA vende, entao aberto e acessivel nao sao a mesma palavra. E o fabricante precificou como nau capitania, nao como isca, e ainda assim ficou sem capacidade, o que diz mais sobre a demanda por modelos abertos de classe fronteira do que qualquer tabela de benchmarks.