Moonshot AI lanzo Kimi K3 el 27 de julio, y el numero que importa es 2,8 billones: el total de parametros de un diseno de mezcla de expertos con 896 expertos especializados, de los que 16 se activan por token para 104 mil millones de parametros activos. La ventana de contexto es de un millon de tokens, el modelo es nativamente multimodal, y los pesos estan en Hugging Face bajo moonshotai/Kimi-K3 en MXFP4 de 4 bits, lo que lo convierte en el mayor modelo publicado abiertamente hasta la fecha. En el indice de inteligencia de Artificial Analysis queda tercero, detras de Claude Fable 5 de Anthropic y GPT-5.6 de OpenAI.
El precio cuenta su propia historia. El analisis de ChinAI llama a la estrategia lujo asequible: igualar el rendimiento de los buques insignia extranjeros anclando el precio al techo del mercado interno chino. La tarifa mixta de K3 ronda los 2,30 $ por millon de tokens, con la entrada en cache a una decima parte de la tarifa sin cache, y su precio de salida es 3,5 veces el de su predecesor K2.6. La competencia domestica queda muy por debajo: Qwen3.7 Max de Alibaba a 1,40 $, GLM-5.2 de Zhipu a 0,90 $, DeepSeek V4 Pro a 0,18 $. La apuesta es que los laboratorios chinos de frontera pueden dejar de correr hacia abajo, y la demanda inicial la respaldo de la manera menos comoda posible: dos dias despues del lanzamiento, Moonshot suspendio las nuevas suscripciones por falta de capacidad de computo e impuso limites de uso.
El resto de la semana fue infraestructura. El 29 de julio Moonshot publico MoonEP bajo licencia MIT, la biblioteca de comunicacion de paralelismo de expertos a la que atribuye una mejora de eficiencia de escalado de 2,5x en K3. Su promesa central es un equilibrio de carga exacto, cada rango recibe el mismo numero de tokens sin importar cuan sesgado este el enrutamiento, lo que elimina la sincronizacion por capa que estrangula el entrenamiento de los grandes MoE; FlashKDA y AgentEnv salieron junto a ella. El 30 de julio, AWS publico su guia oficial de despliegue, que define sin decirlo lo que significa abierto a esta escala: la configuracion de referencia es una sola instancia ml.p6-b300.48xlarge con ocho GPU NVIDIA B300 Blackwell Ultra, servidas con vLLM en paralelismo tensorial sobre las ocho.
Para quienes construyen, la semana se resume en tres hechos. El mayor modelo de pesos abiertos de la historia existe y se descarga hoy. Ejecutarlo uno mismo empieza en un rack de los aceleradores mas nuevos que vende NVIDIA, asi que abierto y accesible no son la misma palabra. Y el fabricante lo tarifo como buque insignia, no como gancho, y aun asi se quedo sin capacidad, lo que dice mas sobre la demanda de modelos abiertos de clase frontera que cualquier tabla de benchmarks.
