A Moonshot AI lançou o Kimi K3 em 16 de julho de 2026 como um modelo de linguagem de 2,8 trilhões de parâmetros que promete liberar os pesos até 27 de julho. O lançamento sugere que a capacidade técnica da China está fechando rapidamente a distância em relação aos modelos fechados de inteligência artificial. É o maior modelo aberto já anunciado e um marco para quem acompanha a corrida de IA entre China e Estados Unidos. O sistema traz janela de contexto de 1 milhão de tokens, visão nativa e uma arquitetura inédita de atenção. Para quem compara ferramentas de IA, o K3 interessa porque pode mudar a conta de quem paga por tokens e a decisão de quem quer rodar inteligência artificial nos próprios servidores. Veja a seguir o que ele oferece, quanto custa, onde vence e onde ainda perde.
O que é o Kimi K3
O Kimi K3 é apresentado pela Moonshot como seu modelo mais capaz, construído sobre uma arquitetura chamada Kimi Delta Attention e Attention Residuals, com visão nativa e janela de 1 milhão de tokens. A empresa descreve o sistema como o primeiro modelo aberto da classe 3 trilhões, projetado para inteligência de fronteira em programação de longa duração, trabalho de conhecimento e raciocínio. Em nove dos últimos doze meses, segundo a própria empresa, modelos da família Kimi definiram o teto de tamanho entre os modelos abertos. O anúncio oficial também destaca que o modelo está disponível no Kimi.com, no Kimi Work, no Kimi Code e na API, com os pesos abertos prometidos para 27 de julho de 2026.
Arquitetura por trás do modelo
A novidade não é apenas tamanho. O K3 ativa efetivamente 16 de 896 especialistas por token dentro de um framework Stable LatentMoE, um nível de esparsidade agressivo para um modelo dessa escala. A Moonshot afirma que a combinação dessas técnicas rende aproximadamente 2,5 vezes mais eficiência de escala em relação ao Kimi K2, convertendo computação em inteligência de forma mais eficaz. O design ainda inclui Quantile Balancing, Per-Head Muon e uma função de ativação chamada SiTU, além de pesos em MXFP4 com ativações em MXFP8 para ampliar a compatibilidade de hardware. Segundo a empresa, o KDA oferece uma base eficiente para escalar a atenção, enquanto os Attention Residuals recuperam representações ao longo da profundidade em vez de acumulá-las de forma uniforme.
Benchmarks e desempenho real
Na avaliação independente do Artificial Analysis, o K3 marcou 57 pontos no Intelligence Index e ocupou a quarta posição entre 187 modelos, um nível que a plataforma considera bem acima da média para a faixa de preço. A própria Moonshot publicou 35 benchmarks comparando o K3 com concorrentes como Claude Fable 5 e GPT 5.6 Sol. Em alguns testes o modelo chinês vence: pontuou 42,0 no SWE Marathon, ante 35,0 do Fable 5, e 91,2 no BrowseComp. No Terminal-Bench 2.1, o K3 marcou 88,3, e no GPQA-Diamond, voltado a raciocínio científico, alcançou 93,5. Em raciocínio puro e visão, contudo, costuma ficar atrás dos dois líderes fechados.
| Benchmark | Kimi K3 | Claude Fable 5 | GPT 5.6 Sol |
|---|---|---|---|
| SWE Marathon | 42,0 | 35,0 | 39,0 |
| BrowseComp | 91,2 | 88,0 | 90,4 |
| Terminal-Bench 2.1 | 88,3 | 84,6 | 88,8 |
| GPQA-Diamond | 93,5 | 92,6 | 94,1 |
| DeepSWE | 67,5 | 70,0 | 73,0 |
Dados da tabela oficial da Moonshot AI, com modelos no esforço máximo de raciocínio.
Onde o K3 supera rivais
O K3 também lidera o AutomationBench com 30,8 pontos, à frente de Claude Fable 5 e GPT 5.6 Sol, e fica em primeiro no SpreadsheetBench 2. O resultado que mais viralizou veio do Arena: o Kimi K3 assumiu o primeiro lugar no Frontend Code Arena com 1679 pontos, superando o Claude Fable 5, um salto da 18ª posição em que estava o K2.6. Segundo a BBC, em testes cegos de preferência humana o modelo chinês ficou à frente do sistema Fable da Anthropic em engenharia de interface web. Esses números importam porque medem tarefas de produto reais, não apenas quebra-cabeças acadêmicos, e mostram que um modelo aberto pode liderar uma categoria visível.
Como usar o Kimi K3 hoje
Na prática, o K3 já pode ser testado sem esperar os pesos. A Moonshot diz que a API está disponível em platform.kimi.ai, o que permite a muitas equipes apontar um cliente existente para o novo endpoint e rodar testes sem reescrever a integração. O modelo também aparece em agregadores como o OpenRouter, que o descreve como um modelo de raciocínio multimodal forte em navegar repositórios grandes, usar ferramentas e depurar código. A disponibilidade ampla no primeiro dia é um sinal de que a empresa quer capturar desenvolvedores de produto, não só pesquisadores acadêmicos.
Pesos abertos e o que muda
A promessa de pesos abertos é o centro do caso de uso. A Moonshot afirma que liberará os pesos completos até 27 de julho de 2026, o que permitiria auto-hospedar um modelo próximo da fronteira sem contrato proprietário. Há um porém operacional sério: a empresa recomenda implantar o K3 em configurações de supernodo com 64 ou mais aceleradores. Baixar e rodar um modelo de 2,8 trilhões de parâmetros exige um cluster robusto, fora do alcance da maioria das equipes pequenas. A Moonshot também contribuiu ao vLLM uma implementação de prefix caching para o KDA, facilitando a integração em runtimes de código aberto.
Preço e custo na prática
O preço oficial é de 3 dólares por milhão de tokens de entrada em cache miss, 15 dólares por milhão de tokens de saída e apenas 0,30 dólar por milhão em cache hit. Essa diferença de dez vezes entre cache hit e cache miss é o mecanismo que torna o K3 competitivo em laços de programação que reenviam o mesmo contexto a cada passo. Para fluxos com muito contexto repetido, o custo efetivo cai bastante; para uso esporádico, o preço de saída fica na faixa normal dos modelos de fronteira.
Onde o K3 ainda falha
A própria Moonshot é honesta sobre as limitações. O anúncio oficial afirma que o desempenho geral do K3 ainda fica atrás dos modelos proprietários mais poderosos, Claude Fable 5 e GPT 5.6 Sol, embora demonstre desempenho de nível de fronteira em sua suíte de avaliação. A empresa admite ainda um intervalo perceptível na experiência do usuário em comparação com esses dois concorrentes, além de excesso de proatividade: em intenções ambíguas, o modelo pode tomar decisões inesperadas pelo usuário. Há também sensibilidade ao histórico de raciocínio — se uma sessão troca de modelo para o K3 no meio, a qualidade pode ficar instável.
O que isso significa para você
O K3 reforça uma tendência concreta: modelos abertos estão chegando a semanas ou poucos meses da fronteira fechada, e não a anos. O modelo também processa imagens, não apenas texto, o que amplia seu uso em tarefas com capturas de tela e diagramas. Para empresas que pesam conta de API contra cluster próprio, a promessa de pesos de um modelo de quase 3 trilhões de parâmetros muda a conta, desde que haja hardware para rodá-lo. Para desenvolvedores individuais, o K3 é hoje uma opção de API com bom custo em tarefas de código e busca, mas que ainda exige verificação humana em raciocínio difícil. Quem quer comparar com assistentes mais conhecidos pode ler o confronto entre ChatGPT, Gemini e Copilot ou a análise sobre o Google Gemini. O impacto geopolítico também é real: segundo a BBC, ações de concorrentes chinesas como Zhipu e MiniMax caíram forte em Hong Kong logo após o anúncio.
Antes de adotar o K3, vale um checklist objetivo:
- Defina o caso de uso antes de migrar.
- Considere o custo do cluster de inferência, não só o preço por token.
- Use cache de contexto para aproveitar o cache hit de 0,30 dólar por milhão.
- Mantenha verificação humana em decisões sensíveis.
- Acompanhe a liberação dos pesos em 27 de julho antes de planejar auto-hospedagem.
Fontes
- Moonshot AI — Kimi K3 (blog técnico oficial)
- Moonshot AI — página oficial
- Kimi (@Kimi_Moonshot) — anúncio oficial no X
- Artificial Analysis — Kimi K3
- BBC News — China’s Moonshot AI claims Kimi K3 can rival OpenAI and Anthropic
- Tom’s Hardware — Kimi K3 beats Claude Fable 5 in Frontend Code Arena
- OpenRouter — Kimi K3
- HowAIWorks — Moonshot Ships Kimi K3