Kimi K3: a IA chinesa de 2,8 trilhões de parâmetros

A Moonshot AI lançou o Kimi K3 em 16 de julho de 2026 como um modelo de linguagem de 2,8 trilhões de parâmetros que promete liberar os pesos até 27 de julho. O lançamento sugere que a capacidade técnica da China está fechando rapidamente a distância em relação aos modelos fechados de inteligência artificial. É o maior modelo aberto já anunciado e um marco para quem acompanha a corrida de IA entre China e Estados Unidos. O sistema traz janela de contexto de 1 milhão de tokens, visão nativa e uma arquitetura inédita de atenção. Para quem compara ferramentas de IA, o K3 interessa porque pode mudar a conta de quem paga por tokens e a decisão de quem quer rodar inteligência artificial nos próprios servidores. Veja a seguir o que ele oferece, quanto custa, onde vence e onde ainda perde.

O que é o Kimi K3

O Kimi K3 é apresentado pela Moonshot como seu modelo mais capaz, construído sobre uma arquitetura chamada Kimi Delta Attention e Attention Residuals, com visão nativa e janela de 1 milhão de tokens. A empresa descreve o sistema como o primeiro modelo aberto da classe 3 trilhões, projetado para inteligência de fronteira em programação de longa duração, trabalho de conhecimento e raciocínio. Em nove dos últimos doze meses, segundo a própria empresa, modelos da família Kimi definiram o teto de tamanho entre os modelos abertos. O anúncio oficial também destaca que o modelo está disponível no Kimi.com, no Kimi Work, no Kimi Code e na API, com os pesos abertos prometidos para 27 de julho de 2026.

Arquitetura por trás do modelo

A novidade não é apenas tamanho. O K3 ativa efetivamente 16 de 896 especialistas por token dentro de um framework Stable LatentMoE, um nível de esparsidade agressivo para um modelo dessa escala. A Moonshot afirma que a combinação dessas técnicas rende aproximadamente 2,5 vezes mais eficiência de escala em relação ao Kimi K2, convertendo computação em inteligência de forma mais eficaz. O design ainda inclui Quantile Balancing, Per-Head Muon e uma função de ativação chamada SiTU, além de pesos em MXFP4 com ativações em MXFP8 para ampliar a compatibilidade de hardware. Segundo a empresa, o KDA oferece uma base eficiente para escalar a atenção, enquanto os Attention Residuals recuperam representações ao longo da profundidade em vez de acumulá-las de forma uniforme.

Benchmarks e desempenho real

Na avaliação independente do Artificial Analysis, o K3 marcou 57 pontos no Intelligence Index e ocupou a quarta posição entre 187 modelos, um nível que a plataforma considera bem acima da média para a faixa de preço. A própria Moonshot publicou 35 benchmarks comparando o K3 com concorrentes como Claude Fable 5 e GPT 5.6 Sol. Em alguns testes o modelo chinês vence: pontuou 42,0 no SWE Marathon, ante 35,0 do Fable 5, e 91,2 no BrowseComp. No Terminal-Bench 2.1, o K3 marcou 88,3, e no GPQA-Diamond, voltado a raciocínio científico, alcançou 93,5. Em raciocínio puro e visão, contudo, costuma ficar atrás dos dois líderes fechados.

BenchmarkKimi K3Claude Fable 5GPT 5.6 Sol
SWE Marathon42,035,039,0
BrowseComp91,288,090,4
Terminal-Bench 2.188,384,688,8
GPQA-Diamond93,592,694,1
DeepSWE67,570,073,0

Dados da tabela oficial da Moonshot AI, com modelos no esforço máximo de raciocínio.

Onde o K3 supera rivais

O K3 também lidera o AutomationBench com 30,8 pontos, à frente de Claude Fable 5 e GPT 5.6 Sol, e fica em primeiro no SpreadsheetBench 2. O resultado que mais viralizou veio do Arena: o Kimi K3 assumiu o primeiro lugar no Frontend Code Arena com 1679 pontos, superando o Claude Fable 5, um salto da 18ª posição em que estava o K2.6. Segundo a BBC, em testes cegos de preferência humana o modelo chinês ficou à frente do sistema Fable da Anthropic em engenharia de interface web. Esses números importam porque medem tarefas de produto reais, não apenas quebra-cabeças acadêmicos, e mostram que um modelo aberto pode liderar uma categoria visível.

Como usar o Kimi K3 hoje

Na prática, o K3 já pode ser testado sem esperar os pesos. A Moonshot diz que a API está disponível em platform.kimi.ai, o que permite a muitas equipes apontar um cliente existente para o novo endpoint e rodar testes sem reescrever a integração. O modelo também aparece em agregadores como o OpenRouter, que o descreve como um modelo de raciocínio multimodal forte em navegar repositórios grandes, usar ferramentas e depurar código. A disponibilidade ampla no primeiro dia é um sinal de que a empresa quer capturar desenvolvedores de produto, não só pesquisadores acadêmicos.

Pesos abertos e o que muda

A promessa de pesos abertos é o centro do caso de uso. A Moonshot afirma que liberará os pesos completos até 27 de julho de 2026, o que permitiria auto-hospedar um modelo próximo da fronteira sem contrato proprietário. Há um porém operacional sério: a empresa recomenda implantar o K3 em configurações de supernodo com 64 ou mais aceleradores. Baixar e rodar um modelo de 2,8 trilhões de parâmetros exige um cluster robusto, fora do alcance da maioria das equipes pequenas. A Moonshot também contribuiu ao vLLM uma implementação de prefix caching para o KDA, facilitando a integração em runtimes de código aberto.

Preço e custo na prática

O preço oficial é de 3 dólares por milhão de tokens de entrada em cache miss, 15 dólares por milhão de tokens de saída e apenas 0,30 dólar por milhão em cache hit. Essa diferença de dez vezes entre cache hit e cache miss é o mecanismo que torna o K3 competitivo em laços de programação que reenviam o mesmo contexto a cada passo. Para fluxos com muito contexto repetido, o custo efetivo cai bastante; para uso esporádico, o preço de saída fica na faixa normal dos modelos de fronteira.

Onde o K3 ainda falha

A própria Moonshot é honesta sobre as limitações. O anúncio oficial afirma que o desempenho geral do K3 ainda fica atrás dos modelos proprietários mais poderosos, Claude Fable 5 e GPT 5.6 Sol, embora demonstre desempenho de nível de fronteira em sua suíte de avaliação. A empresa admite ainda um intervalo perceptível na experiência do usuário em comparação com esses dois concorrentes, além de excesso de proatividade: em intenções ambíguas, o modelo pode tomar decisões inesperadas pelo usuário. Há também sensibilidade ao histórico de raciocínio — se uma sessão troca de modelo para o K3 no meio, a qualidade pode ficar instável.

O que isso significa para você

O K3 reforça uma tendência concreta: modelos abertos estão chegando a semanas ou poucos meses da fronteira fechada, e não a anos. O modelo também processa imagens, não apenas texto, o que amplia seu uso em tarefas com capturas de tela e diagramas. Para empresas que pesam conta de API contra cluster próprio, a promessa de pesos de um modelo de quase 3 trilhões de parâmetros muda a conta, desde que haja hardware para rodá-lo. Para desenvolvedores individuais, o K3 é hoje uma opção de API com bom custo em tarefas de código e busca, mas que ainda exige verificação humana em raciocínio difícil. Quem quer comparar com assistentes mais conhecidos pode ler o confronto entre ChatGPT, Gemini e Copilot ou a análise sobre o Google Gemini. O impacto geopolítico também é real: segundo a BBC, ações de concorrentes chinesas como Zhipu e MiniMax caíram forte em Hong Kong logo após o anúncio.

Antes de adotar o K3, vale um checklist objetivo:

  • Defina o caso de uso antes de migrar.
  • Considere o custo do cluster de inferência, não só o preço por token.
  • Use cache de contexto para aproveitar o cache hit de 0,30 dólar por milhão.
  • Mantenha verificação humana em decisões sensíveis.
  • Acompanhe a liberação dos pesos em 27 de julho antes de planejar auto-hospedagem.

Fontes