Notebookcheck Logo

O que realmente está por trás dos números recordes do Kimi K3

Tela inicial da interface web do Kimi com campo de entrada e logotipo do K3
ⓘ Screenshot: Kimi.com / Moonshot AI
Por trás da interface simples está o maior modelo de IA aberto
O novo modelo emblemático da China está quebrando recordes de tamanho, e as manchetes se sucedem em ritmo acelerado. O próprio Moonshot classifica o Kimi K3 atrás do Claude e do GPT. Analisaremos o que os números realmente significam, se o senhor poderá algum dia executar o modelo por conta própria, quanto ele realmente custa e o que acontece com os dados de entrada.

O Kimi K3 está online desde 16 de julho, e as manchetes dão a entender que a China acaba de ultrapassar os EUA. Com 2,8 trilhões de parâmetros, é o maior modelo cujos pesos serão disponibilizados. Alguns observadores já estão chamando isso de o próximo “momento DeepSeek”.

No entanto, a frase mais interessante sobre esse modelo não está nas manchetes. Ela se encontra no próprio blog técnico da Moonshot. Lá, o desenvolvedor escreve que o desempenho geral ainda fica atrás dos modelos proprietários mais potentes, a saber, o Claude Fable 5 e o GPT-5.6 Sol. É raro uma empresa apresentar seu próprio produto e afirmar que ele não é o melhor. É exatamente por isso que esses números recordes merecem uma análise mais detalhada.

Já abordamos a notícia básica de que o K3 está disponível e pode ser testado gratuitamente. Este artigo trata do que vem a seguir.

Primeiro lugar e o que ele realmente mede

O K3 vence, de fato, uma comparação importante. Na Frontend Code Arena, onde as pessoas veem dois resultados lado a lado e escolhem o melhor sem saber qual modelo o produziu, o K3 sai na frente. À frente do Claude e do GPT, também.

O porém: esse teste mede o gosto pessoal. Os usuários avaliam qual interface da web preferem. Isso diz muito sobre design e pouco sobre precisão. Quem transformar isso em “Kimi supera os modelos dos EUA” não compreendeu a diferença entre uma classificação de preferência e um teste de precisão.

Por que as tabelas de benchmark exigem uma leitura cuidadosa

A Moonshot publica suas medições, e a parte interessante está nas notas de rodapé. Dependendo do benchmark, cada modelo foi executado em um ambiente de agente diferente: às vezes no KimiCode, às vezes no Claude Code, às vezes no Codex. Essas são condições iniciais diferentes, não uma corrida imparcial na mesma pista.

Em um dos testes de codificação, a própria Moonshot admite que o Claude Fable 5 enfrentou falhas em 35% das tarefas, o que pode ter prejudicado sua pontuação. Em outro teste, o K3 só atinge sua pontuação máxima com uma técnica que compacta o contexto em 300.000 tokens. Sem esse gerenciamento de contexto, o número cai.

A facilidade com que esses números se invertem é demonstrada por uma avaliação da empresa de análise independente Artificial Analysis. Nela, o Kimi K3 apresenta 49% em uma métrica de alucinações. Isso pode parecer uma pontuação fraca. A escala, no entanto, é invertida: ela conta a frequência com que o modelo não comete erros. Quanto maior, melhor; e, na mesma lista, o Claude Fable 5 fica abaixo do K3, com 45%, enquanto várias variantes do GPT-5.6 ficam bem atrás.

Uma regra que vale a pena seguir: antes de acreditar em uma manchete sobre um benchmark, verifique o que exatamente foi medido e para que lado a escala aponta.

É possível rodar o K3 por conta própria?

Para nossos leitores, essa é a verdadeira questão. A resposta honesta: para usuários comuns, isso praticamente não fará diferença, mesmo depois que os pesos forem divulgados. O motivo é simplesmente o tamanho.

Faça as contas por um momento. A Moonshot treina o K3 desde o início em um formato numérico compacto chamado MXFP4, que utiliza cerca de quatro bits por peso. Os pesos, também chamados de parâmetros, são os valores numéricos aprendidos que compõem um modelo de IA. Com 2,8 trilhões de parâmetros, isso significa cerca de 1,4 terabytes apenas para o arquivo do modelo. Não são gigabytes. São terabytes. Para se ter uma ideia: um modelo típico com oito bilhões de parâmetros, do tipo que roda em um laptop bem equipado, ocupa cerca de cinco gigabytes.

Um arquivo modelo de 1,4 terabyte: o K3 é grande demais para qualquer computador doméstico

A própria Moonshot recomenda a execução do K3 em configurações de supernós com 64 ou mais aceleradores. Isso não é excesso de cautela, mas a simples consequência dessas dimensões. Uma única placa de vídeo profissional com 96 gigabytes de memória fica aquém em mais de um fator de dez.

“Open weights”, portanto, não significa que o senhor irá executar este modelo em casa. Significa que pesquisadores, empresas e provedores de nuvem podem baixá-lo, analisá-lo e executá-lo em sua própria infraestrutura, em vez de apenas alugá-lo por meio dos servidores da Moonshot. Isso é valioso, mas é algo diferente do que muitas pessoas imaginam.

Se o senhor realmente deseja IA sem a nuvem, em sua própria máquina, os modelos pequenos criados para essa finalidade são a escolha certa. Mostramos como isso funciona e quais são os requisitos de hardware necessários em um artigo separado.

Uma observação para os curiosos em termos técnicos: como o K3 foi treinado com essa baixa precisão desde o início, o formato compacto é o estado original, e não um modelo reduzido posteriormente. A pergunta habitual sobre o quanto a redução de tamanho prejudica a qualidade não se coloca da mesma forma.

Quanto custa na prática

O faturamento funciona com tokens, pequenos trechos de texto que geralmente têm apenas alguns caracteres. Por meio da API, a Moonshot cobra US$ 3 por milhão de tokens de entrada e US$ 15 por milhão de tokens de saída. Entradas repetidas são cobradas a 30 centavos, o que é bem mais barato.

Isso faz com que o K3 não seja mais uma pechincha. Ele custa cerca de três vezes mais do que seu próprio antecessor, que cobrava pouco menos de um dólar por entrada. Em comparação com o Claude Fable 5, que custa US$ 10 e US$ 50, o K3 é claramente mais barato. O Claude Sonnet 5, porém, ainda o supera com seu preço inicial atual de US$ 2 e US$ 10, e só se equipara ao K3 em setembro. A era dos modelos chineses que competiam principalmente em preço está chegando ao fim na Moonshot.

O K3 custa três vezes mais do que seu antecessor, mas permanece abaixo do Fable 5

Há mais um ponto que é fácil deixar passar despercebido. Atualmente, o K3 sempre opera em seu nível máximo de esforço. A Moonshot planeja adicionar modos mais enxutos posteriormente. Isso torna as respostas completas, mas também significa que mesmo uma pergunta simples aciona o dispendioso trabalho de raciocínio. Medidas independentes também registram que o modelo produz cerca de 62 tokens por segundo, o que o coloca na faixa intermediária em termos de velocidade.

O que acontece com suas entradas

Para quem estiver experimentando o K3 no aplicativo ou no site, esta é a seção mais importante. A política de privacidade da Moonshot afirma claramente que entradas, áudio, imagens, vídeos e arquivos são processados para fornecer e aprimorar os serviços, incluindo explicitamente o treinamento e a otimização de seus próprios modelos.

Não há em nenhum lugar da política uma opção dedicada para desativar o treinamento com o seu conteúdo. Ela remete aos direitos gerais do titular dos dados, que você pode exercer por meio das configurações da sua conta ou enviando um e-mail para o contato de privacidade. O ChatGPT e o Claude, por outro lado, colocam uma opção de ativação/desativação diretamente nas configurações.

Também consta na política: os dados coletados incluem endereço IP, identificadores de dispositivo, IDs de sessão e de conversa e, quando as configurações do dispositivo permitirem, dados da área de transferência. Quanto ao local de armazenamento, a política apenas informa que os dados podem ser transferidos para servidores fora do seu país de residência. Nenhum país é mencionado. O provedor é a Moonshot AI PTE. LTD., com sede em Cingapura, e a política está datada de 7 de julho de 2025.

Para um teste com tarefas inofensivas, isso é aceitável. Para informações internas da empresa, dados de clientes ou documentos privados, aplica-se a mesma regra que para qualquer serviço em nuvem, só que, neste caso, com um provedor cujos próprios termos prevêem explicitamente o treinamento.

Quem tira maior proveito do Kimi K3

Experimentá-lo não custa nada. Dois grupos são os que mais têm a ganhar: quem desenvolve ou projeta e quem trabalha regularmente com documentos muito longos. O K3 se destaca onde código e elementos visuais se encontram, em interfaces web, 3D e animação. A janela de contexto de um milhão de tokens é um argumento de peso para textos longos, e o processamento de imagens vem integrado.

Se o senhor deseja a melhor qualidade de respostas ou a experiência mais fluida, os principais modelos dos EUA continuam sendo a melhor escolha. A própria Moonshot afirma isso. E quem espera instalar em breve um modelo de ponta em seu próprio computador deve ter em mente esses 1,4 terabytes.

O que é notável no K3 não é tanto a classificação, mas o ritmo. Uma empresa chinesa está lançando um modelo à altura dos melhores do mundo e está disponibilizando os dados do modelo. Há dois anos, isso teria sido difícil de imaginar.

Google LogoAdd as a preferred source on Google
Mail Logo
> Análises e revisões de portáteis e celulares > Notícias > Arquivo de notícias 2026 07 > O que realmente está por trás dos números recordes do Kimi K3
Steffen Zahn, 2026-07-20 (Update: 2026-07-20)