Kimi K2 Thinking
Rede Neural
Kimi K2 Thinking é um modelo de raciocínio da Moonshot AI para tarefas de agentes e múltiplas etapas, disponível via API.
Comprimento máximo de resposta
(em tokens)
Tamanho do contexto
(em tokens)
Custo do prompt
(por 1M tokens)
Custo da resposta
(por 1M tokens)
Como funciona Kimi K2 Thinking?
Kimi K2 Thinking é um modelo de raciocínio aberto da Moonshot AI, uma continuação da série K2 com arquitetura Mixture-of-Experts e um trilhão de parâmetros. O foco está em cenários de agentes e longas cadeias de raciocínio: foi projetado para tarefas que não são resolvidas com uma única resposta e exigem uma sequência de passos. No BotHub, o modelo está acessível sem VPN ou cartões estrangeiros; o pagamento é feito com cartões locais em rublos, cobrado por uso, não por assinatura. Com mais de 250 modelos disponíveis na mesma janela, você pode comparar as respostas do Kimi K2 com outros e alternar entre eles. Para integrações, há uma API única compatível com OpenAI: uma conexão, com o modelo alterado via parâmetro de solicitação. O modelo é útil para analistas em inferências de várias etapas em grandes conjuntos de dados, para pesquisadores no desenvolvimento de hipóteses, para desenvolvedores como núcleo de raciocínio de agentes e para equipes de produto em protótipos com lógica complexa.Perguntas frequentes sobre Kimi K2 Thinking
Você pode usar os resultados da geração para fins comerciais. Todos os direitos sobre o conteúdo criado pertencem a você. A única restrição: certifique-se de que a solicitação não inclua materiais de terceiros protegidos por direitos autorais. A responsabilidade pelo cumprimento dos direitos sobre os dados de entrada é do usuário.
Kimi K2 Thinking é um modelo de raciocínio da Moonshot AI. Ele trabalha com texto e documentos, aceita imagens e chama funções externas. O contexto de 262.144 tokens permite manter um grande repositório, especificações técnicas ou uma coleção de arquivos no diálogo, tornando o modelo conveniente para código, análise e cenários de agentes.
O limite de saída é de 235.929 tokens por resposta. Isso é suficiente para um documento técnico volumoso, um grande módulo de código ou uma análise detalhada. Na prática, o comprimento depende da tarefa e do seu prompt: se precisar do máximo, peça explicitamente uma resposta detalhada e completa.
Sim, esta é uma característica chave da versão thinking: antes de responder, o modelo constrói uma cadeia de raciocínio e só então fornece o resultado. Este modo ajuda significativamente em matemática, lógica, depuração de código e tarefas de várias etapas, onde uma resposta correta é mais importante do que uma rápida.
Sim. O modelo suporta chamada de funções e saída estruturada em JSON, por isso pode ser conectado às suas ferramentas, bancos de dados e serviços externos. No BotHub, isso está disponível através de uma API única compatível com OpenAI — você pode mudar o modelo sem reescrever a integração.
Imagens e documentos, sim, podem ser enviados junto com o texto: para analisar capturas de tela, diagramas, tabelas ou arquivos. O suporte para áudio e vídeo não está indicado em nossos dados. A geração de imagens ou som não se aplica a este modelo — a saída é apenas texto.
Não há medições separadas por idioma em nossos dados, por isso não prometemos nada específico — é mais fácil testar o modelo em sua tarefa, especialmente porque você pode alternar para outro no BotHub com um clique. O acesso a partir da Rússia é feito sem VPN, com pagamento em rublos.