GLM 5 Turbo
Rede Neural
GLM 5 Turbo é o modelo da Z.ai para cenários de agentes e respostas rápidas; a API do GLM 5 Turbo é ideal para automação de fluxos.
Comprimento máximo de resposta
(em tokens)
Tamanho do contexto
(em tokens)
Custo do prompt
(por 1M tokens)
Custo da resposta
(por 1M tokens)
Como funciona GLM 5 Turbo?
O GLM 5 Turbo é um modelo da Z.ai projetado para respostas rápidas e desempenho confiável em ambientes de agentes. Foi otimizado para fluxos de trabalho reais de agentes, onde não basta apenas responder, mas seguir uma cadeia de passos e acessar ferramentas externas, sendo ideal para automação sensível à latência. No BotHub, o acesso é liberado sem VPN ou cartões estrangeiros: você paga com cartão local em moeda nacional por tokens, que não expiram. Na mesma janela, há mais de 250 redes neurais para alternar e comparar respostas facilmente. A API única compatível com OpenAI permite trocar de modelo em sistemas multimodais sem reescrever a integração. As conversas são criptografadas via AES-GCM, e oferecemos contrato, fatura, EDI e painel administrativo com limites para empresas. Use o GLM 5 Turbo para agentes que operam ferramentas de forma autônoma, automatizam rotinas de suporte e serviços internos, processam fluxos de solicitações com alta velocidade e para prototipagem de pipelines multiagentes.Perguntas frequentes sobre GLM 5 Turbo
Você pode usar os resultados da geração para fins comerciais. Todos os direitos sobre o conteúdo criado pertencem a você. A única restrição: certifique-se de que a solicitação não inclua materiais de terceiros protegidos por direitos autorais. A responsabilidade pelo cumprimento dos direitos sobre os dados de entrada é do usuário.
É um modelo de texto da Z.ai com raciocínio, chamada de funções e suporte a imagens e documentos. Adequado para trabalhar com código: escrita, refatoração, depuração, além de análise de documentos longos, análise de dados, tarefas STEM e integração em cenários multiagentes via API BotHub compatível com OpenAI.
O limite de saída é de 131.072 tokens por resposta com uma janela de contexto de 202.752 tokens. Isso é suficiente para um documento técnico grande, um módulo de código volumoso ou uma análise detalhada completa, sem dividir a tarefa em dezenas de solicitações separadas e colar partes manualmente.
Sim, o raciocínio antes da resposta é confirmado pelos nossos dados. O modelo primeiro estrutura o processo de solução e depois fornece o resultado — isso é perceptível em matemática, lógica, análise de várias etapas e depuração de código. Em solicitações simples, o ganho é menor, mas em complexas, a resposta é mais coesa.
Sim, tanto a chamada de funções quanto a saída estruturada em JSON são suportadas. Descreva suas ferramentas — o modelo escolherá a correta, passará os argumentos e retornará a resposta conforme o esquema definido. Útil para agentes, análise de documentos e integrações com seu backend via API única.
O modelo aceita imagens e documentos como entrada: ele analisará capturas de tela, diagramas, tabelas ou arquivos e responderá com texto. Não há informações sobre áudio e vídeo em nossos dados, portanto, para transcrição ou análise de gravações, é mais conveniente usar um modelo especializado na mesma janela do BotHub.
Não há uma nota específica sobre idiomas em nossos dados, então não prometemos nada. É mais fácil testar com sua própria tarefa: envie um prompt típico no BotHub, compare o resultado com outro modelo na mesma janela e mantenha o que teve melhor desempenho. A troca não requer reescrita da integração.