GLM 4.7 Flash
Rede Neural
GLM 4.7 Flash para código e cenários de agentes: modelo Z.ai de classe 30B que equilibra qualidade e velocidade.
Comprimento máximo de resposta
(em tokens)
Tamanho do contexto
(em tokens)
Custo do prompt
(por 1M tokens)
Custo da resposta
(por 1M tokens)
Como funciona GLM 4.7 Flash?
GLM 4.7 Flash é um modelo da família GLM da Z.ai de classe 30B, projetado para equilibrar a qualidade das respostas e a velocidade de processamento. Em relação à versão anterior, as habilidades de programação e o planejamento de tarefas complexas de várias etapas foram aprimorados, tornando o modelo ideal para cenários de agentes onde as ações ocorrem em cadeia, e não como uma resposta única. No BotHub, você trabalha com ele sem necessidade de VPN ou cartão internacional: o pagamento é feito com cartões russos em rublos, cobrado por token utilizado, e o saldo não expira. Outros modelos do agregador estão disponíveis na mesma janela, e uma API compatível com OpenAI permite trocar de modelo no código sem reescrever a integração; as solicitações são transmitidas com criptografia AES-GCM. Tarefas típicas incluem escrever e refatorar código em projetos existentes, analisar erros e falhas de testes, criar agentes que executam planos de várias etapas, processar fluxos de solicitações repetitivas onde a economia de tokens é importante e conectar o modelo a serviços internos via API. Para empresas, o BotHub oferece contrato, fatura, EDI, painel administrativo e limites.Perguntas frequentes sobre GLM 4.7 Flash
Você pode usar os resultados da geração para fins comerciais. Todos os direitos sobre o conteúdo criado pertencem a você. A única restrição: certifique-se de que a solicitação não inclua materiais de terceiros protegidos por direitos autorais. A responsabilidade pelo cumprimento dos direitos sobre os dados de entrada é do usuário.
O modelo trabalha com texto: responde a perguntas, escreve e analisa código, analisa documentos e imagens, raciocina sobre a tarefa antes de responder e chama funções externas. O contexto de 200.000 tokens permite manter um grande projeto ou um conjunto de arquivos em um único diálogo.
Até 117.964 tokens em uma única resposta — o volume de um pequeno livro. Suficiente para um longo texto técnico, análise detalhada de código ou documentação completa, sem precisar dividir em partes ou pedir para continuar. A janela total de diálogo é de 200.000 tokens.
Sim, o raciocínio antes da resposta é confirmado pelos nossos dados: o modelo primeiro decompõe a tarefa em etapas e só então formula o resultado. Isso ajuda em matemática, lógica, depuração de código e onde uma cadeia de raciocínio é importante, em vez de uma resposta rápida ao acaso.
Sim, ambos. O modelo chama funções e fornece JSON estruturado, por isso é conveniente usá-lo em cenários de agentes e conectá-lo a serviços externos. Através da API unificada compatível com OpenAI do BotHub, isso é conectado sem reescrever sua integração.
Imagens e documentos — sim, você pode enviá-los como entrada e obter uma análise textual: diagrama, captura de tela, tabela, contrato. Áudio e vídeo não estão listados em nossos dados, portanto, para eles, é mais conveniente escolher um modelo especializado no BotHub, alternando na mesma janela.
Não registramos dados específicos sobre a qualidade do russo neste modelo, então não prometemos nada — verifique com sua tarefa real. No BotHub, isso é fácil: pagamento por token sem assinatura, e há outros modelos disponíveis na mesma janela para comparação.