Qwen2.5 VL 72B Instruct
Rede Neural
Qwen2.5 VL 72B Instruct — modelo multimodal Qwen para análise de imagens: objetos, textos, gráficos, ícones e layouts.
Comprimento máximo de resposta
(em tokens)
Tamanho do contexto
(em tokens)
Custo do prompt
(por 1M tokens)
Custo da resposta
(por 1M tokens)
Como funciona Qwen2.5 VL 72B Instruct?
O Qwen2.5 VL 72B Instruct é um modelo de visão e linguagem da família Qwen: ele aceita não apenas solicitações de texto, mas também imagens. O modelo reconhece com confiança objetos comuns, como flores, pássaros, peixes e insetos, além de analisar o que está dentro da imagem: fragmentos de texto, gráficos, ícones, diagramas e layouts. No BotHub, o acesso é liberado sem VPN ou cartões estrangeiros: pagamento em rublos com cartão russo e apenas pelos tokens efetivamente consumidos, que não expiram. Em uma única janela, você tem mais de 250 outras redes neurais, facilitando a alternância e a comparação de respostas. Uma API única compatível com OpenAI permite conectar o modelo ao seu serviço e trocá-lo posteriormente sem reescrever a integração. Os dados são criptografados via AES-GCM e não são salvos. Para empresas, estão disponíveis contratos, faturas, intercâmbio eletrônico de documentos (EDO) e um painel administrativo com limites. Cenários simples: extrair números de diagramas para relatórios, extrair texto de capturas de tela ou digitalizações, descrever o conteúdo de fotos para catálogos, analisar interfaces ou layouts por elementos, ou reconhecer objetos em fotos para tarefas de campo.Perguntas frequentes sobre Qwen2.5 VL 72B Instruct
Você pode usar os resultados da geração para fins comerciais. Todos os direitos sobre o conteúdo criado pertencem a você. A única restrição: certifique-se de que a solicitação não inclua materiais de terceiros protegidos por direitos autorais. A responsabilidade pelo cumprimento dos direitos sobre os dados de entrada é do usuário.
É um modelo de visão e linguagem Qwen: ele lê texto, analisa imagens e documentos, e responde a perguntas sobre seu conteúdo. Adequado para analisar capturas de tela, diagramas, tabelas e digitalizações, extrair dados de forma estruturada, trabalhar com código e conectar ferramentas via chamada de função. Contexto de 32.000 tokens.
Em uma única resposta, até 115.200 tokens segundo nossos dados, o que equivale a um artigo longo ou documentação completa. A janela de contexto é de 32.000 tokens, portanto, considere o prompt e os arquivos anexados juntos; para materiais longos, divida a tarefa em partes.
Um modo de raciocínio separado não está marcado em nossos dados, mas isso não significa que não exista. Na prática, ajuda pedir ao modelo para analisar a tarefa passo a passo: assim, as respostas para lógica, cálculos e análise de documentos ficam mais precisas. Verifique em seu cenário.
Sim. A chamada de funções e a saída estruturada em JSON são suportadas: o modelo pode acessar suas ferramentas e retornar uma resposta de acordo com o esquema definido. Isso é útil para extrair campos de digitalizações e faturas, integrações e cenários de agentes. No BotHub, tudo funciona através de uma API única compatível com OpenAI.
Imagens e documentos, sim, podem ser enviados junto com o texto: o modelo descreverá a imagem, encontrará o fragmento necessário na captura de tela, analisará uma tabela ou contrato. A entrada de áudio e vídeo não está marcada em nossos dados. Para essas tarefas, existem modelos separados no BotHub.
Não temos dados sobre os idiomas de prompts e saída, por isso não prometeremos uma qualidade específica. O Qwen2.5-VL pertence à linha multilíngue Qwen, então o modelo entenderá uma solicitação em português. É mais seguro testar em sua tarefa e comparar com outro modelo — você pode alternar no BotHub em uma única janela.