Ling 3.0 Flash VL
Rede Neural
Ling 3.0 Flash VL — modelo MoE multimodal da InclusionAI: entende imagens e texto, disponível via API no BotHub.
Comprimento máximo de resposta
(em tokens)
Tamanho do contexto
(em tokens)
Custo do prompt
(por 1M tokens)
Custo da resposta
(por 1M tokens)
Como funciona Ling 3.0 Flash VL?
Ling 3.0 Flash VL — uma evolução do Ling 3.0 Flash da InclusionAI: a mesma arquitetura MoE de 124 bilhões de parâmetros com 5,5 bilhões ativos, mas com percepção visual nativa e capacidades linguísticas aprimoradas. O modelo aceita imagens junto com texto e analisa o que vê em um diálogo geral, sem um serviço separado para imagens. Através do BotHub, o modelo está disponível na Rússia sem VPN ou cartão estrangeiro, e você paga conforme o uso por tokens em rublos — sem assinatura, e os tokens não utilizados não expiram. Mais de 250 modelos em uma única janela: você pode alternar e comparar respostas, e uma API única compatível com OpenAI conecta o modelo ao seu produto e permite substituí-lo por outro sem reescrever a integração. Os dados são criptografados via AES-GCM e não são salvos, e as empresas têm acesso a contratos, faturas, EDI e painel administrativo com limites. Útil quando você precisa descrever o conteúdo de uma imagem, extrair significado de uma captura de tela de interface ou diagrama, comparar uma imagem com uma tarefa de texto, criar um assistente de suporte multimodal ou processar um fluxo de materiais visuais via API.Perguntas frequentes sobre Ling 3.0 Flash VL
Você pode usar os resultados da geração para fins comerciais. Todos os direitos sobre o conteúdo criado pertencem a você. A única restrição: certifique-se de que a solicitação não inclua materiais de terceiros protegidos por direitos autorais. A responsabilidade pelo cumprimento dos direitos sobre os dados de entrada é do usuário.
O modelo aceita texto, documentos e imagens, e responde com texto. Adequado para analisar arquivos e capturas de tela, extrair dados de tabelas e diagramas, trabalhar com código, análise e cenários de agentes: possui modo de raciocínio e chamada de funções. Contexto — 131.072 tokens.
Em uma única resposta, o modelo gera até 32.768 tokens — o suficiente para uma análise detalhada de um documento, um artigo longo ou um grande fragmento de código. Se precisar de um texto ainda maior, divida a tarefa em partes: o contexto de entrada de 131.072 tokens permite manter todo o histórico próximo.
Sim, o modelo possui um modo de raciocínio: antes de responder, ele processa a tarefa passo a passo. Isso ajuda significativamente em matemática, lógica, depuração de código e análise de documentos longos. Observe que o raciocínio consome tokens de saída e aumenta ligeiramente o tempo de resposta.
Sim, a chamada de funções e a saída estruturada em JSON são suportadas. O modelo pode ser conectado às suas ferramentas, bancos de dados e serviços externos, e a resposta pode ser obtida estritamente de acordo com o esquema. Funciona através da API única compatível com OpenAI do BotHub, portanto, você pode trocar de modelo mais tarde sem reescrever a integração.
O modelo aceita imagens e documentos — você pode enviar uma captura de tela, diagrama, digitalização ou PDF e pedir para analisar o conteúdo. Não há informações sobre áudio e vídeo em nossos dados, portanto, para esses arquivos, é mais seguro escolher um modelo especializado: ele está disponível na mesma janela do BotHub.
Não há medições separadas para o idioma russo em nossos dados, portanto, não prometemos nada aqui — avalie a qualidade em suas próprias tarefas, é rápido. A interface do BotHub está em russo, o acesso a partir da Rússia é feito sem VPN ou cartão estrangeiro, o pagamento é feito com cartões russos e os tokens não expiram.