Ernie 4.5 VL 424B A47B
Rede Neural
Ernie 4.5 VL 424B A47B é um modelo MoE multimodal da Baidu, treinado em texto e imagens, com acesso via API.
Comprimento máximo de resposta
(em tokens)
Tamanho do contexto
(em tokens)
Custo do prompt
(por 1M tokens)
Custo da resposta
(por 1M tokens)
Como funciona Ernie 4.5 VL 424B A47B?
Ernie 4.5 VL 424B A47B é um modelo multimodal da família ERNIE 4.5 da Baidu. Baseia-se na arquitetura Mixture-of-Experts: dos 424 bilhões de parâmetros, cerca de 47 bilhões são usados por token, combinando vasto conhecimento com geração econômica. O modelo foi treinado simultaneamente em texto e imagens, compreendendo a imagem e o prompt de texto como uma tarefa única. No BotHub, o modelo funciona sem VPN ou cartão estrangeiro: pague com cartão russo em rublos apenas pelos tokens consumidos, que não expiram. Mais de 250 modelos estão disponíveis na mesma janela para comparação e alternância, e uma API compatível com OpenAI permite trocar de modelo no código com uma linha. Para empresas, oferecemos contrato, fatura e painel administrativo com limites. Carregue capturas de tela ou diagramas para análise, gere descrições de produtos a partir de fotos, extraia dados de documentos, analise gráficos de relatórios ou combine análise visual com análise de texto em seu serviço.Perguntas frequentes sobre Ernie 4.5 VL 424B A47B
Você pode usar os resultados da geração para fins comerciais. Todos os direitos sobre o conteúdo criado pertencem a você. A única restrição: certifique-se de que a solicitação não inclua materiais de terceiros protegidos por direitos autorais. A responsabilidade pelo cumprimento dos direitos sobre os dados de entrada é do usuário.
É um modelo multimodal da Baidu: aceita texto, imagens e documentos, retornando texto. Adequado para analisar diagramas, capturas de tela e digitalizações, analisar materiais longos, trabalhar com código e tarefas que exigem vincular imagens ao contexto textual.
Até 16.000 tokens por resposta — suficiente para uma análise detalhada de documentos, grandes trechos de código ou instruções detalhadas. O contexto da solicitação é de 123.000 tokens, permitindo carregar materiais extensos no diálogo e consultá-los durante o trabalho.
Sim, o modo de raciocínio é suportado: o modelo analisa a tarefa passo a passo antes de responder. Isso ajuda significativamente na lógica, matemática, análise de dados de imagens e casos que exigem a comparação de várias fontes dentro de uma única solicitação.
Não temos essa indicação em nossos dados, portanto, não podemos prometer um function calling estável. Respostas estruturadas geralmente podem ser obtidas descrevendo o formato desejado diretamente no prompt. Teste o comportamento em seu cenário — você pode alternar para outro modelo no BotHub sem reescrever a integração.
Imagens e documentos, sim, são capacidades declaradas do modelo: você pode enviar capturas de tela, fotos, diagramas, PDFs ou apresentações e solicitar a análise do conteúdo. Não há indicação sobre áudio e vídeo em nossos dados, portanto, não conte com isso.
O modelo é multilíngue e funciona bem com o português — você pode formular solicitações e receber respostas normalmente. A qualidade é melhor avaliada em suas próprias tarefas: execute um prompt típico e compare com outros modelos na mesma janela do BotHub; o pagamento é feito conforme o uso dos tokens.