Gemini 2.5 Flash Lite
Rede Neural
Gemini 2.5 Flash Lite é um modelo leve do Google com raciocínio, focado em latência mínima e alta velocidade de geração.
Comprimento máximo de resposta
(em tokens)
Tamanho do contexto
(em tokens)
Custo do prompt
(por 1M tokens)
Custo da resposta
(por 1M tokens)
Prompt de imagem
(por 1K tokens)
Como funciona Gemini 2.5 Flash Lite?
Gemini 2.5 Flash Lite é um modelo leve com raciocínio da família Gemini 2.5 do Google, focado em velocidade: latência ultrabaixa, maior largura de banda e operação econômica em grandes volumes de solicitações. Em relação à versão anterior da linha, os tokens são gerados mais rapidamente e o desempenho geral é superior. No BotHub, ele está disponível sem VPN ou cartão estrangeiro, e você paga com cartão russo em rublos conforme o uso — por tokens consumidos, sem assinatura obrigatória, e os tokens não expiram. Ao lado, em uma única janela, mais de 250 redes neurais estão disponíveis: é fácil comparar respostas e alternar para outro modelo sem mudar de ferramenta. A API unificada do BotHub conecta o Gemini 2.5 Flash Lite ao seu serviço, e a troca de modelo não exige reescrever a integração; as conversas são criptografadas via AES-GCM e não são salvas. Para empresas, estão disponíveis contrato, fatura, EDI, painel administrativo e limites para funcionários. Cenários simples: chatbots de suporte com resposta instantânea, processamento de fluxo e classificação de grandes volumes de texto, resumos e rascunhos, sugestões na interface do produto, iterações rápidas na depuração de prompts.Perguntas frequentes sobre Gemini 2.5 Flash Lite
Você pode usar os resultados da geração para fins comerciais. Todos os direitos sobre o conteúdo criado pertencem a você. A única restrição: certifique-se de que a solicitação não inclua materiais de terceiros protegidos por direitos autorais. A responsabilidade pelo cumprimento dos direitos sobre os dados de entrada é do usuário.
O modelo trabalha com texto, documentos e imagens: analisa arquivos longos e responde a perguntas sobre eles, escreve e corrige código, ajuda com raciocínio e tarefas STEM. O contexto é de 1.048.576 tokens, então uma documentação grande ou todo o histórico de conversas caberá na solicitação.
Em uma única resposta, são gerados até 65.535 tokens — isso equivale a dezenas de páginas. É suficiente para uma análise detalhada de documento, tradução volumosa ou um módulo de código inteiro. Se o material não couber, basta pedir para continuar: o contexto de 1.048.576 tokens é suficiente para manter todo o diálogo.
Sim, o raciocínio antes da resposta é suportado: antes de fornecer o resultado, o modelo executa uma cadeia de pensamento. Isso é perceptível em matemática, lógica, análise de dados e depuração de código, onde a tarefa precisa ser dividida em etapas. Quanto mais complexa a solicitação, mais perceptível é o efeito.
Sim, há suporte tanto para chamada de funções quanto para saída estruturada em JSON. Você descreve as ferramentas, o modelo decide quando aplicá-las e retorna a resposta no esquema definido — isso é conveniente para agentes, bots e integrações. A conexão é feita através da API unificada do BotHub, compatível com OpenAI.
De acordo com nossos dados, texto, imagens e documentos são aceitos como entrada: o modelo lê nativamente capturas de tela, diagramas, tabelas, digitalizações e PDFs, sem conversão prévia. Não temos informações sobre áudio e vídeo, portanto, esse cenário deve ser testado com seu próprio arquivo diretamente no chat.
Não há informações específicas sobre idiomas em nossos dados, por isso não faremos promessas — é mais seguro testar com seu próprio texto. É fácil fazer isso: no BotHub, o modelo está disponível sem VPN ou cartão estrangeiro, pagamento em rublos conforme o uso, e outras modelos estão disponíveis na mesma janela para comparação.