gemini-3.5-transcribe-preview
Rede Neural
Comprimento máximo de resposta
(em tokens)
Tamanho do contexto
(em tokens)
Custo do prompt
(por 1M tokens)
Custo da resposta
(por 1M tokens)
Prompt de imagem
(por 1K tokens)
Como funciona gemini-3.5-transcribe-preview?
Perguntas frequentes sobre gemini-3.5-transcribe-preview
Você pode usar os resultados da geração para fins comerciais. Todos os direitos sobre o conteúdo criado pertencem a você. A única restrição: certifique-se de que a solicitação não inclua materiais de terceiros protegidos por direitos autorais. A responsabilidade pelo cumprimento dos direitos sobre os dados de entrada é do usuário.
Este é um modelo da google-gemini que aceita texto, documentos e imagens, e responde com texto. É adequado para transcrição e estruturação de conteúdo de arquivos e digitalizações, extração de dados, análise e trabalho com código. O contexto é de 65.536 tokens, portanto, materiais volumosos cabem em uma única solicitação.
Em uma única resposta, o modelo gera até 32.000 tokens — o suficiente para uma transcrição longa de documento, uma análise detalhada ou um grande fragmento de código. Se o material final for maior, divida a tarefa em partes e continue a geração com as solicitações seguintes, baseando-se no contexto geral do diálogo.
Sim, o modelo possui um modo de raciocínio: antes de responder, ele analisa sequencialmente a condição e só então formula o resultado. Isso ajuda notavelmente em tarefas com lógica complexa, análise de estrutura de documentos, matemática e depuração de código, onde não é importante uma resposta rápida, mas sim uma resposta precisa.
Sim, o modelo suporta function calling e saída estruturada em JSON. Você descreve o esquema e as ferramentas, e ele retorna um objeto pronto para análise — útil para pipelines de extração de dados, integrações e agentes. No BotHub, isso está disponível através de uma API única compatível com OpenAI.
De acordo com nossos dados, o modelo aceita imagens e documentos além de texto: você pode enviar uma digitalização, uma foto de uma página, um diagrama ou um PDF e obter um resultado em texto. O suporte para entrada de áudio e vídeo não foi verificado por nós, portanto, concentre-se em documentos e imagens.
Os modelos da família Gemini da google-gemini tradicionalmente trabalham com o russo em um bom nível — tanto na compreensão da solicitação quanto na análise de texto em imagens e documentos. Não temos dados precisos sobre os idiomas de prompts e saída, portanto, verifique a qualidade em sua tarefa no BotHub.