gemini-3.5-transcribe-live
Rede Neural
Comprimento máximo de resposta
(em tokens)
Tamanho do contexto
(em tokens)
Custo do prompt
(por 1M tokens)
Custo da resposta
(por 1M tokens)
Prompt de imagem
(por 1K tokens)
Como funciona gemini-3.5-transcribe-live?
Perguntas frequentes sobre gemini-3.5-transcribe-live
Você pode usar os resultados da geração para fins comerciais. Todos os direitos sobre o conteúdo criado pertencem a você. A única restrição: certifique-se de que a solicitação não inclua materiais de terceiros protegidos por direitos autorais. A responsabilidade pelo cumprimento dos direitos sobre os dados de entrada é do usuário.
O gemini-3.5-transcribe-live é um modelo do google-gemini que, segundo nossos dados, gera áudio: você descreve a tarefa em texto e obtém uma faixa de áudio como resultado. É adequado para narração de vídeos, podcasts, materiais educativos e roteiros de voz em produtos. Acesso a partir da Rússia sem VPN ou cartão estrangeiro, pagamento por uso de tokens.
Formatos específicos e bitrate não estão especificados em nossos dados, portanto, baseie-se no resultado na interface: o áudio pode ser ouvido e baixado. O contexto de 65.536 tokens e até 32.000 tokens por resposta permite trabalhar com textos longos em uma única solicitação.
Em nossos dados, não há menção sobre raciocínio antes da resposta, e isso não é uma negação da possibilidade, mas uma falta de confirmação. Para narração, reflexões detalhadas geralmente não são necessárias: é mais importante formular a tarefa com precisão. Se precisar de longas cadeias de raciocínio, mude para um modelo de texto na mesma janela.
Chamada de funções e saída JSON estruturada não estão marcadas em nossos dados, portanto, não as inclua na arquitetura sem verificação. O acesso é feito através da API BotHub compatível com OpenAI, então é conveniente delegar o trabalho com ferramentas a um modelo de texto, sem reescrever a integração.
O recebimento de arquivos além de texto não está marcado em nossos dados, então conte com a descrição textual da tarefa. O contexto de 65.536 tokens é suficiente para um roteiro extenso completo. Se precisar de análise de imagem, gravação ou vídeo, selecione um modelo com a entrada adequada na mesma janela.
O idioma dos prompts e da narração não está fixado em nossos dados, por isso não prometemos nada — é mais fácil testar com um fragmento curto e comparar com outro modelo na mesma janela. A interface BotHub, o suporte e o pagamento com cartões russos estão disponíveis sem VPN ou cartão estrangeiro.