Como funciona TBank VoiceKit STT?
Perguntas frequentes sobre TBank VoiceKit STT
Você pode usar os resultados da geração para fins comerciais. Todos os direitos sobre o conteúdo criado pertencem a você. A única restrição: certifique-se de que a solicitação não inclua materiais de terceiros protegidos por direitos autorais. A responsabilidade pelo cumprimento dos direitos sobre os dados de entrada é do usuário.
O voicekit-stt é um modelo de reconhecimento de fala da T-Bank VoiceKit: ele traduz áudio para texto, incluindo gravações longas. É adequado para transcrever reuniões, entrevistas, chamadas e podcasts, além de preparar notas e rascunhos de legendas. Acesso a partir da Rússia sem VPN ou cartão estrangeiro, pagamento em rublos.
Em uma única resposta, o modelo fornece até 4096 tokens de texto, com um contexto de 4095 tokens. Isso é suficiente para transcrever um fragmento de gravação; se o áudio for longo, divida-o em partes e junte os resultados ou processe em lotes via API.
Raciocínios passo a passo não estão marcados em nossos dados e não são o foco para esta tarefa: o voicekit-stt é otimizado para a transcrição precisa da fala, não para reflexões. Se precisar de análise, conclusões ou um resumo do texto pronto, envie a transcrição para qualquer modelo de texto no BotHub.
Chamada de funções e saída estruturada em JSON não estão marcadas em nossos dados. Na saída, você recebe o texto reconhecido. Se precisar de estrutura — campos, tags, tabela — envie a transcrição para um modelo de texto através da API compatível com OpenAI do BotHub, sem precisar reescrever a integração.
Áudio — sim, esta é a entrada principal: o modelo aceita gravações, incluindo arquivos grandes. O recebimento de imagens e vídeos não está marcado em nossos dados, portanto, conte com faixas de áudio. Se precisar trabalhar com imagens ou vídeos, mude para outro modelo na mesma janela.
Este é um desenvolvimento do fornecedor russo T-Bank VoiceKit, e o serviço foi criado para tarefas de reconhecimento de fala em russo. Não publicamos métricas de qualidade precisas, portanto, a melhor maneira é testar suas próprias gravações: chamadas, entrevistas, ligações — e comparar a transcrição com outros modelos no BotHub.