Como funciona Whisper 1?
Perguntas frequentes sobre Whisper 1
Você pode usar os resultados da geração para fins comerciais. Todos os direitos sobre o conteúdo criado pertencem a você. A única restrição: certifique-se de que a solicitação não inclua materiais de terceiros protegidos por direitos autorais. A responsabilidade pelo cumprimento dos direitos sobre os dados de entrada é do usuário.
O whisper-1 da OpenAI transcreve áudio para texto. Você carrega a gravação e recebe a transcrição. É adequado para entrevistas, podcasts, chamadas, palestras, mensagens de voz e rascunhos de legendas. É útil quando você precisa transformar rapidamente horas de conversas em texto legível para pesquisa e edição.
Até 4096 tokens por resposta — isso equivale a algumas páginas de transcrição, o contexto do modelo é de 4095 tokens. É melhor dividir gravações longas em fragmentos e enviá-los um por um, depois juntar o resultado: assim nada é cortado no meio de uma frase.
Em nossos dados, não há um modo de raciocínio separado para o whisper-1, e isso não é necessário para a tarefa: o modelo reconhece a fala, não constrói cadeias de raciocínio. Se precisar de análise da transcrição, envie o texto para um modelo de texto na mesma janela do BotHub.
Em nossos dados, a chamada de funções e a saída estrita em JSON não estão marcadas para o whisper-1. O acesso é feito através da API do BotHub compatível com OpenAI: você envia o arquivo e recebe a transcrição, e pode estruturá-la do seu lado ou no próximo passo do pipeline.
Áudio — sim, esta é a entrada principal do modelo: o whisper-1 transforma a trilha sonora em texto. Imagens não estão marcadas como entrada em nossos dados. Com vídeos, funciona de forma simples: extraia a trilha de áudio com qualquer conversor e envie para reconhecimento.
O whisper-1 é um modelo multilíngue de reconhecimento de fala; ele entende e transcreve o idioma russo. A qualidade depende mais da gravação em si: áudio limpo, um único falante e ritmo calmo produzem um texto visivelmente mais preciso do que uma sala barulhenta ou um sotaque forte. Teste com seu arquivo.