Como funciona Assembly AI Best?
Perguntas frequentes sobre Assembly AI Best
Você pode usar os resultados da geração para fins comerciais. Todos os direitos sobre o conteúdo criado pertencem a você. A única restrição: certifique-se de que a solicitação não inclua materiais de terceiros protegidos por direitos autorais. A responsabilidade pelo cumprimento dos direitos sobre os dados de entrada é do usuário.
O assemblyai-best converte fala em texto: podcasts, entrevistas, chamadas, palestras, mensagens de voz. O modo de processamento de arquivos grandes permite carregar gravações longas na íntegra, sem cortá-las manualmente. É adequado para transcrições, notas pós-reunião, preparação de legendas e pesquisa em arquivos de áudio. Acesso a partir da Rússia sem VPN ou cartão estrangeiro.
O limite de saída é de 4096 tokens, aproximadamente algumas páginas de texto, e a janela de contexto é de 4095 tokens. Se a gravação for longa e a transcrição não couber em uma única resposta, divida o áudio em fragmentos e monte o texto final a partir das partes.
Um modo de raciocínio separado não está indicado em nossos dados, e não é necessário para a transcrição: o modelo reconhece a fala e retorna o texto. Se precisar de análise da transcrição, resumo ou conclusões, envie o texto pronto para um modelo de texto — no BotHub, eles estão disponíveis na mesma janela.
O suporte para chamada de funções e saída JSON estrita não está indicado em nossos dados — baseie-se no resultado de reconhecimento de texto comum. O modelo em si pode ser chamado através da API unificada compatível com OpenAI do BotHub, e é mais conveniente estruturar a transcrição por campos no lado do seu aplicativo.
Áudio é a entrada principal: carregue a gravação e o modelo retornará o texto, inclusive no modo de arquivos grandes. Imagens e vídeos não estão indicados como entrada em nossos dados, portanto, para vídeos, faz sentido extrair a trilha sonora primeiro e enviar apenas ela.
A lista de idiomas suportados não está especificada em nossos dados, portanto, não prometeremos precisão em russo — verifique com sua própria gravação. A qualidade da transcrição depende principalmente da clareza do som: um bom microfone, mínimo de ruído de fundo e sem sobreposição de vozes proporcionam um resultado visivelmente melhor.