Como funciona TTS 1?
Perguntas frequentes sobre TTS 1
Você pode usar os resultados da geração para fins comerciais. Todos os direitos sobre o conteúdo criado pertencem a você. A única restrição: certifique-se de que a solicitação não inclua materiais de terceiros protegidos por direitos autorais. A responsabilidade pelo cumprimento dos direitos sobre os dados de entrada é do usuário.
Este é um modelo de síntese de fala da OpenAI: você envia texto e recebe uma faixa de áudio pronta. É adequado para narração de vídeos e clipes, versões em áudio de artigos, respostas de voz em bots e serviços, narração de notificações e materiais educacionais.
Na saída, você recebe um arquivo de áudio com fala sintetizada, que pode ser inserido imediatamente em vídeos, newsletters ou aplicativos. Em uma única solicitação, o modelo processa texto dentro de um limite de contexto de cerca de 4095 tokens; materiais longos são mais fáceis de narrar em partes.
Um modo de raciocínio separado não está indicado em nossos dados, e não é necessário para a síntese de fala: a tarefa do modelo é narrar o texto enviado. Se precisar de lógica, raciocínio ou STEM, prepare o texto em um modelo de texto e envie o resultado para cá.
Em nossos dados, a chamada de funções e a saída estruturada não estão indicadas para este modelo: ele fornece áudio, não uma resposta de texto baseada em esquema. É conveniente construir a lógica com function calling em um modelo de texto e conectar o tts-1 como uma etapa de narração através da API unificada do BotHub.
O recebimento de arquivos além de texto não está indicado em nossos dados — o trabalho é baseado na descrição de texto que você envia para narração. Se o cenário exigir imagens ou vídeos, conecte outro modelo na mesma interface do BotHub e monte uma cadeia.
Não temos dados sobre idiomas, por isso é mais honesto verificar na prática: envie um pequeno fragmento e ouça o resultado. O pagamento no BotHub é feito por tokens, sem assinatura, então o teste custará o mínimo e os tokens não utilizados não expiram.