Eleven Multilingual V2
Rede Neural
Eleven Multilingual V2 — modelo de síntese de fala da ElevenLabs para narração emocional e viva em 29 idiomas.
Comprimento máximo de resposta
(em tokens)
Tamanho do contexto
(em tokens)
Custo do prompt
(por 1M tokens)
Como funciona Eleven Multilingual V2?
Eleven Multilingual V2 é um modelo de síntese de fala da ElevenLabs projetado para um som natural e transmissão de emoções. Suporta 29 idiomas, permitindo que o mesmo papel seja dublado para diferentes mercados, mantendo o caráter da voz. O fornecedor posiciona-o para narração, audiolivros, pós-produção e qualquer conteúdo onde a entonação humana seja importante. No BotHub, o modelo funciona sem VPN e sem cartão estrangeiro: pagamento com cartões russos em rublos e apenas pelo uso real, sem assinatura, e o saldo não utilizado não expira. Mais de 250 modelos estão disponíveis na mesma janela — o texto para narração pode ser escrito em um modelo de linguagem e enviado imediatamente para síntese. As solicitações são criptografadas via AES-GCM, e para equipes há uma API unificada, contrato, fatura e painel administrativo com limites. Use para dublagem de vídeos e anúncios, audiolivros e podcasts, vozes para cursos de treinamento, dublagem e localização de vídeos, e também para substituir gravações de locutores na fase de edição.Perguntas frequentes sobre Eleven Multilingual V2
Você pode usar os resultados da geração para fins comerciais. Todos os direitos sobre o conteúdo criado pertencem a você. A única restrição: certifique-se de que a solicitação não inclua materiais de terceiros protegidos por direitos autorais. A responsabilidade pelo cumprimento dos direitos sobre os dados de entrada é do usuário.
É um modelo de síntese de fala da ElevenLabs: você envia o texto e recebe uma faixa de áudio narrada. Adequado para narração de vídeos e reels, podcasts, versões em áudio de artigos e livros, cursos de treinamento, respostas de voz em serviços e protótipos de interfaces de voz.
Na saída, você recebe áudio — fala sintetizada a partir do texto enviado. Por solicitação, o modelo trabalha com um volume de até 10.000 tokens, portanto, materiais longos são mais fáceis de dividir em partes. Os parâmetros exatos do arquivo dependem do método de acesso: via interface BotHub ou API.
O modo de raciocínio passo a passo não está indicado em nossos dados — essa não é sua função. O modelo é especializado em narração de texto, não em lógica e análise. Se precisar de raciocínio, prepare o roteiro com um modelo de texto na mesma janela do BotHub e envie o texto pronto para síntese.
Em nossos dados, function calling e saída estruturada não estão indicados para este modelo. No entanto, ele está disponível através da API unificada compatível com OpenAI do BotHub, portanto, você pode integrar a síntese de fala em seu pipeline como uma etapa separada — ao lado de modelos de texto que suportam tais funções.
O recebimento de arquivos além de texto não está indicado em nossos dados: o cenário principal é enviar texto e receber uma faixa de áudio. Se precisar narrar um documento, primeiro extraia o texto dele, e para analisar imagens ou vídeos, use modelos multimodais na mesma interface.
O modelo pertence à linha multilíngue da ElevenLabs, no entanto, a lista exata de idiomas suportados não está especificada em nossos dados. Portanto, é mais seguro verificar o som em um pequeno fragmento do seu texto: no BotHub, você paga apenas pelo uso real, sem assinatura.