gemini-3.5-transcribe-live
Réseau Neuronal
Longueur maximale de la réponse
(en tokens)
Taille du contexte
(en tokens)
Coût du prompt
(par 1M tokens)
Coût de la réponse
(par 1M tokens)
Invite d'image
(par 1K tokens)
Comment ça marche gemini-3.5-transcribe-live?
Questions fréquentes sur gemini-3.5-transcribe-live
Vous pouvez utiliser les résultats générés à des fins commerciales. Tous les droits sur le contenu créé vous appartiennent. Seule restriction : vérifiez que la requête ne contient pas de contenus protégés par le droit d'auteur appartenant à des tiers. Le respect des droits sur les données d'entrée relève de votre responsabilité.
gemini-3.5-transcribe-live est un modèle de google-gemini qui, selon nos données, génère de l'audio : vous décrivez la tâche par texte et obtenez une piste audio en sortie. Il convient pour la voix off de vidéos, de podcasts, de supports pédagogiques et de scénarios vocaux dans les produits. Accès depuis la Russie sans VPN ni carte étrangère, paiement à l'usage par jetons.
Les formats spécifiques et le débit binaire ne sont pas indiqués dans nos données, fiez-vous donc au résultat dans l'interface : l'audio peut être écouté et téléchargé. Un contexte de 65 536 jetons et jusqu'à 32 000 jetons par réponse permettent de travailler sur de longs textes en une seule requête.
Nos données ne mentionnent pas de capacités de raisonnement avant la réponse ; ce n'est pas une négation de la possibilité, mais une absence de confirmation. Pour la voix off, des réflexions détaillées ne sont généralement pas nécessaires : il est plus important de formuler la tâche avec précision. Si vous avez besoin de longues chaînes de raisonnement, passez à un modèle textuel dans la même fenêtre.
L'appel de fonctions et la sortie JSON structurée ne sont pas indiqués dans nos données, ne les intégrez donc pas dans votre architecture sans vérification. L'accès se fait via l'API BotHub compatible OpenAI, il est donc pratique de déléguer le travail avec les outils à un modèle textuel sans réécrire l'intégration.
La réception de fichiers autres que du texte n'est pas indiquée dans nos données, comptez donc sur une description textuelle de la tâche. Un contexte de 65 536 jetons suffit pour un scénario volumineux complet. Si vous avez besoin d'analyser une image, un enregistrement ou une vidéo, choisissez un modèle avec une entrée appropriée dans la même fenêtre.
La langue des prompts et de la voix off n'est pas spécifiée dans nos données, nous ne promettons donc rien — il est plus simple de tester sur un court fragment et de comparer avec un autre modèle dans la même fenêtre. L'interface BotHub, le support et le paiement par cartes russes sont disponibles sans VPN ni carte étrangère.