gemini-3.5-transcribe-preview
Réseau Neuronal
Longueur maximale de la réponse
(en tokens)
Taille du contexte
(en tokens)
Coût du prompt
(par 1M tokens)
Coût de la réponse
(par 1M tokens)
Invite d'image
(par 1K tokens)
Comment ça marche gemini-3.5-transcribe-preview?
Questions fréquentes sur gemini-3.5-transcribe-preview
Vous pouvez utiliser les résultats générés à des fins commerciales. Tous les droits sur le contenu créé vous appartiennent. Seule restriction : vérifiez que la requête ne contient pas de contenus protégés par le droit d'auteur appartenant à des tiers. Le respect des droits sur les données d'entrée relève de votre responsabilité.
Il s'agit d'un modèle de google-gemini qui accepte du texte, des documents et des images, et répond par du texte. Il est adapté à la transcription et à la structuration du contenu de fichiers et de scans, à l'extraction de données, à l'analyse et au travail sur le code. Le contexte est de 65 536 jetons, ce qui permet d'inclure des documents volumineux dans une seule requête.
En une seule réponse, le modèle génère jusqu'à 32 000 jetons, ce qui suffit pour une longue transcription de document, une analyse détaillée ou un grand fragment de code. Si le matériel final est plus long, divisez la tâche en plusieurs parties et poursuivez la génération avec les requêtes suivantes, en vous appuyant sur le contexte global de la conversation.
Oui, le modèle dispose d'un mode de raisonnement : avant de répondre, il analyse séquentiellement la condition et ne formule le résultat qu'ensuite. Cela aide considérablement pour les tâches nécessitant une logique complexe, l'analyse de la structure de documents, les mathématiques et le débogage de code, où une réponse précise est plus importante qu'une réponse rapide.
Oui, le modèle prend en charge le function calling et la sortie structurée en JSON. Vous décrivez le schéma et les outils, et il renvoie un objet prêt à être analysé — pratique pour les pipelines d'extraction de données, les intégrations et les agents. Dans BotHub, cela est disponible via une API unique compatible avec OpenAI.
Selon nos données, le modèle accepte en entrée des images et des documents en plus du texte : vous pouvez envoyer un scan, une photo de page, un schéma ou un PDF et obtenir un résultat textuel. La prise en charge de l'audio et de la vidéo en entrée n'est pas indiquée, veuillez donc vous concentrer sur les documents et les images.
Les modèles de la famille Gemini de google-gemini fonctionnent traditionnellement bien avec le russe, tant pour la compréhension des requêtes que pour l'analyse de texte sur les images et dans les documents. Nous ne disposons pas de données précises sur les langues des prompts et de sortie, veuillez donc vérifier la qualité sur votre tâche dans BotHub.