Comment ça marche Whisper 1?
Questions fréquentes sur Whisper 1
Vous pouvez utiliser les résultats générés à des fins commerciales. Tous les droits sur le contenu créé vous appartiennent. Seule restriction : vérifiez que la requête ne contient pas de contenus protégés par le droit d'auteur appartenant à des tiers. Le respect des droits sur les données d'entrée relève de votre responsabilité.
whisper-1 d'OpenAI transcrit l'audio en texte. Vous téléchargez un enregistrement et obtenez une transcription. Il est adapté aux interviews, podcasts, appels, conférences, messages vocaux et brouillons de sous-titres. C'est pratique pour transformer rapidement des heures de conversation en texte lisible pour la recherche et l'édition.
Jusqu'à 4096 jetons par réponse, ce qui correspond à environ quelques pages de transcription ; le contexte du modèle est de 4095 jetons. Il est préférable de découper un long enregistrement en fragments, de les envoyer un par un, puis de recoller le résultat : ainsi, rien ne sera coupé au milieu d'une phrase.
Dans nos données, aucun mode de raisonnement distinct n'est indiqué pour whisper-1, et ce n'est pas nécessaire pour cette tâche : le modèle reconnaît la parole et ne construit pas de chaînes de raisonnement. Si vous avez besoin d'une analyse de la transcription, transmettez le texte à un modèle textuel dans la même fenêtre BotHub.
Dans nos données, l'appel de fonctions et la sortie JSON stricte ne sont pas indiqués pour whisper-1. L'accès se fait via l'API BotHub compatible avec OpenAI : vous envoyez un fichier et recevez une transcription, et vous pouvez la structurer de votre côté ou lors de l'étape suivante du pipeline.
L'audio, oui, c'est l'entrée principale du modèle : c'est la piste sonore que whisper-1 transforme en texte. Les images ne sont pas indiquées comme entrée dans nos données. Pour la vidéo, c'est simple : extrayez la piste audio avec n'importe quel convertisseur et envoyez-la pour reconnaissance.
whisper-1 est un modèle multilingue de reconnaissance vocale ; il comprend et transcrit la langue russe. La qualité dépend davantage de l'enregistrement lui-même : un son clair, un seul locuteur et un rythme calme donnent un texte nettement plus précis qu'une salle bruyante ou un accent prononcé. Testez avec votre propre fichier.