TBank VoiceKit STT
Réseau Neuronal
Longueur maximale de la réponse
(en tokens)
Taille du contexte
(en tokens)
Coût du prompt
(par 1M tokens)
Comment ça marche TBank VoiceKit STT?
Questions fréquentes sur TBank VoiceKit STT
Vous pouvez utiliser les résultats générés à des fins commerciales. Tous les droits sur le contenu créé vous appartiennent. Seule restriction : vérifiez que la requête ne contient pas de contenus protégés par le droit d'auteur appartenant à des tiers. Le respect des droits sur les données d'entrée relève de votre responsabilité.
voicekit-stt est un modèle de reconnaissance vocale de T-Bank VoiceKit : il transcrit l'audio en texte, y compris les enregistrements longs. Il convient à la transcription de réunions, d'entretiens, d'appels et de podcasts, ainsi qu'à la préparation de notes et de brouillons de sous-titres. Accès depuis la Russie sans VPN ni carte étrangère, paiement en roubles.
En une seule réponse, le modèle fournit jusqu'à 4096 jetons de texte, avec un contexte de 4095 jetons. Cela suffit pour transcrire un fragment d'enregistrement ; si l'audio est long, divisez-le en parties et assemblez les résultats ou traitez-les par lots via l'API.
Le raisonnement étape par étape n'est pas indiqué dans nos données, et ce n'est pas l'essentiel pour cette tâche : voicekit-stt est conçu pour une transcription précise de la parole, et non pour la réflexion. Si vous avez besoin d'une analyse, de conclusions ou d'un résumé du texte généré, transmettez la transcription à n'importe quel modèle textuel dans BotHub.
L'appel de fonctions et la sortie JSON structurée ne sont pas indiqués dans nos données. En sortie, vous obtenez le texte reconnu. Si vous avez besoin d'une structure (champs, balises, tableau), envoyez la transcription à un modèle textuel via l'API BotHub compatible avec OpenAI, sans réécrire l'intégration.
L'audio, oui, c'est l'entrée principale : le modèle accepte les enregistrements, y compris les fichiers volumineux. La réception d'images et de vidéos n'est pas indiquée dans nos données, comptez donc sur les pistes audio. Si vous avez besoin de travailler avec des images ou des vidéos, passez à un autre modèle dans la même fenêtre.
Il s'agit d'un développement du fournisseur russe T-Bank VoiceKit, et le service a été créé pour les tâches de reconnaissance vocale en russe. Nous ne publions pas de mesures de qualité précises, donc la meilleure méthode consiste à tester vos propres enregistrements (appels, entretiens, appels téléphoniques) et à comparer la transcription avec d'autres modèles dans BotHub.