Cómo funciona TBank VoiceKit STT?
Preguntas frecuentes sobre TBank VoiceKit STT
Puede usar los resultados generados con fines comerciales. Todos los derechos sobre el contenido creado le pertenecen. La única restricción: asegúrese de que la solicitud no incluya material de terceros protegido por derechos de autor. El usuario es responsable de respetar los derechos sobre los datos de entrada.
voicekit-stt es un modelo de reconocimiento de voz de T-Bank VoiceKit: convierte audio a texto, incluidas grabaciones largas. Es adecuado para transcribir reuniones, entrevistas, llamadas y podcasts, así como para preparar notas y borradores de subtítulos. Acceso desde Rusia sin VPN ni tarjeta extranjera, pago en rublos.
En una sola respuesta, el modelo entrega hasta 4096 tokens de texto, con un contexto de 4095 tokens. Esto es suficiente para transcribir un fragmento de grabación; si el audio es largo, divídalo en partes y una los resultados o procéselo en lotes a través de la API.
El razonamiento paso a paso no está marcado en nuestros datos, y no es lo principal para esta tarea: voicekit-stt está diseñada para una transcripción precisa del habla, no para reflexionar. Si necesita análisis, conclusiones o un resumen del texto resultante, envíe la transcripción a cualquier modelo de texto en BotHub.
La llamada a funciones y la salida estructurada en JSON no están marcadas en nuestros datos. Como resultado, obtiene texto reconocido. Si necesita una estructura (campos, etiquetas, tablas), envíe la transcripción a un modelo de texto a través de la API unificada compatible con OpenAI de BotHub, sin reescribir la integración.
Audio, sí, es la entrada principal: el modelo acepta grabaciones, incluidos archivos grandes. La recepción de imágenes y videos no está marcada en nuestros datos, así que cuente con pistas de audio. Si necesita trabajar con imágenes o videos, cambie a otro modelo en la misma ventana.
Es un desarrollo del proveedor ruso T-Bank VoiceKit, y el servicio fue creado para tareas de reconocimiento de voz en ruso. No publicamos métricas de calidad exactas, por lo que la mejor manera es probar sus propias grabaciones (reuniones, entrevistas, llamadas) y comparar la transcripción con otros modelos en BotHub.