Cómo funciona Whisper 1?
Preguntas frecuentes sobre Whisper 1
Puede usar los resultados generados con fines comerciales. Todos los derechos sobre el contenido creado le pertenecen. La única restricción: asegúrese de que la solicitud no incluya material de terceros protegido por derechos de autor. El usuario es responsable de respetar los derechos sobre los datos de entrada.
whisper-1 de OpenAI traduce audio a texto. Subes una grabación y obtienes la transcripción. Es adecuado para entrevistas, podcasts, llamadas, conferencias, mensajes de voz y borradores de subtítulos. Es útil cuando necesitas convertir rápidamente horas de conversación en texto legible para buscar y editar.
Hasta 4096 tokens por respuesta, lo que equivale aproximadamente a varias páginas de transcripción; el contexto del modelo es de 4095 tokens. Es mejor dividir las grabaciones largas en fragmentos y enviarlos uno por uno, y luego unir el resultado: así no se cortará nada a mitad de una frase.
En nuestros datos, no se indica un modo de razonamiento separado para whisper-1, y para esta tarea no es necesario: el modelo reconoce el habla, no construye cadenas de razonamiento. Si necesitas analizar la transcripción, envía el texto a un modelo de texto en la misma ventana de BotHub.
En nuestros datos, la llamada a funciones y la salida estricta en JSON no están marcadas para whisper-1. La solicitud se realiza a través de la API de BotHub compatible con OpenAI: envías el archivo y recibes la transcripción, y puedes estructurarla por tu cuenta o en el siguiente paso del pipeline.
Audio, sí, es la entrada principal del modelo: whisper-1 convierte precisamente la pista de audio en texto. Las imágenes no están marcadas como entrada en nuestros datos. Con el video es sencillo: extraes la pista de audio con cualquier convertidor y la envías para su reconocimiento.
whisper-1 es un modelo multilingüe de reconocimiento de voz; entiende y transcribe el habla rusa. La calidad depende más de la grabación en sí: un sonido limpio, un solo hablante y un ritmo tranquilo dan un texto notablemente más preciso que una sala ruidosa o un acento fuerte. Compruébalo con tu archivo.