Whisper 1
нейросеть
Whisper 1 — модель распознавания речи от OpenAI, обученная на большом массиве многоязычных записей
Макс. длина ответа
(в токенах)
Размер контекста
(в токенах)
Стоимость промпта
(за 1M токенов)
Как работает Whisper 1?
Принимает аудио- и видеофайлы, возвращает готовую расшифровку: разговорную речь, диктофонные записи созвонов, интервью, подкасты, лекции. Русский язык — одна из сильных сторон: модель уверенно держит акценты, фоновый шум и быструю речь, расставляет знаки препинания и не теряет смысл на длинных фрагментах. Кроме обычной расшифровки Whisper умеет переводить речь на английский и отдавать результат с тайм-кодами в форматах субтитров SRT и VTT — их можно сразу подложить в монтаж. Через BotHub онлайн-транскрибация аудио в текст работает из России без VPN и зарубежной карты: оплата российской картой в рублях, без подписки, списание по факту за минуты аудио, баланс не сгорает, а стартовый бонус позволяет попробовать бесплатно. Рядом в одном окне ChatGPT (чат GPT), Claude, Gemini и Suno — расшифровку удобно тут же превратить в саммари встречи или статью, а озвучку текста сделать голосовыми моделями. Всё шифруется AES-GCM, записи не хранятся; есть единый OpenAI-совместимый API для встраивания в свои сервисы.Частые вопросы о Whisper 1
Вы можете использовать результаты генерации в коммерческих целях. Все права на созданный контент принадлежат вам. Единственное ограничение: убедитесь, что в запросе не использовались защищённые авторским правом материалы третьих сторон. Ответственность за соблюдение прав на входные данные лежит на пользователе.
whisper-1 от OpenAI переводит аудио в текст. Загружаете запись — получаете расшифровку. Подходит для интервью, подкастов, созвонов, лекций, голосовых сообщений и заготовок под субтитры. Удобно, когда нужно быстро превратить часы разговоров в читаемый текст для поиска и правок.
До 4096 токенов за один ответ — это примерно несколько страниц расшифровки, контекст модели составляет 4095 токенов. Длинную запись лучше нарезать на фрагменты и отправлять их по очереди, а затем склеивать результат: так ничего не обрежется на середине фразы.
В наших данных отдельный режим рассуждений у whisper-1 не отмечен, и по задаче он здесь не нужен: модель распознаёт речь, а не строит цепочки выводов. Если нужен анализ расшифровки, передайте текст текстовой модели в том же окне BotHub.
В наших данных вызов функций и строгий JSON-вывод у whisper-1 не отмечены. Обращение идёт через единый OpenAI-совместимый API BotHub: вы отправляете файл и получаете расшифровку, а структурировать её можно уже на своей стороне или следующим шагом пайплайна.
Аудио — да, это основной вход модели: именно звуковую дорожку whisper-1 превращает в текст. Изображения в наших данных как вход не отмечены. С видео работают просто: извлекаете аудиодорожку любым конвертером и отправляете её на распознавание.
whisper-1 — многоязычная модель распознавания речи, русскую речь она понимает и расшифровывает. Качество сильнее зависит от самой записи: чистый звук, один говорящий и спокойный темп дают заметно более аккуратный текст, чем шумный зал или сильный акцент. Проверьте на своём файле.