Whisper 1

нейросеть

Whisper 1 — модель распознавания речи от OpenAI, обученная на большом массиве многоязычных записей

4 096

Макс. длина ответа

(в токенах)

4 095

Размер контекста

(в токенах)

864 285,71 ₽

Стоимость промпта

(за 1M токенов)

*Указаны цены при использовании API через ECO-провайдеров.
bothub
BotHub: Попробуйте нейросети бесплатноbot

Осталось Caps: 0 CAPS
Пример кода и API для Whisper 1Мы предлагаем полный доступ к API OpenAI через наш сервис. Все наши конечные точки полностью соответствуют конечным точкам OpenAI, их можно использовать как с плагинами, так и при разработке собственного программного обеспечения через SDK.Создать API ключ
Javascript
Python
Curl
illustaration

Как работает Whisper 1?

Принимает аудио- и видеофайлы, возвращает готовую расшифровку: разговорную речь, диктофонные записи созвонов, интервью, подкасты, лекции. Русский язык — одна из сильных сторон: модель уверенно держит акценты, фоновый шум и быструю речь, расставляет знаки препинания и не теряет смысл на длинных фрагментах. Кроме обычной расшифровки Whisper умеет переводить речь на английский и отдавать результат с тайм-кодами в форматах субтитров SRT и VTT — их можно сразу подложить в монтаж. Через BotHub онлайн-транскрибация аудио в текст работает из России без VPN и зарубежной карты: оплата российской картой в рублях, без подписки, списание по факту за минуты аудио, баланс не сгорает, а стартовый бонус позволяет попробовать бесплатно. Рядом в одном окне ChatGPT (чат GPT), Claude, Gemini и Suno — расшифровку удобно тут же превратить в саммари встречи или статью, а озвучку текста сделать голосовыми моделями. Всё шифруется AES-GCM, записи не хранятся; есть единый OpenAI-совместимый API для встраивания в свои сервисы.

Частые вопросы о Whisper 1

Можно ли использовать результаты Whisper 1 в коммерческих целях?

Вы можете использовать результаты генерации в коммерческих целях. Все права на созданный контент принадлежат вам. Единственное ограничение: убедитесь, что в запросе не использовались защищённые авторским правом материалы третьих сторон. Ответственность за соблюдение прав на входные данные лежит на пользователе.

Что умеет whisper-1 и для каких задач подходит?

whisper-1 от OpenAI переводит аудио в текст. Загружаете запись — получаете расшифровку. Подходит для интервью, подкастов, созвонов, лекций, голосовых сообщений и заготовок под субтитры. Удобно, когда нужно быстро превратить часы разговоров в читаемый текст для поиска и правок.

Сколько текста может написать whisper-1 за один ответ?

До 4096 токенов за один ответ — это примерно несколько страниц расшифровки, контекст модели составляет 4095 токенов. Длинную запись лучше нарезать на фрагменты и отправлять их по очереди, а затем склеивать результат: так ничего не обрежется на середине фразы.

Умеет ли whisper-1 рассуждать перед ответом?

В наших данных отдельный режим рассуждений у whisper-1 не отмечен, и по задаче он здесь не нужен: модель распознаёт речь, а не строит цепочки выводов. Если нужен анализ расшифровки, передайте текст текстовой модели в том же окне BotHub.

Поддерживает ли whisper-1 вызов функций и вывод в JSON?

В наших данных вызов функций и строгий JSON-вывод у whisper-1 не отмечены. Обращение идёт через единый OpenAI-совместимый API BotHub: вы отправляете файл и получаете расшифровку, а структурировать её можно уже на своей стороне или следующим шагом пайплайна.

Можно ли загрузить в whisper-1 изображения, аудио или видео?

Аудио — да, это основной вход модели: именно звуковую дорожку whisper-1 превращает в текст. Изображения в наших данных как вход не отмечены. С видео работают просто: извлекаете аудиодорожку любым конвертером и отправляете её на распознавание.

Насколько хорошо whisper-1 понимает русский язык?

whisper-1 — многоязычная модель распознавания речи, русскую речь она понимает и расшифровывает. Качество сильнее зависит от самой записи: чистый звук, один говорящий и спокойный темп дают заметно более аккуратный текст, чем шумный зал или сильный акцент. Проверьте на своём файле.

Служба поддержкиРаботаем с 10:00 до 18:00 по МСК