Qwen2.5 VL 72B Instruct
нейросеть
Qwen2.5 VL 72B Instruct — мультимодальная модель Qwen для анализа изображений: объекты, тексты, графики, иконки и разметка макета.
Макс. длина ответа
(в токенах)
Размер контекста
(в токенах)
Стоимость промпта
(за 1M токенов)
Стоимость ответа
(за 1M токенов)
Как работает Qwen2.5 VL 72B Instruct?
Qwen2.5 VL 72B Instruct — визуально-языковая модель семейства Qwen: она принимает не только текстовый запрос, но и изображение. Модель уверенно распознаёт привычные объекты вроде цветов, птиц, рыб и насекомых, а также разбирает то, что находится внутри картинки: текстовые фрагменты, графики, иконки, схемы и компоновку макета. В BotHub доступ открывается без VPN и зарубежной карты: оплата российской картой в рублях и только за фактически израсходованные токены, которые не сгорают. В одном окне рядом — более 250 других нейросетей, между которыми легко переключаться и сравнивать ответы, а единый OpenAI-совместимый API позволяет подключить модель к своему сервису и позже сменить её без переписывания интеграции. Данные шифруются по AES-GCM и не сохраняются, а компаниям доступны договор, счёт, ЭДО и админ-панель с лимитами. Сценарии простые: снять цифры с диаграммы для отчёта, вытащить текст со скриншота или скана, описать содержимое фотографии для каталога, разобрать интерфейс или макет по элементам, распознать объект на снимке в полевой задаче.Частые вопросы о Qwen2.5 VL 72B Instruct
Вы можете использовать результаты генерации в коммерческих целях. Все права на созданный контент принадлежат вам. Единственное ограничение: убедитесь, что в запросе не использовались защищённые авторским правом материалы третьих сторон. Ответственность за соблюдение прав на входные данные лежит на пользователе.
Это визуально-языковая модель Qwen: она читает текст, разбирает изображения и документы, отвечает на вопросы по их содержимому. Подходит для анализа скриншотов, схем, таблиц и сканов, извлечения данных в структурированный вид, работы с кодом и подключения инструментов через вызов функций. Контекст — 32 000 токенов.
В одном ответе — до 115 200 токенов по нашим данным, это объём большой статьи или документации целиком. Контекстное окно — 32 000 токенов, поэтому промпт и приложенные файлы считайте вместе, а для длинных материалов разбивайте задачу на части.
Отдельный режим рассуждений в наших данных не отмечен, но это не значит, что его нет. На практике помогает попросить модель разобрать задачу по шагам: так ответы на логику, расчёты и разбор документов получаются аккуратнее. Проверьте на своём сценарии.
Да. Вызов функций и структурированный вывод JSON поддерживаются: модель может обращаться к вашим инструментам и возвращать ответ по заданной схеме. Это удобно для извлечения полей из сканов и счетов, интеграций и агентных сценариев. В BotHub всё работает через единый OpenAI-совместимый API.
Изображения и документы — да, их можно отправлять на вход вместе с текстом: модель опишет картинку, найдёт нужный фрагмент на скриншоте, разберёт таблицу или договор. Приём аудио и видео в наших данных не отмечен. Для таких задач в BotHub есть отдельные модели.
Данных о языках промптов и вывода у нас нет, поэтому обещать конкретное качество не станем. Qwen2.5-VL относится к многоязычной линейке Qwen, так что русский запрос модель поймёт. Надёжнее всего проверить на своей задаче и сравнить с другой моделью — переключиться в BotHub можно в одном окне.