Qwen2.5 VL 72B Instruct
Réseau Neuronal
Qwen2.5 VL 72B Instruct : modèle multimodal Qwen pour l'analyse d'images : objets, textes, graphiques, icônes et mise en page.
Longueur maximale de la réponse
(en tokens)
Taille du contexte
(en tokens)
Coût du prompt
(par 1M tokens)
Coût de la réponse
(par 1M tokens)
Comment ça marche Qwen2.5 VL 72B Instruct?
Qwen2.5 VL 72B Instruct est un modèle visuel-langage de la famille Qwen : il accepte non seulement des requêtes textuelles, mais aussi des images. Le modèle reconnaît avec assurance des objets courants comme des fleurs, des oiseaux, des poissons et des insectes, et analyse le contenu des images : fragments de texte, graphiques, icônes, schémas et mise en page. Sur BotHub, l'accès est disponible sans VPN ni carte étrangère : paiement en roubles par carte russe, uniquement pour les jetons consommés, qui n'expirent pas. Plus de 250 autres réseaux neuronaux sont disponibles dans une seule fenêtre, permettant de basculer facilement et de comparer les réponses. Une API unique compatible OpenAI permet de connecter le modèle à votre service et de le changer ultérieurement sans réécrire l'intégration. Les données sont chiffrées via AES-GCM et ne sont pas conservées. Les entreprises bénéficient de contrats, factures, gestion électronique des documents et d'un panneau d'administration avec limites. Scénarios simples : extraire des chiffres d'un diagramme pour un rapport, récupérer du texte d'une capture d'écran ou d'un scan, décrire le contenu d'une photo pour un catalogue, analyser une interface ou une mise en page par éléments, ou reconnaître un objet sur une photo pour une tâche sur le terrain.Questions fréquentes sur Qwen2.5 VL 72B Instruct
Vous pouvez utiliser les résultats générés à des fins commerciales. Tous les droits sur le contenu créé vous appartiennent. Seule restriction : vérifiez que la requête ne contient pas de contenus protégés par le droit d'auteur appartenant à des tiers. Le respect des droits sur les données d'entrée relève de votre responsabilité.
C'est un modèle visuel-langage Qwen : il lit le texte, analyse les images et documents, et répond aux questions sur leur contenu. Adapté à l'analyse de captures d'écran, schémas, tableaux et scans, à l'extraction de données structurées, au travail sur le code et à la connexion d'outils via l'appel de fonctions. Contexte : 32 000 jetons.
Jusqu'à 115 200 jetons par réponse selon nos données, soit le volume d'un long article ou d'une documentation complète. La fenêtre de contexte est de 32 000 jetons ; comptez donc le prompt et les fichiers joints ensemble, et divisez les tâches longues.
Aucun mode de raisonnement spécifique n'est indiqué dans nos données, mais cela ne signifie pas qu'il n'existe pas. En pratique, demander au modèle de décomposer la tâche étape par étape aide : les réponses sur la logique, les calculs et l'analyse de documents sont plus précises. Testez avec votre scénario.
Oui. L'appel de fonctions et la sortie JSON structurée sont pris en charge : le modèle peut utiliser vos outils et renvoyer une réponse selon un schéma défini. C'est pratique pour extraire des champs de scans et factures, pour les intégrations et les scénarios d'agents. Sur BotHub, tout fonctionne via une API unique compatible OpenAI.
Images et documents : oui, vous pouvez les envoyer avec du texte : le modèle décrira l'image, trouvera le fragment souhaité sur une capture d'écran, analysera un tableau ou un contrat. La prise en charge de l'audio et de la vidéo n'est pas indiquée dans nos données. Pour ces tâches, BotHub propose d'autres modèles.
Nous n'avons pas de données sur les langues des prompts et des sorties, nous ne pouvons donc pas garantir une qualité spécifique. Qwen2.5-VL fait partie de la gamme multilingue Qwen, le modèle comprendra donc une requête en russe. Le plus fiable est de tester avec votre tâche et de comparer avec un autre modèle ; vous pouvez basculer dans BotHub dans une seule fenêtre.