Ernie 4.5 VL 424B A47B
Réseau Neuronal
Ernie 4.5 VL 424B A47B est un modèle MoE multimodal de Baidu, entraîné sur texte et images, accessible via API.
Longueur maximale de la réponse
(en tokens)
Taille du contexte
(en tokens)
Coût du prompt
(par 1M tokens)
Coût de la réponse
(par 1M tokens)
Comment ça marche Ernie 4.5 VL 424B A47B?
Ernie 4.5 VL 424B A47B est un modèle multimodal de la famille ERNIE 4.5 de Baidu. Il repose sur une architecture Mixture-of-Experts : sur 424 milliards de paramètres, environ 47 milliards sont utilisés par jeton, alliant vaste savoir et génération économique. Le modèle a été entraîné simultanément sur du texte et des images, traitant l'image et la requête textuelle comme une tâche unique. Sur BotHub, le modèle fonctionne sans VPN ni carte étrangère : payez en roubles avec une carte russe, uniquement pour les jetons consommés, qui n'expirent pas. Plus de 250 modèles sont disponibles dans la même fenêtre pour comparer les réponses, et une API compatible OpenAI permet de changer de modèle en une ligne de code. Pour les entreprises, nous proposons contrat, facture et panneau d'administration avec limites. Téléchargez une capture d'écran ou un schéma pour analyse, générez des descriptions de produits à partir de photos, reconnaissez des données de documents, analysez des graphiques ou combinez analyse visuelle et textuelle dans votre service.Questions fréquentes sur Ernie 4.5 VL 424B A47B
Vous pouvez utiliser les résultats générés à des fins commerciales. Tous les droits sur le contenu créé vous appartiennent. Seule restriction : vérifiez que la requête ne contient pas de contenus protégés par le droit d'auteur appartenant à des tiers. Le respect des droits sur les données d'entrée relève de votre responsabilité.
C'est un modèle multimodal de Baidu : il accepte texte, images et documents, et répond en texte. Idéal pour analyser schémas, captures d'écran, scans, longs documents, code et tâches nécessitant de lier image et contexte textuel.
Jusqu'à 16 000 jetons par réponse, suffisant pour une analyse détaillée de document, un grand fragment de code ou une instruction complète. Le contexte est de 123 000 jetons, permettant de charger des documents volumineux et de s'y référer.
Oui, le mode de raisonnement est pris en charge : le modèle décompose la tâche étape par étape avant de répondre. Cela aide pour la logique, les mathématiques, l'analyse d'images et la corrélation de plusieurs sources dans une requête.
Nos données ne l'indiquent pas, nous ne pouvons donc pas garantir un appel de fonction stable. Une réponse structurée peut généralement être obtenue en décrivant le format souhaité dans le prompt. Testez votre scénario ; vous pouvez changer de modèle sur BotHub sans réécrire l'intégration.
Images et documents, oui : vous pouvez envoyer captures d'écran, photos, schémas, PDF ou présentations pour analyse. Aucune mention concernant l'audio ou la vidéo, ne comptez donc pas dessus.
Le modèle est multilingue et fonctionne bien en français : vous pouvez formuler vos requêtes et obtenir des réponses naturellement. Évaluez la qualité sur vos propres tâches : testez un prompt type et comparez avec d'autres modèles sur BotHub, avec paiement à l'usage.