Ernie 4.5 VL 424B A47B
Red Neuronal
Ernie 4.5 VL 424B A47B es un modelo MoE multimodal de Baidu, entrenado en texto e imágenes, con acceso vía API.
Longitud máxima de respuesta
(en tokens)
Tamaño del contexto
(en tokens)
Costo del prompt
(por 1M tokens)
Costo de la respuesta
(por 1M tokens)
Cómo funciona Ernie 4.5 VL 424B A47B?
Ernie 4.5 VL 424B A47B es un modelo multimodal de la familia ERNIE 4.5 de Baidu. Se basa en la arquitectura Mixture-of-Experts: de los 424 mil millones de parámetros, utiliza unos 47 mil millones por token, combinando un gran volumen de conocimientos con una generación eficiente. El modelo fue entrenado simultáneamente en texto e imágenes, por lo que entiende la imagen y la consulta de texto como una tarea única. En BotHub, el modelo funciona sin VPN ni tarjetas extranjeras: pague con tarjeta rusa en rublos y solo por los tokens consumidos, que no caducan. Hay más de 250 modelos disponibles en la misma ventana para comparar respuestas, y una API compatible con OpenAI permite cambiar de modelo con una sola línea de código. Para empresas, ofrecemos contrato, factura y panel de administración con límites. Cargue capturas de pantalla o esquemas para analizarlos, obtenga descripciones de productos a partir de fotos, reconozca datos de documentos, analice gráficos de informes o combine el análisis visual con el textual en su servicio.Preguntas frecuentes sobre Ernie 4.5 VL 424B A47B
Puede usar los resultados generados con fines comerciales. Todos los derechos sobre el contenido creado le pertenecen. La única restricción: asegúrese de que la solicitud no incluya material de terceros protegido por derechos de autor. El usuario es responsable de respetar los derechos sobre los datos de entrada.
Es un modelo multimodal de Baidu: acepta texto, imágenes y documentos, y responde con texto. Es adecuado para analizar esquemas, capturas de pantalla y escaneos, analizar materiales extensos, trabajar con código y tareas que requieren vincular imágenes con contexto textual.
Hasta 16 000 tokens por respuesta, suficiente para un análisis detallado de documentos, fragmentos de código grandes o instrucciones detalladas. El contexto de la consulta es de 123 000 tokens, por lo que puede cargar materiales extensos en el diálogo y consultarlos durante el trabajo.
Sí, se admite el modo de razonamiento: el modelo desglosa la tarea paso a paso antes de responder. Esto ayuda notablemente en lógica, matemáticas, análisis de datos de imágenes y casos donde se deben comparar varias fuentes dentro de una misma consulta.
No tenemos esa indicación en nuestros datos, por lo que no podemos garantizar una llamada a funciones estable. Generalmente, se puede obtener una respuesta estructurada describiendo el formato deseado directamente en el prompt. Pruebe el comportamiento en su escenario; puede cambiar a otro modelo en BotHub sin reescribir la integración.
Imágenes y documentos, sí, son capacidades declaradas del modelo: puede enviar capturas de pantalla, fotos, esquemas, PDF o presentaciones y pedir que se analice el contenido. No hay indicaciones sobre la recepción de audio y video en nuestros datos, por lo que no debe contar con ello.
El modelo es multilingüe y funciona con ruso; puede formular consultas y recibir respuestas de forma habitual. Es mejor evaluar la calidad con sus propias tareas: ejecute un prompt típico y compárelo con otros modelos en la misma ventana de BotHub; el pago se realiza según los tokens consumidos.