gemini-omni-1.1-flash-preview
Red Neuronal
Longitud máxima de respuesta
(en tokens)
Tamaño del contexto
(en tokens)
Costo del prompt
(por 1M tokens)
Costo de la respuesta
(por 1M tokens)
Prompt de imagen
(por 1K tokens)
Cómo funciona gemini-omni-1.1-flash-preview?
Preguntas frecuentes sobre gemini-omni-1.1-flash-preview
Puede usar los resultados generados con fines comerciales. Todos los derechos sobre el contenido creado le pertenecen. La única restricción: asegúrese de que la solicitud no incluya material de terceros protegido por derechos de autor. El usuario es responsable de respetar los derechos sobre los datos de entrada.
Es un modelo de google-gemini que acepta no solo texto, sino también imágenes y documentos, y responde con texto. Es adecuado para analizar PDF y escaneos, analizar capturas de pantalla, escribir y refactorizar código, y trabajar con materiales extensos: la ventana de contexto es de 65 536 tokens.
En una sola respuesta, el modelo genera hasta 32 000 tokens, lo que equivale a decenas de páginas. Es suficiente para un documento técnico extenso, un análisis detallado de un archivo o un fragmento de código grande. Si hay más material, divida la tarea en partes y continúe en el mismo diálogo; el contexto de 65 536 tokens lo permite.
En nuestros datos no hay mención de razonamiento antes de responder, por lo que no prometemos un modo de reflexión separado. Pero esto no significa que el modelo no pueda manejar lógica de varios pasos: pídale que desglose la solución paso a paso y compare el resultado con otros modelos directamente en la interfaz de BotHub.
La llamada a funciones y la salida JSON estructurada no están marcadas en nuestros datos, por lo que no se recomienda implementarlas en producción sin probarlas. El acceso se realiza a través de la API de BotHub compatible con OpenAI: pruebe su esquema y, si es necesario, cambie a otro modelo sin reescribir la integración.
Imágenes y documentos, sí: envíe una captura de pantalla, una foto, un PDF o un escaneo y pida que analice el contenido. No hay notas en nuestros datos sobre la recepción de audio y video. El modelo responde con texto; no se declara la generación de imágenes y sonido, para eso hay modelos separados en BotHub.
No tenemos datos específicos sobre la calidad del ruso, por lo que no nos aventuramos a evaluarlo. La forma más honesta es probarlo con su tarea: envíe una solicitud a BotHub, vea la respuesta y, si lo desea, compárela con otro modelo en la misma ventana; el cambio toma segundos.