gemini-3.5-transcribe-preview
Red Neuronal
Longitud máxima de respuesta
(en tokens)
Tamaño del contexto
(en tokens)
Costo del prompt
(por 1M tokens)
Costo de la respuesta
(por 1M tokens)
Prompt de imagen
(por 1K tokens)
Cómo funciona gemini-3.5-transcribe-preview?
Preguntas frecuentes sobre gemini-3.5-transcribe-preview
Puede usar los resultados generados con fines comerciales. Todos los derechos sobre el contenido creado le pertenecen. La única restricción: asegúrese de que la solicitud no incluya material de terceros protegido por derechos de autor. El usuario es responsable de respetar los derechos sobre los datos de entrada.
Es un modelo de google-gemini que acepta texto, documentos e imágenes, y responde con texto. Es adecuado para transcribir y estructurar el contenido de archivos y escaneos, extracción de datos, análisis y trabajo con código. El contexto es de 65 536 tokens, por lo que se pueden incluir materiales extensos en una sola solicitud.
En una sola respuesta, el modelo genera hasta 32 000 tokens; esto es suficiente para una transcripción larga de un documento, un análisis detallado o un fragmento de código grande. Si el material resultante es mayor, divida la tarea en partes y continúe la generación con las siguientes solicitudes, basándose en el contexto general del diálogo.
Sí, el modelo tiene un modo de razonamiento: antes de responder, analiza secuencialmente la condición y solo entonces formula el resultado. Esto ayuda notablemente en tareas con lógica compleja, análisis de estructuras de documentos, matemáticas y depuración de código, donde lo importante no es una respuesta rápida, sino una precisa.
Sí, el modelo admite 'function calling' y salida estructurada en JSON. Usted describe el esquema y las herramientas, y el modelo devuelve un objeto listo para ser analizado; es útil para pipelines de extracción de datos, integraciones y agentes. En BotHub, esto está disponible a través de una API única compatible con OpenAI.
Según nuestros datos, el modelo acepta imágenes y documentos además de texto: puede enviar un escaneo, una fotografía de una página, un esquema o un PDF y obtener un resultado en texto. No tenemos constancia de soporte para audio y video en la entrada, así que céntrese en documentos e imágenes.
Los modelos de la familia Gemini de google-gemini tradicionalmente funcionan bien con el ruso, tanto en la comprensión de la solicitud como en el análisis de texto en imágenes y documentos. No tenemos datos exactos sobre los idiomas de los prompts y la salida, así que verifique la calidad en su tarea en BotHub.