TL;DR
Gemini 3.6 Flash cuesta $1.50/M de entrada y $7.50/M de salida, con un precio de salida más bajo y mejor rendimiento reportado en programación y agentes que Gemini 3.5 Flash. Para producción, usa 3.6 Flash en razonamiento complejo y agentes, y enruta cargas simples y de alto volumen al más barato Gemini 3.5 Flash-Lite.
Gemini 3.6 Flash es más que otra actualización de ID de modelo.
Para desarrolladores que ya usan Gemini 3.5 Flash, el mayor cambio es económico. Google mantuvo el precio de entrada en $1.50 por millón de tokens, bajó el precio de salida de $9.00 a $7.50 y reporta mejor rendimiento en varios benchmarks de programación y agentes.
La pregunta práctica es si esas mejoras son lo bastante grandes como para justificar mover cargas de trabajo de producción.
La respuesta depende de la carga. Los agentes de programación, el análisis multimodal y el uso de herramientas en varios pasos pueden beneficiarse más que la extracción o clasificación simples. La migración también requiere algunas comprobaciones de compatibilidad de API que es fácil pasar por alto si solo cambias el nombre del modelo.
Esta guía cubre los precios del API de Gemini 3.6 Flash, acceso al nivel gratuito, resultados de benchmarks, cambios de migración, ejemplos en Python y qué probar antes de cambiar el tráfico de producción.
¿Qué es Gemini 3.6 Flash?
Gemini 3.6 Flash es el modelo Flash más nuevo de Google para programación, razonamiento multimodal y flujos de trabajo de agentes de varios pasos. Lanzado el 21 de julio de 2026, está diseñado para cargas de producción que necesitan mayor razonamiento y rendimiento en agentes, manteniéndose dentro del nivel de modelos Flash de Google.
Sus especificaciones principales incluyen:
| Elemento | Gemini 3.6 Flash |
|---|---|
| Model ID | gemini-3.6-flash |
| Standard input price | $1.50 / 1M tokens |
| Standard output price | $7.50 / 1M tokens |
| Standard cached input | $0.15 / 1M tokens |
| Default thinking level | medium |
| Input context | 1,048,576 tokens |
| Maximum output | 65,536 tokens |
| Inputs | Text, image, video, audio, PDF |
| Output | Text |
| Best suited for | Coding, multimodal reasoning, complex agents |
Google posiciona Gemini 3.6 Flash para cargas como programación, razonamiento espacial y multimodal, y tareas de agente en varios pasos.
El modelo también admite funciones como function calling, structured outputs, code execution, context caching, File Search, URL context, Google Search grounding y Google Maps grounding.
Puedes revisar las especificaciones y la guía de migración más recientes en la última guía de modelos Gemini de Google: latest Gemini model guide.
Para desarrolladores que vienen de la generación anterior, la guía del API de Gemini 3.5 Flash de CometAPI ofrece una línea base de integración útil.
¿Cuánto cuesta el API de Gemini 3.6 Flash?
Gemini 3.6 Flash cuesta $1.50 por millón de tokens de entrada y $7.50 por millón de tokens de salida en el nivel de pago Estándar de Google.
En comparación con Gemini 3.5 Flash, el precio de entrada no cambia, mientras que el precio de salida baja de $9.00 a $7.50 por millón de tokens, una reducción del 16.7%.
Google también ofrece procesamiento Batch, Flex y Priority.
| Gemini 3.6 Flash Tier | Input / 1M | Cached Input / 1M | Output / 1M |
|---|---|---|---|
| Standard | $1.50 | $0.15 | $7.50 |
| Batch | $0.75 | $0.075 | $3.75 |
| Flex | $0.75 | $0.075 | $3.75 |
| Priority | $2.70 | $0.27 | $13.50 |
Importante:** Los tokens de pensamiento se facturan a la tarifa de tokens de salida. Por lo tanto, una respuesta visible corta puede consumir más tokens de salida facturables de lo que sugiere la longitud de la respuesta final.
El caché de contexto también puede marcar una diferencia significativa para aplicaciones que envían repetidamente el mismo system prompt grande, contexto de repositorio, conjunto de documentos o historial de conversación.
En el nivel de pago Estándar, el input en caché de Gemini 3.6 Flash cuesta $0.15 por millón de tokens, frente a $1.50 para la entrada normal.
Ejemplo: 15,000 tokens de entrada + 8,000 tokens de salida
Considera una tarea que usa 15,000 tokens de entrada y 8,000 tokens de salida.
| Modelo | Costo estimado |
|---|---|
| Gemini 3.5 Flash | $0.0945 |
| Gemini 3.6 Flash con el mismo volumen de tokens | $0.0825 |
| Gemini 3.6 Flash con 17% menos tokens de salida | $0.0723 |
| Gemini 3.5 Flash-Lite con el mismo volumen | $0.0245 |
Con uso de tokens idéntico, Gemini 3.6 Flash es aproximadamente 12.7% más barato que Gemini 3.5 Flash en este ejemplo.
Google también informa que Gemini 3.6 Flash usó 17% menos tokens de salida en el Artificial Analysis Index. Si una carga de producción reprodujera esa reducción, el ahorro modelado en este ejemplo aumentaría aproximadamente a 23.5%.
Google informa por separado reducciones de tokens de salida de hasta 65% en DeepSWE. Estas cifras miden cargas diferentes y no deben tratarse como intercambiables: 17% se refiere al Artificial Analysis Index, mientras que 65% proviene de un benchmark específico de programación.
El cálculo básico del costo por tokens es:
Request cost =
(input tokens x input price + output tokens x output price) / 1,000,000
Para agentes, el costo real es más amplio:
Total task cost =
initial model call
+ retries
+ fallback calls
+ paid tools
+ grounding or search costs
Por eso el modelo más barato por token no siempre es el más barato para completar una tarea.
¿Gemini 3.6 Flash es gratis?
Sí. El precio actual del Gemini Developer API de Google lista acceso al Free Tier para uso Estándar de Gemini 3.6 Flash.
La disponibilidad del nivel gratuito no significa capacidad de producción ilimitada. Los límites de API dependen del proyecto y del nivel de uso, así que los desarrolladores deben revisar los límites de tasa aplicados a su propio proyecto en lugar de confiar en una cifra fija de solicitudes por minuto de un artículo de terceros.
Para la planificación de producción, usa la tarificación del Gemini API y la documentación de rate limits actuales de Google al estimar la capacidad.
Los desarrolladores pueden acceder a Gemini 3.6 Flash a través del Gemini API y Google AI Studio. Los equipos que usan un flujo de trabajo multimodelo unificado también pueden probar el modelo en la página del modelo Gemini 3.6 Flash de CometAPI.
¿Cómo se compara Gemini 3.6 Flash con Gemini 3.5 Flash?
Los resultados publicados por Google muestran las mayores mejoras en programación, ejecución de agentes, uso de computadora y trabajo de conocimiento.
| Benchmark | Gemini 3.6 Flash | Gemini 3.5 Flash | Cambio |
|---|---|---|---|
| DeepSWE | 49.00% | 37.00% | +12.0 puntos |
| MLE-Bench | 63.90% | 49.70% | +14.2 puntos |
| OSWorld-Verified | 83.00% | 78.40% | +4.6 puntos |
| GDPval-AA v2 | 1,421 | 1,349 | 72 |
Google también dice que Gemini 3.6 Flash completa flujos de trabajo de varios pasos con menos pasos de razonamiento, turnos conversacionales y llamadas a herramientas que Gemini 3.5 Flash.
La compañía reporta:
- 17% menos tokens de salida en el Artificial Analysis Index.
- Hasta 65% menos tokens de salida en DeepSWE.
- Menos ediciones de código no deseadas y bucles de ejecución.
- Mejor razonamiento multimodal y espacial.
Los resultados originales están disponibles en el anuncio de lanzamiento de Gemini 3.6 Flash de Google.
Estos benchmarks hacen de 3.6 Flash un candidato fuerte para evaluación, particularmente para cargas donde una solicitud puede convertirse en varias rondas de razonamiento, llamadas a herramientas y correcciones.
Sin embargo, no deben reemplazar las pruebas en tu propia aplicación.
Google también señala que 3.6 Flash puede realizar más inspección programática previa antes de realizar cambios de código. En un repositorio grande, eso puede mejorar la precisión. En una edición de frontend de alcance estrecho, puede simplemente añadir exploración innecesaria.
Aún importan límites de archivos claros, criterios de aceptación e instrucciones de implementación.
Gemini 3.6 Flash vs Gemini 3.5 Flash-Lite: ¿Cuál deberías usar?
Una vez que decides que vale la pena probar Gemini 3.6 Flash, la siguiente pregunta es si cada solicitud realmente lo necesita.
Para muchos sistemas de producción, la respuesta será no.
Gemini 3.5 Flash-Lite es sustancialmente más barato y puede ser un mejor valor predeterminado para cargas predecibles y de alto volumen.
| Elemento | Gemini 3.6 Flash | Gemini 3.5 Flash-Lite |
|---|---|---|
| Standard input price | $1.50 / 1M tokens | $0.30 / 1M tokens |
| Standard output price | $7.50 / 1M tokens | $2.50 / 1M tokens |
| Standard cached input | $0.15 / 1M tokens | $0.03 / 1M tokens |
| Default thinking level | medium | minimal |
| Best suited for | Complex reasoning, coding, agents | Extraction, routing, classification |
A precios Estándar, Flash-Lite es 5× más barato en entrada y 3× más barato en salida que Gemini 3.6 Flash.
Comienza con Gemini 3.5 Flash-Lite para:
- Clasificación
- Enrutamiento de solicitudes
- Extracción JSON y estructurada
- Procesamiento de documentos
- Transformación de datos
- Traducción a escala
- Subagentes ligeros
- Tareas repetibles de alto volumen
Una estrategia de enrutamiento práctica podría ser:
| Carga de trabajo | Primera ruta | Escalado |
|---|---|---|
| Clasificación o enrutamiento | Gemini 3.5 Flash-Lite | 3.6 Flash tras fallo de validación |
| Extracción estructurada | Gemini 3.5 Flash-Lite | 3.6 Flash para documentos complejos |
| Subagente ligero | Gemini 3.5 Flash-Lite | Elevar thinking level o usar 3.6 Flash |
| Programación multifichero | Gemini 3.6 Flash | Fallback más fuerte si no se resuelve |
| Flujo complejo con herramientas | Gemini 3.6 Flash | Fallback tras fallo de herramienta o validación |
| Razonamiento multimodal | Gemini 3.6 Flash | Fallback específico de la tarea |
Para tráfico mixto en producción, la métrica más útil es:
Cost per successful task =
(model calls + retries + tools + fallbacks) / accepted tasks
Una primera llamada barata es menos atractiva si falla repetidamente y eventualmente requiere un modelo más fuerte de todos modos.
Lo inverso es igualmente importante. No hay mucha razón para enviar millones de solicitudes de clasificación predecibles a Gemini 3.6 Flash si Flash-Lite ya cumple la precisión requerida.
Para aplicaciones que necesitan este tipo de enrutamiento, consulta nuestra guía para llamar a múltiples modelos de IA mediante una URL base compatible con OpenAI.
¿Qué cambia al migrar a Gemini 3.6 Flash?
Pasar de Gemini 3.5 Flash a Gemini 3.6 Flash implica más que cambiar el ID del modelo.
Los desarrolladores deben revisar cinco áreas antes de cambiar el tráfico de producción: parámetros de muestreo desaprobados, controles de thinking, candidate_count, turnos de modelo prefijados y estado de function calling.
1. Elimina temperature, top_p y top_k
Google ha desaprobado estos controles de muestreo para Gemini 3.6 Flash y Gemini 3.5 Flash-Lite:
generation_config = {
"temperature": 0.7,
"top_p": 0.9,
"top_k": 40,
}
Los modelos nuevos actualmente ignoran estos parámetros. Google dice que futuras generaciones de modelos Gemini pueden devolver un error HTTP 400 cuando se suministren.
Para formatos de salida predecibles, usa instrucciones de sistema más claras y structured outputs en su lugar.
2. Reemplaza thinking_budget por thinking_level
Gemini 3.6 Flash tiene medium como thinking predeterminado.
La guía de migración de Google recomienda pasar de configuraciones numéricas thinking_budget a thinking_level.
Gemini 3.5 Flash-Lite tiene minimal por defecto, lo cual es apropiado para muchas cargas de alto volumen de extracción, clasificación y enrutamiento.
Los niveles de thinking más altos deben probarse cuando la tarea implique razonamiento de varios pasos, ejecución de código o uso de herramientas.
3. Elimina candidate_count
Google lista candidate_count como no compatible en Gemini 3.x.
Esto puede pasarse por alto fácilmente cuando varios modelos comparten la misma configuración de generación. Elimínalo antes de migrar solicitudes de producción.
4. Deja de prefijar turnos del modelo
Las solicitudes ya no pueden terminar con un turno model no vacío.
Una aplicación antigua podría usar un payload como:
{
"contents": [
{
"role": "user",
"parts": [{"text": "Translate 'Hello world' to Spanish."}]
},
{
"role": "model",
"parts": [{"text": "Translation:"}]
}
]
}
Ese patrón ahora puede devolver HTTP 400.
Si antes usabas prefilling para forzar un formato de respuesta, mueve el requisito a system_instruction o usa structured outputs en su lugar.
5. Vuelve a probar function calling y estado de múltiples turnos
Los agentes que usan herramientas necesitan pruebas de migración por separado.
Google recomienda usar previous_interaction_id para el estado de múltiples turnos del lado del servidor en el Interactions API.
Al devolver el resultado de una función, conserva tanto el nombre de la función como el ID de llamada original:
final_interaction = client.interactions.create(
model="gemini-3.6-flash",
previous_interaction_id=interaction.id,
tools=tools,
input=[
{
"type": "function_result",
"name": step.name,
"call_id": step.id,
"result": [
{
"type": "text",
"text": json.dumps(result),
}
],
}
],
)
Las aplicaciones que usan generateContent también deben verificar sus payloads de FunctionResponse y monitorizar errores de llamadas a herramientas tras la migración.
Consulta la guía de migración del último modelo de Google y la documentación de function-calling para detalles de implementación actuales.
¿Cómo llamar a Gemini 3.6 Flash en Python?
Instala o actualiza el SDK GenAI de Google:
pip install -U google-genai
Configura tu API key:
export GEMINI_API_KEY="your-api-key"
Luego llama a Gemini 3.6 Flash:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.6-flash",
input=(
"Review this migration plan and list the three "
"highest-risk compatibility issues."
),
)
print(interaction.output_text)
Para una tarea que necesita más razonamiento, configura el thinking level:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.6-flash",
input="Analyze this multi-step debugging problem.",
generation_config={
"thinking_level": "medium",
},
)
print(interaction.output_text)
La principal diferencia de migración puede resumirse así:
# Older shared configuration
old_config = {
"temperature": 0.2,
"top_p": 0.9,
"top_k": 40,
"candidate_count": 1,
"thinking_budget": 4096,
}
# Gemini 3.6 Flash
new_config = {
"thinking_level": "medium",
}
No asumas que un thinking level más alto siempre es mejor. Mide latencia, consumo de tokens y tasa de finalización en tus propias tareas.
¿Cómo deberías probar Gemini 3.6 Flash antes de producción?
No necesitas un gran conjunto de benchmarks públicos para decidir si Gemini 3.6 Flash pertenece a tu pila de producción.
Un mejor punto de partida son 30-50 tareas recientes que se parezcan a tu tráfico real.
Incluye una mezcla de:
- Programación y depuración
- Uso de herramientas en varios pasos
- Documentos multimodales
- Extracción de datos
- Clasificación y enrutamiento
Ejecuta las mismas entradas con:
- Tu modelo de producción actual
- Gemini 3.6 Flash
- Gemini 3.5 Flash-Lite
Mantén prompts, herramientas, validadores y criterios de aceptación sin cambios.
Rastrea:
- Tokens de entrada
- Tokens de salida y de pensamiento
- Latencia
- Llamadas a herramientas
- Reintentos
- Errores de llamadas a funciones
- Tasa de aprobación de validadores
- Tiempo de corrección humana
- Éxito final de la tarea
Luego compara el costo total requerido para producir un resultado aceptado.
Una solicitud de programación que cuesta $0.08 y tiene éxito al primer intento puede ser más barata que una solicitud de $0.02 que falla dos veces y eventualmente escala.
Al mismo tiempo, pagar precios de Gemini 3.6 Flash por una tarea de clasificación simple tiene poco sentido si Flash-Lite la maneja con fiabilidad.
El objetivo no es encontrar un solo modelo para cada solicitud. Es usar el modelo más fuerte solo donde su capacidad adicional realmente cambia el resultado.
Los desarrolladores pueden comparar las rutas actuales de Gemini 3.6 Flash y Gemini 3.5 Flash-Lite a través de CometAPI usando el mismo conjunto de evaluación.
Preguntas frecuentes
¿Cuánto cuesta el API de Gemini 3.6 Flash?
La tarifa de pago Estándar de Google es $1.50 por millón de tokens de entrada y $7.50 por millón de tokens de salida. La entrada en caché Estándar cuesta $0.15/M. Batch y Flex cuestan $0.75/M en entrada y $3.75/M en salida.
¿Gemini 3.6 Flash es gratis?
Sí. El precio actual del Gemini Developer API de Google lista uso Estándar en el Free Tier para Gemini 3.6 Flash. El acceso gratuito sigue sujeto a límites de tasa por proyecto y nivel de uso.
¿Gemini 3.6 Flash está disponible de forma general?
Sí. Google lanzó gemini-3.6-flash el 21 de julio de 2026 y lo lista como modelo de producción en la documentación del Gemini API.
¿Cuál es la ventana de contexto de Gemini 3.6 Flash?
Gemini 3.6 Flash admite hasta 1,048,576 tokens de entrada y 65,536 tokens de salida. Acepta entradas de texto, imagen, video, audio y PDF, y produce salida de texto.
¿Gemini 3.6 Flash es más barato que Gemini 3.5 Flash?
Sí en tokens de salida. Ambos modelos cuestan $1.50/M en tokens de entrada estándar, mientras que Gemini 3.6 Flash reduce el precio de salida de $9.00/M a $7.50/M.
¿Debo usar Gemini 3.6 Flash o Gemini 3.5 Flash-Lite?
Usa Gemini 3.6 Flash cuando la calidad en programación, el razonamiento multimodal o la ejecución de agentes complejos pueda reducir fallos y reintentos. Comienza con Flash-Lite para extracción, clasificación, enrutamiento y otras cargas predecibles de alto volumen donde el menor costo importa más.
¿Qué debo cambiar antes de migrar a Gemini 3.6 Flash?
Elimina temperature, top_p, top_k y candidate_count; reemplaza thinking_budget por thinking_level; elimina turnos de modelo prefijados; y vuelve a probar function calling y la gestión de estado en múltiples turnos.
Conclusión
Gemini 3.6 Flash vale la pena para benchmarking si ya usas Gemini 3.5 Flash en programación, trabajo multimodal o flujos de agentes.
Su precio de salida es más bajo y los primeros resultados de Google sugieren que algunas cargas también pueden requerir menos tokens y menos pasos de ejecución. Para agentes que razonan repetidamente, llaman herramientas y reintentan acciones fallidas, esos ahorros pueden importar más que la diferencia de precio principal.
Pero eso no significa que cada solicitud deba pasar a 3.6 Flash.
Gemini 3.5 Flash-Lite es sustancialmente más barato y puede ser todo lo que necesitas para trabajo predecible como extracción, clasificación y enrutamiento.
La mejor estrategia de producción es usar cada modelo donde tenga sentido económico: Flash-Lite para tareas simples y de alto volumen; 3.6 Flash donde un razonamiento más fuerte pueda mejorar la probabilidad de terminar correctamente al primer intento.
Luego mide el resultado que realmente importa: el costo total de obtener una respuesta aceptada.
Para comparar ambos modelos en el mismo flujo de trabajo, consulta la página del modelo Gemini 3.6 Flash y la página del modelo Gemini 3.5 Flash-Lite en CometAPI, o revisa las rutas de modelos actuales en la página de precios de CometAPI.
