Google lanza Gemini 3.7 Flash: mejoras en coding y agentes a mitad de precio (50% off hasta fin de año)

¿Qué es Gemini 3.7 Flash?
Gemini 3.7 Flash es el último modelo de la serie Flash de Google DeepMind, lanzado el 13 de agosto de 2026 — apenas 3 semanas después de Gemini 3.6 Flash. Google lo describe como su "most intelligent workhorse model yet for coding and agents". No es un nuevo pretraining run, sino el resultado de feedback de desarrolladores e innovaciones algorítmicas en el núcleo de razonamiento que Google planea llevar a futuros modelos.
El modelo acepta texto, imágenes, audio y video con un context window de 1 millón de tokens, retorna hasta 64.000 output tokens, soporta adjustable thinking settings (quality vs latency/cost), y tiene un knowledge cutoff de marzo 2026.
Mejoras en benchmarks
Coding
| Benchmark | Gemini 3.6 Flash | Gemini 3.7 Flash | Mejora | Competidores |
|---|---|---|---|---|
| FrontierCode 1.1 Main | 34.4% | 43.6% | +9.2 | Sonnet 5: 42.7% / GPT-5.6 Terra: 41.3% |
| DeepSWE v1.1 | 49.0% | 65.3% | +16.3 | GPT-5.6 Terra: 69.6% / Sonnet 5: 54.0% |
| Code Arena (WebDev, Elo) | 1538 | 1588 | +50 | Sonnet 5: 1541 / GPT-5.6 Terra: 1523 / Muse Spark 1.2: 1535 |
| Terminal-Bench 2.1 | — | 85.8% | — | GPT-5.6 Terra: 87.4% |
| Terminal-Bench 3.0 | — | 14.9% | — | GPT-5.6 Terra: 20.8% / Sonnet 5: 14.6% |
Gemini 3.7 Flash lidera el mercado en FrontierCode 1.1 Main (43.6%) y Code Arena (Elo 1588), superando a Claude Sonnet 5 y GPT-5.6 Terra en ambos benchmarks.
Knowledge work y enterprise
| Benchmark | Gemini 3.6 Flash | Gemini 3.7 Flash | Mejora | Competidores |
|---|---|---|---|---|
| GDP.pdf (documentos complejos) | 22.0% | 34.0% | +12.0 | — |
| AutomationBench (workflows) | 17.0% | 30.4% | +13.4 (1.8x) | GPT-5.6 Terra: 23.6% / Sonnet 5: 10.7% |
| Harvey LAB-AA (legal) | — | 90.7% | — | — |
| AA Intelligence Index | 52 | 56 | +4 | Sonnet 5: 55 / Terra: 57 / Muse Spark 1.2: 57 |
En AutomationBench, Gemini 3.7 Flash (30.4%) supera por amplio margen a GPT-5.6 Terra (23.6%) y Claude Sonnet 5 (10.7%). En Harvey LAB-AA (workflows legales complejos) alcanza 90.7%.
Long context y multimodal
- LVBench (long video understanding): 85.4% — líder del campo
- GDM-MRCR v2 (long-context retrieval): 97.0% a 128K / 62.5% a 1M tokens
Dónde no lidera
- OSWorld-2.0 (agentic computer use): 38.1% vs GPT-5.6 Terra 50.2%
- Agent's Last Exam (multimodal desktop): 26.3% vs Claude Sonnet 5 33.3%
- BioMysteryBench (human difficult): 43.5% vs GPT-5.6 Terra 49.4%
- GDPval-AA v2 (knowledge work Elo): por debajo de Muse Spark 1.2, Sonnet 5 y Terra
Pricing — 50% de descuento hasta fin de año
| Período | Input ($/M tokens) | Output ($/M tokens) | Cached input ($/M) |
|---|---|---|---|
| Introductorio (hasta 31 dic 2026) | $0.75 | $3.75 | $0.075 |
| Standard (desde 1 ene 2027) | $1.50 | $7.50 | $0.15 |
El precio introductorio es la mitad del precio standard y también la mitad del precio original de 3.6 Flash. Comparado con competidores:
| Modelo | Input ($/M) | Output ($/M) |
|---|---|---|
| Gemini 3.7 Flash (intro) | $0.75 | $3.75 |
| Muse Spark 1.2 | $1.25 | $4.25 |
| GPT-5.6 Terra | $2.00 | $12.00 |
| Claude Sonnet 5 | $2.00 | $10.00 |
Gemini 3.7 Flash es significativamente más barato que todos sus competidores directos en el tier introductorio, y aun en pricing standard ($1.50/$7.50) sigue siendo más económico que Terra y Sonnet 5.
Mejoras en developer experience
Google describe un modelo que "piensa más diligentemente":
- Se adapta a roadblocks: recupera de errores en vez de abandonar
- Clarifica intent: pide aclaración cuando una request es ambigua
- Sigue instrucciones con mayor fidelidad: menos cambios innecesarios
- Multi-step planning y tool calls con más esfuerzo: ejecución más disciplinada
- Menos retries y menos supervisión manual en pipelines de engineering
- Mejor debugging y issue resolution: mayor first-pass code accuracy
- Web development: layouts más funcionales y apps feature-complete en menos prompts, con alta design adherence desde screenshots, imágenes o design systems
Lo que puedes construir
Google mostró demos de lo que 3.7 Flash puede generar:
- Juego 3D jugable desde un text prompt, combinado con Nano Banana para generar personajes, items y texturas en tiempo real
- Landing pages interactivas en un solo shot, orquestando sub-agentes con Gemini Omni para crear componentes parallax smooth
- Entrenamiento de modelos de robótica usando multimodal understanding en un 3-agent graph loop
- PDF estático → interactive data story: annual reports transformados en experiencias web con live charts y aggregated insights
Gemini Spark con 3.7 Flash
Gemini Spark, el agente personal 24/7 lanzado en Google I/O, ahora usa Gemini 3.7 Flash. Disponible para suscriptores Google AI Pro y Ultra en 160+ países. La actualización hace Spark más eficiente en knowledge work con improved tool use para Google Workspace apps: consolidar archivos, redactar emails y actualizar status documents con mayor precisión y calidad de output en workflows multi-skill complejos.
Disponibilidad
| Audiencia | Plataforma |
|---|---|
| Developers | Google AI Studio, Android Studio, Google Antigravity (agent-first workflows), Gemini API |
| Enterprises | Gemini Enterprise Agent Platform, Gemini Enterprise app |
| Individuos | Gemini Spark en la Gemini app (Google AI Pro/Ultra, 160+ países) |
Cómo empezar como developer
# Google AI Studio
# https://ai.dev/prompts/new_chat?model=gemini-3.7-flash
# Gemini API
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.7-flash:generateContent?key=$GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"contents": [{"parts": [{"text": "Hello"}]}]
}'
# Vertex AI (enterprise)
# Model: gemini-3.7-flash
# Docs: https://cloud.google.com/gemini-enterprise-agent-platform/generative-ai/pricing
# Google Antigravity (agent-first)
# https://antigravity.google/
Seguridad
Gemini 3.7 Flash incluye Frontier Safety safeguards actualizados en los dominios de Chemical, Biological, Radiological y Nuclear (CBRN) y cyber offense, minimizando refusals para usos beneficiosos. Model card disponible.
Contexto competitivo
El lanzamiento llega un día después de DeepSeek V4 Pro GA y Grok 4.6, en una semana donde la competencia de pricing se intensificó. Google compite en el tier de modelos workhorse (no frontier top-tier como Opus 5 o Fable 5), y su estrategia es clara: ofrecer calidad cercana al frontier a una fracción del precio. Con FrontierCode 1.1 Main liderando (43.6%) y Code Arena Elo 1588 (top del mercado), 3.7 Flash supera a modelos más caros como Sonnet 5 y Terra en coding, mientras cuesta 2.7x-3.2x menos en blended rates.
El pricing introductorio hasta fin de año es un movimiento para capturar workloads de production agents antes del aumento a $1.50/$7.50 en enero 2027. Para equipos evaluando dónde correr sus coding agents y business workflows a escala, la ventana de 4 meses a precio reducido es significativa.
Especificaciones técnicas
| Spec | Valor |
|---|---|
| Model ID | gemini-3.7-flash |
| Context window | 1M tokens |
| Max output | 64K tokens |
| Modalidades | Texto, imagen, audio, video |
| Thinking settings | Adjustable (quality vs latency/cost) |
| Knowledge cutoff | Marzo 2026 |
| AA Intelligence Index | 56 |
Conclusión
Gemini 3.7 Flash es un upgrade sustancial sobre 3.6 Flash en exactamente las áreas que importan para production agents: coding (+9.2 en FrontierCode, +16.3 en DeepSWE), knowledge work (+12 en GDP.pdf, +13.4 en AutomationBench) y web development (Code Arena Elo 1588, líder del mercado). A precio introductorio de $0.75/$3.75, es el modelo más barato del tier workhorse y supera a competidores 2-3x más caros en benchmarks clave de coding. La ventana de 50% off hasta diciembre 2026 es un incentivo claro para migrar workloads ahora. Para equipos que ya usan Gemini en production vía Vertex AI o AI Studio, 3.7 Flash es un drop-in upgrade inmediato. Para los que evalúan migrar desde Claude Sonnet 5 o GPT-5.6 Terra, la combinación de mejor calidad en coding + precio 2.7x-3.2x menor hace la matemática difícil de ignorar.