Gemma 4: la familia de modelos open source de Google DeepMind salta al frontier (guía completa y update de julio 2026)
¿Qué es Gemma 4?
Gemma 4 es la cuarta generación de modelos open weight de Google DeepMind, lanzada el 2 de abril de 2026. Construida con la misma investigación y tecnología que Gemini 3, Gemma 4 está diseñada para maximizar la inteligencia por parámetro: ofrece rendimiento de nivel frontier en tamaños que puedes correr en tu propio hardware, desde teléfonos móviles hasta workstations con GPUs consumer.
La familia completa incluye cinco tamaños distintos, con arquitecturas Dense y Mixture-of-Experts (MoE), y se distribuye bajo licencia Apache 2.0, permitiendo uso comercial sin restricciones. Desde el lanzamiento de la primera generación, los desarrolladores han descargado Gemma más de 400 millones de veces, construyendo un ecosistema de más de 100.000 variantes community.
Arquitectura y tamaños
Gemma 4 ofrece cinco tamaños pensados para escenarios de deployment específicos:
| Modelo | Arquitectura | Parámetros totales | Parámetros activos | Contexto | Target hardware |
|---|---|---|---|---|---|
| Gemma 4 E2B | Dense | 2.3B | 2B efectivos | 128K | Móviles, Raspberry Pi, IoT |
| Gemma 4 E4B | Dense | 4.5B | 4B efectivos | 128K | Edge devices, Jetson Orin |
| Gemma 4 12B | Dense unificado | 12B | 12B | 256K | Laptops, consumer GPUs |
| Gemma 4 26B A4B | MoE | 26B | 3.8B activos | 256K | Consumer GPUs (latencia) |
| Gemma 4 31B | Dense | 31B | 31B | 256K | Workstations, H100 |
Diseño arquitectónico clave
- Thinking mode: modo de razonamiento integrado que permite al modelo pensar paso a paso antes de responder, mejorando significativamente en dominios que requieren reasoning como matemáticas y coding
- Arquitectura encoder-free (12B): el modelo de 12B introduce una arquitectura unificada sin encoder que proyecta chunks de audio de 40ms y patches de imagen directamente al espacio de embeddings del LLM, eliminando encoders separados
- Encoders congelados de visión y audio: los demás tamaños usan encoders congelados para visión y audio
- System prompt nativo: soporte built-in para el rol system, enabling conversaciones más estructuradas y controlables
- Multimodalidad nativa: texto, imagen y video en todos los modelos; audio nativo en E2B, E4B y 12B
Benchmarks: rendimiento de nivel frontier
Gemma 4 entrega rendimiento state-of-the-art para su tamaño. El modelo 31B ocupa el puesto #3 entre modelos open source en el Arena AI text leaderboard, y el 26B el puesto #6, compitiendo contra modelos 20x más grandes.
| Benchmark | Gemma 4 31B | Gemma 4 26B A4B | Gemma 4 12B | Gemma 4 E4B | Gemma 3 27B |
|---|---|---|---|---|---|
| MMLU Pro | 85.2% | 82.6% | 77.2% | 69.4% | 67.6% |
| AIME 2026 (no tools) | 89.2% | 88.3% | 77.5% | 42.5% | 20.8% |
| LiveCodeBench v6 | 80.0% | 77.1% | 72.0% | 52.0% | 29.1% |
| Codeforces ELO | 2150 | 1718 | 1659 | 940 | 110 |
| GPQA Diamond | 84.3% | 82.3% | 78.8% | 58.6% | 42.4% |
| SciCode | 43.0 | 40.0 | 38.0 | 24.0 | 21.0 |
| BigBench Extra Hard | 74.4% | 64.8% | 53.0% | 33.1% | 19.3% |
| MMMLU (multilingüe) | 88.4% | 86.3% | 83.4% | 76.6% | 70.7% |
| MMMU Pro (visión) | 76.9% | 73.8% | 69.1% | 52.6% | 49.7% |
El salto en coding es espectacular: LiveCodeBench v6 pasa de 29.1% en Gemma 3 27B a 80.0% en Gemma 4 31B, casi triplicando el rendimiento. El ELO de Codeforces sube de 110 a 2150, un incremento de 19x.
Capacidades de coding y agentic
Code generation
Gemma 4 soporta generación de código de alta calidad offline, convirtiendo tu workstation en un asistente de coding IA local-first. Los modelos pueden:
- Generar código desde descripciones en lenguaje natural
- Completar y corregir código existente
- Razonar sobre arquitectura y diseño de software
- Resolver problemas de programación competitiva (Codeforces ELO 2150 en 31B)
Function calling nativo
Gemma 4 incluye soporte nativo para function calling, permitiendo workflows agénticos donde el modelo puede:
- Llamar herramientas externas y APIs de forma estructurada
- Producir JSON estructurado y predecible
- Ejecutar planes multi-step con herramientas
- Interactuar con diferentes tools y APIs de forma fiable
System instructions nativas
El soporte built-in para system prompts permite configurar el comportamiento del modelo de forma más estructurada, esencial para agentes autónomos que necesitan instrucciones de sistema consistentes.
Update stealth de julio 2026: Flash Attention 4 y tool calling fixes
El 15 de julio de 2026, Google publicó un update silencioso de Gemma 4 que no cambió el nombre del modelo (lo que generó confusión en la comunidad sobre si era "Gemma 4.1"). El update trae cinco mejoras concretas:
1. Flash Attention 4 en NVIDIA Hopper
La integración de FA4 targeting GPUs NVIDIA Hopper (H100-class) delivers:
- Prefill throughput: +25% a +70% (dependiendo del workload)
- Time-to-first-token (TTFT): reducción de hasta 31%
Esto importa especialmente para agentes: los harnesses de agentes inyectan system prompts, definiciones de tools, schemas de MCP tools y chunks de RAG antes de que el modelo genere su primer token. El prefill es el "hidden latency tax" en loops de Claude Code y OpenCode. FA4 ataca esa fase, no el decode tok/s.
2. Chat template polish
Google actualizó el chat template para formatting conversacional más suave:
- Menos role-tag leaks en output del assistant
- Estructura multi-turn más consistente al mezclar bloques user/model/tool-result
- Mejor alineación con
apply_chat_templatede HuggingFace
Si fine-tuneaste en un template anterior o hard-codeaste Jinja en un server custom, re-testea después de actualizar — el template drift es una causa común de reportes de "el modelo se hizo más tonto" que en realidad son regresiones de formatting.
3. Tool calling reliability patches
El update parchea bugs en tool calling, mejorando la consistencia y precisión de la ejecución. Las mejoras se ven en benchmarks agénticos:
Gemma 4 31B — mejoras agénticas:
| Benchmark | Anterior | Ganancia neta |
|---|---|---|
| BFCL (Tools) | 74.20% | +0.40% |
| TB2 (Agents) | 25.80% | +4.50% |
| Tau2 (Retail) | 77.60% | +3.10% |
| Tau2 (Airline) | 84.00% | +2.00% |
| Tau2 (Telecom) | 62.70% | +10.10% |
Gemma 4 E4B — mejoras agénticas:
| Benchmark | Anterior | Ganancia neta |
|---|---|---|
| BFCL (Tools) | 66.60% | +0.50% |
| TB2 (Agents) | 0.00% | +2.20% |
| Tau2 (Retail) | 60.50% | +0.90% |
| Tau2 (Airline) | 49.00% | +8.00% |
| Tau2 (Telecom) | 15.80% | +6.10% |
El salto de +10.10% en Tau2 Telecom del 31B sugiere que Google fixeó la consistencia de ejecución (JSON válido, selección correcta de tools, menos calls dropeadas) más que el razonamiento bruto.
4. Visión: OCR más nítido y inputs de 2.51 MP
Los defaults de visión cambiaron para workloads de documentos y screenshots:
| Setting | Valor | Efecto |
|---|---|---|
| Default bucket | 280 tokens | Baseline vision encoding |
| max_soft_tokens | 1.120 (manual) | OCR más nítido, soporte hasta 2.51 MP |
Si usas agentes de screenshot-to-patch o PDF OCR, re-pull los weights y sube el vision token budget. Los token buckets bajos eran una razón común de que la visión de Gemma 4 se sintiera "soft" en texto denso.
5. Refresh de la colección en Hugging Face
Todos los checkpoints en google/gemma-4 en Hugging Face muestran timestamps de update recientes (~15 julio 2026). Acción recomendada: huggingface-cli download o re-pull vía Ollama — los caches stale son la razón #1 de que developers se pierdan los fixes de template y tool calling.
Cómo aplicar el update localmente
Ollama (path más rápido)
ollama pull gemma4:12b-mlx
ollama pull gemma4:12b
# Verifica template + tools en tu agente
ollama launch claude --model gemma4:12b-mlx
llama.cpp / OpenCode
# Refresh GGUF y reiniciar server
llama-server -hf google/gemma-4-12b-it-GGUF:Q8_0 \
-ngl 999 -fa on -c 65536 --port 8080
Apunta OpenCode a http://127.0.0.1:8080/v1. Después del pull, corre un smoke test de tool calling (weather API o filesystem tool) antes de sesiones largas de agente.
vLLM / Hopper (FA4 prefill)
Usa un build de Transformers + flash-attn que exponga FA4 en Hopper. Benchmark TTFT con tu system prompt real + token count de tool schema — ahí es donde Google claimed hasta 31% de mejora.
Modelos edge: E2B y E4B
Los modelos E2B y E4B están engineered from the ground up para máxima eficiencia de compute y memoria. Activan un footprint efectivo de 2B y 4B parámetros durante inferencia para preservar RAM y batería.
En colaboración con Google Pixel, Qualcomm y MediaTek, estos modelos multimodales corren completamente offline con near-zero latency en:
- Teléfonos (Google Pixel, dispositivos con Snapdragon)
- Raspberry Pi 5 (133 prefill tok/s, 7.6 decode tok/s en CPU)
- NVIDIA Jetson Orin Nano
- Qualcomm Dragonwing IQ8 (3.700 prefill tok/s, 31 decode tok/s con NPU)
Los desarrolladores Android pueden prototipar flujos agénticos en el AICore Developer Preview para forward-compatibility con Gemini Nano 4. La app Google AI Edge Gallery (iOS y Android) permite experimentar con Agent Skills que corren workflows autónomos multi-step completamente on-device.
LiteRT-LM para deployment edge
- Memory footprint mínimo: corre Gemma 4 E2B usando <1.5GB en algunos dispositivos gracias a soporte de weights 2-bit y 4-bit
- Constrained decoding: outputs estructurados y predecibles para apps de IA y scripts de tool calling en producción
- Dynamic context: flexibilidad para manejar single models across CPUs y GPUs con context lengths dinámicos, aprovechando la ventana de 128K
- Performance: procesa 4.000 input tokens across 2 skills distintas en menos de 3 segundos
Gemma 4 vs competidores open source
Gemma 4 vs Qwen 3.6 27B
El routing práctico según la comunidad:
- Agente de coding text-only en Mac/PC → Qwen 3.6 27B como punto de partida
- Agente de screenshot/documento/UI → Gemma 4 12B o 31B con vision buckets actualizados
- Automatización on-device iOS/edge → Gemma 4 E4B
- Serving en datacenter Hopper → refresh para FA4 prefill antes de benchmarkear decode-only tok/s
Ninguno de los dos reemplaza APIs cerradas frontier en los suites de agentes más difíciles, pero ambos ofrecen opciones serias para uso local y edge.
Gemma 4 vs Gemma 3
El salto generacional es masivo en coding: LiveCodeBench v6 pasa de 29.1% a 80.0% (31B), Codeforces ELO de 110 a 2150. En razonamiento matemático, AIME 2026 sube de 20.8% a 89.2%. La ventana de contexto se duplica a 256K en los modelos grandes. Se añade thinking mode, function calling nativo y system prompts nativos.
Disponibilidad y acceso
- Hugging Face: colección
google/gemma-4con todos los checkpoints - Ollama:
ollama pull gemma4para los tamaños disponibles - Google AI Edge Gallery: app iOS/Android para experimentar con E2B y E4B
- AICore Developer Preview: para desarrolladores Android
- Licencia: Apache 2.0 (uso comercial permitido)
- Soporte: 140+ idiomas pre-entrenados, 35+ out-of-the-box
FAQ
¿Gemma 4 es gratis?
Sí. Gemma 4 se distribuye bajo licencia Apache 2.0, que permite uso comercial sin restricciones. Puedes descargar los weights y correrlos en tu hardware.
¿Qué hardware necesito para correr Gemma 4 31B?
Los weights unquantized bfloat16 caben en una sola GPU NVIDIA H100 de 80GB. Para setups locales, versiones quantizadas corren en GPUs consumer. El 26B MoE activa solo 3.8B parámetros durante inferencia, ofreciendo latencia baja.
¿Gemma 4 soporta function calling?
Sí. Gemma 4 incluye soporte nativo para function calling, structured JSON output y system instructions, enabling workflows agénticos autónomos.
¿El update de julio 2026 es un nuevo modelo (Gemma 4.1)?
No. Google mantiene el nombre "Gemma 4" para el update. Es un refresh de weights, kernels y templates que mejora Flash Attention 4, tool calling, chat template y visión. Re-pull los weights para obtener las mejoras.
¿Puedo usar Gemma 4 para coding?
Sí. Gemma 4 logra 80% en LiveCodeBench v6 (31B) y ELO 2150 en Codeforces. El thinking mode mejora el razonamiento en problemas de programación complejos. Está diseñado para funcionar como asistente de coding local-first en tu workstation.
¿Gemma 4 tiene modo thinking?
Sí. Todos los modelos Gemma 4 incluyen un thinking mode integrado que genera un reasoning trace antes de la respuesta, mejorando en dominios que requieren razonamiento como matemáticas y coding.
Conclusión
Gemma 4 representa un salto cuántico para los modelos open source de Google DeepMind. Con inteligencia de nivel frontier en tamaños que van desde 2B efectivos para móviles hasta 31B para workstations, contexto de 256K, multimodalidad nativa (texto, imagen, video, audio), function calling integrado y un modo de thinking que mejora dramáticamente el razonamiento, Gemma 4 democratiza acceso a capacidades que antes requerían APIs cerradas costosas. El update stealth de julio 2026 con Flash Attention 4 y fixes de tool calling refuerza el compromiso de Google con la comunidad open source, aunque la decisión de no versionar el update generó críticas justificadas. Para desarrolladores que buscan un modelo open weight de nivel frontier para coding, agentes o deployment edge, Gemma 4 es una de las opciones más competitivas de 2026.