DeepSeek V4 Pro GA y Grok 4.6: dos frontier models que amenazan a Claude y GPT-5.6 a una fracción del precio
Dos frontier models en un día
El 12 de agosto de 2026 se lanzaron dos de los modelos más esperados del año: DeepSeek V4 Pro en su versión general availability (build 0813) y Grok 4.6 de SpaceXAI (antes xAI). Ambos apuntan al mismo blanco: Claude Fable 5 y GPT-5.6 Sol, los modelos cerrados más caros del mercado. Y ambos lo hacen con una estrategia similar: igualar o acercarse al frontier a una fracción del precio.
DeepSeek V4 Pro 0813 — General Availability
De preview a GA en 4 meses
DeepSeek V4 Pro estuvo en preview desde el 24 de abril de 2026. El 12 de agosto, sin blog post ni anuncio, DeepSeek actualizó silenciosamente el model version en su API pricing page a DeepSeek-V4-Pro-0813. El 13 de agosto confirmó la GA release con actualización oficial de docs.
Arquitectura
- 1.6T total / 49B active params (MoE)
- 1M context window (default en todos los servicios oficiales)
- 384K max output tokens
- Novel Attention: Token-wise compression + DSA (DeepSeek Sparse Attention)
- Open weights en Hugging Face bajo licencia MIT (pesos 0813 pendientes de publicación)
Saltos en benchmarks de agentes
El cambio de preview a GA trajo mejoras dramáticas en agent benchmarks:
| Benchmark | Preview | GA (0813) | Mejora |
|---|---|---|---|
| Terminal-Bench 2.1 | 72.1 | 87.9 | +15.8 |
| CyberGym | 52.7 | 83.3 | +30.6 |
| DeepSWE | 12.8 | 62.7 | +49.9 (4.9x) |
| AutomationBench | 12.8 | 31.8 | +19.0 |
| DSBench-FullStack | 41.8 | 71.1 | +29.3 |
| DSBench-Hard | 31.1 | 67.2 | +36.1 (2.2x) |
vs Claude Fable 5
Across 9 agent benchmarks donde ambos modelos tienen score, Fable 5 lidera por un promedio de 5.3%. Pero DeepSeek gana en 2 benchmarks:
- CyberGym: V4 Pro 83.3 vs Fable 5 83.1 (cybersecurity)
- AutomationBench: V4 Pro supera a Fable 5 (automation tasks)
Excluyendo Humanity's Last Exam (donde DeepSeek scored 42.7 vs 53.3), el gap promedio se reduce a 2.8%.
vs Kimi K3
- Terminal-Bench 2.1: V4 Pro 87.9 vs Kimi K3 88.3 (0.4 puntos detrás)
- V4 Pro supera a Kimi K3 en AIME math, LiveCodeBench coding y MMLU
- Code Arena (independiente): V4 Pro ~8vo overall, 2do entre open models, detrás de Kimi K3 en web dev
Features nuevas en GA
- Responses API nativa (OpenAI-compatible)
- Integración con Codex con one-click setup
- Flexible reasoning effort: low (simple tasks), high (daily agent workflows), max (complex tasks)
- Dual modes: Thinking / Non-Thinking
- Compatible con Claude Code, OpenClaw y OpenCode
- Disponible en app/web via "Expert Mode"
Pricing
| Concepto | DeepSeek V4 Pro | Claude Fable 5 | Ratio |
|---|---|---|---|
| Input ($/M tokens) | $0.435 | $10.00 | 23x más barato |
| Output ($/M tokens) | $0.87 | $50.00 | 57x más barato |
| Cached input ($/M) | $0.003625 | — | — |
| Blended rate ($/M) | ~$0.65 | ~$30.00 | 46x más barato |
DeepSeek planea un aumento significativo de pricing en el futuro cercano, con rates peak y off-peak (off-peak 50% más barato). Nuevo pricing efectivo desde 16:00 UTC, 16 de agosto de 2026.
Grok 4.6 — SpaceXAI
El modelo
Grok 4.6 es el último frontier model de SpaceXAI (antes xAI, ahora bajo SpaceX tras la acquisición en febrero 2026 y rebrand en julio). Se lanzó el 12 de agosto de 2026, solo un mes después de Grok 4.5.
Enfoque: long-running agents y visual work
Grok 4.6 se enfoca en agentes de larga duración y trabajo interactivo y visual ambicioso. Se queda con tareas complejas across muchos steps: research, análisis, trabajo across codebases, o convertir una idea en una aplicación pulida.
Training
- Supplemental training run más largo que Grok 4.5
- Curated model-generated data para reasoning y conceptos técnicos avanzados
- High-quality engineering data
- Improved optimizer y training recipe
- SFT trajectories regenerados usando Grok 4.5, filtrados con model-based checks
- Agentic RL tasks: knowledge work, coding, kernel optimization, web dev, CAD
Benchmarks
| Benchmark | Grok 4.5 | Grok 4.6 | Líder |
|---|---|---|---|
| AA Intelligence Index | 56 | 61 | Opus 5: 63 / Fable 5: 62 |
| GDPval-AA v2 (Elo) | 1,526 | 1,753 | Opus 5: ~1,760 |
| CursorBench v3.2 | 66.7% | 69.9% | Fable 5: 70.5% |
| DeepSWE v1.1 | 54.0% | 65.9% | GPT-5.6 Sol: 73% |
| FrontierCode v1.1 Ext. | 56.6% | 61.3% | Fable 5: 63.6% |
| APEX-Agents | 47.1% | 57.5% | Fable 5: 59.2% |
| APEX-SWE | 53.6% | 56.4% | Fable 5: 58.8% |
| Terminal-Bench v3.0 | 15.7% | 26.0% | GPT-5.6 Sol: 34.6% |
| AA-Briefcase (Elo) | — | 1,577 | Grok 4.6 lidera (Fable 5: 1,574) |
| Harvey LAB | 12.9% | 15.8% | Grok 4.6 lidera (Fable 5: 12.9%) |
Dónde gana Grok 4.6
- AA-Briefcase: Elo 1,577 — supera a Fable 5 (1,574) y GPT-5.6 Sol (1,502)
- Harvey LAB: 15.8% — supera a Fable 5 (12.9%) y GPT-5.6 Sol (2.5%)
- GDPval-AA v2: Elo 1,753 — 2do overall, detrás de Claude Opus 5, pero supera a GPT-5.6 Sol (1,728) y Fable 5 (1,741)
- Eficiencia: completa tasks en ~53 pasos vs ~103 de Claude Opus 5
Pricing
| Concepto | Grok 4.6 | Grok 4.6 Fast | Claude Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Input ($/M, <200K) | $2.00 | $4.00 | $5.00 | $5.00 |
| Output ($/M, <200K) | $6.00 | $12.00 | $25.00 | $30.00 |
| Input ($/M, ≥200K) | $4.00 | $8.00 | — | — |
| Output ($/M, ≥200K) | $12.00 | $24.00 | — | — |
| Cached input ($/M) | $0.50 | — | — | — |
Grok 4.6 es 60%+ más barato que Claude Opus 5 y GPT-5.6 Sol en blended rates. Cost per task reportado por Artificial Analysis: ~$0.84.
Disponibilidad
- Cursor (adquirido por SpaceX en junio por $60B)
- Grok Build (desde $30/mes plan SuperGrok)
- API via console.x.ai
- Partners: OpenRouter, Vercel, Cloudflare
- 2x usage incluido en Cursor y Grok Build durante la primera semana
Comparativa head-to-head
| Feature | DeepSeek V4 Pro 0813 | Grok 4.6 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| AA Intelligence Index | 53 (max effort) | 61 | 62 | 61 |
| Terminal-Bench | 87.9 (v2.1) | 26.0 (v3.0) | 88.0 (v2.1) | 34.6 (v3.0) |
| CyberGym | 83.3 | — | 83.1 | — |
| DeepSWE | 62.7 | 65.9% | — | 73% |
| GDPval-AA v2 | — | 1,753 | 1,741 | 1,728 |
| Params | 1.6T/49B active (MoE) | No revelado | No revelado | No revelado |
| Context window | 1M | 200K+ (tiered pricing) | 200K | 200K |
| Open weights | Sí (MIT, 0813 pendiente) | No | No | No |
| Input $/M | $0.435 | $2.00 | $10.00 | $5.00 |
| Output $/M | $0.87 | $6.00 | $50.00 | $30.00 |
| Blended $/M | ~$0.65 | ~$4.00 | ~$30.00 | ~$17.50 |
| Agent integration | Claude Code, Codex, OpenCode | Cursor, Grok Build | Claude Code | Codex |
| API compatible | OpenAI + Anthropic | OpenAI-compatible | Anthropic | OpenAI |
El contexto competitivo
El ranking de Artificial Analysis Intelligence Index después de estos lanzamientos:
- Claude Opus 5 — 63
- Claude Fable 5 — 62
- Grok 4.6 — 61 (empata con GPT-5.6 Sol)
- GPT-5.6 Sol — 61
- Grok 4.5 High — 56
- DeepSeek V4 Pro 0813 — 53 (max effort)
Pero el value proposition es donde la historia cambia. DeepSeek V4 Pro es 46x más barato que Fable 5 en blended rates, con un gap de solo 5.3% en benchmarks. Grok 4.6 es 60%+ más barato que Opus 5 y GPT-5.6 Sol, empantando con este último en el Intelligence Index.
Cómo usarlos
DeepSeek V4 Pro
# API (OpenAI-compatible)
curl https://api.deepseek.com/v1/chat/completions \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-pro",
"messages": [{"role": "user", "content": "Hello"}],
"thinking": true
}'
# Con Codex (one-click setup)
# Ver: https://api-docs.deepseek.com/quick_start/agent_integrations/codex
# Con Claude Code
# Usar API Anthropic-compatible de DeepSeek
# Web: chat.deepseek.com → Expert Mode
Grok 4.6
# API
curl https://api.x.ai/v1/chat/completions \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.6",
"messages": [{"role": "user", "content": "Hello"}]
}'
# Cursor: seleccionar Grok 4.6 en model picker
# Grok Build: x.ai/build (plan SuperGrok desde $30/mes)
# OpenRouter, Vercel, Cloudflare: disponible
Limitaciones y caveats
DeepSeek V4 Pro
- Los benchmarks son self-reported en infraestructura no liberada
- Dos de los 10 benchmarks (DSBench-FullStack y DSBench-Hard) son internal test sets sin leaderboard público
- Los pesos 0813 aún no se han publicado en Hugging Face (el model card sigue diciendo "preview")
- Pricing aumentará "significativamente" en el futuro cercano
- DeepSWE: salto de 12.8 a 62.7 necesita verificación independiente — "dame un repo messy, tools y un task de 30+ steps y ve si termina sin salirse de los rieles"
Grok 4.6
- Terminal-Bench v3.0: 26% — sigue significativamente atrás de Fable 5 (34.1%) y GPT-5.6 Sol (34.6%)
- Cost per task ($0.84) es menos económico que Grok 4.5 según Artificial Analysis Pareto frontier
- No es open source / open weights
- Solo un mes desde Grok 4.5 — ciclo de release agresivo
Conclusión
El 12 de agosto de 2026 marca un punto de inflexión. DeepSeek V4 Pro GA demuestra que un modelo open weight de 1.6T params puede estar a 2.8-5.3% del frontier cerrado a 46x menos costo, con saltos dramáticos en agent benchmarks (DeepSWE 4.9x, CyberGym +30.6 puntos). Grok 4.6 empata con GPT-5.6 Sol en el Intelligence Index, gana en AA-Briefcase y Harvey LAB, y completa tareas en la mitad de pasos que Claude Opus 5 — a 60%+ menos precio. El mensaje es claro: el gap entre el frontier cerrado y las alternativas se está comprimiendo rápido, y el pricing del frontier se está volviendo difícil de justificar para workloads a escala. Para equipos que corren agents 24/7, la matemática es simple: 46x o 4x de diferencia en costo se acumula rápido.