Meta lanza Muse Code: su primer agente de programación con IA (Muse Spark 1.2, subagentes en paralelo y precios desde $0.10/M)
Meta entra al mercado de coding agents
El 5 de agosto de 2026, Meta lanzó Muse Code (beta), su primer agente de programación terminal potenciado por Muse Spark 1.2, el último modelo de Meta Superintelligence Labs (MSL). No es un wrapper sobre un modelo general: Muse Spark 1.2 fue co-entrenado con Muse Code, usando trayectorias del harness, herramientas del agente y workflows de coding reales. El resultado es un modelo tuned específicamente para trabajar dentro de este agente.
Mark Zuckerberg lo describió como "un agente terminal que maneja tareas completas de software engineering a través de repos grandes: planificar cambios, escribir código, validar los resultados". Alexandr Wang, chief de AI de Meta, lo posicionó como "una opción increíblemente buena, especialmente desde una perspectiva de costos".
Con Claude Code (Anthropic), Codex (OpenAI) y Cursor ya consolidados, Meta llega cuarto a la guerra de coding agents. Su palanca principal: precio, con un tier contributor que llega a $0.10/M input y $0.20/M output.
Qué hace Muse Code
Subagentes persistentes en paralelo
Cuando un job es suficientemente grande, Muse Code hace fan-out a subagentes separados que trabajan en paralelo en git worktrees aislados. Tu working copy nunca se toca. Zuckerberg mencionó que en testing interno construyó seis features para un juego simultáneamente sin colisiones.
Los subagentes son persistents: permanecen activos durante toda la sesión en lugar de crearse por tarea individual. Trabajan async y deciden cuándo reportar findings al agente principal. Esto reduce repetición de información gathering y la necesidad de dirección del developer durante tareas multi-step complejas.
Event log local: replay-exact y restart-safe
Muse Code usa un local event log donde cada model call, tool run, approval y edit se appendea. Esto hace que el runtime sea:
- Replay-exact: puedes reproducir cualquier sesión exactamente como corrió
- Restart-safe: si el sistema crashea durante una tarea larga, puede resumir desde donde se detuvo sin empezar de nuevo
- Auditable: cada acción queda registrada con quién la autorizó
Comandos built-in: /plan, /grill, /goal
Muse Code incluye comandos slash para estructurar el trabajo:
| Comando | Función |
|---|---|
/plan | Crea un plan con approval gates antes de ejecutar código |
/grill | Stress-test del plan: lo cuestiona antes de proceder |
/goal | Trabaja hacia un objetivo específico con acceptance checks |
Test de estrés: 1.000+ tool calls en 24 horas
Uno de los tests más demandantes involucró optimización de GPU kernels. Muse Spark 1.2 trabajó dentro de Muse Code para escribir, compilar, perfilar y mejorar kernels KDA y MLA sobre NVIDIA Hopper GPUs durante más de 1.000 tool calls, con runs individuales de hasta 24 horas. El sistema tuvo que mantener dirección a través de una secuencia larga de decisiones de engineering en lugar de producir una respuesta en un solo pass.
Muse Spark 1.2: el modelo
Especificaciones
| Especificación | Valor |
|---|---|
| Contexto | 1.048.576 tokens (1M) |
| Modalidades input | Texto, imagen, PDF, video |
| Modalidades output | Texto |
| Reasoning | Nativo, con effort configurable (minimal → xhigh) |
| Tool calling | Sí, parallel function calling |
| Structured output | Sí, JSON schema |
| APIs compatibles | OpenAI Chat Completions, OpenAI Responses, Anthropic Messages |
| Model ID (standard) | muse-spark-1.2 |
| Model ID (contributor) | muse-spark-1.2-contributor |
Benchmarks
| Benchmark | Muse Spark 1.2 | Líder | Gap |
|---|---|---|---|
| Terminal-Bench 2.1 | 82.9% | Claude Opus 5: 86.7% | −3.8 pts |
| DeepSWE 1.1 | 59.3% | GPT-5.6 Sol: 72.7% | −13.4 pts |
| GDPval-AA v2 | 1631 Elo (#5) | — | +260 Elo vs 1.1 |
| Meta Internal Coding Bench | 70.6% | Opus 5: ~79.6% | −9 pts |
Honestidad sobre los benchmarks: Meta evaluó cada modelo con su propio agente (Muse Code para Spark, Claude Code para Opus, Codex para GPT), no con el mismo harness. Meta reconoce en su methodology que el setup no fue tuned para modelos competidores y puede no reflejar sus mejores resultados. Críticos señalaron que los benchmarks se publicaron como imágenes sin methodology write-up. Kimi K3, que en otros leaderboards está ahead de Spark, está ausente de los charts publicados.
Mejoras vs Muse Spark 1.1
- GDPval-AA v2: +260 Elo (1371 → 1631)
- Terminal-Bench v2.1: +2 puntos (78% → 80%)
- τ³-Banking: +2 puntos (25% → 27%)
- SciCode: −2 puntos (regresión menor)
- Humanity's Last Exam: −1 punto (regresión menor)
El gain de 3 puntos en el Artificial Analysis Intelligence Index está concentrado en evaluaciones agénticas. Meta usó un self-improvement loop: Muse Spark 1.1 generó coding environments desafiantes e instruction-following templates, luego graduó soluciones candidatas contra esos requirements, produciendo un training dataset escalable para su sucesor.
Pricing: standard vs contributor
| Tier | Input ($/M) | Output ($/M) | Cached input ($/M) | Rate limit | Data usage |
|---|---|---|---|---|---|
| Standard | $1.25 | $4.25 | $0.15 | 3.000 req/min, 4M tokens/min | No se usa para entrenamiento |
| Contributor | $0.10 | $0.20 | $0.002 | 60 req/min | Sí, data se usa para mejorar modelos de Meta |
El tier contributor es 12x más barato en input y 21x más barato en output que el standard. Es el modelo más barato disponible en el mercado para coding agéntico. Pero hay un trade-off: tus prompts y completions pueden usarse para entrenar futuros modelos de Meta.
Cada cuenta nueva empieza con $20 en créditos gratis. Incluso el tier contributor requiere método de pago antes de que Muse Code funcione: low-cost es preciso, free no.
Comparativa de costos
| Modelo | Input ($/M) | Output ($/M) | Total ($/M) |
|---|---|---|---|
| Muse Spark 1.2 Contributor | $0.10 | $0.20 | $0.30 |
| DeepSeek V4 Flash | $0.14 | $0.28 | $0.42 |
| GPT-5.6 Luna | $0.20 | $1.20 | $1.40 |
| Muse Spark 1.2 Standard | $1.25 | $4.25 | $5.50 |
| Claude Sonnet 5 | $3.00 | $15.00 | $18.00 |
| Claude Opus 5 | $5.00 | $25.00 | $30.00 |
Costo real por tarea (tier contributor)
| Tarea | Tokens (in · out) | Costo |
|---|---|---|
| Quick lookup / one-liner | 8K · 1K | $0.0003 |
| Review de PR de 500 líneas | 60K · 4K | $0.003 |
| Fix un bug (agent loop) | 180K · 12K | $0.007 |
| Refactor de módulo | 320K · 20K | $0.01 |
| Full-repo agent run | 900K · 45K | $0.03 |
Un full-repo agent run de 900K input + 45K output cuesta $0.03 en contributor vs $0.49 en Claude Haiku 4.5. La diferencia es un orden de magnitud.
Cómo instalar Muse Code
Requisitos
- macOS o Linux (Windows no soportado)
- Cuenta en dev.meta.ai con API key
- Método de pago configurado (incluso para contributor tier)
Paso 1: Crear API key en Meta Model API
- Ve a dev.meta.ai y crea una cuenta
- Abre el Model API dashboard
- Ve a API keys → Create API key
- Copia la key inmediatamente (solo se ve una vez). Formato:
LLM|{numeric_id}|{secret} - Guárdala como variable de entorno:
export MODEL_API_KEY="LLM|607358788850350|nx9.....LJY"
Paso 2: Instalar Muse Code
Muse Code se instala con un solo comando (ver docs oficiales para el comando exacto según plataforma). Una vez instalado, arranca el agente en tu repositorio y empieza a dar tareas.
Usar Muse Spark 1.2 con otros agentes
Muse Spark 1.2 no es exclusivo de Muse Code. La Meta Model API es compatible con OpenAI (Chat Completions + Responses) y Anthropic (Messages), así que puedes usar Muse Spark como backend de OpenCode, Codex, Claude Code y cualquier herramienta compatible.
OpenCode
OpenCode tiene soporte built-in para Meta. Launch OpenCode y corre:
/connect
Selecciona Meta, pega tu API key. Luego selecciona Muse Spark 1.2. El status bar debe leer Muse Spark 1.2 · Meta.
Config manual en ~/.config/opencode/opencode.json:
{
"provider": {
"meta": {
"name": "Meta Model API",
"npm": "@ai-sdk/openai",
"options": {
"baseURL": "https://api.meta.ai/v1"
},
"models": {
"muse-spark-1.2": {
"name": "muse-spark-1.2",
"reasoning": true,
"limit": {
"context": 1048576,
"output": 131072
},
"modalities": {
"input": ["text", "image", "pdf", "video"],
"output": ["text"]
},
"options": {
"reasoningEffort": "high",
"reasoningSummary": "auto",
"include": ["reasoning.encrypted_content"]
}
}
}
}
}
}
Importante: el setting include: ["reasoning.encrypted_content"] es lo que carry el reasoning de Muse Spark entre turns. Sin esto, el modelo pierde su propio reasoning entre calls.
Codex CLI
export MODEL_API_KEY="tu-key-aqui"
mkdir -p /tmp/codex-modelapi
CODEX_HOME=/tmp/codex-modelapi codex \
-m muse-spark-1.2 \
-c 'model_provider="meta"' \
-c 'model_providers.meta.name="Meta Model API"' \
-c 'model_providers.meta.base_url="https://api.meta.ai/v1"' \
-c 'model_providers.meta.env_key="MODEL_API_KEY"' \
-c 'model_providers.meta.wire_api="responses"' \
-c 'model_reasoning_effort="xhigh"'
Claude Code
Claude Code usa el formato Anthropic Messages. Meta expone un endpoint compatible en https://api.meta.ai:
export ANTHROPIC_BASE_URL="https://api.meta.ai"
export ANTHROPIC_API_KEY="$MODEL_API_KEY"
export ANTHROPIC_MODEL="muse-spark-1.2"
export ANTHROPIC_DEFAULT_OPUS_MODEL="muse-spark-1.2"
export ANTHROPIC_DEFAULT_SONNET_MODEL="muse-spark-1.2"
export ANTHROPIC_DEFAULT_HAIKU_MODEL="muse-spark-1.2"
export CLAUDE_CODE_SUBAGENT_MODEL="muse-spark-1.2"
claude
Advertencia: limpia ANTHROPIC_CUSTOM_HEADERS si la tienes seteada para un gateway de Anthropic, o esas headers se enviarán a Meta.
Vía OpenRouter
Muse Spark 1.2 también está disponible en OpenRouter para integrarlo en cualquier workflow existente:
# Model ID en OpenRouter
openrouter/poolside/muse-spark-1.2
# o contributor
openrouter/poolside/muse-spark-1.2-contributor
Meta Model API: las tres superficies
| API surface | Endpoint | Soporta | Agentes compatibles |
|---|---|---|---|
| Responses API | /v1/responses | Texto, imágenes, PDFs, video, server-managed state, web search | Agentes que targeteen Responses explícitamente |
| Chat Completions | /v1/chat/completions | Texto, imágenes, PDFs, tool calling, streaming | Universal (cualquier agente OpenAI-compatible) |
| Messages | /v1/messages | Texto, imágenes, PDFs, video, tool calling, streaming (formato Anthropic) | Claude Code y agentes Anthropic-format |
Features de seguridad de Muse Code
Muse Code incluye several safety features built-in:
- OS sandbox: cada comando corre en un sandbox que verifica containment en vivo
- Guardrail protection: el agente no puede reescribir sus propias reglas; edits a guardrails se pausan para review
- Shell write protection: un shell write al mismo path que un guardrail falla read-only en el sandbox
- Command staging: split de comandos compuestos en stages, donde los safe auto-resuelven y los risky hold para review
- Goal pinning: el harness audita el trabajo contra acceptance checks antes de que el goal pueda cerrar
- Replay como CI check: eventos grabados pueden convertirse en fixtures y replayarse como merge-blocking CI check
- Thread branching: branch off del main thread para conversaciones laterales que nunca entran al main history
Limitaciones honestas
- No es el líder en benchmarks: Claude Opus 5 supera a Spark 1.2 en Terminal-Bench (86.7% vs 82.9%) y DeepSWE (72.7% vs 59.3% del Sol). Meta compite en precio, no en capabilities absolutas.
- Benchmarks sin methodology: los charts se publicaron como imágenes sin write-up. Cada modelo corrió en su propio agente, no en el mismo harness. Kimi K3 está ausente de los charts.
- macOS y Linux solamente: Windows no soportado.
- Contributor tier = tus datos: el tier de $0.10/$0.20 envía tus prompts y completions al pipeline de training de Meta. Para código propietario, usa standard ($1.25/$4.25).
- Rate limits ajustados en contributor: 60 req/min vs 3.000 req/min en standard. El contributor es para individuos y experiments, no production.
- Beta: el producto aún está en beta. Features pueden cambiar.
- No es open weight: a diferencia de Llama, Muse Spark es proprietary. Wang dijo que una variante open source está en desarrollo pero no dio fecha.
- Modelo más grande en camino: Meta está entrenando "Watermelon", el siguiente modelo. Spark era "Avocado". Esto sugiere que Spark 1.2 es un paso intermedio.
¿Cuándo usar Muse Code vs la competencia?
| Caso | Recomendado | Por qué |
|---|---|---|
| Prototipado rápido, código no sensible | Muse Code (contributor) | $0.03 por full-repo run. Imbatible en costo. |
| Código propietario / enterprise | Muse Code (standard) o Claude Code | Standard no usa datos para training. Claude Code si necesitas máxima calidad. |
| Máxima calidad de coding | Claude Code (Opus 5) | Líder en Terminal-Bench y DeepSWE. |
| Long-horizon, 24h+ tasks | Muse Code | Event log restart-safe + subagentes persistentes. Diseñado para runs largos. |
| Paralelismo de features | Muse Code o Superset.sh | Ambos fan-out a worktrees aislados. Muse Code lo hace nativo, Superset orquesta cualquier CLI. |
| Presupuesto ajustado | Muse Code (contributor) | 10-20x más barato que alternativas. Ideal para experimentation. |
| Integración con workflow existente | Muse Spark 1.2 via OpenCode/Codex/Claude Code | API compatible con OpenAI y Anthropic. Drop-in en tools existentes. |
FAQ
¿Muse Code es gratis?
No. Cada cuenta nueva recibe $20 en créditos gratis, pero incluso el tier contributor requiere método de pago. Es low-cost, no free.
¿Mi código se usa para entrenar modelos de Meta?
Solo en el tier contributor ($0.10/$0.20). El tier standard ($1.25/$4.25) no usa tus prompts ni completions para entrenamiento.
¿Muse Spark 1.2 es open source?
No. A diferencia de Llama, Muse Spark es proprietary. Wang dijo que una variante open source está en desarrollo pero sin fecha confirmada.
¿Funciona en Windows?
No. macOS y Linux solamente por ahora.
¿Puedo usar Muse Spark 1.2 sin Muse Code?
Sí. Muse Spark 1.2 está disponible via Meta Model API y OpenRouter. Puedes usarlo con OpenCode, Codex, Claude Code o cualquier herramienta compatible con OpenAI/Anthropic.
¿Cómo se compara con Claude Code?
Claude Opus 5 supera a Muse Spark 1.2 en benchmarks (Terminal-Bench 86.7% vs 82.9%, DeepSWE 72.7% vs 59.3%). Pero Muse Spark 1.2 contributor es 50x más barato ($0.30/M vs $30/M blended). Para prototipado y código no sensible, Muse Code es extremadamente cost-efficient. Para máxima calidad en código propietario, Claude Code sigue siendo líder.
¿Qué pasa si Muse Code crashea?
El event log local hace que el runtime sea restart-safe. El agente puede resumir desde donde se detuvo sin empezar de nuevo, sin duplicate side effects.
¿Puedo correr múltiples subagentes en paralelo?
Sí, es una feature core. Cuando un job es grande, Muse Code hace fan-out a subagentes en git worktrees aislados. Zuckerberg demostró 6 features simultáneas sin colisiones.
Conclusión
Muse Code es la entrada de Meta al mercado de coding agents, y lo hace con una propuesta clara: precio agresivo + co-training modelo-harness + subagentes persistentes + safety built-in. No gana en benchmarks absolutos (Claude Opus 5 y GPT-5.6 Sol superan a Muse Spark 1.2), pero el tier contributor a $0.10/$0.20 por millón de tokens lo hace el coding agent más barato del mercado por un orden de magnitud. Para developers que hacen prototipado, experimentation o trabajan con código no sensible, Muse Code en contributor tier es casi imbatible en costo. Para enterprises con código propietario, el tier standard ($1.25/$4.25) ofrece pricing competitivo sin ceder datos. La co-training entre modelo y harness significa que Muse Spark 1.2 rinde mejor dentro de Muse Code que en otros harnesses, un patrón que se está volviendo estándar en la industria. Con "Watermelon" (el siguiente modelo) en entrenamiento y features del harness en roadmap, Meta está señalizando que viene para quedarse en la guerra de coding agents.