Meta lanza Muse Code: el agente de IA para programar en repositorios grandes (análisis 2026)

Qué es Muse Code
Muse Code es un agente de programación terminal lanzado en beta por Meta el 5 de agosto de 2026. Está diseñado para resolver tareas complejas de ingeniería de software en repositorios grandes: planificar cambios, escribir código, validar resultados y coordinar múltiples subagentes que trabajan en paralelo.
Está potenciado por Muse Spark 1.2, el modelo de coding más reciente de Meta, co-entrenado específicamente con Muse Code para maximizar la compatibilidad entre modelo y agente. Meta lo describe como "su próximo paso hacia la frontera, con modelos más grandes y mucho más capaces en camino".
La instalación es una sola línea:
curl -fsSL https://dev.meta.ai/install.sh | bash
Disponible para macOS y Linux. No hay build nativo para Windows, no hay GUI, no hay extensión de IDE. Es un agente terminal puro.
El diferenciador: subagentes persistentes + runtime crash-safe
Dos características de ingeniería distinguen a Muse Code de Claude Code, Codex y otros agentes:
1. Subagentes asíncronos persistentes
Cuando un trabajo es suficientemente grande, Muse Code fan-out a subagentes separados que trabajan en paralelo en worktrees aislados. Tu working copy nunca se toca. Zuckerberg mencionó que en testing lo usaron para construir 6 features de un juego simultáneamente sin colisiones.
La diferencia clave con otros agentes: estos subagentes no se crean por tarea y se destruyen. Se mantienen vivos durante toda la sesión, ejecutan próximos pasos por su cuenta y deciden cuándo reportar al agente principal. Esto reduce latencia (sin coste de spin-up) y disminuye la necesidad de dirección del desarrollador en tareas multi-paso.
2. Event log replay-exact y restart-safe
Muse Code registra cada llamada al modelo, cada tool run, cada aprobación y cada edit en un log local append-only. Esto hace que el runtime sea:
- Replay-exact: podés reproducir exactamente qué hizo el agente y cuándo
- Restart-safe: después de un crash, el agente resume precisamente donde se detuvo sin re-derivar su contexto desde cero
Competidores tienen crash recovery de calidad variable, pero ninguno lo ha hecho su headline. Además, el log es un artefacto de auditoría: un registro completo de lo que un proceso autónomo hizo a tu working tree —exactamente lo que pide un security review y que la mayoría de agentes CLI no pueden producir.
Caso de estudio: 24 horas, 1.000+ tool calls
Meta demostró Muse Code corriendo durante 24 horas con más de 1.000 tool calls, optimizando kernels de GPU en NVIDIA Hopper de forma autónoma. El modelo escribía, compilaba, profileaba y mejoraba kernels progresivamente. No se publicó figura de speedup, pero lo relevante es la duración: 1.000 tool calls sin intervención humana es una superficie de fallo distinta a un refactor de 50 llamadas.
Muse Spark 1.2: el modelo debajo
Muse Spark 1.2 es una actualización enfocada en coding del modelo Muse Spark 1.1. Mejoras en:
- Generación de código
- Debugging complejo
- Comprensión de codebase completo
- Workflows end-to-end de desarrollo
Meta escaló significativamente el compute de entrenamiento en tareas de coding y amplió la diversidad de entornos. El modelo fue entrenado en tareas long-horizon: generación de repositorios completos, proyectos end-to-end grandes, y auto-research. Usa planning para secuenciar trabajo, goal conditioning para mantener dirección, y context compaction para retener conocimiento necesario.
Context window: 1.048.576 tokens (1M).
Disponible también independientemente a través del Meta Model API, con acceso global expandido. Podés usarlo con Claude Code, Codex, OpenCode y otros agentes vía endpoint compatible con OpenAI y Anthropic.
Benchmarks: segundo lugar honesto
Meta publicó tres benchmarks y perdió en los tres contra Claude Opus 5. Aún así, los resultados son sólidos:
| Benchmark | Claude Opus 5 (Claude Code) | Muse Spark 1.2 (Muse Code) | GPT-5.6 Terra (Codex) | Grok 4.5 (Grok Build) |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 86.7% | 82.9% | 81.8% | 81.6% |
| DeepSWE 1.1 | 65.0% | 59.3% | 64.8% | — |
| Meta Internal Coding Bench | 79.4% | 70.6% | — | — |
Lectura honesta:
- En Terminal-Bench 2.1, Muse Code queda segundo pero a solo 1.3 puntos del tercer lugar (GPT-5.6 Terra y Grok 4.5 están casi empatados)
- En DeepSWE 1.1, la brecha es decisiva: 5.7 puntos detrás de Opus 5 y también por debajo de GPT-5.6 Terra
- En el benchmark interno de Meta (440 PRs reales de sus ingenieros), pierde por 8.8 puntos —en su propio test
- Meta comparó contra GPT-5.6 Terra, no contra Sol (el modelo más fuerte de OpenAI, que lidera Terminal-Bench con 89.5% en leaderboards independientes)
Aún así, Meta publicó los charts donde sale segundo. Eso es notable y honesto.
Pricing: el arma real es el precio
No hay suscripción a Muse Code. La facturación es por tokens a través del Meta Model API, en dos tiers:
| Tier | Input ($/M tokens) | Cached input ($/M) | Output ($/M tokens) | ¿Entrena con tus datos? |
|---|---|---|---|---|
| Standard | $1.25 | $0.15 | $4.25 | No |
| Contributor | $0.10 | $0.002 | $0.20 | Sí (Meta puede usarlos) |
El tier Contributor es 12.5x más barato en input, 21x más barato en output y 75x más barato en cached input. La diferencia es enorme.
Costo real por step de agente
Un step típico de agente: 60.000 tokens de contexto de repo input, 3.000 tokens de plan + patch output:
| Escenario | Costo por step | Costo por 1.000 steps |
|---|---|---|
| Standard, cold prompt | $0.088 | $87.75 |
| Standard, cache hit | $0.022 | $21.75 |
| Contributor, cold prompt | $0.0066 | $6.60 |
| Contributor, cache hit | $0.00072 | $0.72 |
La misma cantidad de trabajo puede costar $87 o $0.72 dependiendo de dos decisiones: tier y cache.
Para referencia, el run de 24 horas con 1.000+ tool calls de Meta costaría ~$90 en Standard o menos de $1 en Contributor.
El catch: tu código fuente es el pago
Un agente de coding lee tu codebase entero —esa es su función. Los prompts en el tier Contributor contienen tu código fuente, tus APIs internas, tus comentarios sobre por qué existe un workaround, y cualquier fixture de test en tu repo.
Para un proyecto open-source o personal, el tier Contributor es dinero gratis. Para una codebase propietaria o cualquier repo cerca de datos de clientes, es una decisión de licenciamiento disfrazada de descuento. Pertenece a quien aprueba manejo de datos, no a quien mira la factura de cloud.
Meta lo precios con 12x de descuento porque los datos valen al menos eso para ellos.
Skills incluidas: /plan, /grill, /goal
Muse Code viene con tres comandos integrados que describen el estilo de trabajo:
- /plan: convierte una tarea en un plan con approval gates antes de escribir nada
- /grill: stress-testea el plan hasta que se sostenga
- /goal: trabaja hacia la finalización exitosa del objetivo
Plan, atacar el plan, ejecutar —el patrón que usuarios experimentados de Claude Code y Codex convergieron manualmente, ahora como comandos first-class.
Comparación con la competencia
| Agente | Modelo | Empresa | Fortaleza | Pricing |
|---|---|---|---|---|
| Muse Code | Muse Spark 1.2 | Meta | Subagentes persistentes, crash-safe, precio | Por token (desde $0.10/M input) |
| Claude Code | Claude Opus 5 | Anthropic | Líder en todos los benchmarks | Suscripción ($20/mes+) o API |
| Codex | GPT-5.6 Terra / Sol | OpenAI | Agentes paralelos en cloud | Suscripción o API |
| Grok Build | Grok 4.5 | xAI | Integración con ecosistema X | Suscripción |
| Hermes / OpenClaw | Multi-modelo | Open source | Flexibilidad, multi-modelo | Gratis (modelo aparte) |
Limitaciones honestas
- Segundo en benchmarks: pierde contra Claude Opus 5 en los tres tests publicados, incluyendo el suyo propio
- Sin Windows: solo macOS y Linux. No hay GUI ni extensión de IDE
- DeepSWE 1.1 es la brecha más grande: 5.7 puntos detrás de Opus 5 y por debajo de GPT-5.6 Terra —el benchmark de agentic coding más relevante
- Comparó contra Terra, no Sol: OpenAI tiene un modelo más fuerte (Sol, 89.5% en Terminal-Bench) que Meta no incluyó en los charts
- Beta: es la primera versión pública. Modelos más grandes "en camino" según Meta
- El tier Contributor tiene implicaciones de privacidad serias: tu código fuente va a entrenamiento de Meta
- Sin pesos descargables: Muse Spark 1.2 es hosted-only. Dependés del Meta Model API
- Co-training claim no verificado por terceros: Meta dice que el co-training model+agente mejora resultados, pero nadie ha testeado Muse Spark 1.2 dentro de un harness rival
- Meta en conversaciones para lease compute a Anthropic: podría llegar a $10B en 2 años. Los datacenters de Meta podrían correr los modelos de Claude que Muse Code intenta desbancar
Cómo instalar y empezar
curl -fsSL https://dev.meta.ai/install.sh | bash
Después:
- Autenticarse con cuenta Meta
- Elegir tier (Standard para código propietario, Contributor para open-source)
- Usar
/planpara planificar antes de ejecutar - Usar
/grillpara stress-testear el plan - Usar
/goalpara ejecutar hacia el objetivo
También podés usar Muse Spark 1.2 con otros agentes (Claude Code, Codex, OpenCode) vía Meta Model API con endpoint compatible OpenAI/Anthropic en https://api.meta.ai/v1.
Para quién tiene sentido Muse Code
- Equipos con codebases grandes que necesitan refactors a escala de repositorio completo y migraciones
- Proyectos open-source donde el tier Contributor es prácticamente gratis
- Workloads long-running (24h, 1.000+ tool calls) donde el crash-safe runtime es crítico
- Equipos que priorizan costo sobre precisión máxima: 12x más barato que Claude Opus 5 con resultados sólidos
- Optimización de kernels GPU y tareas HPC: el caso de estudio de Meta muestra capacidad real aquí
Para quién NO tiene sentido todavía
- Codebases propietarias sensibles: el tier Standard es seguro pero 12x más caro; el Contributor expone tu código
- Si necesitás el #1 en benchmarks: Claude Opus 5 + Claude Code sigue siendo superior
- Si necesitás Windows o GUI: no disponible
- Si necesitás pesos descargables: Muse Spark es hosted-only
Conclusión
Meta llegó tarde a la carrera de agentes de coding, pero lo hizo con una propuesta diferenciada. Muse Code no gana en benchmarks —queda segundo detrás de Claude Opus 5 en los tres tests que Meta publicó— pero ofrece dos cosas que ningún competidor tiene: un runtime crash-safe con event log auditable y un precio 12x más barato que la competencia.
El subagent design con worktrees aislados y persistencia across sessions es ingeniería seria. La capacidad de correr 1.000+ tool calls durante 24 horas sin intervención humana abre workloads que otros agentes no pueden manejar.
La pregunta real no es "¿es mejor que Claude Code?" —no lo es. Es "¿vale la pena cambiar 3.8 puntos de accuracy por un costo 12x menor y un runtime que no se rompe?" Para muchos equipos, especialmente en open-source o workloads long-running, la respuesta es sí.
Meta prometió modelos más grandes "en camino". Si Muse Spark 1.2 ya está a 3.8 puntos de Opus 5 con 12x menos costo, la próxima iteración podría cambiar la ecuación. Por ahora, Muse Code es el segundo mejor agente de coding al precio del décimo —y eso, para muchos, es suficiente.