Laguna S 2.1 de Poolside y Hy3 de Tencent: dos modelos open weight que redefinen el coding agéntico en 2026
Dos modelos open weight que golpean al frontier
Julio de 2026 está siendo un mes decisivo para los modelos open weight de coding. En menos de tres semanas, dos releases importantes llegaron desde lados opuestos del mundo: Laguna S 2.1 de Poolside (San Francisco, 21 de julio) y Hy3 de Tencent Hunyuan (China, 6 de julio). Ambos comparten una idea: no necesitas 2T parámetros para competir en coding agéntico si optimizas la arquitectura MoE, el entrenamiento RL y el comportamiento del modelo en sesiones largas.
Los resultados son notables. Laguna S 2.1, con solo 8B parámetros activos por token, empata o supera a modelos de 975B en Terminal-Bench 2.1. Hy3, con 21B activos, rivaliza con flagships de 1.6T. Ambos son open weight, descargables y pensados para self-hosting.
Laguna S 2.1: el modelo más capaz de su clase
¿Qué es?
Laguna S 2.1 es un modelo de 118B parámetros totales, 8B activos por token, construido con arquitectura Mixture-of-Experts. Es el tercer modelo de Poolside en tres meses, entrenado de principio a fin en menos de 9 semanas en 4.000 GPUs H200. Está posicionado entre Laguna XS 2.1 (33B-A3B) y Laguna M.1 (225B-A23B) en la serie Laguna.
Especificaciones técnicas
| Especificación | Laguna S 2.1 |
|---|---|
| Parámetros totales | 118B |
| Parámetros activos por token | ~8B |
| Arquitectura | MoE: 256 expertos routed (top-10) + 1 shared expert |
| Capas | 48 (12 global attention, 36 sliding-window attention, window 512) |
| Atención | Grouped-query, 8 KV heads, head dim 128, softplus gating |
| Ventana de contexto | 1.048.576 tokens (1M) |
| Vocabulario | 100.352 tokens |
| Modalidad | Text-to-text |
| Reasoning | Thinking mode interleaved entre tool calls, control por enable_thinking |
| Speculative decoding | DFlash draft model disponible |
| Variantes quantizadas | FP8, NVFP4, INT4, GGUF |
| Licencia | OpenMDW-1.1 (uso comercial y no comercial) |
| Tokens de entrenamiento | 30T |
Benchmarks: punch above its weight
| Benchmark | Laguna S 2.1 (118B-A8B) | Modelos 5-20x más grandes |
|---|---|---|
| Terminal-Bench 2.1 | 70.2% | Inkling 975B: 63.8% / Nemotron 3 Ultra 550B: 56.4% / DeepSeek V4 Pro 1.6T: 64.0% |
| SWE-Bench Multilingual | 78.5% | Nemotron 3 Ultra: 67.7% / DeepSeek V4 Pro: 76.2% |
| SWE-Bench Pro | 59.4% | Inkling: 54.3% / DeepSeek V4 Pro: 55.4% |
| DeepSWE v1.1 | 40.4% | DeepSeek V4 Pro 1.6T: 9.0% |
| SWE Atlas (Codebase QnA) | 46.2% | DeepSeek V4 Pro: 27.2% |
| Toolathlon Verified | 49.7% | Inkling: 45.5% / Nemotron 3 Ultra: 34.3% |
El caso más extremo: en DeepSWE, Laguna S 2.1 con 8B activos scorea 40.4% mientras DeepSeek V4 Pro Max con 1.6T totales y 49B activos scorea 9.0%. Eso es 4.5x mejor con 6x menos parámetros activos.
Thinking mode: el impacto es masivo
| Benchmark | Thinking OFF | Thinking MAX (default) | Mejora |
|---|---|---|---|
| Terminal-Bench 2.1 | 60.4% | 70.2% | +9.8 pts |
| DeepSWE | 16.5% | 40.4% | +23.9 pts |
Poolside reporta thinking coherente y productivo durante varias horas y cientos de miles de tokens de longitud. Ningún Laguna anterior había mostrado un gap tan grande entre thinking on y off.
Persistencia como filosofía de diseño
Poolside no trata de añadir más inteligencia bruta, sino de mejorar los comportamientos que llevan a un modelo más capaz: más verificación, menos dar cosas por sentadas, no declarar victoria prematuramente, y ser más persistente. Modelos Laguna anteriores a veces se detenían tras pasar parcialmente un test suite o abandonaban un approach dos pasos antes de que funcionara. Laguna S 2.1 invierte en persistencia, verificación y revisión de enfoques fallidos.
Self-hosting realista
A 118B parámetros, el checkpoint BF16 necesita aproximadamente 236GB (múltiples GPUs). Pero las variantes quantizadas reducen esto sustancialmente. Poolside destaca que cabe en un single NVIDIA DGX Spark, cambiando la aritmética de deployar coding agents: mover trabajo agéntico de APIs metered a hardware que controlas.
Disponibilidad
- Hugging Face:
poolside/Laguna-S-2.1con variantes FP8, NVFP4, INT4, GGUF - OpenRouter: disponible para uso vía API
- Poolside API: acceso directo
- Licencia: OpenMDW-1.1 (uso comercial y no comercial libre)
- Trajectories: todos los trajectories de evaluación publicados en
trajectories.poolside.ai - Integraciones: vLLM, SGLang, Transformers, TRT-LLM, llama.cpp (fork de Poolside, branch laguna)
Logro notable: Erdős Problem #397
Como demostración de razonamiento long-horizon, Poolside publicó una trajectory completa de Laguna S 2.1 resolviendo independientemente el Erdős Problem #397, un problema de combinatoria que hasta hace poco solo los modelos de reasoning frontier más grandes habían resuelto.
Hy3: el flagship open source de Tencent Hunyuan
¿Qué es?
Hy3 es el modelo flagship de tercera generación del equipo Hunyuan (混元) de Tencent. Con 295B parámetros totales, 21B activos por token, es un MoE diseñado para reasoning, agentes y productividad. Tras un Hy3 Preview lanzado en abril 2026 con licencia restrictiva, la versión final llegó el 6 de julio de 2026 bajo Apache 2.0, tras recoger feedback de más de 50 productos internos de Tencent.
Especificaciones técnicas
| Especificación | Hy3 |
|---|---|
| Parámetros totales | 295B |
| Parámetros activos por token | ~21B |
| Capa MTP | 3.8B (Multi-Token Prediction) |
| Arquitectura | MoE: 192 expertos, top-8 activados |
| Capas | 80 (+ 1 capa MTP) |
| Atención | GQA, 64 heads, 8 KV heads, head dim 128 |
| Hidden size | 4.096 |
| Intermediate size | 13.312 |
| Ventana de contexto | 256K tokens |
| Vocabulario | 120.832 tokens |
| Modalidad | Text-to-text |
| Soporta fast y slow thinking | Sí |
| Licencia | Apache 2.0 |
Multi-Token Prediction (MTP)
Hy3 incluye una capa MTP de 3.8B parámetros que permite al modelo drafter varios tokens por forward pass, una técnica de optimización de inferencia que mejora significativamente la velocidad de generación. Tencent reporta un 40% de mejora en eficiencia de inferencia gracias a la co-optimización entre arquitectura del modelo y framework de inferencia.
Benchmarks
| Benchmark | Hy3 (295B-A21B) | Comparación |
|---|---|---|
| Terminal-Bench 2.1 | 71.7% | Laguna S 2.1: 70.2% / Inkling 975B: 63.8% / DeepSeek V4 Pro 1.6T: 64.0% |
| SWE-Bench Multilingual | 75.8% | Nemotron 3 Ultra: 67.7% / DeepSeek V4 Pro: 76.2% |
| SWE-Bench Pro | 57.9% | Inkling: 54.3% / DeepSeek V4 Pro: 55.4% |
| SWE-bench Verified | 78 resolved | — |
| Artificial Analysis Intelligence Index | 41 | — |
Evaluación ciega con 270 expertos
Tencent no se conformó con benchmarks públicos y corrió una evaluación ciega con 270 expertos usando tareas reales de su trabajo. Hy3 scoreó 2.67/4, superando a GLM-5.1 (2.51/4). La ventaja fue más sustancial en:
- Frontend development
- Data & storage
- CI/CD tasks
Agent workflows de 495 pasos
En entornos de usuario reales, Hy3 ha demostrado capacidad de powerar workflows agénticos complejos de hasta 495 pasos, soportando document processing, data analysis, knowledge retrieval y orquestación de toolchains MCP. En la feature AI PPT de Tencent Docs, el modelo mostró un 20% de aumento en success rate sobre la generación anterior (Hy2).
Pricing: extremadamente competitivo
| Concepto | Precio oficial (Tencent Cloud TokenHub) | Equivalente USD aprox. |
|---|---|---|
| Input | 1 RMB / millón tokens | ~$0.14-$0.15 |
| Cached input | 0.25 RMB / millón tokens | ~$0.06 |
| Output | 4 RMB / millón tokens | ~$0.58-$0.59 |
Para contexto, Hy3 es ~17x más barato que Claude Sonnet 5 ($10/M output) en output tokens. OpenRouter mirroró este pricing con un tier gratuito limitado hasta el 21 de julio de 2026.
Disponibilidad
- Hugging Face:
tencent/Hy3ytencent/Hy3-FP8 - GitHub:
Tencent-Hunyuan/Hy3(536+ stars) - ModelScope, GitCode, CNB: mirrors adicionales
- OpenRouter: disponible
- Tencent Cloud TokenHub: API oficial
- Quantizaciones: 1-bit GGUF, 4-bit GGUF, GPTQ Int4 (vía AngelSlim)
- Licencia: Apache 2.0
- Integraciones: vLLM, SGLang, OpenAI-compatible API, OpenClaw, OpenCode, KiloCode
Self-hosting
Con 295B parámetros, el BF16 necesita 8 GPUs con memoria grande (recomendado H20-3e o similar). La versión FP8 reduce requisitos. Las quantizaciones GGUF de 1-bit y 4-bit permiten running en hardware más modesto.
Laguna S 2.1 vs Hy3: comparativa directa
| Aspecto | Laguna S 2.1 | Hy3 |
|---|---|---|
| Developer | Poolside (San Francisco) | Tencent Hunyuan (China) |
| Parámetros totales | 118B | 295B |
| Parámetros activos/token | ~8B | ~21B |
| Contexto | 1M tokens | 256K tokens |
| Terminal-Bench 2.1 | 70.2% | 71.7% |
| SWE-Bench Multilingual | 78.5% | 75.8% |
| SWE-Bench Pro | 59.4% | 57.9% |
| DeepSWE | 40.4% | No evaluado |
| Licencia | OpenMDW-1.1 | Apache 2.0 |
| Precio API output/M | Vía OpenRouter / Poolside API | ~$0.58 |
| Hardware mínimo | Single DGX Spark (quantizado) | 8x H20-3e (BF16) |
| Enfoque | Coding agéntico, persistencia | Reasoning general, productividad |
| MTP layer | No (DFlash speculative decoding) | Sí (3.8B MTP) |
| Thinking mode | On/off, default max | Fast y slow thinking |
¿Cuándo elegir cuál?
- Self-hosting en hardware limitado → Laguna S 2.1 (8B activos, cabe en un DGX Spark quantizado)
- Contexto muy largo (+256K) → Laguna S 2.1 (1M tokens vs 256K de Hy3)
- Workflows agénticos generales (no solo coding) → Hy3 (495 pasos, integración con OpenClaw, productividad office)
- Costo mínimo por token → Hy3 (~$0.58/M output, extremadamente barato)
- DeepSWE / coding long-horizon extremo → Laguna S 2.1 (40.4% en DeepSWE, thinking mode persistente)
- Integración con ecosistema Tencent → Hy3 (Tencent Docs, TokenHub, productividad China)
- Gobierno/defense/regulated (US) → Laguna S 2.1 (Poolside ya sirve este mercado, OpenMDW-1.1)
Contexto: el landscape open weight de coding en julio 2026
| Modelo | Tamaño | Terminal-Bench 2.1 | SWE-Bench Pro | Licencia |
|---|---|---|---|---|
| Claude Fable 5 | Cerrado | 88.0% | 80.3% | Propietario |
| Kimi K3 | 2.8T-A50B | 88.3% | — | Modified MIT |
| GPT-5.6 Luna Max | Cerrado | 82.5% | — | Propietario |
| Muse Spark 1.1 | — | 80.0% | 61.5% | — |
| Qwen 3.7 Max | — | 74.5% | 60.6% | — |
| Hy3 | 295B-A21B | 71.7% | 57.9% | Apache 2.0 |
| Laguna S 2.1 | 118B-A8B | 70.2% | 59.4% | OpenMDW-1.1 |
| DeepSeek V4 Pro Max | 1.6T-A49B | 64.0% | 55.4% | — |
| Inkling | 975B-A41B | 63.8% | 54.3% | Modified MIT |
| Nemotron 3 Ultra | 550B-A55B | 56.4% | — | — |
Lo notable: Laguna S 2.1 con 8B activos está a solo 18 puntos de Claude Fable 5 en Terminal-Bench, y a 1.5 puntos de Hy3 que tiene 2.6x más parámetros activos. La eficiencia por parámetro activo es extraordinaria.
FAQ
¿Laguna S 2.1 es open source?
Sí, bajo licencia OpenMDW-1.1, que permite uso y modificación libre para fines comerciales y no comerciales. Los pesos están en Hugging Face.
¿Hy3 es gratis?
Los pesos son open source bajo Apache 2.0. El API oficial de Tencent cobra ~$0.14/M input y ~$0.58/M output. OpenRouter ofreció un tier gratuito limitado hasta el 21 de julio de 2026.
¿Puedo correr Laguna S 2.1 localmente?
Sí. A 118B totales con 8B activos, las variantes quantizadas (FP8, INT4, GGUF) pueden correr en hardware accesible como un NVIDIA DGX Spark. El BF16 completo necesita ~236GB.
¿Hy3 sirve para agentes?
Sí. Hy3 ha demostrado workflows agénticos de hasta 495 pasos, con integración nativa con OpenClaw, OpenCode y KiloCode. Es particularmente fuerte en frontend, CI/CD y data/storage.
¿Qué modelo es mejor para coding?
Para coding agéntico long-horizon extremo, Laguna S 2.1 tiene ventaja por su thinking mode persistente y score DeepSWE de 40.4%. Para productividad general y costo por token, Hy3 es más versátil y económico.
¿Cuál tiene más contexto?
Laguna S 2.1: 1M tokens. Hy3: 256K tokens. Si necesitas pasar repositorios completos o documentos muy largos, Laguna S 2.1 tiene 4x más capacidad.
Conclusión
Laguna S 2.1 y Hy3 representan dos filosofías diferentes del mismo problema: cómo competir con el frontier sin 2T parámetros. Poolside apuesta por la persistencia y el comportamiento del modelo en sesiones largas, logrando que 8B activos compitan con 50B. Tencent apuesta por la eficiencia de inferencia con MTP y la integración profunda con productos reales, logrando que 21B activos compitan con flagships cerrados. Ambos son open weight, ambos son descargables hoy, y ambos demuestran que el gap entre open y closed en coding agéntico se está cerrando más rápido de lo que nadie esperaba. Para equipos que necesitan self-hosting de coding agents en 2026, estas son dos de las opciones más competitivas disponibles.