IBM lanza Granite 4.2: modelos de reasoning open-source con agentic RL bajo Apache 2.0

Granite 4.2: reasoning nativo, no opcional
IBM ha lanzado Granite 4.2, una familia de modelos de lenguaje de reasoning open-source en tamaños de 3B, 8B y 30B parámetros. A diferencia de releases anteriores de Granite (que eran asistentes de instruction-following), Granite 4.2 está construido alrededor de reasoning explícito: cada modelo puede emitir una cadena de pensamiento antes de responder.
Características clave
- Thinking / non-thinking / low-effort switch: cada modelo expone un switch en el chat template para controlar el presupuesto de reasoning
- Agentic RL: los modelos 8B y 30B se entrenan con reinforcement learning en entornos reales — editar código, usar terminal, buscar web
- Apache 2.0: download, fine-tuning y uso comercial sin restricciones de licencia
- Dense transformers: decoder-only, pre-entrenados desde cero en ~15 trillones de tokens
Specs y benchmarks
| Benchmark | 3B | 8B | 30B |
|---|---|---|---|
| SWE-Bench Verified | N/A | 47.67 | 57.00 |
| Terminal-Bench 2.1 | N/A | 20.56 | 29.24 |
| τ³-bench | 50.99 | 66.34 | 68.05 |
| BFCL (v4) | 52.41 | 50.29 | 61.39 |
| AIME25 | 78.33 | 86.67 | 89.17 |
| GPQA | 54.80 | 64.14 | 66.41 |
| MMLU-Pro | 67.84 | 74.04 | 77.60 |
| RULER 128K | 55.30 | 71.41 | 81.38 |
Agentic RL: entrenamiento en entornos reales
Los modelos 8B y 30B incluyen un bloque de agentic RL donde el modelo aprende a:
- Editar código en sandboxes reales
- Usar terminal para ejecutar comandos
- Buscar en web dentro de entornos sandboxed
Esto no es RL abstracto: el modelo interactúa con herramientas reales y aprende de los resultados. El 30B logra 57.00 en SWE-Bench Verified y 29.24 en Terminal-Bench 2.1, números competitivos para modelos de su tamaño.
Thinking switch: tres modos
El chat template expone tres modos de reasoning:
- Thinking: cadena de pensamiento completa antes de responder
- Low-effort: presupuesto de reasoning corto para preguntas fáciles
- Non-thinking: respuesta directa sin reasoning explícito
Esto permite optimizar el costo de inferencia: usar reasoning solo cuando aporta valor.
Granite Speech 5.0 Turbo CTC
Junto con los LLMs, IBM lanzó Granite Speech 5.0 Turbo CTC:
- 470M parámetros, sin LLM backbone
- Usa Connectionist Temporal Classification (CTC) para mapear audio a texto
- Throughput de ~12.600 RTFx en una sola H200 (vs ~6.000 de los líderes actuales en Open ASR Leaderboard)
- WebGPU demo disponible
Por qué importa
Granite 4.2 es notable por tres razones:
- Reasoning nativo en open-source: la mayoría de modelos open-source no tienen reasoning explícito. Granite 4.2 lo trae a 3B, 8B y 30B.
- Agentic RL en entornos reales: no es RL simulado, es RL con terminal, código y web reales. Esto produce modelos mejores para tool use.
- Apache 2.0 sin restricciones: a diferencia de muchos modelos "open" con licencias restrictivas, Granite 4.2 es Apache 2.0 real. Fine-tuning, uso comercial, producción sin gates.
Disponibilidad
- Licencia: Apache 2.0 (3B, 8B, 30B)
- Descarga: pesos disponibles para download
- Granite Speech 5.0 Turbo CTC: 470M params, WebGPU demo activo
Conclusión
IBM con Granite 4.2 demuestra que el reasoning nativo y el agentic RL no son exclusivos de modelos propietarios. Con Apache 2.0, tamaños desde 3B hasta 30B, y entrenamiento en entornos reales (código, terminal, web), IBM posiciona a Granite como la opción open-source para enterprises que necesitan modelos de reasoning sin restricciones de licencia. El 30B con 57.00 en SWE-Bench Verified es un número sólido para un modelo dense open-source.
Fuentes verificadas
www.marktechpost.com
www.marktechpost.com