OmniRoute: el gateway gratuito que conecta Claude Code con 290+ providers de IA (Claude, Gemini, GLM, GPT y más)

Qué es OmniRoute
OmniRoute es un gateway de IA open source (MIT) que actúa como intermediario entre tus herramientas de coding (Claude Code, Codex, Cursor, Cline, Copilot, etc.) y 290+ providers de IA. Un solo endpoint, auto-fallback automático, y acceso a ~1.53 billones de tokens gratis por mes agregados across los free tiers de múltiples providers.
La propuesta es simple: apuntas tu tool a http://localhost:20128/v1, configuras tu API key del dashboard, y OmniRoute rutea automáticamente al mejor provider disponible. Si uno se queda sin quota, salta al siguiente en milisegundos —sin downtime.
Con 500+ contributors, 14K+ estrellas en GitHub y soporte para 33+ herramientas de coding, OmniRoute se posiciona como el gateway más completo del ecosistema open source.
Por qué OmniRoute existe
El problema: usás Claude Code, Codex o Cursor, y tarde o temprano te quedás sin quota. Cambiar de provider manualmente es tedioso. Registrar API keys en cada tool es repetitivo. Y los free tiers de diferentes providers están dispersos.
OmniRoute resuelve esto con:
- Auto-fallback en 4 niveles: quota agotada → siguiente provider automático
- Compresión de tokens RTK + Caveman: ahorra 15–95% de tokens (~89% promedio en sesiones tool-heavy)
- 90+ providers con free tier, 40+ free forever: sin tarjeta de crédito
- Un solo endpoint: OpenAI ↔ Claude ↔ Gemini ↔ Responses API translation automática
- 33+ tools compatibles: Claude Code, Codex, Cursor, Cline, Copilot, Antigravity, OpenCode, Kilo Code, y más
Instalación
Opción 1: npm (recomendada)
npm install -g omniroute
omniroute
El server arranca en localhost:20128. Dashboard en http://localhost:20128, API en http://localhost:20128/v1.
Opción 2: Docker
docker pull omniroute/omniroute
docker run -p 20128:20128 omniroute/omniroute
Opción 3: pnpm
pnpm add -g omniroute
omniroute
Opción 4: Desde el source
git clone https://github.com/diegosouzapw/OmniRoute.git
cd OmniRoute
pnpm install
pnpm build
pnpm start
Verificar instalación
# Test con curl — funciona sin API key (auto combo usa providers gratuitos)
curl http://localhost:20128/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"auto","messages":[{"role":"user","content":"Hello!"}]}'
Funciona desde el segundo 1: sin keys, sin signup, sin config. Los providers gratuitos OpenCode Free y Felo están pre-wired en el combo auto.
Quick start: conectar Claude Code
Paso 1: Instalar y arrancar OmniRoute
npm install -g omniroute
omniroute
Paso 2: Conectar un provider gratuito
Dashboard → Providers → conectar Kiro AI (Claude gratis, ~50 créditos/mes) o OpenCode Free (sin auth) → done.
Paso 3: Configurar Claude Code
Editá ~/.claude/settings.json:
{
"env": {
"ANTHROPIC_BASE_URL": "http://localhost:20128",
"ANTHROPIC_AUTH_TOKEN": "your-omniroute-api-key"
}
}
Importante: NO agregues /v1 al base URL. Claude Code agrega /v1/messages automáticamente.
Paso 4: Verificar
curl http://localhost:20128/v1/models -H "Authorization: Bearer YOUR_KEY"
Deberías ver todos los modelos conectados listados. Listo — empezá a codear.
Método alternativo: omniroute launch
OmniRoute incluye un launcher que inyecta las variables de entorno automáticamente, sin escribir config:
# Local
omniroute launch
# Remote VPS
omniroute launch --remote http://192.168.0.15:20128 --api-key oma_live_xxx
# Con un perfil específico
omniroute launch --profile glm52
Perfiles por modelo con setup-claude
Genera un perfil de Claude Code por cada modelo disponible:
# Generar perfiles para todos los modelos
omniroute setup-claude
# Solo algunos providers
omniroute setup-claude --only glm,kimi
# Remote VPS
omniroute setup-claude --remote http://192.168.0.15:20128 --api-key oma_live_xxx
Esto crea ~/.claude/profiles/<name>/settings.json por cada modelo:
// ~/.claude/profiles/glm52/settings.json
{
"$schema": "https://json.schemastore.org/claude-code-settings.json",
"model": "glm/glm-5.2",
"effortLevel": "xhigh",
"env": {
"ANTHROPIC_BASE_URL": "http://192.168.0.15:20128",
"ANTHROPIC_MODEL": "glm/glm-5.2",
"CLAUDE_CODE_ENABLE_GATEWAY_MODEL_DISCOVERY": "1",
"CLAUDE_CODE_AUTO_COMPACT_WINDOW": "190000"
}
}
Lanzar un perfil:
omniroute launch --profile glm52 # Claude Code usando GLM-5.2
omniroute launch --profile kimi-k27 # Claude Code usando Kimi K2.7
Model tiers: diferentes models para diferentes tareas
Claude Code rutea a tiers de capability. Podés mapear cada tier a un modelo diferente de OmniRoute:
export ANTHROPIC_DEFAULT_OPUS_MODEL="glm/glm-5.2"
export ANTHROPIC_DEFAULT_SONNET_MODEL="kmc/kimi-k2.6"
export ANTHROPIC_DEFAULT_HAIKU_MODEL="glm/glm-4.7-flash"
Así, las tareas complejas usan GLM-5.2, las rápidas usan Kimi, y las triviales usan GLM Flash —todo automático.
Auto-routing: zero-config
Sin crear combos manualmente. Solo usá un prefix auto/* y OmniRoute ensambla un combo virtual en vivo:
| Model ID | Optimiza para |
|---|---|
auto | Balanceado (LKGP — se queda con el último provider bueno) |
auto/coding | Calidad de código primero (Claude, GPT-5, GLM, Kimi, Qwen Coder, DeepSeek) |
auto/fast | Latencia más baja |
auto/cheap | Costo por token más bajo |
auto/offline | Solo providers locales (Ollama, vLLM, llama.cpp) |
auto/smart | Calidad de razonamiento primero + 10% exploración |
auto/lkgp | Sticky al último provider exitoso |
Combos: fallback chains personalizadas
Un combo es una cadena de modelos por los que OmniRoute rutea automáticamente. Si uno falla, salta al siguiente. 19 estrategias de routing:
| Estrategia | Comportamiento |
|---|---|
priority | Orden fijo, siguiente tras fallo |
round-robin | Rotación entre targets |
cost-optimized | Prefiere modelos más baratos disponibles |
headroom | Prefiere conexiones con más saldo |
context-optimized | Selecciona según tamaño de contexto |
lkgp | Mantiene el último provider exitoso |
Providers free forever ($0, sin tarjeta)
| Provider | Prefix | Modelos gratuitos | Quota |
|---|---|---|---|
| OpenCode Zen | oc/ | DeepSeek V4, Nemotron 3 | Sin cap de tokens |
| Kilo Code | — | Auto-router, Tencent Hy3 | Free forever |
| Requesty | — | GPT-OSS 120B, Nemotron | Free forever |
| Z.AI GLM | zai/ | GLM-4.7 / 4.5-Flash | Free forever |
| Baidu ERNIE | — | ERNIE 4.0 | Free forever |
| SiliconFlow | — | DeepSeek V3.2 / R1 | Free tier |
| Qoder AI | if/ | Qwen3-Max, Kimi-K2, DeepSeek-R1 | ∞ Unlimited |
| Pollinations | pol/ | GPT, Llama, Claude, DeepSeek | Sin key needed |
| Cloudflare AI | cf/ | 50+ modelos | 10K neurons/day |
| NVIDIA NIM | nvidia/ | 129 modelos (GLM, MiniMax) | ~40 RPM |
| Cerebras | cerebras/ | GLM 4.7, GPT-OSS | 1M tokens/day |
| OpenRouter | — | :free models | +$10 → higher RPM |
Providers con free tier (90+)
| Provider | Modelos destacados | Free tier |
|---|---|---|
| Kiro | Claude Sonnet 4.5, Haiku 4.5, Opus 4.6 | 50 credits/mes |
| AgentRouter | GPT-5, Claude, Gemini | $100 free credits |
| LongCat | LongCat-2.0 | 10M tokens one-time (KYC) |
| OpenRouter | 500+ modelos | :free models + $10 signup |
OAuth providers (subscription)
OmniRoute soporta OAuth login para providers que usan suscripción:
| Provider | Modelos | Costo |
|---|---|---|
| Claude Code (Pro) | cc/claude-opus-4-8, cc/claude-sonnet-4-6, cc/claude-haiku-4-5 | $20/mes |
| Codex (Plus/Pro) | GPT-5.6 Sol, GPT-5.5 | $20-200/mes |
| GitHub Copilot | gh/gpt-5.5, gh/claude-opus-4.7, gh/claude-sonnet-4.6 | $10-19/mes |
| Gemini CLI | Gemini 3.1 Pro, Gemini 3.5 Flash | FREE (180K/mes + 1K/day) |
Compresión de tokens: RTK + Caveman
OmniRoute incluye un stack de 12 motores de compresión que ahorran 15–95% de tokens (~89% promedio en sesiones tool-heavy). Esto estira cada token gratis más lejos:
- RTK (Recursive Token Kompression): comprime prompts recursivamente
- Caveman: compresión adicional stacked sobre RTK
- Funciona en sesiones con mucho tool calling (donde el overhead de tokens es mayor)
Tools compatibles (33+)
| Categoría | Tools |
|---|---|
| CLI Coding Agents | Claude Code, Codex CLI, OpenCode, Cline, Kilo Code, Roo Code, Continue, Aider, ForgeCode, jcode, DeepSeek TUI, CodeWhale, Factory Droid, Copilot CLI, Cursor CLI, Smelt, Pi, Grok Build |
| CLI Agent Harnesses | Hermes Agent, OpenClaw, Goose, Open Interpreter, Warp AI, Agent Deck |
| IDEs | Cursor, Windsurf, Antigravity, VS Code (Continue) |
| Compatibles | Kiro, Command Code, y cualquier tool OpenAI-compatible |
Configuración para otras tools
Codex CLI
omniroute setup-codex
omniroute launch-codex --profile glm52
Cursor
omniroute setup-cursor --only glm,kimi
Cline
omniroute setup-cline
OpenCode
omniroute setup-opencode
opencode -m omniroute/glm/glm-5.2 "..."
Cualquier tool OpenAI-compatible
Base URL: http://localhost:20128/v1
API Key: [tu key del dashboard]
Model: auto
Remote mode: OmniRoute en un VPS
Podés correr OmniRoute en un server remoto y conectar tus tools locales:
# Conectar al remote (mints scoped token, stores context)
omniroute connect 192.168.0.15
# Ahora setup y launch usan el remote automáticamente
omniroute setup-claude
omniroute launch --profile glm52
# Override per-invocation
omniroute launch --remote http://192.168.0.15:20128 --api-key oma_live_xxx
MCP Server: 104 tools
OmniRoute expone un MCP server con 104 tools que cualquier agente puede usar para controlar el gateway:
# Conectar Claude Code al MCP de OmniRoute
claude mcp add omniroute --type http --url http://localhost:20128/api/mcp/stream
Los agentes pueden: gestionar providers, crear/editar combos, ajustar routing, ver costs, manejar compression, y más —todo via MCP.
A2A protocol
OmniRoute también es un A2A server con 6 skills, permitiendo que agentes se comuniquen entre sí a través del gateway.
Resilience: 3 capas independientes
- Circuit breakers: detecta providers caídos y los saca del pool
- Cooldowns: espera antes de reintentar un provider fallido
- Lockouts: bloquea providers con errores persistentes
También incluye TLS fingerprint stealth (wreq-js) para evitar detección de proxies.
Privacidad y local-first
- Corre 100% local por defecto
- Tus datos no salen de tu máquina (el gateway rutea, pero los providers que elijas sí reciben los prompts)
- Soporta providers locales: Ollama, LM Studio, vLLM, llama.cpp
auto/offlinemode para setups air-gapped
Dónde corre OmniRoute
| Plataforma | Soporte |
|---|---|
| macOS | ✅ Nativo |
| Linux | ✅ Nativo |
| Windows | ✅ Nativo |
| Docker | ✅ |
| VPS remoto | ✅ Remote mode |
| Desktop PWA | ✅ |
Comparación con alternativas
| Feature | OmniRoute | 9router | LiteLLM | CLIProxyAPI |
|---|---|---|---|---|
| Providers | 290+ | 40+ | 100+ | 8+ |
| Routing strategies | 19 | 3-tier | retry/priority | round-robin |
| Tier 1/2/3 fallback + UI | ✅ | ✅ | Manual | ⚠ |
| Token compression | RTK+Caveman 15–95% | RTK 20–40% | ❌ | ❌ |
| MCP server | ✅ 104 tools | ❌ | ⚠ client | ❌ |
| A2A protocol | ✅ server, 6 skills | ❌ | ⚠ client | ❌ |
| Cloud agents | ✅ | ❌ | ❌ | ⚠ sidecar |
| Resilience layers | 3 (breaker+cooldown+lockout) | ⚠ cooldown | ⚠ cooldown | ⚠ cooldown |
| Memory (FTS5 + vector) | ✅ | ❌ | ⚠ semantic cache | ❌ |
| Guardrails (PII/injection) | ✅ | ❌ | ✅ | ⚠ |
| Eval framework | ✅ | ❌ | ❌ | ❌ |
| TLS stealth | ✅ wreq-js | ❌ | ❌ | ✅ utls |
| OAuth providers | 16+ | 5 | SSO | 6 |
| Licencia | MIT | MIT | MIT + Comm | MIT |
| Stack | TS / Next 16 | Node / Next 16 | Python | Go |
Casos de uso
1. Claude Code gratis con GLM, Gemini y Claude al mismo tiempo
Conectás Kiro (Claude gratis), Z.AI GLM (GLM free forever), Gemini CLI (free) y Qoder (Qwen/Kimi unlimited). Configurás auto/coding como modelo. OmniRoute rutea al mejor disponible. Si Kiro se queda sin créditos, salta a GLM. Si GLM falla, salta a Gemini. Nunca te quedás sin modelo.
2. Múltiples cuentas Claude Code en paralelo
OmniRoute soporta multi-account round-robin para OAuth providers. Conectás varias cuentas de Claude Code Pro y el gateway rota entre ellas, extendiendo tu quota efectiva.
3. VPS remoto compartido
Corrés OmniRoute en un VPS. Tu equipo conecta sus tools al mismo gateway. Todos comparten los mismos providers, combos y configuración. Centralizás costos y observabilidad.
4. Air-gapped con modelos locales
auto/offline rutea solo a Ollama, vLLM, llama.cpp. Útil para entornos sin internet o con políticas estrictas de datos.
5. Ahorro de tokens con compresión
La compresión RTK + Caveman ahorra hasta 95% de tokens en sesiones tool-heavy. Esto estira los free tiers y los créditos pagos significativamente más lejos.
Pricing
| Aspecto | Detalle |
|---|---|
| OmniRoute (software) | Gratis (MIT) |
| Free tokens agregados | ~1.53B tokens/mes (free tiers) + ~2.1B primer mes con signup credits |
| Free forever providers | 40+ (OpenCode, Qoder, Pollinations, Z.AI GLM, Baidu, Cloudflare, NVIDIA, Cerebras...) |
| Providers con free tier | 90+ |
| Total providers | 290+ |
| Compresión | 15–95% ahorro de tokens |
| Costo real | $0 si usás solo free providers. Si conectás subscriptions (Claude Pro, Copilot), pagás esas |
Limitaciones
- No genera créditos gratis de la nada: los free tiers son de cada provider upstream. OmniRoute los agrega y rutea, pero las quotas las definen los providers
- Calidad variable: los models free pueden ser menos capaces que los pagos. Para tareas críticas, fijá el modelo en lugar de usar
auto - Tool call formats varían: diferentes models pueden tener diferentes capacidades de tool calling. Para tareas largas, fijá el modelo o limitá el candidate set
- Complejidad de setup inicial: más complejo que usar un solo provider directo. Para proyectos simples con un provider estable, puede ser overkill
- Terms of service: cada provider tiene sus propios terms. Usar free tiers via gateway no exime de cumplirlos
- Latencia: el hop extra through el gateway agrega latencia mínima, pero existe
Conclusión
OmniRoute es el gateway más completo del ecosistema open source para devs que usan múltiples AI coding agents. La combinación de 290+ providers, auto-fallback automático, compresión de tokens y 33+ tools compatibles lo hace único.
Para devs que usan Claude Code y se quedan sin quota constantemente, OmniRoute es la solución más pragmática: conectás Kiro (Claude gratis), Z.AI GLM (free forever), Gemini CLI (free) y Qoder (unlimited), configurás auto/coding, y nunca más te quedás sin modelo. Con la compresión RTK + Caveman estirando cada token, los free tiers rinden significativamente más.
El hecho de que funcione desde el segundo 1 sin keys ni config —gracias a los providers pre-wired— lo hace la opción más accesible para empezar. Y el MCP server con 104 tools permite que los propios agentes gestionen el gateway, abriendo la puerta a orquestación autónoma.
Si usás múltiples AI coding agents y querés maximizar free tiers mientras mantenés resiliencia, OmniRoute es la herramienta que faltaba en tu stack.