FreeLLMAPI: 7.400 millones de tokens gratis al mes detrás de una sola API — guía completa de uso y conexión
La idea: los free tiers stacked valen una fortuna
Cada laboratorio serio de IA ofrece hoy un free tier: unos pocos millones de tokens al mes, unos miles de requests al día. Vistos uno a uno, son juguetes. Pero apilados, los tiers gratuitos de 34 proveedores suman ~7.400 millones de tokens al mes de capacidad real de inferencia — de modelos pequeños y rápidos a frontiers genuinos. El problema: 34 SDKs distintos, 34 rate limits, 34 lugares donde un request puede fallar.
FreeLLMAPI (open source, MIT, 31.400 estrellas en GitHub) resuelve exactamente eso: un router self-hosted que colapsa todos esos tiers gratuitos detrás de un único endpoint OpenAI-compatible. Apuntas cualquier cliente al `http://localhost:3001/v1` de tu máquina, y el router reparte transparentemente entre los proveedores donde registraste keys. En su catálogo vivo: 855 modelos, 635 endpoints, 474 familias — de Gemini 3.8 Flash y Qwen3.8 Max a GLM-5.3, Kimi K3, DeepSeek V4.1 Flash y MiniMax M3, todos a $0 dentro de los allowances.
Características principales
| Característica | Detalle |
|---|---|
| Endpoint unificado | Un solo /v1 OpenAI-compatible con streaming; las keys de proveedores se quedan cifradas (AES-256-GCM) en tu SQLite local |
| Modalidades | Chat, completions, embeddings, imágenes, video y voz (speech + transcripción) |
| APIs nativas extra | Anthropic /v1/messages (Claude Code), Gemini /v1beta (Gemini CLI) y emulación Ollama |
| Smart routing | 6 estrategias con scores en vivo de velocidad/capacidad/fiabilidad; failover automático en 429/5xx con cooldowns y rotación de keys |
| Control de cuotas | Contadores RPM/RPD/TPM/TPD por (proveedor, modelo, key) que aprenden los techos reportados |
| Catálogo autoactualizado | Feed firmado que se sincroniza 2 veces al día: nuevos modelos, cambios de cuota y fixes llegan sin git pull |
| Modelo fusion | El modelo virtual "fusion" envía tu prompt a un panel de modelos en paralelo y un juez sintetiza la mejor respuesta |
| Sesiones inteligentes | Sticky de 30 minutos por conversación + nota de handoff cuando cambia el modelo a mitad de chat |
| Dashboard | UI en React con playground, gestión de keys, analítica p50/p95/TTFT (24h–90d) y 60 idiomas |
| Consumo | ~40 MB de RAM en reposo; corre en cualquier cosa con Node 20+ (Windows, macOS, Linux, Raspberry Pi) |
Instalación paso a paso
- Requisito: Docker en tu máquina (o Node 20+ para desarrollo).
- Instalar con una línea:
curl -fsSL https://freellmapi.co/install.sh | bash— crea `~/freellmapi`, genera la clave de cifrado, baja la imagen y arranca el contenedor. Re-ejecutar es seguro: conserva tu configuración. - Abrir el panel:
http://localhost:3001y agregar tus keys gratuitas en la página Keys (las sacas gratis de cada proveedor: Google AI Studio, Groq, Mistral, NVIDIA NIM, OpenRouter, etc.). - Ordenar la cadena de fallback a gusto y copiar tu key unificada
freellmapi-...del encabezado de la página Keys. Esa es la única credencial que verán tus aplicaciones. - Alternativas sin Docker: app de escritorio para macOS (.dmg) y Windows (.exe) desde los releases de GitHub (vive en tu barra de menú), apps móviles (App Store y Google Play) y guía experimental para Android vía Termux.
Formas de conexión
1. Cualquier cliente OpenAI
Todo lo que acepte una base URL OpenAI-compatible funciona apuntándolo a http://localhost:3001/v1 con tu key unificada: SDKs oficiales de Python/JS, Postman, tu código propio. Soporta /v1/chat/completions, /v1/responses (lo que usa Codex CLI), /v1/completions (autocompletado de editores), /v1/embeddings, /v1/images/generations, /v1/videos/generations y /v1/audio/*.
2. Agentes de código con auto-setup
El comando estrella configura cada agente leyendo tu catálogo, respaldando la config previa y fusionando la nueva:
npx freellmapi setup-claude --url http://localhost:3001 --api-key <tu-key>
Compatible con Claude Code, Codex CLI, Gemini CLI, Cursor, Cline, Roo Code, OpenCode, Aider, Continue, Goose, Zed, JetBrains AI, DeepSeek Harness, MiMo Code y cualquier cliente OpenAI/Anthropic/Gemini/Ollama. Para Claude Code y Codex existe además launch, que mantiene las credenciales fuera de los archivos de configuración.
3. Claude Code y SDKs de Anthropic
El router habla el formato nativo de Anthropic en /v1/messages: Claude Code y los SDKs oficiales corren contra tu pool gratuito sin cambios de protocolo.
4. Gemini CLI y clientes Ollama
Gemini CLI se conecta vía /v1beta (generateContent, streaming, conteo de tokens), y la emulación Ollama opt-in sirve NDJSON para clientes de modelos locales como Zed o JetBrains.
5. ChatGPT vía MCP
El router incluye un servidor MCP en /mcp con un túnel privado: ChatGPT puede llamar a la herramienta ask_freellmapi para ejecutar tareas de inferencia en tu pool local y devolver la respuesta con metadatos de modelo, fallback, caché y tokens — sin que ninguna key toque Git o URLs.
6. Proveedor custom
Desde la página Keys puedes sumar cualquier endpoint OpenAI-compatible propio: llama.cpp, LM Studio, vLLM u Ollama local, o gateways remotos — que también entran en el routing y el failover.
Free vs Premium: qué paga exactamente
| Gratis (para siempre) | Premium ($19/año · $49 lifetime) | |
|---|---|---|
| Router completo | Sí | Sí |
| Catálogo de modelos | Snapshot mensual (cada modelo llega 30 días tarde) | Feed live, mismo día (hoy: 306 modelos de diferencia) |
| Cambios de cuota y fixes | Mensuales | Al momento de publicarse |
La licencia es MIT: el software es tuyo. Lo que se vende es frescura del catálogo en un mercado donde los tiers gratis cambian semanalmente.
Limitaciones y letra pequeña
- Uso personal y de experimentación: el proyecto lo declara explícitamente; cada ToS de proveedor aplica y no debe exponerse como proxy público.
- Disponibilidad variable: los modelos free dependen de promociones y cuotas que cambian sin aviso; el catálogo lo trackea, pero un modelo puede desaparecer de un mes a otro.
- No es para producción con SLA: la fiabilidad es la de un patchwork de terceros gratuitos. Para producción, un proveedor pagado directo (o modelos baratos como Le Chonk y DeepSeek a centavos) sigue siendo la respuesta correcta.
Qué significa para Latinoamérica
- Desarrollo a costo cero real: para estudiantes, freelancers y startups de la región, tener 7.400M de tokens mensuales —incluidos frontiers vía allowances— elimina la barrera de entrada más dura de la IA.
- Perfecto para agentes personales: combinado con las desktops agénticas que cubrimos (Cline, DeepSeek Harness, Qoder), el costo total de un stack de agentes completo puede ser literalmente $0.
- Privacidad local-first: tus keys y tus requests viven en tu máquina; nada pasa por servidores de FreeLLMAPI — el único servicio remoto es el feed del catálogo.
- El Raspberry Pi lo corre: con 40 MB de RAM en reposo, hasta una placa de US$50 puede ser tu router de IA casero.
Preguntas frecuentes
- ¿Qué es FreeLLMAPI? Un router open source (MIT) que agrega los tiers gratuitos de 34+ proveedores de IA —~7.400M de tokens al mes, 855 modelos— detrás de un único endpoint OpenAI-compatible que corres en tu propia máquina.
- ¿Es gratis de verdad? El software es gratis para siempre. Los tokens vienen de los free tiers de cada proveedor (necesitas registrar tus propias keys gratuitas). El premium opcional ($19/año) solo acelera la actualización del catálogo.
- ¿Cómo lo instalo? Con Docker y una línea: curl -fsSL https://freellmapi.co/install.sh | bash. También hay apps de escritorio para macOS y Windows, y apps móviles.
- ¿Funciona con Claude Code? Sí: habla el formato nativo de Anthropic (/v1/messages) y trae un comando de auto-configuración (npx freellmapi setup-claude). También con Cursor, Cline, Codex CLI, Gemini CLI, Aider y decenas más.
- ¿Qué pasa si un proveedor se queda sin cuota? El failover automático reintenta con el siguiente modelo de tu cadena al recibir 429/5xx, con cooldowns y rotación de keys; el rate tracker evita pasarte de los techos.
- ¿Es seguro? Las keys se cifran con AES-256-GCM en SQLite local y las apps solo ven una key unificada. Es single-user por diseño: no lo expongas como proxy público.
- ¿Qué es el modelo fusion? Un modelo virtual que envía tu prompt a un panel de modelos gratuitos en paralelo y usa un modelo juez para sintetizar una única respuesta a partir de los borradores.
Fuentes y referencias
Fuentes verificadas
https://freellmapi.co/
freellmapi.co
https://github.com/tashfeenahmed/freellmapi
github.com
https://freellmapi.co/models
freellmapi.co