+250 skills, dinamita para tu productividad 🧨Explorar →

FreeLLMAPI: 7.400 millones de tokens gratis, ¿de verdad?

Un repositorio pasa de cero a 22.400 estrellas en cuatro meses. El README promete 7.400 millones de tokens gratis al mes. Lo publican dos veces en Hacker News y consigue, entre las dos, seis puntos y cero comentarios.

Ese hueco entre el ruido de GitHub y el silencio de los foros me hizo abrir FreeLLMAPI con lupa.

Dentro hay una herramienta honesta con una cifra de portada que no aguanta el examen, un ecosistema de opinión partido en dos idiomas y una issue abierta que explica por qué el número de tu propio panel está inflado ocho veces.

Esto es lo que vas a encontrar aquí:

  • Qué hace FreeLLMAPI y por qué 22.400 personas le han dado una estrella
  • De dónde sale la cifra de 7.400 millones de tokens y por qué crece cada mes
  • La issue #1065: el panel cuenta 2.370 millones donde hay 294 millones
  • Qué se dice en los foros en inglés (spoiler: casi nada) y qué se dice en chino (bastante más, y más crítico)
  • La tabla de términos de servicio proveedor por proveedor, con un ❌ que te va a sorprender
  • Para quién sirve y para quién es una pérdida de tiempo

¿Qué es FreeLLMAPI y por qué tiene 22.400 estrellas?

FreeLLMAPI es un router local que apila los planes gratuitos de decenas de proveedores de IA detrás de un único endpoint compatible con OpenAI. Tú registras tus propias claves de Google, Groq, Cerebras, Mistral, OpenRouter, Cloudflare o Z.ai, y el router decide a cuál llamar en cada petición.

No es una API gratis hospedada. No te dan una clave y ya. Tú pones las cuentas, tú pones las claves, y el proyecto pone la fontanería.

Los datos del repositorio, consultados el 30 de agosto de 2026 vía la API de GitHub:

Métrica Valor
Estrellas 22.401
Forks 3.128
Issues abiertas 78
Creado 21 de abril de 2026
Último push 28 de agosto de 2026
Licencia MIT
Lenguaje TypeScript
Última versión v0.9.0

Cuatro meses de vida y 22.400 estrellas. El proyecto publicó 20 releases entre el 28 de julio y el 26 de agosto, una cada día y medio. El autor no está durmiendo.

La propuesta técnica es sólida y está bien pensada. El router elige el modelo de mayor prioridad que tenga una clave sana y esté por debajo de todos sus límites, descifra la clave en memoria y llama al proveedor. Si recibe un 429 o un 5xx, pone esa clave en enfriamiento y reintenta con el siguiente modelo de la cadena, hasta 20 intentos.

Las claves se guardan cifradas con AES-256-GCM en SQLite. Tus aplicaciones solo ven un token unificado freellmapi-… y nunca tocan las claves de arriba. Eso está bien resuelto.

Y funciona con casi todo lo que ya usas: Claude Code, Codex CLI, Cline, Continue, Aider, OpenCode, Goose, Qwen Code, Roo, Kilo, Crush y Cursor tienen scripts de configuración automática. Si ya has trasteado con proxys y routers para cambiarle el motor a Claude Code, el terreno te va a sonar.

🔑 FreeLLMAPI no genera cuota. Agrupa la que ya tienes. Todo lo que sigue en este artículo se entiende mejor con esa frase en la cabeza.

Guía interactiva gratis

Antes de elegir proveedor, decide tu presupuesto

El curso tiene una parada entera sobre esto: gratis, pago por API o suscripción. Recorres las 17 decisiones y sales con una checklist a tu medida.

Entra en el curso gratis →

¿De dónde salen los 7.400 millones de tokens al mes?

De sumar los planes gratuitos de 34 proveedores. El problema es que esa suma es un cuentakilómetros, no una medición.

Rastrea la cifra por las publicaciones que han cubierto el proyecto y verás el patrón:

Fuente Fecha aprox. Proveedores Tokens/mes anunciados
Guía de javabetter.cn Repo con 6,2k estrellas 14 1.300 millones
Artículo de Tencent Cloud Repo con 4,4k estrellas 11 1.300 millones
Reseñas en Zhihu y CSDN Junio 2026 16 1.700 millones
Artículo en Juejin Julio 2026 24 128 modelos
Guía de Better Stack Julio 2026 28 4.000 millones
README actual Agosto 2026 34 7.400 millones

Los proveedores no se han vuelto más generosos. El autor añade filas al catálogo y el titular sube con ellas, y el titular es lo que la gente comparte.

Eso por sí solo no es deshonesto. El problema está en cómo se calcula la suma.

¿Por qué el panel de tokens está inflado ocho veces?

Porque cuenta la misma bolsa de tokens una vez por cada modelo que la comparte.

La issue #1065, abierta el 29 de agosto de 2026, lo documenta con el código en la mano. Su título ya lo dice todo: “Monthly token budget bar counts shared pools once per model (shows 2.37B vs 294M actual)”.

// server/src/routes/fallback.ts:499
budget: parseBudget(m.monthly_token_budget) * keys,

// :510
const totalBudget = modelBudgets.reduce((s, m) => s + m.budget, 0);

Cada modelo de una plataforma lleva colgada la etiqueta de la bolsa de esa plataforma. Así que una cuota compartida se multiplica por cuantos modelos tenga esa plataforma en el catálogo.

El desglose que publica en la issue, sobre una instalación real con 13 claves:

Plataforma Modelos Bolsa real Contado como
Mistral 13 100M 1.300M
Cloudflare 21 45M 535M
Ollama 7 30M 120M
Cerebras 3 30M 90M
Zhipu 3 30M 90M
Google 10 30M 84M
Groq 9 15M 60M
OpenRouter 9 6M 52M
Cohere 11 2M 22M
Total 294M 2.370M

Mistral se lleva casi todo el inflado. Los 13 modelos de Mistral llevan la misma etiqueta de 100 millones porque es una sola cuota de cuenta repetida en trece filas, no trece concesiones separadas. El router las mete todas en el mismo grupo (mistral::experiment-pool) y luego las suma como si fueran independientes.

La leyenda que hay justo debajo de la barra ya imprime la cifra correcta por bolsa. La cabecera de Mistral dice 100.0M/mo mientras el titular que tiene encima ha contado esos mismos 100 millones trece veces.

Y es reproducible: al añadir una clave de Cloudflare Workers AI (bolsa de 45M, 21 modelos en el catálogo), el titular saltó de 1.820 millones a 2.370 millones. Medio millar de millones de tokens que no existen, materializados por una clave.

⚠️ Ojo con lo que estoy diciendo y lo que no. La issue #1065 documenta el cálculo de la barra del panel, no el de los 7.400 millones del README. Pero es la misma operación conceptual: sumar cuotas por modelo en vez de por cuenta. Nadie ha publicado un desglose auditado del titular.

Que conste que el proyecto es consciente del asunto: hay una issue anterior, la #905, sobre un panel de cuota agregada “con criterio de deduplicación de bolsas”, y está cerrada. El problema es que la deduplicación no llegó a la barra que todo el mundo mira.

¿Qué se dice de FreeLLMAPI en los foros en inglés?

Nada. Y ese silencio se puede medir.

Busqué en el índice de Hacker News vía la API de Algolia. Hay dos envíos:

  • “FreeLLMAPI – One key. One billion free LLM tokens. Every month”, del 22 de mayo de 2026: 2 puntos, 0 comentarios.
  • “Free LLM API – every free model behind one key”, del 15 de agosto de 2026: 4 puntos, 0 comentarios.

Seis puntos combinados. Ningún hilo. Ninguna crítica técnica, ninguna defensa, ninguna de esas discusiones de 300 mensajes que Hacker News dedica a cualquier router de LLM que se precie.

En Reddit tampoco encontré discusión indexada en las comunidades donde este proyecto debería haber explotado: r/LocalLLaMA, r/selfhosted, r/ChatGPTCoding. Las búsquedas devuelven proyectos de nombre parecido, listas curadas de APIs gratuitas y alternativas, pero no un hilo sobre este repositorio.

¿Cómo se sostiene eso con 22.400 estrellas?

Mi lectura: las estrellas de este proyecto vienen de agregadores de “awesome lists”, de vídeos de YouTube, de canales de Telegram y de artículos-tutorial, no de comunidades donde alguien te va a preguntar por el desglose de la cifra. Es un repositorio con enorme alcance y muy poca fricción crítica.

Y cuando un proyecto no tiene fricción crítica en su propio idioma, hay que ir a buscarla a otro.

La señal sobre una herramienta casi nunca está donde más ruido hay. Cada domingo seleccionamos 12 recursos sobre programación con IA para +6.700 developers. Gratis, desde 2018.

Quiero esa dinamita 🧨

¿Y qué se dice en los foros y blogs en chino?

Bastante más, y con más matiz. La comunidad china lo ha adoptado y lo ha diseccionado a fondo.

Lo que hay:

  • Zhihu tiene al menos dos artículos largos. Uno técnico, “FreeLLMAPI:一个 Endpoint 聚合 16 家免费大模型,月享 17 亿 Token,这篇拆解讲透它的设计哲学” (desmonta su filosofía de diseño). Y otro crítico, titulado “实测爆火FreeLLMAPI!聚合16家AI免费额度,白嫖真香但别被噱头坑了”, que se traduce más o menos como “probado a fondo: agregar 16 cuotas gratis sabe de maravilla, pero que no te engañe el reclamo”.
  • V2EX tiene un hilo, el 1222796, con 1.702 visitas y cero respuestas. El mismo silencio que en Hacker News.
  • CSDN, Juejin, Tencent Cloud y varios blogs técnicos tienen guías de instalación con desglose del algoritmo de routing.
  • Existe un fork con la interfaz traducida al chino (zhangguoguo1314/freellmapi, descrito como 汉化版).
  • De las últimas 100 issues del repositorio, 15 están escritas en chino. Hay peticiones de tutorial para QwenPaw, de soporte para modelos de vídeo de SiliconFlow, y una que pide poder pagar el plan premium con WeChat Pay o Alipay.
  • El README tiene versión oficial en 简体中文 y el panel soporta 50 idiomas, español incluido.

Esa última petición dice más que cualquier métrica: cuando tus usuarios piden métodos de pago locales, es que los tienes.

Hay también un detalle incómodo. Los artículos-tutorial chinos que revisé (el de javabetter.cn, por ejemplo) explican el algoritmo de enfriamiento con detalle (2 minutos, 10 minutos, 1 hora, 24 horas) y no mencionan ni una vez el riesgo de bloqueo de cuenta ni las restricciones de los términos de servicio. El único sitio donde aparece esa conversación es en la reseña crítica de Zhihu. La misma asimetría que en inglés: mucho tutorial, poca auditoría.

¿Qué encontró la reseña crítica china al probarlo?

La reseña de Zhihu que citaba arriba señala cuatro cosas que ningún tutorial menciona, y todas coinciden con lo que documenta el propio repositorio:

La latencia es una lotería. Cifra un abanico que va de unos 300 ms con Gemini Flash a unos 5 segundos con un modelo poco frecuentado de OpenRouter. No eliges: te toca el que esté disponible. La documentación del proyecto lo confirma con otras palabras: “Cerebras y Groq son extremadamente rápidos; otros no. Te toca el que esté disponible”.

Hay una trampa en el arranque. Después de añadir una clave hay que esperar a que el chequeo de salud complete una ronda antes de que el router la use. Si llamas a la API justo después de añadirla, te puede responder que no hay modelos disponibles. Ese detalle solo aparece cuando alguien lo prueba.

Es monousuario por diseño. No sirve para concurrencia de equipo. Y esto no es interpretación: la documentación de arquitectura lo lista en “no soportado todavía” como “per-user billing / multi-tenant auth — single-user by design”.

El cumplimiento es zona gris. Aquí la reseña china y la documentación oficial dicen lo mismo.

Depende del proveedor, y el proyecto tiene el detalle de decírtelo en su propia cara. En docs/architecture.md hay una revisión de términos de servicio proveedor por proveedor, fechada en mayo de 2026. Esto es lo más valioso del repositorio y casi nadie lo cita.

Proveedor Veredicto Motivo
Groq ✅ Probablemente OK El acuerdo de servicio permite integración en aplicaciones
Cerebras ✅ Probablemente OK Permitido; prohíbe vender o transferir claves
Mistral ✅ Probablemente OK Uso personal o interno de negocio permitido
OpenRouter ✅ Probablemente OK Proxy privado monousuario sigue estando bien
Zhipu ✅ Probablemente OK Excepción para investigación personal/no comercial
Ollama Cloud ✅ Probablemente OK Plan gratuito permite acceso, 1 concurrente
Google Gemini ⚠️ Precaución Los términos de marzo de 2026 lo acotan a “fines profesionales o de negocio, no para uso de consumidor”
Cloudflare Workers AI ⚠️ Ambiguo Sin cláusula anti-proxy, pero sin permiso explícito
NVIDIA NIM ⚠️ Precaución Términos de prueba: “solo evaluación, no producción”
GitHub Models ⚠️ Precaución Plan gratuito acotado a “experimentación” y “prototipado”
Z.ai ⚠️ Precaución Cláusula contra la redirección de tráfico
Cohere ❌ Evitar Los términos §14 prohíben “fines personales, familiares o domésticos”

Ese ❌ de Cohere tiene una ironía redonda. El único proveedor que hay que evitar no es por hacer un uso comercial encubierto. Es por lo contrario: sus términos prohíben el uso personal, que es justo el único uso que esta herramienta declara soportar.

Las cuatro reglas que el propio proyecto propone para no meterte en un lío son sensatas y cortas:

  1. Una cuenta por proveedor. Nada de granjas de cuentas.
  2. Nada de revender el acceso.
  3. Nada de compartir tu endpoint con otras personas.
  4. No machaques un plan gratuito como si fuera tu backend de producción.

🛡️ Si estás pensando “esto lo monto en un VPS y le doy la URL a mi equipo”, acabas de romper las reglas 3 y 4 de golpe. La documentación es explícita: “Local-first. No hay autenticación multiinquilino. Móntalo para ti; no lo expongas a internet.”

Y el descargo de responsabilidad del README no se esconde en letra pequeña. Dice, en negrita: “Este proyecto es para experimentación personal y aprendizaje, no para producción”. Y remata: “Si construyes algo real sobre FreeLLMAPI, cambia a una API de pago antes de lanzarlo”.

Ese descargo es más honesto que la mayoría de los artículos que promocionan el proyecto.

¿Cómo funciona el router por dentro?

Esta es la parte que justifica las estrellas. Quitando la cifra de portada, la ingeniería tiene cosas que están bien pensadas.

Seis estrategias de routing que puedes cambiar desde el panel: priority (tu orden manual), balanced, smartest, fastest, reliable y custom con tus propios pesos. Por debajo hay un bandit con muestreo de Thompson que puntúa velocidad, capacidad, margen de límite de tasa y errores recientes con mediciones en vivo.

Enfriamiento escalonado. Cuando una clave se topa con un límite, entra en enfriamiento progresivo: 2 minutos, 10 minutos, 1 hora, 24 horas. Es una defensa razonable contra machacar a un proveedor que ya te ha dicho que no.

Sesiones pegajosas de 30 minutos. Una conversación multivuelta sigue hablando con el mismo modelo durante media hora para evitar el pico de alucinación que provoca cambiar de modelo a mitad de conversación. Este detalle me parece de los mejores del proyecto: alguien se ha comido ese problema en producción.

Rescate de tool calls. Los modelos que emiten llamadas a herramientas como texto plano en vez de JSON estructurado se reconvierten a tool_calls reales de forma automática. Y las peticiones con herramientas solo se enrutan a modelos que las soportan.

El ledger aprende. Los límites que un proveedor reporta en el cuerpo de un error o en las cabeceras de cuota (un 413 de Groq nombrando su límite de TPM) aprietan los límites internos del router de forma automática.

Nada de esto es trivial. Si has peleado con cómo repartir el trabajo entre varios modelos sabes que el 80% del dolor está justo en estos detalles.

Tu IA puede mentirte

El mismo método de auditoría, aplicado a lo que escribe tu agente

Comprobar la cifra de un README es sencillo comparado con verificar 300 líneas que no has escrito tú. Te llevas el ciclo anticaos, pruebas con Playwright, casos Gherkin y revisión adversarial entre modelos.

Destripar el método →

Métodos en directo + casos Gherkin · Acceso con suscripción Web Reactiva Premium

¿Qué se rompe de verdad? Lo que dicen las issues

Las 78 issues abiertas son el mejor termómetro que existe de un proyecto. Estas son las que más me llamaron la atención:

La cadena de fallback tiene problemas. La issue #1047 se titula “Custom Fallback chains are STILL unpolished” (con el “STILL” en mayúsculas) y es continuación de la #1021, “Fallback chains are a TAD broken”. El reporte es concreto y doloroso: cada vez que cambia de cadena para editarla tiene que recargar la página, el botón de activar se queda en gris unos cinco minutos antes de cambiar, y la carga de modelos y cadenas se arrastra. Cierra con un ruego que entiendo: “Ojalá que después de arreglar esto, quien lo haga lo pruebe él mismo para asegurarse de que está pulido”.

Que la cadena de failover cojee es más grave que en otro proyecto cualquiera. El failover es el producto. Sin él esto es una lista de claves en un archivo.

Las salidas estructuradas no siempre se enrutan bien. La issue #933 reporta que con el endpoint auto, las respuestas JSON estructuradas fallan a menudo: FreeLLMAPI no parece detectar qué modelos las soportan y enrutar en consecuencia. Si tu caso de uso depende de response_format, esto te afecta.

Un modelo puede bloquear el pozo entero. La issue #952, en chino, pide poder activar y desactivar la “presión de routing” porque un problema puntual le deja todo el pool de claves inmóvil.

El chequeo de salud reañade modelos que no quieres. La #926 lo describe tal cual: cuando comprueba la clave, mete en la lista todos los modelos, incluidos los que habías quitado.

Todo esto es normal en un 0.9.0, y las 22.400 estrellas tapan justo ese dato: el proyecto todavía no ha llegado a la versión 1.0.

¿Cuánto cuesta lo gratis?

19 dólares al año, o 49 de por vida. Y lo que compras no es acceso: es frescura.

El router sincroniza su catálogo de modelos desde un feed firmado con Ed25519 dos veces al día. Las instalaciones gratuitas reciben una instantánea mensual, así que un modelo nuevo les llega 30 días después de estar disponible. Las premium lo reciben el mismo día.

Ese detalle es más importante de lo que parece, y la propia documentación explica por qué: “Los planes gratuitos pueden cambiar sin previo aviso. Los proveedores endurecen, aflojan o eliminan planes gratuitos con regularidad. Cuando eso pasa verás 429 o errores de autenticación hasta que la actualización del catálogo te llegue”.

Traducido: en la versión gratuita, puedes pasarte hasta un mes recibiendo errores por un cambio que ya está arreglado en el feed. El modelo de negocio no es cobrar por el software, que es MIT y está entero en GitHub. Es cobrar por saber, hoy, qué planes gratuitos siguen siendo lo que dicen ser.

Es un modelo legítimo. Pero cámbiale el marco: no estás pagando por una herramienta, estás pagando una suscripción de inteligencia de mercado sobre planes gratuitos volátiles. Que es un producto bastante más raro y bastante más interesante.

El mapa de lo que es gratis en IA cambia cada semana y ningún README lo cuenta entero. En la newsletter compartimos lo que vamos probando y lo que aportan los +6.700 developers que participan.

Apúntate gratis →

¿Qué pasa con la calidad de los modelos según avanza el día?

Baja. Y el proyecto lo dice sin rodeos, que es de agradecer.

La documentación de arquitectura lo explica así: los modelos mejor rankeados de tu cadena son justo los que tienen los límites diarios más bajos. Cuando se agotan, el router va cayendo por la cadena de prioridad hacia modelos más pequeños y flojos. “Espera que la inteligencia efectiva del endpoint baje en las últimas horas de cada día, y luego se reinicie a medianoche UTC.”

Eso significa que el mismo prompt, con la misma configuración, te da una respuesta distinta a las nueve de la mañana que a las once de la noche. Si estás evaluando algo o comparando salidas, esa varianza te va a volver loco sin que sepas de dónde viene.

Sobre los modelos de frontera hay un matiz. El catálogo sí lleva filas de primer nivel: la documentación menciona GPT-5.x, Grok 4.x, Kimi K3, DeepSeek V4 Pro y Gemini 3.x en el plan gratuito de alguien. Lo que no tienes es acceso sostenido, porque son justo las filas con las cuotas diarias más pequeñas, las colas más largas y más probabilidad de desaparecer sin aviso. Si tu interés es probar modelos de pesos abiertos con calma, hay caminos menos frágiles.

¿Para quién sirve FreeLLMAPI y para quién no?

Aquí va mi veredicto, sin rodeos.

Te sirve si:

  • Quemas tokens experimentando y ya tienes cinco o seis claves gratuitas repartidas por archivos .env que no encuentras.
  • Estás construyendo prototipos que no van a ver un usuario real.
  • Te da igual qué modelo te responda mientras responda algo decente.
  • Quieres un panel donde ver de una vez cuánta cuota gratuita tienes viva.
  • Te interesa leer un router de LLM bien escrito en TypeScript. El código merece el rato.

No te sirve si:

  • Tienes usuarios. Ninguno. Ni de pago ni gratis.
  • Necesitas resultados reproducibles: la varianza a lo largo del día te va a arruinar cualquier evaluación.
  • Dependes de salidas estructuradas fiables (ver issue #933).
  • Quieres montarlo para tu equipo: es monousuario por diseño y compartirlo rompe los términos de varios proveedores.
  • Tu único objetivo es ahorrar dinero en una aplicación que ya funciona. Para eso, afinar cómo gastas los tokens te va a dar más que apilar planes gratuitos.

💡 La forma sana de mirar esto: FreeLLMAPI no es una alternativa barata a una API de pago. Es un banco de pruebas. En el momento en que empiezas a depender de que responda, ya lo estás usando mal.

¿Cómo probarlo en diez minutos sin liarla?

Si después de todo esto quieres verlo con tus ojos, el camino corto pasa por Docker.

# Descarga el instalador. Léelo antes de ejecutarlo, que es sano.
curl -fsSL https://freellmapi.co/install.sh -o install.sh
less install.sh

# Cuando lo hayas revisado
bash install.sh

El script crea ~/freellmapi, genera una clave de cifrado, descarga la imagen y arranca el contenedor. Volver a ejecutarlo es seguro: preserva tu .env y actualiza la imagen.

Luego abres http://localhost:3001, añades tus claves en la pestaña Keys, reordenas la Fallback Chain a tu gusto y copias tu clave unificada.

Apuntar tu código ahí es cambiar dos líneas:

from openai import OpenAI

# Todo tu código existente sigue igual, solo cambia el destino
client = OpenAI(
    base_url="http://localhost:3001/v1",
    api_key="freellmapi-tu-clave-unificada",
)

respuesta = client.chat.completions.create(
    model="auto",  # el router elige por ti
    messages=[{"role": "user", "content": "Explícame qué es un cuello de botella"}],
)
print(respuesta.choices[0].message.content)

Tres cosas que te vas a encontrar y conviene saber de antemano:

  1. Espera a que termine el primer chequeo de salud antes de lanzar peticiones, o te dirá que no hay modelos disponibles.
  2. No te creas la barra de presupuesto mensual. Mira la leyenda de debajo, que es la que trae los números por bolsa buenos.
  3. Salta Cohere si te tomas en serio la tabla de términos de servicio.

TL;DR

  • 🚀 FreeLLMAPI apila los planes gratuitos de 34 proveedores tras un endpoint compatible con OpenAI. 22.401 estrellas en cuatro meses, MIT, TypeScript, y todavía en la versión 0.9.0.
  • ⚠️ La cifra de 7.400 millones de tokens es un cuentakilómetros que sube con cada proveedor añadido. La issue #1065 demuestra que el panel cuenta bolsas compartidas una vez por modelo: 2.370 millones mostrados frente a 294 millones reales. Ocho veces.
  • 🌏 En inglés, silencio: dos envíos a Hacker News con 6 puntos y 0 comentarios entre ambos. En chino, análisis técnicos, una reseña crítica en Zhihu, un fork traducido y el 15% de las issues recientes.
  • 🛡️ El repositorio incluye una revisión de términos de servicio proveedor por proveedor. Cohere marca ❌ porque sus términos prohíben el uso personal. Google, NVIDIA, GitHub Models y Z.ai marcan ⚠️.
  • 🎯 Úsalo para prototipar y para dejar de perder claves. No lo uses con usuarios, ni para evaluaciones reproducibles, ni compartido con tu equipo. El propio README te lo dice.

Preguntas frecuentes sobre FreeLLMAPI

¿FreeLLMAPI me da tokens gratis sin registrarme en ningún sitio?
No. Es un router local, no un servicio hospedado. Tienes que crear tus propias cuentas en Google, Groq, Mistral y el resto, y meter tus claves. Lo que aporta es unificar todas esas claves detrás de un solo endpoint compatible con OpenAI.

¿Son reales los 7.400 millones de tokens al mes?
Es la suma de los planes gratuitos anunciados de 34 proveedores, no una capacidad medida. La issue #1065 documenta que el panel del propio proyecto infla el cálculo ocho veces al contar bolsas compartidas una vez por modelo. Trata la cifra como un techo teórico muy optimista.

¿Puedo usar FreeLLMAPI en producción?
El README lo desaconseja de forma explícita: “para experimentación personal y aprendizaje, no para producción”. No hay SLA, la latencia varía mucho, y la calidad efectiva baja según se agotan las cuotas diarias hasta que se reinician a medianoche UTC.

¿Me pueden banear la cuenta por usarlo?
El riesgo existe y depende del proveedor. La revisión de términos de servicio del proyecto marca Cohere como “evitar”, y Google Gemini, NVIDIA NIM, GitHub Models y Z.ai como “precaución”. Las reglas para no tener problemas son: una cuenta por proveedor, sin reventa, sin compartir tu endpoint y sin usarlo como backend de producción.

¿Funciona con Claude Code y otros agentes de código?
Sí. Trae scripts de configuración automática para Claude Code, Codex CLI, Cline, Continue, Aider, OpenCode, Goose, Qwen Code, Roo, Kilo, Crush y Cursor. Expone además la API de mensajes de Anthropic y el formato nativo de Gemini, no solo /v1 de OpenAI.

¿En qué se diferencia de OpenRouter?
OpenRouter es un servicio hospedado que te cobra por uso y te da un catálogo enorme con una sola cuenta. FreeLLMAPI se ejecuta en tu máquina, no cobra por token y solo usa tus propias cuotas gratuitas, incluida la de OpenRouter. Uno es proveedor, el otro es un cajón organizado de proveedores.

¿Qué se paga con la suscripción de 19 dólares al año?
La frescura del catálogo. Las instalaciones gratuitas reciben una instantánea mensual, así que un modelo nuevo o un arreglo de compatibilidad tarda hasta 30 días en llegarles. Las premium lo reciben el mismo día. El software en sí es MIT y gratuito.

¿Puedo montarlo en un VPS para mi equipo?
Técnicamente sí, pero rompe dos reglas a la vez. La documentación dice que es monousuario por diseño y que no lo expongas a internet, y compartir tu endpoint con otras personas contradice los términos de varios proveedores. Para un equipo, una pasarela de pago es el camino correcto.

¿Por qué mis respuestas empeoran por la noche?
Porque tus modelos mejor puntuados suelen ser los que tienen los límites diarios más bajos. Cuando se agotan, el router cae por la cadena de prioridad hacia modelos más pequeños. La documentación lo describe como una bajada de “inteligencia efectiva” que se reinicia a medianoche UTC.

¿Merece la pena si ya tengo una API de pago?
Como sustituto, no. Como banco de pruebas, puede que sí: te deja probar 34 proveedores sin sumar coste y sin repartir claves por media docena de archivos de configuración. En el momento en que necesites que algo responda siempre, vuelve a la API de pago.

Fuentes

🧨 Última oprtunidad para recibir la dinamita que mereces sobre programación con IA el próximo domingo: Suscríbete gratis a Web Reactiva en https://webreactiva.com/newsletter

Imagen de Daniel Primo
Claude, IA de Anthropic

Escrito con la ayuda de la IA generativa de Claude, fuentes fidedignas y con un human in the loop:
Dani Primo.

CEO en pantuflas de Web Reactiva. Programador y formador en tecnologías que cambian el mundo y a las personas. Activo en linkedin, en substack y canal @webreactiva en telegram

12 recursos para developers cada domingo en tu bandeja de entrada

Además de una skill práctica bien explicada, trucos para mejorar tu futuro profesional y una pizquita de humor útil para el resto de la semana. Gratis.