Claves API de LLM de código abierto gratuitas en 2026: comparativa de 6 proveedores

Claves API de LLM de código abierto gratuitas en 2026: comparativa de 6 proveedores

Sí: varios proveedores te dan una clave API gratuita para llamar a LLM de código abierto, pero «gratis» se divide en tres ofertas muy diferentes: un nivel gratuito permanente con límites de tasa que nunca caduca, un crédito de registro único que se agota, o pesos de modelo que tienes que descargar y alojar tú mismo. A continuación se presentan 6 proveedores activos a partir de agosto de 2026, ordenados según la categoría en la que caen, para que puedas elegir según cuánto tiempo necesites realmente acceso gratuito, en lugar de llevarte la sorpresa de una factura en la tercera semana.

Respuesta corta: sí, con tres tipos de «gratis»

Si quieres una clave hoy y no quieres introducir una tarjeta, OpenRouter y Groq ofrecen ambos acceso gratuito permanente sin caducidad: solo tienes que aceptar los límites de tasa. Si necesitas mayor rendimiento temporalmente, Together AI, Novita AI y Hugging Face te dan créditos o modelos gratuitos al principio, y luego te cobran una vez superado ese margen. Si no quieres depender en absoluto del tiempo de actividad ni de los cambios de precios de ningún proveedor, los modelos de peso abierto se pueden descargar directamente del Hugging Face Hub y ejecutarlos en tu propio hardware; eso no es una llamada API al servicio alojado de Hugging Face, pero es la única opción que es gratis para siempre y sin límite de tasa.

Forma gratuita 1: API de LLM con nivel gratuito permanente (con límite de tasa, sin caducidad)

Estas no piden datos de pago y no se apagan después de un período de prueba. El inconveniente es el rendimiento, no el tiempo.

OpenRouter te permite llamar a cualquier modelo etiquetado como :free en su catálogo sin añadir créditos, con un límite de 20 solicitudes por minuto y 50 solicitudes por día. Si compras $10 en créditos (una sola vez, no caducan), el límite diario sube a 1,000 solicitudes, mientras que el límite por minuto no cambia. Al momento de escribir esto, OpenRouter lista 17 modelos con el sufijo :free, incluyendo GLM-5.2 de Z.ai, Gemma 4 de Google (variantes de 26B y 31B) y varios modelos Nvidia Nemotron. (Comprobado el 2026-08-18 mediante openrouter.ai/api/v1/models y la documentación de límites de tasa de la plataforma en openrouter.ai/docs/api_reference/limits.)

Groq no exige tarjeta de crédito para su nivel gratuito ni lo limita a una ventana de prueba, pero cada modelo tiene sus propios límites de solicitudes y tokens por minuto y por día. Por ejemplo, openai/gpt-oss-120b está limitado a 30 solicitudes/minuto, 1,000 solicitudes/día, 8,000 tokens/minuto y 200,000 tokens/día en el nivel gratuito; los modelos de texto pequeños, como las variantes Llama Prompt Guard, obtienen techos de tokens mucho más altos (500K tokens/día). Los clientes de pago del nivel “on-demand” obtienen aproximadamente 30-40 veces más margen de solicitudes y tokens, pero el nivel gratuito en sí no caduca. (Comprobado el 2026-08-18 mediante la tabla de límites de tasa publicada por Groq.)

Novita AI mantiene un conjunto rotatorio de modelos de peso abierto con un precio de $0 por token como parte permanente de su catálogo, en lugar de una promoción limitada en el tiempo; actualmente Qwen3.5-Plus, Qwen3.6-Plus y Bunny, cada uno con precio de entrada/salida 0/0 según la lista de modelos en vivo. Esto es independiente de la recopilación dedicada de modelos gratuitos de Novita que cubre Llama, Qwen, GLM y BGE-M3, y también es independiente del programa de referidos de la plataforma que se describe más abajo. La selección de modelos del nivel gratuito rota a medida que se lanzan nuevos modelos y los más antiguos pasan a tener precio de pago, así que consulta el catálogo en vivo en lugar de asumir que un modelo específico se mantiene gratis. (Comprobado el 2026-08-18 mediante api.novita.ai/openai/v1/models.)

Forma gratuita 2: API de LLM con crédito de registro (cantidad limitada, luego pagas)

Este es el «gratis» más común con el que te encontrarás, y es el que sorprende a la gente: el contador está corriendo desde el primer día, solo que empieza en cero.

El programa de referidos de Novita AI otorga $10 en créditos de API de LLM tanto al referidor como al nuevo registro, con un límite declarado de hasta $500 en total obtenibles mediante referidos. Es una recarga de cartera, no un nivel con límite de tasa: una vez que se gastan los $10, se aplica el precio estándar por token. (Comprobado el 2026-08-18 mediante novita.ai/referral.)

Together AI eliminó su prueba gratuita general en un cambio de facturación de julio de 2025; ahora las cuentas nuevas necesitan un saldo prepagado mínimo de $5 antes de hacer llamadas. Sin embargo, ofrece endpoints de modelos específicos con un precio de $0.00/1M tokens fuera de ese requisito prepagado, como Prism-ML’s Ternary-Bonsai-27B, un modelo de peso abierto de 27B con una ventana de contexto de 262K. Las startups también pueden solicitar por separado hasta $50,000 en créditos a través de su programa Startup Accelerator, que es un proceso de solicitud, no un beneficio de registro. (Comprobado el 2026-08-18 mediante el bloque de precios de together.ai/models/prism-ml-ternary-bonsai-27b y la documentación de facturación de Together.)

Hugging Face’s Inference Providers es una API alojada: la llamas de forma remota con un token de acceso de Hugging Face, de la misma manera que llamarías a OpenRouter o Together AI, y Hugging Face enruta la solicitud al proveedor subyacente y te factura. Cada cuenta gratuita recibe automáticamente $0.10 al mes en crédito, que se eleva a $2.00/mes en el plan PRO de $9/mes. Eso es suficiente para pruebas ligeras de modelos pequeños, no para tráfico de producción; el crédito se renueva mensualmente en lugar de ser una concesión única, pero es una cantidad tan pequeña que la mayoría de las cargas de trabajo reales lo agotan en unas pocas solicitudes. (Comprobado el 2026-08-18 mediante huggingface.co/docs/api-inference/en/pricing.)

DeepInfra anuncia «$10 USD gratis al mes» en su página de precios, estructurado como una asignación mensual recurrente en lugar de un bono único de registro. (Comprobado el 2026-08-18 mediante deepinfra.com/pricing.)

Forma gratuita 3: LLM de código abierto autoalojados (sin API, sin factura, sin límite de tasa)

Esto no es una clave API en absoluto: es descargar los pesos del modelo tú mismo y ejecutarlos en hardware que controlas, mediante algo como vLLM, Ollama o llama.cpp. El Hugging Face Hub es el punto de distribución principal para los lanzamientos de peso abierto (Llama, Qwen, GLM y la mayoría de las otras familias de código abierto publican pesos allí), lo cual es algo separado de la API alojada Inference Providers de Hugging Face que se describió anteriormente; el Hub solo aloja los archivos. Pagas por cómputo en lugar de tokens, y no hay límite de tasa porque no hay un servicio compartido, pero eres responsable de la GPU, el stack de servidores y el tiempo de actividad. Esta vía tiene sentido si necesitas disponibilidad garantizada o si procesas un volumen suficiente como para que una GPU alquilada sea mejor que el precio por token; es la elección equivocada si solo quieres probar un modelo esta tarde.

Comparativa de proveedores gratuitos de API de LLM

Proveedor Tipo de gratis Qué obtienes ¿Caduca?
OpenRouter Nivel gratuito permanente 50 solicitudes/día (o 1,000/día tras comprar $10 en créditos), 20 solicitudes/min, solo modelos :free No
Groq Nivel gratuito permanente Límites RPM/RPD/TPM/TPD por modelo, p. ej., 1,000 solicitudes/día en gpt-oss-120b No
Novita AI (modelos de nivel gratuito) Nivel gratuito permanente Modelos abiertos seleccionados a $0/M tokens, catálogo rotatorio No, pero la lista de modelos cambia
Novita AI (referidos) Crédito de registro $10 en créditos por referido, tope de $500 en total Sí, una vez gastado
Together AI Crédito de registro + endpoints gratuitos Mínimo prepagado de $5 para uso general; endpoints de modelos específicos a $0.00/M (p. ej., Ternary-Bonsai-27B) Endpoints gratuitos: no. Crédito general: ninguno ofrecido desde jul 2025
Hugging Face (Inference Providers, API alojada) Crédito de registro (mensual) $0.10/mes gratis, $2.00/mes en PRO Se renueva mensualmente, cantidad pequeña
DeepInfra Crédito de registro (mensual) $10 USD gratis al mes Se renueva mensualmente
Autoalojado (pesos del Hugging Face Hub) Sin API Pesos completos del modelo, ejecútalos en tu propia GPU Nunca, pero tampoco hay beneficio de API/límite de tasa

¿Qué API de LLM gratuita deberías usar realmente?

Si estás creando un prototipo y quieres una configuración sin fricciones, empieza con OpenRouter o Groq: sin tarjeta, sin caducidad, y sabrás en una hora si el límite de tasa es una restricción real para tu caso de uso. Si estás construyendo algo que necesita un rendimiento constante antes de estar listo para pagar, un crédito de registro como los $10 de referidos de Novita AI o los endpoints de modelos con precio $0.00 de Together AI te dan un margen de prueba real sin los estrictos límites por minuto que imponen los niveles gratuitos permanentes. Si ya estás comprometido con un modelo específico y necesitas que funcione indefinidamente sin depender de los límites de tasa o cambios de precios de ningún proveedor, descarga los pesos del Hugging Face Hub y autoalójalo.

Nada de esto es «gratis para siempre sin límites»: esa combinación no existe para las API alojadas, porque alguien está pagando por el tiempo de GPU subyacente. Los niveles gratuitos permanentes limitan las solicitudes en lugar de los dólares; los créditos de registro limitan los dólares en lugar de las solicitudes; el autoalojamiento elimina ambos límites, pero te entrega la factura de infraestructura y el trabajo operativo a cambio.

Conclusión

Sí: hoy existen API de LLM de código abierto gratuitas, pero «gratis» es una etiqueta que cubre tres ofertas diferentes, no una sola. Los niveles gratuitos permanentes (OpenRouter, Groq, los modelos rotatorios de Novita AI con precio $0) nunca caducan, pero limitan el rendimiento de solicitudes o tokens. Los créditos de registro (referidos de Novita AI, endpoints exentos de prepago de Together AI, Hugging Face, DeepInfra) te dan una asignación real en dólares que se agota una vez que la superas. Autoalojar pesos abiertos desde el Hugging Face Hub elimina ambos tipos de límites por completo, a costa de ejecutar y pagar la GPU tú mismo. Cuál es «la opción gratuita» para ti depende de si tu restricción son los límites de tasa, un tope de gasto o la independencia a largo plazo de las decisiones de precios de cualquier proveedor; no de encontrar un único proveedor que evite las tres compensaciones a la vez, porque actualmente ninguno lo hace.

Preguntas frecuentes

¿Las API de LLM de código abierto son realmente gratuitas o siempre hay alguna trampa?

Siempre hay una trampa, y una de tres formas: un límite de solicitudes por día/minuto que nunca caduca (OpenRouter, Groq), un crédito en dólares que se agota (referidos de Novita AI, mínimo de $5 de Together AI, Hugging Face, DeepInfra), o el requisito de autoalojar en tu propio hardware. Saber qué forma vas a obtener antes de construir sobre ella evita la factura sorpresa o el error 429 sorpresa.

¿Qué proveedor tiene el nivel gratuito permanente más generoso?

El nivel gratuito de Groq ofrece techos de tokens más altos en algunos modelos —hasta 200,000 tokens/día en gpt-oss-120b y 500,000 tokens/día en modelos guard más pequeños— en comparación con el límite plano de 50 solicitudes/día de OpenRouter antes de añadir créditos. Cuál gana para ti depende de si tu cuello de botella es el número de solicitudes o el volumen de tokens; una aplicación de chat con intercambios cortos alcanza primero el límite de solicitudes de OpenRouter, mientras que una carga de trabajo de resumen por lotes alcanza primero los límites de tokens.

¿Puedo combinar niveles gratuitos de varios proveedores para obtener más capacidad?

Sí, y es un patrón común para pruebas: enruta tráfico diferente a los niveles gratuitos de distintos proveedores en lugar de depender de uno solo. Ten en cuenta que la selección de modelos del nivel gratuito cambia con el tiempo (un modelo que hoy es :free en OpenRouter puede no serlo el próximo trimestre), así que diseña con conmutación por error entre proveedores en lugar de fijar un ID de modelo gratuito específico.

¿El crédito de referido de $10 de Novita AI es lo mismo que sus modelos de nivel gratuito?

No, son cosas separadas. El programa de referidos es un crédito único de $10 para la facturación estándar por token, con un tope de $500 en total entre todos los referidos. Los modelos de nivel gratuito son entradas específicas del catálogo con un precio de $0 por token de forma continua, independientemente de si has usado un código de referido. Consulta el catálogo de modelos en vivo para ver qué modelos tienen actualmente un precio de $0, ya que esa lista rota a medida que se lanzan nuevos modelos.

Si autoalojo un modelo de código abierto, ¿es realmente gratis?

Los pesos del modelo son gratuitos de descargar, pero ejecutarlos no lo es: estás pagando por cómputo de GPU, almacenamiento y tu propio tiempo de actividad en lugar del precio por token de una API. Para tráfico bajo y constante, esto suele ser más caro que un nivel de API de pago una vez que se tiene en cuenta el tiempo inactivo de la GPU; se vuelve rentable principalmente con un volumen alto y predecible, o cuando necesitas una localidad de datos garantizada.

Artículos recomendados