Chaves de API de LLM Open-Source Gratuitas em 2026: 6 Provedores Comparados

Chaves de API de LLM Open-Source Gratuitas em 2026: 6 Provedores Comparados

Sim — vários provedores oferecem uma chave de API gratuita para chamar LLMs open-source, mas “grátis” se divide em três ofertas bem diferentes: um nível gratuito permanente com limites de taxa que nunca expira, um crédito de inscrição único que se esgota, ou pesos de modelo que você precisa baixar e hospedar por conta própria. Abaixo estão 6 provedores ativos em agosto de 2026, organizados por categoria, para que você escolha com base em quanto tempo realmente precisa de acesso gratuito, evitando surpresas com uma fatura na terceira semana.

Resposta Rápida: Sim, Com Três Tipos de “Grátis”

Se você quer uma chave hoje e não quer inserir cartão de crédito, o OpenRouter e o Groq oferecem acesso gratuito permanente sem data de expiração — você apenas convive com limites de taxa. Se você precisa de maior taxa de transferência temporariamente, Together AI, Novita AI e Hugging Face concedem créditos gratuitos ou modelos gratuitos para começar, e depois cobram quando você ultrapassa essa cota. Se você não quer depender da disponibilidade ou de mudanças de preço de nenhum provedor, modelos de peso aberto podem ser baixados diretamente do Hugging Face Hub e executados no seu próprio hardware — isso não é uma chamada de API para o serviço hospedado do Hugging Face, mas é a única opção gratuita para sempre, sem nenhum limite de taxa.

Opção Grátis 1: APIs de LLM de Nível Gratuito Permanente (Com Limites de Taxa, Nunca Expira)

Estes não pedem informações de pagamento e não desligam após um período de teste. A limitação é a taxa de transferência, não o tempo.

OpenRouter permite chamar qualquer modelo marcado com :free em seu catálogo sem adicionar créditos, limitado a 20 requisições por minuto e 50 requisições por dia. Se você comprar $10 em créditos (uma vez, eles não expiram), o limite diário sobe para 1.000 requisições, mantendo o limite por minuto. No momento da redação, o OpenRouter lista 17 modelos com o sufixo :free, incluindo o GLM-5.2 da Z.ai, o Google Gemma 4 (variantes 26B e 31B), e vários modelos Nvidia Nemotron. (Verificado em 2026-08-18 via openrouter.ai/api/v1/models e na documentação de limites de taxa em openrouter.ai/docs/api_reference/limits.)

Groq não exige cartão de crédito para seu nível gratuito e não o restringe a um período de teste, mas cada modelo tem seus próprios limites de requisições e tokens por minuto e por dia. Por exemplo, openai/gpt-oss-120b tem limite de 30 requisições/minuto, 1.000 requisições/dia, 8.000 tokens/minuto e 200.000 tokens/dia no nível gratuito — modelos de texto pequenos, como as variantes do Llama Prompt Guard, têm tetos de tokens muito maiores (500.000 tokens/dia). Clientes pagantes no nível “on-demand” têm aproximadamente 30-40x mais requisições e tokens, mas o nível gratuito em si não expira. (Verificado em 2026-08-18 via a tabela de limites de taxa publicada do Groq.)

Novita AI mantém um conjunto rotativo de modelos de peso aberto com preço de $0 por token como parte permanente de seu catálogo, não como promoção temporária — atualmente Qwen3.5-Plus, Qwen3.6-Plus e Bunny, cada um com precificação 0/0 de entrada/saída conforme a lista de modelos ao vivo. Isso é separado do resumo dedicado de modelos gratuitos da Novita (que cobre Llama, Qwen, GLM e BGE-M3) e também separado do programa de indicação da plataforma abaixo. A seleção de modelos do nível gratuito aqui rotaciona conforme novos modelos são lançados e os antigos passam para precificação paga, então verifique o catálogo ao vivo em vez de assumir que um modelo específico permanece gratuito. (Verificado em 2026-08-18 via api.novita.ai/openai/v1/models.)

Opção Grátis 2: APIs de LLM com Créditos de Inscrição (Quantia Limitada, Depois Você Paga)

Este é o “grátis” mais comum que você encontrará, e é o que pega as pessoas de surpresa — o medidor está correndo desde o primeiro dia, só que começa em zero.

Programa de indicação da Novita AI concede $10 em créditos de API de LLM tanto para o indicador quanto para o novo usuário, com um limite declarado de até $500 no total ganho por indicações. Isso é um saldo na carteira, não um nível com limite de taxa — quando os $10 forem gastos, a precificação padrão por token é aplicada. (Verificado em 2026-08-18 via novita.ai/referral.)

Together AI removeu seu teste gratuito geral em uma mudança de faturamento em julho de 2025 — novas contas agora precisam de um saldo mínimo pré-pago de $5 antes de fazer chamadas. No entanto, ele possui endpoints de modelos específicos precificados a $0,00/1M de tokens fora desse requisito pré-pago, como o Prism-ML’s Ternary-Bonsai-27B, um modelo de peso abeto de 27B com contexto de 262K. Startups também podem se candidatar separadamente para até $50.000 em créditos através do programa Startup Accelerator, que é um processo de inscrição, não um benefício de cadastro. (Verificado em 2026-08-18 via bloco de preços together.ai/models/prism-ml-ternary-bonsai-27b e documentação de faturamento do Together.)

Inference Providers do Hugging Face é uma API hospedada — você a chama remotamente com um token de acesso do Hugging Face, da mesma forma que chamaria OpenRouter ou Together AI, e o Hugging Face roteia a requisição para o provedor subjacente e cobra você. Cada conta gratuita recebe automaticamente $0,10 por mês em crédito, subindo para $2,00/mês no plano PRO de $9/mês. Isso é suficiente para testes leves em modelos pequenos, não para tráfego de produção — o crédito renova mensalmente em vez de ser uma concessão única, mas o valor é tão pequeno que a maioria das cargas de trabalho reais o esgotam em algumas requisições. (Verificado em 2026-08-18 via huggingface.co/docs/api-inference/en/pricing.)

DeepInfra anuncia “$10 USD grátis por mês” em sua página de preços, estruturado como uma cota mensal recorrente, em vez de um bônus de cadastro único. (Verificado em 2026-08-18 via deepinfra.com/pricing.)

Opção Grátis 3: LLMs Open-Source Auto-Hospedados (Sem API, Sem Conta, Sem Limite de Taxa)

Isso não é uma chave de API — é baixar os pesos do modelo você mesmo e executá-los em hardware que você controla, através de algo como vLLM, Ollama ou llama.cpp. O Hugging Face Hub é o ponto de distribuição principal para lançamentos de peso abeto (Llama, Quen, GLM e a maioria das outras famílias open-source publicam pesos lá) — isso é separado da API hospedada Inference Providers do próprio Hugging Face descrita acima; o Hub apenas hospeda os arquivos. Você paga pelo poder computacional em vez de tokens, e não há limite de taxa porque não há serviço compartilhado — mas você é responsável pela GPU, pela pilha de serviço e pelo tempo de atividae. Esse caminho faz sentio se você preciisa de disponibilidad garantida ou está processando volome suficient para que uma GPU alugada seja melhor do que o preço por token; é a esolha errada se você apenas quer testar um modelo esta tarde.

Comparação de Provedores de API LLM Grátis

Provedor Tipo grátis O que você recebe Expira?
OpenRouter Nível gratuito permanente 50 req/dia (ou 1.000/dia após compa de $10 em créditos), 20 req/min, apenas modelos :free Não
Groq Nível gratuito permanente Limites RPM/RPD/TPM/TPD por modelo, ex: 1.000 req/dia no gpt-oss-120b Não
Novita AI (modelos de nível grátis) Nível gratuito permanente Modelos selecionados a $0/M tokens, catálogo rotativo Não, mas a lista de modelos muda
Novita AI (indicação) Crédito de inscrição $10 em créditos por indicação, limite máxmo $500 Sim, assim que gasto
Together AI Crédito de inscrição + endpoints gratuitos Mínimo de $5 pré-pago para uso geral; endpoints específicos a $0,00/M (ex: Ternary-Bonsai-27B) Endpoints gratuitos: não. Crédito geral: nenhum oferecido desde jul/2025
Hugging Face (Inference Providers, API hospedada) Crédito de inscrição (mensal) $0,10/mês grátis, $2,00/mês no PRO Renova mensalmente, quantia pequena
DeepInfra Crédito de inscrição (mensal) $10 USD grátis por mês Renova mensalmente
Auto-hospedagem (pesos do Hugging Face Hub) Sem API Pesos completos do modelo, execute na sua própria GPU Nunca, mas também não há benefício de API/limite de taxa

Qual API LLM Grátis Você Deveria Usar?

Se você está prototipando e quer zro atrito de configuração, comece com OpenRouter ou Groq — sem cartão, sem expiração, e você vai saber em uma hora se o limite de taxa é uma restrição real para seu caso de uso. Se você está construindo algo que preciisa de vazão constnte antes de estar pront para pagar, um crédito de inscrição como os $10 de indicação da Novita AI ou os endpoints de modelo a $0,00 do Together AI compram espaço real de teste sem os limites apertados por minuto que os níveis gratuitos permanentes impõem. Se você já está comprometido com um modelo especíico e preciisa que ele rod indefinidamente sem depender dos limites de taxa ou mudanças de preço de nenhum provedor, baixe os pesos do Hugging Face Hub e auto-hospede.

Nada disso é “grátis para sempre sem limites” — essa combinação não existe para APIs hospedadas, porque alguém está pagando pelo tempo de GPU subjacente. Níveis gratuitos permanentes limitam requisições em vez de dólares; créditos de inscrição limitam dólares em vez de requisições; auto-hospedagem remov ambos os limites, mas entrega a conta de infraestrutura e o trabalho operacional para você.

Conclusão

Sim — APIs gratuitas de LLM open-source existem hoje, mas “grátis” é um rótulo que cobre três ofertas diferentes, não uma só. Níveis gratuitos permanent (OpenRuter, Groq, modelos a $0 rotativos da Novita AI) nunca expirem, mas limitam sua taxa de requsições ou tokens. Créditos de inscrição (indicação da Novita AI, endpoints isentos de pré-pagamento do Together AI, Hugging Face, DeepInfra) dão uma cota em dólares que se esgota quando você a ultrapassa. Auto-hospedagem de pesos abertos do Hugging Face Hub remov ambos os tipos de limite, ao custo de rodar e pagar pela GPU você mesmo. Qua l opção “grátis” é melhor para você dende se sua restrição é limite de taxa, um teto de gastos, ou independência de longo prazo das decisões de preço de qualquer provedor — e não de encontrar um único provedor que evite todos os três tradeofs de uma vez, porque nenhum atualmente o faz.

FAQ

As APIs de LLM open-source são realmente gratuitas, ou sempre há uma pegadinha?

Sempre há um pegadinha, e é uma de três formas: um limite de requisições/dia/minuto que nunca expira (OpenRouter, Groq), um crédito em dólares que acaba (indicação da Novita AI, mínimo de $5 do Together AI, Hugging Face, DeepInfra), ou a exigência de auto-hospedagem no seu próprio hardware. Saber qual forma você está recebendo antes de construir sobre ela evita a surpresa da conta ou o erro 429 inesperado.

Qual provedor tem o nível gratuito permanente mais generoso?

O nível gratuito do Groq dá tetos de token mais altos em alguns modelos — até 200.000 tokens/dia no gpt-oss-120b e 500.000 tokens/dia em modelos de guarda menores — comparado ao limite fixo de 50 requisições/dia do OpenRouter antes de adicionar créditos. Qual um vence para você depende se seu gargalo é o número de requisições ou o volume de tokens; um aplicativo de chat com trocas curtas atinge primeiro o limite de requisições do OpenRouter, enquanto uma carga de trabalho de sumarização em lote atinge primeiro os limites de token.

Posso combinar níveis gratutos de vários provedores para obter mais capacidade?

Sim, e é um padrão comum para testes — roteie tráfego difernte para os níveis gratutos de diferntes provedores em vez de depender de um só. Apenas esteja ciente de que a seleção de modelos do nível gratuto muda com o tempo (um modelo que é :free no OpenRouter hoje pode não ser no próxmo trimestre), então construa com fallback de provedor em vez de codificar fixo um ID específic de modelo gratuto.

O crédito de indicação de $10 da Novita AI é o mesmo que seus modelos de nível gratuto?

Não, são separados. O programa de indicação é um crédito único de $10 para a faturação padrão por token, limitado a $500 no total entre todas as indicações. Os modelos de nível gratuito são itens específicos do catálogo precificados a $0 por token de forma contínua, independentemente de você ter usado um código de indicação ou não. Verifique o catálogo ao vivo para saber quais modelos atualmente têm preço $0, já que essa lista rotaiona conforme novos modelos são lançados.

Se eu auto-hospedar um modelo open-source, ele é realmente gratuito?

Os pesos do modelo são gratuitos para baixar, mas executá-los não é — você está pagando por computação GPU, armazenamento e seu próprio tempo de atividade em vez de precificação por token de API. Para tráfego baixo e constante, isso geralmente é mais caro do que um plano de API pago quando se considera o tempo ocioso da GPU; torna-se vantajoso principalmente em volume alto e previsível ou quando você precisa de localização de dados garantida.

Artigos Recomendados