Existem Chaves de API de LLM Open-Source Grátis em 2026? Sim, mas nem todas permanecem gratuitas

Existem Chaves de API de LLM Open-Source Grátis em 2026? Sim, mas nem todas permanecem gratuitas

Sim — vários provedores oferecem uma chave de API gratuita para acessar LLMs open-source, mas “grátis” se divide em três tipos de ofertas muito diferentes: um tier gratuito permanente com limites de taxa que nunca expira, um crédito de inscrição único que acaba, ou pesos de modelo que você precisa baixar e hospedar por conta própria. Abaixo estão 6 provedores ativos em agosto de 2026, organizados pela categoria em que se encaixam, para que você possa escolher com base em quanto tempo realmente precisa de acesso gratuito, em vez de ser surpreendido por uma fatura na terceira semana.

A Resposta Curta: Sim, Com Três Tipos de “Grátis”

Se você quer uma chave hoje e não quer inserir um cartão, o OpenRouter e o Groq oferecem acesso gratuito permanente sem expiração — você apenas convive com limites de taxa. Se você quer maior throughput temporariamente, Together AI, Novita AI e Hugging Face oferecem créditos gratuitos ou modelos gratuitos para começar, e depois cobram quando você ultrapassa essa cota. Se você não quer depender da disponibilidade ou mudanças de preço de nenhum provedor, modelos de pesos abertos podem ser baixados diretamente do Hugging Face Hub e executados em seu próprio hardware — isso não é uma chamada de API para o serviço hospedado do Hugging Face, mas é a única opção que é gratuita para sempre com zero limite de taxa.

Forma Gratuita 1: APIs de LLM com Tier Gratuito Permanente (Com Limite de Taxa, Nunca Expira)

Estes não pedem informações de pagamento e não desligam após um período de teste. A desvantagem é o throughput, não o tempo.

OpenRouter permite que você chame qualquer modelo marcado como :free em seu catálogo sem adicionar créditos, com limite de 20 requisições por minuto e 50 requisições por dia. Compre $10 em créditos (uma vez, eles não expiram) e o limite diário sobe para 1.000 requisições, com o limite por minuto inalterado. No momento da escrita, o OpenRouter lista 17 modelos sob o sufixo :free, incluindo o GLM-5.2 da Z.ai, o Gemma 4 do Google (variantes 26B e 31B), e vários modelos Nvidia Nemotron. (Verificado em 2026-08-18 via openrouter.ai/api/v1/models e na documentação de limites de taxa da plataforma em openrouter.ai/docs/api_reference/limits.)

Groq não exige cartão de crédito para seu tier gratuito e não o bloqueia atrás de uma janela de teste, mas cada modelo tem seus próprios limites de requisições e tokens por minuto e por dia. Por exemplo, openai/gpt-oss-120b tem limite de 30 requisições/minuto, 1.000 requisições/dia, 8.000 tokens/minuto e 200.000 tokens/dia no tier gratuito — modelos de texto pequenos como as variantes Llama Prompt Guard têm tetos de token muito maiores (500K tokens/dia). Clientes pagantes no tier “on-demand” têm aproximadamente 30-40x mais requisições e headroom de token, mas o tier gratuito em si não expira. (Verificado em 2026-08-18 via tabela de limites de taxa publicada do Groq.)

Novita AI mantém um conjunto rotativo de modelos de pesos abertos com preço de $0 por token como parte permanente de seu catálogo, em vez de uma promoção com prazo limitado — atualmente Qwen3.5-Plus, Qwen3.6-Plus e Bunny, cada um com precificação de entrada/saída 0/0 de acordo com a lista de modelos ao vivo. Isso é separado da rodada dedicada de modelos gratuitos da Novita cobrindo Llama, Qwen, GLM e BGE-M3, e também separado do programa de indicação da plataforma abaixo. A seleção de modelos do tier gratuito aqui rota à medida que novos modelos são lançados e os mais antigos passam para preços pagos, então verifique o catálogo ao vivo em vez de assumir que um modelo específico permanece gratuitoTempo.* (Verificado em 2026-08-18 via api.novita.ai/openai/v1/models.)

Forma Gratuita 2: APIs de LLM com Crédito de Inscrição (Quantia Limitada, Depois Você Paga)

Esta é a forma mais comum de “grátis” que você vai en contrar, e é a que surpreende as pessoas — o medidor está rodando desde o primeiro dia, apenas começa em zero.

Programa de Indicação da Novita AI dá $10 em créditos de API LLM tanto para o indi cador quanto para o novo in scritor, com um limite declardo de até $500 no totalmente obtenível através de indições. Isso é uma recarga de cartei ra, não um tier com limite de taxa — uma vez que os $10 são gastos, a precificação padrão por token se apiica. (Verificado em 2026-08-18 via novita.ai/referral.)

Together AI remoeu seu teste grátis geral em uma mudança de cobrança em julho de 2025 — novas contas agora precisam de um saldo pré-pago mínimo de $5 antes de fazer chamadas. No entanto, ele executa endpoints de modelo específicos com preço de $0.00/1M tokens fora desse requisito pré-pago, como o Prism-ML’s Ternay-Bonsai-27B, um modelo de 27B de peso aberto com janela de contexto de 262K. Startups também podem se inscrever separadamente para até $50.000 em créditos através do seu programa Startup Accelerator, que é um processo de aplicação, não um benefício de inscrição. (Verificado em 2026-08-18 via bloco de preço do togeter.ai/models/prism-ml-ternay-bonsai-27b e documentos de cobrança do Together.)

Provêdores de In ferência do Huging Face é uma API hospedada — você a chama remotamente com um token de acesso do Hugging Face, da mesma forma que chamaria OpenRouter ou Together AI, e o Hugging Face roteia a requisição para o provedor subjacente e cobra você. Cada conta gratuita recebe $0.10 por mês em crédito automaticamente, subindo para $2.00/mês no plano PRO de $9/mês. Isso é suficiente para testes leves de modelos pequenos, não para tráfego de produção — o crédito renova mensalmente em vez de ser um crédito único, mas a quantia é pequena o suficiente para que a maioria das cargas de trabalho reais o esgotem em algumas requisições. (Verificado em 2026-08-18 via hugingface.co/docs/api-inference/en/pricing.)

DeepInfra anuncia “$10 USD grátis por mês” em sua página de preços, estrut urado como uma mesada recorrente em vez de um bônus de ins crição único. (Verificado em 2026-08-18 via deepinfra.com/pricing.)

Forma Grátis 3: LLMs Open-Source Auto-Hospedados (Sem API, Sem Conta, Sem Limite de Taxa)

Isto não é uma cha ve de API — é baixar os pesos do modelo você mesmo e executá-los em hardware que você controla, atra vés de algo como vLLM, Ollama ou llama.cpp. O Huging Face Hub é o ponto de distribuição principal para lançamentos de pesos ab ertos (Llama, Qwen, GLM e a maioria das outras famílias open-source publicam pesos lá) — isso é uma coisa separada da API hospedada de Provê dores de Infer inção do Hugging Face descrita acima; o Hub apenas hospeda os arquivos. Você paga pelo computo em vez de tokens, e não há limite de taxa porque não há serviço compartilhado — mas você é responsável pela GPU, pela pilha de servimen to e pela disponibilidade. Esse caminho faz sentido se você precisa de disponibilidade garantida ou está processando volume suficiente que uma GPU alugada supere o preço por token; é a escolha errada se você apenas quiser testar um modelo esta tarde.

Provedores de API LLM Grátis Comparados

Provedor Tipo de grátis O que você ganha Expira?
OpenRouter Tier gratuito permanente 50 req/dia (ou 1.000/dia após compra de $10 créditos),20 req/min, modelos :free apenas Não
Groq Tier gratuito permanente Limites RPM/RPD/TPM/TPD por modelo, ex.1.000 req/dia no gpt-oss-120b Não
Novita AI (modelos de tier gratuito) Tier gratuito permanente Modelos ab ertos selecionados a $0/M tokens, catálogo rotativo Não, mas a lista de model os muda
Novita AI (indicação) Crédito de inscrição $10 em créditos por indicação, limite tot al $500 Sim, uma vez gasto
Together AI Crédito de inscrição + endpoints grátis Mínimo $5 pré-pago para uso geral; endpoints específicos de modelo a $0.00/M (ex. Ternay-Bonsai-27B) Endpoints grátis: não. Crédito geral: nenhum oferecido desde Jul2025
Huging Face (Provedores de Inferência, API hospedada) Crédito de inscrição (mensal) $0.10/mês grátis, $2.00/mês no PRO Renova mensalmente, quantia pequena
Auto-hospedado (pesos do Hugging Face Hub) Sem API Pesos completos do modelo, execute na sua própria GPU Nunca, mas também sem benefício de API/limite de taxa

Qual API LLM Gratuita Você Deve Usar de Fato?

Se você está prototipando e quer zero atrito de configuração, comece com OpenRouter ou Groq — sem cartão, sem expiração, e você saberá em uma hora se o limite de taxa é uma restrição real para seu caso de uso. Se você está construindo algo que precisa de throughput constante antes de estar pronto para paga, um crédito de inscrição como os $10 de indicação da Novita AI ou os endpoints de modelo a $0.00 do Together AI lhe dão espaço real de teste sem os limites apertados por minuto que os tiers gratúitos permanentes impõem. Se você já está comprometido com um modelo específico e precisa que ele funcione indefinidamente sem depender dos limites de taxa ou mudanças de preço de nenhum provedor, baixe os pesos do Hugging Face Hub e auto-hospede.

Nada disso é “grátis para sempre sem limites” — essa combinação não existe para APIs hospedadas, porque alguém está pagando pelo tempo de GPU subjacente. Tiers gratúitos permanentes limitam requisições em vez de dólares; créditos de inscrição limitam dólares em vez de requisições; auto-hospedagem remove ambos os limites mas entrega a você a conta de infraestrutura e o trabalho operacional em troca.

Conclusão

Sim — APIs LLM open-source grátis existem hoje, mas “grátis” é um rótulo cobrindo três ofertas diferentes, não uma só. Tiers gratúitos permanentes (OpenRouter, Groq, modelos rotativos a $0 da Novita AI) nunca expiram mas limitam sua taxa de requisição ou token. Créditos de inscrição (indicação da Novita AI, endpoints isentos de pré-pagamento do Together AI, Hugging Face, DeepInfra) dão uma cota real em dólares que se esgota uma vez que você a ultrapassa. Auto-hospedar pesos abertos do Hugging Face Hub remove ambos os tipos de limites completamente, ao custo de executar e paga pela própria GPU. Qual deles é “a opção grátis” para você depende se sua restrição são limites de taxa, um teto de gastos ou independência de longo prazo das decises de preço de qualquer provedor — não em encontrar um único provedor que evite todas as três trocas ao mesmo tempo, porque nenhum atualmente faz.

Se GLM é a família de modelos que você está avaliando, compare os canais de API GLM grátis atuamente disponíveis em vez de assumir que um rótulo de tier gratuito se apiica a todo modelo GLM.

FAQ

As APIs LLM open-source são realmente grátis, ou sempre há um porém?

Sempre há um porém, e é um de três formatos: um limite de requisição/dia/minuto que nunca expira (OpenRouter, Groq), um crédito em dólar que acaba (indicação Novita AI, mínino $5 do Together AI, Hugging Face, DeepInfra), ou a exigiência de auto-hospedar em seu próprio hardware. Saber qual formato você está obtendo antes de construir sobre ele evita a surpre sa da conta ou o surpreendente erro 429.

Qual provedor tem o tier gratuito permanente mais generoso?

O tier grátis do Groq dá tetos de token mais altos em alguns modelos — até 200.000 tokens/dia no gpt-oss-120b e 500.000 tokens/dia em modelos de guarda menores — em comparação com o limite fixo de 50 requisições/dia do OpenRouter antes de você adicionar créditos. Qual deles vence para você depende se seu garga lo é a contagem de requisições ou o volume de tokens; um aplictivo de chat com trocas curtas atinge o limite de requisições do OpenRouter primeio, enquanto uma carga de trabalho de sumarização em lote atinge os limites de token primeio.

Posso combinar tiers gratúitos de vários provedores para obter mais capacidad e?

Sim, e é um padrão comum para testes — roteie tráfego diferente para tiers gratúitos de diferentes provedores em vez de depender de um. Apenas esteja ciente de que a seleção de modelos do tier gratuito muda com o tempo (um modelo que é :free no OpenRouter hoje pode não ser no próximo trimestre), então construa com fallback de provedor em vez de hardcodar um ID de modelo gratuito específico.

O crédito de indicação de $10 da Novita AI é o mesmo que seus modelos de tier gratuito?

Não, são separados. O programa de indicação é um crédito único de $10 para a cobrança padrão por token, com limite de $500 total entre todas as indicações. Os modelos de tier gratuito são entradas específicas do catálogo com preço de $0 por token de forma contínua, independentemente de você ter usado ou não um código de indicação. Verifique o catálogo de modelos ao vivo para saber quais modelos atualmente têm preço $0, pois essa lista rotaciona à medida que novos modelos são lançados.

Se eu auto-hospedar um modelo open-source, é realmente grátis?

Os pesos do modelo são grátis para baixar, mas executá-los não é — você está pagando por computo GPU, armazenamento e sua própria disponibilidade em vez de preço por token de API. Para tráfego baixo e constante, isso geralmente é mais caro do que um tier de API pago uma vez que você considera o tempo ocioso da GPU; torna-se vantajoso principalmente em volume alto e previsível ou quando você precisa de localidade de dados garantida.

Artigos Recomendados