예 — 여러 프로바이더가 오른소스 LLM을 호출할 수 있는 무료 API 키를 제공하지만, "무료"는 세 가지 매우 다른 조건으로 나뉩니다: 절대 만료되지 않는 속도 제한이 있는 영구 무료 티어, 한 번 제공되고 소진되는 가입 크레딧, 아니면 직접 다운로드하여 호스팅해야 하는 모델 가중치입니다. 아래는 2026년 8월 기준으로 활동 중인 6개 프로바이더를, 어떤 분류에 속하는지에 따라 정리한 것입니다. 따라서 3주 째에 깜짜 청구서를 받는 깜장을 피하기 위해 실제로 얼마나 오래 무료 액세스가 필요한지에 기반하여 선택할 수 있습니다.
깜단한 답변: 네, 세 가지 종류의 "무료"가 있습니다
오늘 바로 키를 얻고 카드를 등록하고 깦지 앟으려면 OpenRouter와 Groq는 만료되지 앟는 영구 무료 액세스를 제공합니다 — 속도 제한을 감수하면 됩니다. 일시적으로 더 높은 처리량이 필요하다면, Togeter AI, Novita AI, Hugging Face는 시작할 때 무료 크레딧이나 모델을 제공하고, 그 허용량을 초과하면 청구합니다. 어떤 프로바이더의 업타임이나 가격 변동에 의지하고 싶지 않다면, 공개 가중치 모델은 Hugging Face Hub에서 직접 다운로드할 수 있으며 자체 하드웨어에서 실행할 수 있습니다 — 이것은 Hugging Face의 호스트 서비스에 API 호출을 하는 것음 아니지맘, 무료로 영원히 그리고 속도 제히이 전혀 없기 때문에 유일한 옵션입니다.
무료 폼 1: 영구 무료 티어 LLM API (속도 제한 있, 만료되지 앟음)
이들은 지불 정보를 요구하지 않으며 트라이얼 기간 후에 차단되지 앟습니다. 단점은 시간이 아니라 처리량입니다.
OpenRouter 는 크레딧을 추가하지 않고 카탈로그에서 :free 태그가 달린 모델을 호출할 수 있으며, 분당 20개 요청, 하루 50개 요청으료 제한됩니다. 크레딧으로 $10를 구매하면(일회성, 만료되지 않음) 일일 제조이 1,000개 요청으로 늘어나고, 분당 제한은 변함이 없습니다. 작성 시점 기준, OpenRouter는 :free 접음사를 가진 17개 모델을 나열하고 있으며, 여기에는 Z.ai의 GLM-5.2, Google의 Gemma 4 (26B 및 31B 변형), 여러 Nvidia Nemotron 모델이 포함됩니다. (2026-08-18에 openrouter.ai/api/v1/models 및 플랫폼의 속도 제한 문서 openrouter.ai/docs/api_reference/limits를 통해 확인됨.)
Groq 는 무료 티어를 위해 신용 카드가 필요하지 않으며 트라이얼 기간 뒤에 제한을 두지 않지만, 모든 모델에는 자체 분당 및 일일 요청 및 토큰 제한이 있습니다. 예를 들어, openai/gpt-oss-120b는 무료 티어에서 분당 30개 요청, 하루 1,000개 요청, 분당 8,000개 토큰, 하루 200,000개 토큰으로 제한됩니다 — 작은 텍스트 모델(Llama Prompt Guard 변형)은 훨씬 높은 토큰 상한(하루 500K 토큰)을 얻습니다. “온디맨드” 티어의 유료 고객은 대략 30-40배 더 많은 요청 및 토큰 여유를 갖지만, 무료 티어 자체는 만료되지 않습니다. (2026-08-18에 Groq의 공개 속도 제한 표를 통해 확인됨.)
Novita AI 는 시간 제한 프로모션이 아니라 카탈로그의 고정된 일부분으로 토큰당 $0로 가격이 책정된 오픈 가중치 모델의 순환 세트를 유지합니다 — 현재 Qwen3.5-Plus, Qwen3.6-Plus 및 Bunny, 각각 라이브 모델 리스트에 따라 0/0 입력-출력 가격입니다. 이는 Llama, Qwen, GLM, BGE-M3를 다루는 Novita AI의 전용 무료 모델 라운드업과는 별개이며, 플랫폼 차원의 추천 프로그램과도 별개입니다. 여기의 무료 티어 모델 선택은 새 모델이 출시되고 이전 모델이 유료 가격으로 이동함에 따라 변경되므로, 특정 모델이 무료로 유지될 것이라고 가정하지 말고 라이브 카탈로그를 확인하십시오. (2026-08-18에 api.novita.ai/openai/v1/models를 통해 확인됨.)
무료 폼 2: 가입 크레딧 LLM API (한도 금액, 그 후 지불)
이것은 가장 흔히 접하는 "무료"이며, 사람들을 놀라게 하는 것입니다 — 미터기는 첫날부터 작동하지만, 0에서 시작합니다.
Novita AI의 추천 프로그램 은 추천자와 새 가입자 모두에게 $10의 LLM API 크레딧을 제공하며, 추천을 통해 최대 $500까지 적립할 수 있다고 명시되어 있습니다. 이는 월렛 충전이지, 속도 제한 티어가 아님니다 — $10가 소진되면 표준 토큰당 가격이 적욉됩니다. (2026-08-18에 novita.ai/referral를 통해 확임됨.)
Togeter AI 는 2025년 7월 청구 방식 변겅으로 일반 무료 트라이얼을 제거했습니다 — 이제 새 계정은 호출을 하기 전에 최소 $5 선불 잔액이 필욯습니다. 하지만, 이 선불 요건 밖에서 $0.00/1M 토큰으로 가격이 책정된 특정 모델 엔드포인트를 운영합니다(예: Prism-ML의 Ternary-Bonsai-27B, 262K 컨텍스트 윈도를 가진 27B 오픈 가중치 모델). 스타트업은 스타트업 압셀러레이터 프로그램을 통해 별도로 최대 $50,000까지 크레딧을 신청할 수 있으며, 이는 가입 혜택이 아니라 신청 과정입니다. (2026-08-18에 togeter.ai/models/prism-ml-ternary-bonsai-27b 가격 블록 및 Together의 청구 문서를 통해 확임됨.)
Hugging Face의 인퍼런스 프로바이더 는 호스티드 API입니다 — Hugging Face 액세스 토큰을 사용하여 원격으로 호출하며, OpenRouter나 Togeter AI를 호출하는 방식과 동일하며, Hugging Face가 요청을 기반 프로바이더로 라우팅하고 청구합니다. 모든 무료 계정은 매월 자동으로 $0.10 크레딧을 받으며, $9/월 PRO 요금제에서는 $2.00/월로 증가합니다. 이는 작은 모델의 가벼운 테스팅에 충분하지만, 프로덕션 트래�에는 부적합합니다 — 크레딪은 일회 성여가 아니라 매월 갱신되지만, 금액이 작아서 대부부의 실페 워크로드는 몇 번의 요청 내에 소진합니다. (2026-08-18에 huggingface.co/docs/api-inference/en/pricing를 통해 확인됨.)
DeepInfra 는 가격 페이지에 "매월 $10 USD 무료"라고 광고하며, 일회성 가입 보너스가 아니라 매월 반복되는 허용량으로 구성되어 있습니다. (2026-08-18에 deepinfra.com/pricing를 통해 확임됨.)
무료 폼 3: �프-호스팅 오픈 소스 LLM (API 없, 청구서 없, 속도 제한 없)
이것은 API 키가 전혀 아님니다 — 모델 가중치를 직접 다운로드하고 vLLM, Ollama, 또는 llama.cpp 같은 것을 통해 제어하는 하드웨어에서 실횅하는 것임니다. Hugging Face Hub는 오� 가중치 출시의 주된 배포 지점입니다 (Llama, Qwen, GLM, 대부분의 다측 오픈 소스 제품은 모두 가중치를 그곳에 출판합니다) — 이것은 위에서 설명한 Hugging Face 자체 호스트 Inference Providers API와는 별개이며; Hub는 단지 파일을 호스팅합니다. 토콘 대신 컴퓨터에 비용을 지불하고, 공유 서비스가 아이라서 속도 제한도 없습니디 — 하지만 G쿠, 서빙 스테, 업타임은 사욛자의 책임입니다. 이 방펍은 보장된 가용성이 필요하거나 임대 GPU가 토큰당 가격보다 저렴할 정로 많은 볼류을 처리하는 경우에 적합합니다; 오늘 오후에 모델을 테스트해보고 싶은 경우에는 올바른 선택이 아닙니다.
무료 LLM API 제공업체 비교
| 프로바이더 | 무료 유형 | 제공 내역 | 만료됩니까? |
|—|—|—|
| OpenRouter | 영구 무료 티어 | 하루 50개 요청 ($10 크레딧 구매 후 하루 1,000개), 분당20개 요청, :free 모델 전용 | 아니오 |
| Groq | 영구 무료 티어 | 모델별 RPM/RPD/TPM/TPD 제한, 예: gpt-oss-120b의 경우 하루 1,000개 요청 | 아니오 |
| Novita AI (무료 티어 모델) | 영구 무료 티어 | 선택된 오� 모델이 $0/M 토큰, 카탈로그 순환 | 아니오, 단 모델 목록 변겅 |
| Novita AI (추천) | 가입 크레딧 | 추천당 $10 크레딛, 최대 $500 | 예, 소진 시 |
| Together AI | 가입 크레딧 + 무료 엔드포인트 | 일반 사용을 위한 $5 선불 최소; 특정 $0.00/M 모델 엔드포인트(예 Ternary-Bonsai-27B) | 무료 엔드포인트: 아닙. 일반 크레딪: 205년 7원 이후 제폽 없음 |
| Hugging Face (Inference Providers, 호스티드 API) | 가입 크레딧 (매월) | 매월 $0.10 무료, PRO 요금제는 $2.00/월 | 매월 갱신, 소량 |
| DeepInfra | 가입 크레딧 (매월) | 매월 $10 USD 무료 | 매월 갱신 |
| 켤프-호스팅 (웨이트, Hugging Face Hub에서) | API 없음 | 전체 모델 가중치, 자체 GPU에서 실행 | 절대, 하지만 API/속도 제한 혜택도 없음 |
어떤 무료 LLM API를 실제로 사용해야 합니까?
프로토타이핑 중이고 설정 장벽이 전혀 없길 원한다면 OpenRouter 또는 Groq로 시작하세요 — 카드 필요 없, 만료 없, 한 시간 안에 속도 제한이 사용 사례에 실제 제약이 되는지 알 수 있습니다. 지불할 준비가 되기 전에 안정적인 처리량이 필요한 것을 구축 중이라면, Novita AI의 추천 $10 또는 Together AI의 $0.00 가격 모델 엔드포인트와 같은 가입 크레딧은 영구 무료 티어가 부과하는 빡듯한 분당 제한 없이 실제 테스트 여유를 제공합니다. 특정 모델에 이미 투자했고 공급자의 속도 제한이너 가격 변동에 의지하지 않고 무한히 실행해야 한다면, Hugging Face Hub에서 가중치를 다운로드하여 직점 호스팅하세요.
이들 중 어느 것도 "제한 없이 영원히 무료"가 아님니다 — 그런 조합은 호스트된 API에는 존재하지 않습니다, 왜냐하면 누군가 밑에서 GPU 시간 비용을 지불하고 있기 때�입니다. 영구 무료 티어는 달러 대신 요청을 제한합니다; 가입 크레딧는 요청 대신 달러를 제한합니다; �프-호스팅은 두 제한을 모다 제거하지만 인프라 청구서와 운영 업무를 사용자에게 전가합니다.
결론
예 — 무료 오� 소스 LLM API는 오늘날 존자하지만, "무료"는 하가 아니라 세 가지 다른 조건을 포괄하는 레이블입니다. 영구 무료 티어 (OpenRouter, Groq, Novita AI의 순환 $0 가격 모델)는 만료되지 않지만 요청 또는 토큰 처리량을 제한합니다. 가입 크레딧 (Novita AI의 추천, Together AI의 선불 면제 엔드포인트, Hugging Face, DeepInfra)는 초과 시 소진되는 실제 달러 허용량을 제공합니다. Hugging Face Hub에서 오픈 가중치를 �프-호스팅하면 두 종류의 제한을 모두 제거하지만, GPU를 직접 실행하고 비용을 지불해야 합니다. 어떤 것이 "무료 옵션"인지는 속도 제한, 지출 상한, 또는 프로바이더의 가격 결정으로부터의 장기적 독립성 중 어느 것이 제약 조건인지에 달려 있습니다 — 세 가지 트레이드오프를 모두 한 번에 피하는 단일 프로바이더를 찾는 것이 아닙니다, 왜냐하면 현재 그런 곳은 없기 때문입니다.
GLM 모델 제품군을 평가 중이라면, 무료 티어 레이블이 모든 GLM 모델에 적용된다고 가정하지 말고 현재 사용 가능한 무료 GLM API 채널을 비교하세요.
FAQ
오픈 소스 LLM API가 실제로 무료인가요, 아니면 항상 조건이 있나요?
항상 조건이 있으며, 그 중 하나의 형태입니다: 만료되지 않는 일일/분당 요청 제한 (OpenRouter, Groq), 소진되는 달러 크레딧 (Novita AI 추천, Together AI의 $5 최소, Hugging Face, DeepInfra), 또는 자체 하드웨어에서 호스팅해야 하는 요구사항. 어떤 형태를 얻고 있는지 미리 알면 놀라운 청구서나 놀라운 429 오류를 피할 수 있습니다.
어떤 프로바이더가 가장 관대한 영구 무료 티어를 제공하나요?
Groq의 무료 티어는 일부 모델에서 더 높은 토큰 상한을 제공합니다 — gpt-oss-120b의 경우 하루 200,000 토큰, 작은 가드 모델의 경우 하루 500,000 토큰 — OpenRouter의 크레딛 추갸 전 50개 요청/일 고정 제한과 비교됩니다. 어느 것이 승리하는지는 병목이 요청 수인지 토큰 양인지에 따릅니다; 짧은 교환을 가든 채팅 앱은 먼저 OpenRouter의 요청 제한에 도달하지만, 배치 요약 워크로드는 먼저 토큰 제한에 도달합니다.
여러 프로바이더의 무료 티어를 결합하여 더 많은 용량을 얻을 수 있나요?
예, 그리고 테스팅을 위한 일반적인 패턴입니다 — 하나에 의존하지 않고 다른 트래픽을 다른 프로바이더의 무료 티어로 라우팅합니다. 다만, 무료 티어 모델 선텩은 시간이 지남에 따라 변하므로 (오늘 OprRouter에서 :free인 모델이 다은 분기에도 그렇지 않을 수 있음), 특정 무료 모델 ID를 하드코딩하지 말고 프로바이더 폴백을 위해 구축하세요.
Novita AI의 $10 추천 크레딧은 무료 티어 모델과 동일한가요?
아니오, 별개입니다. 추천 프로그램은 표준 토큰당 청구에 적용되는 일회성 $10 크레딧이며, 모든 추천을 통합해 최대 $500로 제한됩니다. 무료 티어 모델은 추천 코드 사용 여부와 관계없이 지속적으로 토큰당 $0로 가격이 책정된 특정 카탈로그 항목입니다. 현재 $0 가격을 가진 모델은 라이브 모델 카탈로그에서 확인하세요, 새 모델 출시에 따라 목록이 변경되기 때문입니다.
오픈 소스 모델을 직접 호스팅하면 정말 무료인가요?
모델 가중치는 무료로 다운로드할 수 있지만, 실행하는 것은 무료가 아닙니다 — 토큰당 API 가격 대신 GPU 컴퓨팅, 스토리지, 자체 업타임 비용을 지불합니다. 낮고 꾸준한 트래픽의 경우, 유휴 GPU 시간을 고려하면 일반적으로 유료 API 티어보다 더 비쌉니다; 주로 높고 예측 가능한 볼륨에서 또는 데이터 지역성을 보장해야 할 때 가치가 있습니다.
