예 — 여러 제공업체가 오픈소스 LLM을 호출할 수 있는 무료 API 키를 제공하지만, "무료"는 세 가지 매우 다른 조건으로 나뉩니다. 절대 만료되지 않는 속도 제한이 있는 영구 무료 티어, 소진되는 일회성 가입 크레딧, 또는 직접 다운로드하여 호스팅해야 하는 모델 가중치입니다. 아래는 2026년 8월 기준으로 활성화된 6개 제공업체를 해당 그룹별로 정렬한 목록입니다. 이를 통해 실제로 무료 액세스가 필요한 기간을 기준으로 선택할 수 있으며, 3주 차에 갑자기 청구서를 받는 일이 없습니다.
간단한 답변: 예, 세 가지 종류의 "무료"가 있습니다
오늘 바로 키를 받고 카드를 등록하고 싶지 않다면 OpenRouter와 Groq 모두 만료되지 않는 영구 무료 액세스를 제공합니다. 다만 속도 제한이 적용됩니다. 더 높은 처리량이 일시적으로 필요하다면 있는 Together AI, Novita AI, Hugging Face가 무료 크레딧 또는 무료 모델로 시작할 수 있게 해주고, 해당 허용량을 초과하면 청구합니다. 어떤 제공업체의 가동 시간이나 가격 변동에 의존하고 싶지 않다면, 오픈 가중치 모델을 Hugging Face Hub에서 직접 다운로드하여 자체 하드웨어에서 실행할 수 있습니다. 이는 Hugging Face의 호스팅 서비스에 대한 API 호출은 아니지만, 속도 제한이 없고 영구적으로 무료인 유일한 옵션입니다.
무료 형태 1: 영구 무료 티어 LLM API (속도 제한 있음, 만료되지 않음)
이 API는 결제 정보를 요구하지 않으며 평가판 기간 이후에 차단되지 않습니다. 단점은 시간이 아니라 처리량입니다.
OpenRouter 는 카탈로그에서 :free 태그가 붙은 모델을 크레딧을 추가하지 않고 호출할 수 있으며, 분당 20개 요청, 일당 50개 요청으로 제한됩니다. $10 크레딧을 구매하면(일회성, 만료되지 않음) 일일 한도가 1,000개 요청으로 증가하고 분당 한도는 그대로 유지됩니다. 현재 기준으로 OpenRouter는 :free 접미사 아래에 17개의 모델을 나열하고 있으며, 여기에는 Z.ai의 GLM-5.2, Google의 Gemma 4(26B 및 31B 변형), 여러 Nvidia Nemotron 모델이 포함됩니다. (2026-08-18 확인, openrouter.ai/api/v1/models 및 플랫폼의 속도 제한 문서 openrouter.ai/docs/api_reference/limits)
Groq 는 무료 티어에 신용카드를 요구하지 않으며 평가판 기간으로 제한하지 않지만, 모든 모델에 자체적인 분당/일일 요청 및 토큰 한도가 있습니다. 예를 들어, openai/gpt-oss-120b는 무료 티어에서 분당 30개 요청, 일일 1,000개 요청, 분당 8,000개 토큰, 일일 200,000개 토큰으로 제한됩니다. Llama Prompt Guard 변형과 같은 소형 텍스트 모델은 훨씬 더 높은 토큰 한도(일일 500,000개 토큰)를 받습니다. 유료 고객은 “온디맨드” 티어에서 요청 및 토큰 여유 공간이 약 30~40배 더 크지만, 무료 티어 자체는 만료되지 않습니다. (2026-08-18 확인, Groq의 게시된 속도 제한 표)
Novita AI 는 시간 제한 프로모션이 아닌 카탈로그의 영구적인 부분으로, 토큰당 $0로 책정된 오픈 가중치 모델의 순환 세트를 유지합니다. 현재는 Qwen3.5-Plus, Qwen3.6-Plus 및 Bunny가 있으며, 각각 라이브 모델 목록에 따라 입력-출력 0/0 가격입니다. 이는 Llama, Qwen, GLM 및 BGE-M3를 다루는 Novita의 전용 무료 모델 요약과는 별개이며, 플랫폼 전체 추천 프로그램과도 별개입니다. 여기서의 무료 티어 모델 선택은 새 모델이 출시되고 이전 모델이 유료 가격으로 전환됨에 따라 변경되므로, 특정 모델이 계속 무료라고 가정하지 말고 라이브 카탈로그를 확인하세요. (2026-08-18 확인, api.novita.ai/openai/v1/models)
무료 형태 2: 가입 크레딧 LLM API (한도가 정해져 있고, 이후 지불)
이것은 가장 흔히 접하게 되는 "무료"이며, 사람들을 놀라게 하는 경우입니다. 측정기는 첫날부터 작동 중이며, 단지 0에서 시작할 뿐입니다.
Novita AI의 추천 프로그램 은 추천인과 새 가입자 모두에게 LLM API 크레딧 $10를 제공하며, 추천을 통해 최대 $500까지 적립할 수 있다고 명시되어 있습니다. 이는 속도 제한 티어가 아닌 지갑 충전입니다. $10가 소진되면 표준 토큰당 가격이 적용됩니다. (2026-08-18 확인, novita.ai/referral)
Together AI 는 2025년 7월 청구 변경으로 일반 무료 평가판을 제거했습니다. 이제 새 계정은 호출하기 전에 최소 $5의 선불 잔액이 필요합니다. 그러나 선불 요구 사항 외에 $0.00/100만 토큰으로 가격이 책정된 특정 모델 엔드포인트를 실행합니다. 예를 들어 Prism-ML의 Ternary-Bonsai-27B는 262K 컨텍스트 창을 가진 27B 오픈 가중치 모델입니다. 스타트업은 Startup Accelerator 프로그램을 통해 별도로 최대 $50,000의 크레딧을 신청할 수 있으며, 이는 가입 혜택이 아닌 신청 과정입니다. (2026-08-18 확인, together.ai/models/prism-ml-ternary-bonsai-27b 가격 블록 및 Together의 청구 문서)
Hugging Face의 Inference Providers 는 호스팅 API입니다. Hugging Face 액세스 토큰을 사용하여 원격으로 호출하며, OpenRouter나 Together AI를 호출하는 것과 동일한 방식입니다. Hugging Face는 요청을 기본 제공업체로 라우팅하고 청구합니다. 모든 무료 계정은 매월 자동으로 $0.10의 크레딧을 받으며, 월 $9 PRO 요금제에서는 월 $2.00로 증가합니다. 이는 소형 모델의 가벼운 테스트에는 충분하지만 프로덕션 트래픽에는 부족합니다. 크레딧은 일회성 부여가 아니라 매월 갱신되지만, 금액이 너무 작아 대부분의 실제 작업은 몇 번의 요청만으로 소진됩니다. (2026-08-18 확인, huggingface.co/docs/api-inference/en/pricing)
DeepInfra 는 가격 페이지에서 "월 $10 USD 무료"를 광고하며, 일회성 가입 보너스가 아닌 반복되는 월별 할당량으로 구성됩니다. (2026-08-18 확인, deepinfra.com/pricing)
무료 형태 3: 자체 호스팅 오픈소스 LLM (API 없음, 청구 없음, 속도 제한 없음)
이것은 API 키가 전혀 아닙니다. 모델 가중치를 직접 다운로드하여 vLLM, Ollama 또는 llama.cpp와 같은 도구를 통해 자신이 제어하는 하드웨어에서 실행하는 것입니다. Hugging Face Hub는 오픈 가중치 릴리스(Llama, Qwen, GLM 및 대부분의 다른 오픈소스 제품군이 모두 가중치를 게시하는 곳)의 주요 배포 지점입니다. 이는 위에서 설명한 Hugging Face 자체 호스팅 Inference Providers API와는 별개의 것이며, Hub는 단지 파일을 호스팅할 뿐입니다. 토큰 대신 컴퓨팅 비용을 지불하며, 공유 서비스가 없기 때문에 속도 제한이 없습니다. 그러나 GPU, 서빙 스택 및 가동 시간에 대한 책임은 사용자에게 있습니다. 이 경로는 보장된 가용성이 필요하거나, 렌탈 GPU가 토큰당 가격보다 저렴할 만큼 충분한 볼륨을 처리하는 경우에 적합합니다. 오늘 오후에 모델을 테스트해보고 싶은 경우에는 잘못된 선택입니다.
무료 LLM API 제공업체 비교
| 제공업체 | 무료 유형 | 제공 내용 | 만료 여부 |
|---|---|---|---|
| OpenRouter | 영구 무료 티어 | 일 50개 요청(또는 $10 크레딧 구매 후 일 1,000개 요청), 분 20개 요청, :free 모델만 |
아니요 |
| Groq | 영구 무료 티어 | 모델별 RPM/RPD/TPM/TPD 한도, 예: gpt-oss-120b의 경우 일 1,000개 요청 | 아니요 |
| Novita AI (무료 티어 모델) | 영구 무료 티어 | 선택된 오픈 모델, 토큰당 $0, 카탈로그 순환 | 아니요, 단 모델 목록 변경됨 |
| Novita AI (추천) | 가입 크레딧 | 추천당 $10 크레딧, 최대 $500 | 예, 소진 시 |
| Together AI | 가입 크레딧 + 무료 엔드포인트 | 일반 사용을 위한 최소 $5 선불; 특정 $0.00/백만 모델 엔드포인트(예: Ternary-Bonsai-27B) | 무료 엔드포인트: 아니요. 일반 크레딧: 2025년 7월 이후 제공 없음 |
| Hugging Face (Inference Providers, 호스팅 API) | 가입 크레딧 (월별) | 월 $0.10 무료, PRO 요금제 월 $2.00 | 매월 갱신, 소액 |
| DeepInfra | 가입 크레딧 (월별) | 월 $10 USD 무료 | 매월 갱신 |
| 자체 호스팅 (Hugging Face Hub의 가중치) | API 없음 | 전체 모델 가중치, 자체 GPU에서 실행 | 절대 만료되지 않지만 API/속도 제한 혜택 없음 |
어떤 무료 LLM API를 실제로 사용해야 할까요?
프로토타이핑 중이고 설정 장벽이 없기를 원한다면 OpenRouter 또는 Groq로 시작하세요. 카드 등록이 필요 없고 만료되지 않으며, 한 시간 안에 속도 제한이 사용 사례에 실질적인 제약인지 알 수 있습니다. 지불할 준비가 되기 전에 안정적인 처리량이 필요한 것을 구축 중이라면, Novita AI의 추천 $10 또는 Together AI의 $0.00 가격 모델 엔드포인트와 같은 가입 크레딧이 영구 무료 티어가 부과하는 엄격한 분당 한도 없이 실제 테스트 여유 공간을 제공합니다. 특정 모델에 이미 전념하고 있으며 어떤 제공업체의 속도 제한이나 가격 변동에 의존하지 않고 무기한 실행해야 한다면, Hugging Face Hub에서 가중치를 다운로드하여 자체 호스팅하세요.
이 중 어느 것도 "제한 없는 영구 무료"가 아닙니다. 호스팅 API의 경우 그런 조합은 존재하지 않습니다. 누군가가 그 밑의 GPU 시간에 대한 비용을 지불하고 있기 때문입니다. 영구 무료 티어는 달러 대신 요청을 제한합니다. 가입 크레딧은 요청 대신 달러를 제한합니다. 자체 호스팅은 두 제한을 모두 제거하지만 인프라 비용과 운영 작업을 사용자에게 넘깁니다.
결론
예 — 무료 오픈소스 LLM API는 오늘날 존재하지만, "무료"는 하나가 아닌 세 가지 다른 조건을 포괄하는 레이블입니다. 영구 무료 티어(OpenRouter, Groq, Novita AI의 순환 $0 가격 모델)는 만료되지 않지만 요청 또는 토큰 처리량을 제한합니다. 가입 크레딧(Novita AI의 추천, Together AI의 선불 면제 엔드포인트, Hugging Face, DeepInfra)은 소진되면 사라지는 실제 달러 할당량을 제공합니다. Hugging Face Hub에서 오픈 가중치를 자체 호스팅하면 GPU를 직접 실행하고 비용을 지불하는 대가로 두 종류의 제한이 모두 사라집니다. 어떤 것이 "무료 옵션"인지는 제약 조건이 속도 제한, 지출 상한, 또는 제공업체의 가격 결정으로부터의 장기적 독립성 중 무엇인지에 따라 달라집니다. 세 가지 트레이드오프를 모두 피하는 단일 제공업체를 찾는 것이 아닙니다. 현재로서는 그런 제공업체가 없기 때문입니다.
FAQ
오픈소스 LLM API는 실제로 무료인가요, 아니면 항상 조건이 있나요?
항상 조건이 있으며, 그 중 하나입니다. 만료되지 않는 일일/분당 요청 한도(OpenRouter, Groq), 소진되는 달러 크레딧(Novita AI 추천, Together AI의 $5 최소 금액, Hugging Face, DeepInfra), 또는 자체 하드웨어에서 자ㅔ 호스팅해야 하는 요구사항입니다. 빌드하기 전에 어떤 조건인지 알면 예상치 못한 청구서나 429 오류를 피할 수 있습니다.
어떤 제공업체가 가장 관대한 영구 무료 티어를 가지고 있나요?
Groq의 무료 티는 일부 모델에서 더 높은 토큰 한도를 제공합니다. 예를 들어 gpt-oss-120b에서 일일 최대 200,000개 토큰, 소형 가드 모델에서 일일 500,000개 토큰입니다. 이는 OpenRouter의 크레딧 추가 전 일일 50개 요청 한도와 비교됩니다. 어느 것이 더 나은지는 병목 현상이 요청 수인지 토큰 볼륨인지에 달려 있습니다. 짧은 대화를 주고받는 채팅 앱은 먼저 OpenRouter의 요청 한도를, 배치 요약 작업은 토큰 한도를 먼저 만나게 됩니다.
여러 제공업체의 무료 티어를 결합하여 더 많은 용량을 확보할 수 있나요?
예, 테스트를 위한 일반적인 패턴입니다. 하나에 의존하지 않고 다른 트래픽을 다른 제공업체의 무료 티로 라우팅하는 것입니다. 다만 무료 티어 모델 선택은 시간이 지남에 따라 변화한다는 점을 인식하세요. (오늘날 OpenRouter에서 :free인 모델이 다음 분기에도 그럴 것이라는 보장은 없습니다). 따라서 특정 무료 모델 ID를 하드코딩하기보다는 제공업체 폴백을 염두에 두고 구축하세요.
Novita AI의 $10 추천 크레딧은 무료 티어 모델과 동일한가요?
아니요, 별개입니다. 추천 프로그램은 표준 토큰당 청구에 사용되는 일회성 $10 크레딧이며, 모든 추천을 통해 최대 $500로 제한됩니다. 무료 티어 모델은 추천 코드 사용 여부와 관계없이 지속적으로 토큰당 $0로 책정된 특정 카타로그 항목입니다. 현재 $0 가격이 적용되는 모델을 확인하기 위해 라이브 모델 카탈로그를 확인하세요. 이 리스트는 새 모델이 출시됨에 따라 회전되기 때문에 그렇습니다.
오�소스 모델을 자체 호스팅하면 정말 무료인가요?
모델 가중치는 무료로 다운로드할 수 있지만, 실행하는 것은 무료가 아닙니다. 토큰당 API 가격 대신 GPU 컴퓨팅, 저장소 및 자체 가동 시간에 대한 비용을 지불하므로. 낮고 안정적인 트래�의 경우, 유휴 GPU 시간을 고려하면 일반적으로 유료 API 티어보다 비싼니다. 주로 높고 예측 가능한 볼륨이 있거나 보장된 데이터 지역성 필요한 경우에 가치가 있습니디.
추천 문서
- 2026년 가장 저렴한 LLM API 10선
- 2026년 오�소스 모델을 위한 최고의 추론 API 제공업체
- Qwen, Llamal, GLM, BGE-M3가 Novita AI에서 무료
- [DeepSeek V4 Pro 0813 on Novita AI](deepseek-v4-pro-0813-onovoita-ai-ga-release-dspark-and-pricing/]
