Anthropic에 임베딩 API가 있을까? 대신 사용할 것

Anthropic에 임베딩 API가 있을까? 대신 사용할 것

아니요 — Anthropic은 자체 임베딩 모델을 제공하지 않습니다. Anthropic의 공식 문서에는 "Anthropic은 자체 임베딩 모델을 제공하지 않습니다"라고 명시되어 있으며, 개발자에게 권장 임베딩 파트너로 Voyage AI를 안내하고 있습니다. (2026-09-08 확인, platform.claude.com/docs/en/build-with-claude/embeddings) 이것이 정확한 답변이지만, 유일한 선택지는 아닙니다. 아래 표는 Voyage AI를 Novita AI에서 OpenAI 호환 엔드포인트를 통해 호출할 수 있는 두 가지 오픈소스 임베딩 모델과 비교합니다. 두 번째 SDK를 스택에 추가할 필요가 없습니다.

모델 백만 토큰당 가격 컨텍스트 길이 OpenAI 호환 엔드포인트
Voyage voyage-4 (Anthropic 권장 벤더) $0.06 32,000 토큰 아니요 — Voyage 자체 SDK/REST 형식 사용
BAAI BGE-M3 (Novita AI) $0.01 8,192 토큰 예 — /openai/v1/embeddings
Qwen3 Embedding 8B (Novita AI) $0.07 32,768 토큰 예 — /openai/v1/embeddings

(2026-09-08 확인. Voyage voyage-4 가격 및 컨텍스트 길이는 docs.voyageai.com/docs/pricingplatform.claude.com/docs/en/build-with-claude/embeddings 참조. BGE-M3 및 Qwen3 Embedding 8B 가격/컨텍스트는 novita.ai/pricing 참조: BGE-M3는 컨텍스트 8192, 입력 가격 $0.01/Mt로 기재; Qwen3 Embedding 8B는 context_size 32768, 입력 가격 $0.07/Mt로 기재. 엔드포인트 호환성은 raw.githubusercontent.com/novitalabs/novita-skills/main/skills/novita-ai/references/llm-api.md 참조: POST /openai/v1/embeddings.)

Anthropic이 임베딩 모델을 제공하지 않는 이유

Claude는 생성과 추론(채팅, 도구 사용, 에이전트 워크플로)을 위해 구축되었습니다. 임베딩은 다른 문제입니다. 텍스트를 유사도 검색, 클러스터링, 또는 검색을 위한 고정 길이 벡터로 변환하는 것입니다. 별도의 임베딩 모델을 구축하고 유지 관리하는 대신, Anthropic 문서는 "특정 사용 사례에 가장 적합한 솔루션을 찾기 위해 다양한 임베딩 벤더를 평가"할 것을 권장하며, 그 가이드에서 Voyage AI를 주요 옵션으로 명시하고 있습니다.

이는 Claude 기반 RAG 파이프라인을 설계하는 방식에 중요합니다. 임베딩 단계를 위해 항상 Voyage든 다른 것이든 Anthropic이 아닌 엔드포인트에 두 번째 API 호출을 해야 하기 때문입니다.

옵션 1: Voyage AI (Anthropic 권장 경로)

모델 컨텍스트 길이 백만 토큰당 가격 무료 티어
voyage-4-large 32,000 토큰 $0.12 최초 2억 토큰 무료
voyage-4 32,000 토큰 $0.06 최초 2억 토큰 무료
voyage-4-lite 32,000 토큰 $0.02 최초 2억 토큰 무료

(2026-09-08 확인. 모델명/컨텍스트 길이는 platform.claude.com/docs/en/build-with-claude/embeddings, 무료 티어 및 토큰당 요금 정보는 docs.voyageai.com/docs/pricing 참조: “모든 계정에 대해 voyage-4-large, voyage-4, voyage-4-lite의 최초 2억 토큰이 무료입니다.”)

Voyage AI의 엔드포인트는 POST https://api.voyageai.com/v1/embeddings이며, 자체 SDK 또는 직접 REST 호출을 사용합니다. OpenAI SDK 형식이 아닙니다. Anthropic이 공식 추천하는 벤더를 사용하고 임베딩을 위한 별도의 계정 및 청구 관계를 감수할 의향이 있다면 좋은 선택입니다.

옵션 2: Novita AI의 OpenAI 호환 오픈소스 임베딩

Voyage 전용 SDK를 추가하는 대신 모든 것을 하나의 OpenAI 호환 클라이언트로 유지하고 싶다면, Novita AI는 챗 컴플리션에 이미 사용하는 것과 동일한 /openai/v1/embeddings 엔드포인트 뒤에 오픈소스 임베딩 모델을 호스팅합니다.

BGE-M3 는 100개 이상의 언어를 지원하며 조밀(dense), 멀티 벡터(multi-vector), 희소(sparse) 검색을 하나의 모델에 결합합니다. 8,192 토큰 컨텍스트 윈도우로 대부분의 RAG 파이프라인 문서 청크에 충분합니다. (2026-09-08 확인, novita.ai/pricing: “100개 이상의 언어와 짧은 문장에서 긴 문서(최대 8,192 토큰)에 이르는 입력을 처리할 수 있습니다… MIRACL 및 MKQA와 같은 벤치마크에서 최고 성능을 기록했습니다.”)

Qwen3 Embedding 8B 는 2025년 6월 출시 당시 MTEB 다국어 리더보드에서 70.58점으로 1위를 기록했으며, BGE-M3보다 긴 32,768 토큰 컨텍스트 윈도우를 지원합니다. (2026-09-08 확인, Hugging Face의 Qwen/Qwen3-Embedding-8B 모델 카드: 70.58 MTEB 다국어 점수 및 1위 기록 보고.) 토큰당 가격은 BGE-M3보다 비싸지만 청킹 없이 더 긴 입력을 처리할 수 있습니다.

이미 OpenAI SDK를 사용하는 코드에서 호출하기

from openai import OpenAI
import os

client = OpenAI(
    base_url="https://api.novita.ai/openai/v1",
    api_key=os.environ["NOVITA_API_KEY"],
)

response = client.embeddings.create(
    model="baai/bge-m3",
    input="Anthropic은 임베딩에 Voyage AI를 권장하지만, 이 텍스트는 대신 BGE-M3로 임베딩되고 있습니다.",
)

print(response.data[0].embedding[:5])  # 첫 5개 차원

더 긴 컨텍스트 모델을 사용하려면 model="baai/bge-m3"model="qwen/qwen3-embedding-8b"로 바꾸면 됩니다. 둘 다 input으로 문자열 또는 문자열 배열을 받고, OpenAI 임베딩 응답 형태와 일치하는 float 배열로 data[].embedding을 반환합니다. (2026-09-08 확인, raw.githubusercontent.com/novitalabs/novita-skills/main/skills/novita-ai/references/llm-api.md: POST /openai/v1/embeddings, 매개변수 inputmodel, “Returns data[].embedding (float array).”)

어떤 것이 파이프라인에 적합한가

이미 Anthropic 생태계에 깊이 관여하고 있고 Anthropic이 명시적으로 검증한 벤더를 원한다면 Voyage AI가 가장 마찰이 적은 경로입니다. Matryoshka 스타일의 가변 차원 출력과 코드 및 다국어 검색에 맞춰진 모델을 얻을 수 있습니다. 파이프라인이 OpenAI SDK 기반(LangChain, LlamaIndex 또는 /embeddings 엔드포인트를 가리키는 커스텀 클라이언트)이고 임베딩 단계를 위해 두 번째 SDK를 피하고 싶다면, Novita AI의 BGE-M3 또는 Qwen3 Embedding 8B가 기본 URL 변경만으로 새 클라이언트 라이브러리 없이 통합됩니다.

비용도 또 다른 고려 사항입니다. BGE-M3는 백만 토큰당 $0.01로 voyage-4-lite의 $0.02를 포함한 모든 Voyage 모델보다 저렴합니다. 컨텍스트 윈도우가 BGE-M3의 8,192 토큰 제한 내에 들어온다면, 여기서 비교한 네 가지 옵션 중 토큰당 비용이 가장 낮습니다. 분할 없이 더 긴 청크를 임베딩해야 한다면, Qwen3 Embedding 8B의 32,768 토큰 윈도우는 Voyage의 voyage-4 제품군과 유사한 토큰당 가격($0.07 대 $0.06)으로 일치합니다.

FAQ

Claude에 임베딩 기능이 내장되어 있나요? 아니요. Anthropic 문서는 Claude가 임베딩 모델을 제공하지 않으며, 개발자를 주로 Voyage AI와 같은 타사 제공업체로 안내한다고 명시하고 있습니다.

Voyage AI 임베딩을 동일한 파이프라인에서 Claude와 함께 사용할 수 있나요? 예 — 그것이 의도된 패턴입니다. 생성은 Claude에, 임베딩은 Voyage AI에 별도로 호출합니다. 결합된 엔드포인트는 없습니다.

OpenAI 스타일 코드에서도 작동하면서 Voyage AI보다 저렴한 대안이 있나요? 예. BAAI BGE-M3 및 Qwen3 Embedding 8B와 같은 오픈소스 모델이 Novita AI에서 OpenAI 호환 /embeddings 엔드포인트 뒤에 호스팅되며, 각각 백만 토큰당 $0.01 및 $0.07로 Voyage의 중간 가격대보다 낮습니다.

어떤 컨텍스트 윈도우를 선택해야 하나요? BGE-M3는 입력당 최대 8,192 토큰입니다. Qwen3 Embedding 8B와 Voyage의 현재 세대 모델은 모두 32,000+ 토큰을 지원합니다. 평균 청크 크기가 아닌 가장 큰 청크 크기를 기준으로 선택하세요.

추천 문서