Hat Anthropic eine Embeddings-API? Was stattdessen zu verwenden ist

Hat Anthropic eine Embeddings-API? Was stattdessen zu verwenden ist

Nein – Anthropic bietet kein eigenes Embedding-Modell an. Anthropics eigene Dokumentation stellt klar: „Anthropic bietet kein eigenes Embedding-Modell an“ und verweist Entwickler stattdessen auf Voyage AI als empfohlenen Embedding-Partner. (Geprüft am 2026-09-08 über platform.claude.com/docs/en/build-with-claude/embeddings.) Das ist die richtige Antwort, aber es ist nicht die einzige Option. Die folgende Tabelle vergleicht Voyage AI mit zwei Open-Source-Embedding-Modellen, die Sie über einen OpenAI-kompatiblen Endpunkt auf Novita AI aufrufen können, ohne ein zweites SDK zu Ihrem Stack hinzuzufügen.

Modell Preis pro Million Tokens Kontextlänge OpenAI-kompatibler Endpunkt
Voyage voyage-4 (Anthropics empfohlener Anbieter) 0,06 $ 32.000 Tokens Nein – verwendet eigenes SDK/REST-Format
BAAI BGE-M3 (Novita AI) 0,01 $ 8.192 Tokens Ja – /openai/v1/embeddings
Qwen3 Embedding 8B (Novita AI) 0,07 $ 32.768 Tokens Ja – /openai/v1/embeddings

(Geprüft am 2026-09-08. Preise und Kontextlänge von Voyage voyage-4 über docs.voyageai.com/docs/pricing und platform.claude.com/docs/en/build-with-claude/embeddings. Preise/Kontext von BGE-M3 und Qwen3 Embedding 8B über novita.ai/pricing: BGE-M3 mit Kontext 8192 und Eingabepreis 0,01 $/Mio. Tokens; Qwen3 Embedding 8B mit Kontextgröße 32768 und Eingabepreis 0,07 $/Mio. Tokens. Endpunkt-Kompatibilität über raw.githubusercontent.com/novitalabs/novita-skills/main/skills/novita-ai/references/llm-api.md: POST /openai/v1/embeddings.)

Warum Anthropic kein Embedding-Modell ausliefert

Claude wurde für Generierung und Reasoning entwickelt – Chat, Tool-Nutzung, agentische Workflows. Embeddings sind ein anderes Problem: Text in einen Vektor fester Länge umwandeln für Ähnlichkeitssuche, Clustering oder Retrieval. Anstatt ein separates Embedding-Modell zu entwickeln und zu warten, empfehlen Anthropics Dokumentationen, „eine Vielzahl von Embedding-Anbietern zu bewerten, um die beste Lösung für Ihren spezifischen Anwendungsfall zu finden“, wobei Voyage AI als primäre Option in ihrem Leitfaden genannt wird.

Dies ist wichtig für die Architektur einer Claude-basierten RAG-Pipeline: Sie benötigen immer einen zweiten API-Aufruf an einen Nicht-Anthropic-Endpunkt für den Embedding-Schritt, sei es Voyage oder etwas anderes.

Option 1: Voyage AI (Anthropics empfohlener Weg)

Modell Kontextlänge Preis pro Million Tokens Kostenlose Stufe
voyage-4-large 32.000 Tokens 0,12 $ Erste 200M Tokens kostenlos
voyage-4 32.000 Tokens 0,06 $ Erste 200M Tokens kostenlos
voyage-4-lite 32.000 Tokens 0,02 $ Erste 200M Tokens kostenlos

(Geprüft am 2026-09-08 über platform.claude.com/docs/en/build-with-claude/embeddings für Modellnamen/Kontextlänge und docs.voyageai.com/docs/pricing für die kostenlose Stufe und Preise pro Token: „Die ersten 200 Millionen Tokens für voyage-4-large, voyage-4, voyage-4-lite… sind für jedes Konto kostenlos.“)

Der Endpunkt von Voyage AI ist POST https://api.voyageai.com/v1/embeddings und verwendet ein eigenes SDK oder einen direkten REST-Aufruf – nicht das OpenAI SDK-Format. Es ist eine solide Wahl, wenn Sie den von Anthropic empfohlenen Anbieter möchten und kein Problem mit einem separaten Konto und eigener Abrechnung für Embeddings haben.

Option 2: OpenAI-kompatible Open-Source-Embeddings auf Novita AI

Wenn Sie lieber alles hinter einem OpenAI-kompatiblen Client behalten, anstatt ein Voyage-spezifisches SDK hinzuzufügen, hostet Novita AI Open-Source-Embedding-Modelle hinter demselben /openai/v1/embeddings-Endpunkt, den Sie bereits für Chat-Completions verwenden.

BGE-M3 unterstützt über 100 Sprachen und kombiniert dichtes, Multi-Vector und sparse Retrieval in einem Modell, mit einem Kontextfenster von 8.192 Tokens – genug für die meisten Dokument-Chunks in einer RAG-Pipeline. (Geprüft am 2026-09-08 über novita.ai/pricing: „Fähig, über 100 Sprachen und Eingaben von kurzen Sätzen bis zu langen Dokumenten (bis zu 8.192 Tokens) zu verarbeiten… und Spitzenwerte in Benchmarks wie MIRACL und MKQA zu erzielen.“)

Qwen3 Embedding 8B belegte Platz 1 im multilingualen MTEB-Ranking mit einer Punktzahl von 70,58 (Stand Veröffentlichung Juni 2025) und unterstützt ein längeres Kontextfenster von 32.768 Tokens als BGE-M3. (Geprüft am 2026-09-08 über die Modellkarte von Hugging Face Qwen/Qwen3-Embedding-8B, die die multilinguale MTEB-Punktzahl von 70,58 und die Platzierung Nr. 1 meldet.) Es kostet mehr pro Token als BGE-M3, verarbeitet aber längere Eingaben ohne Chunking.

Aufruf aus Code, der bereits das OpenAI SDK verwendet

from openai import OpenAI
import os

client = OpenAI(
    base_url="https://api.novita.ai/openai/v1",
    api_key=os.environ["NOVITA_API_KEY"],
)

response = client.embeddings.create(
    model="baai/bge-m3",
    input="Anthropic recommends Voyage AI for embeddings, but this text is being embedded with BGE-M3 instead.",
)

print(response.data[0].embedding[:5])  # first 5 dimensions

Tauschen Sie model="baai/bge-m3" gegen model="qwen/qwen3-embedding-8b" aus, um das Modell mit längerem Kontext zu verwenden. Beide akzeptieren einen String oder ein String-Array als input und geben data[].embedding als Float-Array zurück, entsprechend der Antwortstruktur der OpenAI-Embeddings. (Geprüft am 2026-09-08 über raw.githubusercontent.com/novitalabs/novita-skills/main/skills/novita-ai/references/llm-api.md: POST /openai/v1/embeddings, Parameter input und model, „Gibt data[].embedding (Float-Array) zurück.“)

Welches zu Ihrer Pipeline passt

Wenn Sie bereits tief im Anthropic-Ökosystem stecken und den von ihnen explizit geprüften Anbieter möchten, ist Voyage AI der Weg mit der geringsten Reibung – Sie erhalten einen Ausgang variabler Dimension im Matroschka-Stil und Modelle, die für Code und multilinguales Retrieval optimiert sind. Wenn Ihre Pipeline auf dem OpenAI SDK basiert (LangChain, LlamaIndex oder ein benutzerdefinierter Client, der auf einen /embeddings-Endpunkt zeigt) und Sie ein zweites SDK nur für den Embedding-Schritt vermeiden möchten, passen BGE-M3 oder Qwen3 Embedding 8B auf Novita AI mit einer Änderung der Basis-URL und ohne neue Client-Bibliothek.

Die Kosten sind der andere Hebel: BGE-M3 mit 0,01 $ pro Million Tokens ist günstiger als jedes Voyage-Modell, einschließlich voyage-4-lite mit 0,02 $. Wenn Ihre Kontextfenster in das 8.192-Token-Limit von BGE-M3 passen, sind dies die niedrigsten Kosten pro Token der vier hier verglichenen Optionen. Wenn Sie längere Chunks ohne Aufteilung embedden müssen, entspricht das 32.768-Token-Fenster von Qwen3 Embedding 8B der voyage-4-Familie zu einem ähnlichen Preis pro Token (0,07 $ gegenüber 0,06 $).

FAQ

Hat Claude eine integrierte Embeddings-Funktion?
Nein. Anthropics Dokumentation stellt direkt fest, dass Claude kein Embedding-Modell anbietet, und verweist Entwickler auf Drittanbieter, hauptsächlich Voyage AI.

Kann ich Voyage AI-Embeddings mit Claude in derselben Pipeline verwenden?
Ja – das ist das beabsichtigte Muster. Sie rufen Claude für die Generierung und Voyage AI separat für Embeddings auf; es gibt keinen kombinierten Endpunkt.

Gibt es eine günstigere Alternative zu Voyage AI, die weiterhin mit OpenAI-kompatiblem Code funktioniert?
Ja. Open-Source-Modelle wie BAAI BGE-M3 und Qwen3 Embedding 8B werden auf Novita AI hinter einem OpenAI-kompatiblen /embeddings-Endpunkt gehostet, zu 0,01 $ bzw. 0,07 $ pro Million Tokens, beide unter den Preisen der mittleren Voyage-Stufe.

Welches Kontextfenster sollte ich wählen?
BGE-M3 ist auf 8.192 Tokens pro Eingabe begrenzt; Qwen3 Embedding 8B und Voyages aktuelle Modelle unterstützen beide 32.000+ Tokens. Wählen Sie basierend auf Ihrer größten Chunk-Größe, nicht auf der durchschnittlichen.

Empfohlene Artikel