Nein – Anthropic bietet kein eigenes Embedding-Modell an. Die eigene Dokumentation von Anthropic sagt es klar: „Anthropic bietet kein eigenes Embedding-Modell an" und verweist Entwickler stattdessen auf Voyage AI als empfohlenen Embeddings-Partner. (Geprüft am 08.09.2026 via platform.claude.com/docs/en/build-with-claude/embeddings.) Das ist die korrekte Antwort, aber es ist nicht die einzige Option. Die folgende Tabelle vergleicht Voyage AI mit zwei Open-Source-Embedding-Modellen, die Sie über einen OpenAI-kompatiblen Endpunkt auf Novita AI aufrufen können, ohne ein zweites SDK in Ihren Stack einzubinden.
| Modell | Preis pro Million Tokens | Kontextlänge | OpenAI-kompatibler Endpunkt |
|---|---|---|---|
Voyage voyage-4 (Anthropics empfohlener Anbieter) |
0,06 $ | 32.000 Tokens | Nein – verwendet Voyages eigenes SDK/REST-Format |
| BAAI BGE-M3 (Novita AI) | 0,01 $ | 8.192 Tokens | Ja – /openai/v1/embeddings |
| Qwen3 Embedding 8B (Novita AI) | 0,07 $ | 32.768 Tokens | Ja – /openai/v1/embeddings |
(Geprüft am 08.09.2026. Voyage voyage-4-Preise und Kontextlänge via docs.voyageai.com/docs/pricing und platform.claude.com/docs/en/build-with-claude/embeddings. BGE-M3- und Qwen3-Embedding-8B-Preise/Kontext via novita.ai/pricing: BGE-M3 gelistet mit Kontext 8192, Eingabepreis 0,01 $/Mt; Qwen3 Embedding 8B gelistet mit context_size 32768, Eingabepreis 0,07 $/Mt. Endpunkt-Kompatibilität via raw.githubusercontent.com/novitalabs/novita-skills/main/skills/novita-ai/references/llm-api.md: POST /openai/v1/embeddings.)
Warum Anthropic kein Embedding-Modell ausliefert
Claude wurde für Generierung und Reasoning entwickelt – Chat, Tool-Nutzung, agentische Workflows. Embeddings sind ein anderes Problem: Text in einen Vektor fester Länge für Ähnlichkeitssuche, Clustering oder Retrieval umwandeln. Anstatt ein separates Embedding-Modell zu bauen und zu warten, empfiehlt die Anthropic-Dokumentation, „eine Vielzahl von Embeddings-Anbietern zu bewerten, um die beste Lösung für Ihren spezifischen Anwendungsfall zu finden", wobei Voyage AI als primäre Option genannt wird, die in ihrem Leitfaden behandelt wird.
Das ist relevant für die Architektur einer Claude-basierten RAG-Pipeline: Sie benötigen immer einen zweiten API-Aufruf an einen Nicht-Anthropic-Endpunkt für den Embedding-Schritt, sei es Voyage oder etwas anderes.
Option 1: Voyage AI (Anthropics empfohlener Pfad)
| Modell | Kontextlänge | Preis pro Million Tokens | Kostenloses Kontingent |
|---|---|---|---|
voyage-4-large |
32.000 Tokens | 0,12 $ | Erste 200 Mio. Tokens kostenlos |
voyage-4 |
32.000 Tokens | 0,06 $ | Erste 200 Mio. Tokens kostenlos |
voyage-4-lite |
32.000 Tokens | 0,02 $ | Erste 200 Mio. Tokens kostenlos |
(Geprüft am 08.09.2026 via platform.claude.com/docs/en/build-with-claude/embeddings für Modellnamen/Kontextlänge und docs.voyageai.com/docs/pricing für das kostenlose Kontingent und die Token-Preise: „Die ersten 200 Millionen Tokens für voyage-4-large, voyage-4, voyage-4-lite … sind für jedes Konto kostenlos.")
Der Endpunkt von Voyage AI ist POST https://api.voyageai.com/v1/embeddings und verwendet ein eigenes SDK oder einen direkten REST-Aufruf – nicht das OpenAI-SDK-Format. Es ist eine solide Wahl, wenn Sie den von Anthropic empfohlenen Anbieter möchten und ein separates Konto und eine separate Abrechnungsbeziehung für Embeddings in Kauf nehmen.
Option 2: OpenAI-kompatible Open-Source-Embeddings auf Novita AI
Wenn Sie alles lieber hinter einem OpenAI-kompatiblen Client behalten möchten, anstatt ein Voyage-spezifisches SDK hinzuzufügen, hostet Novita AI Open-Source-Embedding-Modelle hinter demselben /openai/v1/embeddings-Endpunkt, den Sie bereits für Chat-Completions verwenden.
BGE-M3 unterstützt über 100 Sprachen und kombiniert dichte, Multi-Vector- und Sparse-Retrieval in einem Modell, mit einem Kontextfenster von 8.192 Tokens – ausreichend für die meisten Dokument-Chunks in einer RAG-Pipeline. (Geprüft am 08.09.2026 via novita.ai/pricing: „Kann über 100 Sprachen verarbeiten und Eingaben von kurzen Sätzen bis zu langen Dokumenten (bis zu 8.192 Tokens) … Spitzenwerte in Benchmarks wie MIRACL und MKQA.")
Qwen3 Embedding 8B belegte im Juni 2025 den 1. Platz auf dem MTEB-Multilingual-Ranking mit einer Punktzahl von 70,58 und unterstützt ein längeres Kontextfenster von 32.768 Tokens als BGE-M3. (Geprüft am 08.09.2026 via Hugging Face Modellkarte von Qwen/Qwen3-Embedding-8B, die die multilinguale MTEB-Punktzahl von 70,58 und den 1. Platz ausweist.) Es kostet mehr pro Token als BGE-M3, verarbeitet aber längere Eingaben ohne Chunking.
Aufruf aus Code, der bereits das OpenAI-SDK verwendet
from openai import OpenAI
import os
client = OpenAI(
base_url="https://api.novita.ai/openai/v1",
api_key=os.environ["NOVITA_API_KEY"],
)
response = client.embeddings.create(
model="baai/bge-m3",
input="Anthropic empfiehlt Voyage AI für Embeddings, aber dieser Text wird stattdessen mit BGE-M3 eingebettet.",
)
print(response.data[0].embedding[:5]) # erste 5 Dimensionen
Ersetzen Sie model="baai/bge-m3" durch model="qwen/qwen3-embedding-8b", um das Modell mit dem längeren Kontext zu verwenden. Beide akzeptieren einen String oder ein Array von Strings als input und geben data[].embedding als Float-Array zurück, das der Antwortform der OpenAI-Embeddings entspricht. (Geprüft am 08.09.2026 via raw.githubusercontent.com/novitalabs/novita-skills/main/skills/novita-ai/references/llm-api.md: POST /openai/v1/embeddings, Parameter input und model, „Returns data[].embedding (float array)".)
Welches Modell passt zu Ihrer Pipeline
Wenn Sie bereits tief im Anthropic-Ökosystem verwurzelt sind und den Anbieter nutzen möchten, den sie explizit prüfen, ist Voyage AI der Weg mit dem geringsten Reibungsverlust – Sie erhalten Matryoshka-artige Ausgaben mit variabler Dimension und Modelle, die für Code und mehrsprachiges Retrieval optimiert sind. Wenn Ihre Pipeline auf dem OpenAI-SDK basiert (LangChain, LlamaIndex oder ein benutzerdefinierter Client, der auf einen /embeddings-Endpunkt zeigt) und Sie ein zweites SDK nur für den Embedding-Schritt vermeiden möchten, lassen sich BGE-M3 oder Qwen3 Embedding 8B auf Novita AI mit einer Base-URL-Änderung und ohne neue Client-Bibliothek integrieren.
Die Kosten sind der andere Hebel: BGE-M3 mit 0,01 $ pro Million Tokens ist günstiger als jedes Voyage-Modell, einschließlich voyage-4-lite für 0,02 $. Wenn Ihre Kontextfenster innerhalb des BGE-M3-Limits von 8.192 Tokens liegen, sind das die niedrigsten Kosten pro Token der hier verglichenen vier Optionen. Wenn Sie längere Chunks einbetten müssen, ohne sie aufzuteilen, erreicht das Kontextfenster von Qwen3 Embedding 8B mit 32.768 Tokens die voyage-4-Familie von Voyage zu einem ähnlichen Preis pro Token (0,07 $ gegenüber 0,06 $).
FAQ
Hat Claude eine integrierte Embeddings-Funktion?
Nein. Die Dokumentation von Anthropic stellt direkt fest, dass Claude kein Embedding-Modell anbietet, und verweist Entwickler auf Drittanbieter, hauptsächlich Voyage AI.
Kann ich Voyage AI Embeddings mit Claude in derselben Pipeline verwenden?
Ja – das ist das beabsichtigte Muster. Sie rufen Claude für die Generierung und Voyage AI separat für Embeddings auf; es gibt keinen kombinierten Endpunkt.
Gibt es eine günstigere Alternative zu Voyage AI, die weiterhin mit OpenAI-kompatiblem Code funktioniert?
Ja. Open-Source-Modelle wie BAAI BGE-M3 und Qwen3 Embedding 8B werden auf Novita AI hinter einem OpenAI-kompatiblen /embeddings-Endpunkt gehostet, zu Preisen von 0,01 $ bzw. 0,07 $ pro Million Tokens, beide unter Voyages Preisgestaltung der mittleren Stufe.
Welches Kontextfenster sollte ich wählen?
BGE-M3 ist auf 8.192 Tokens pro Eingabe begrenzt; Qwen3 Embedding 8B und die aktuellen Voyage-Modelle unterstützen 32.000+ Tokens. Wählen Sie basierend auf Ihrer größten Chunk-Größe, nicht Ihrer durchschnittlichen.