Non — Anthropic ne propose pas son propre modèle d’embedding. La documentation d’Anthropic le dit clairement : « Anthropic ne propose pas son propre modèle d’embedding », et oriente les développeurs vers Voyage AI comme partenaire d’embedging recommandé. (Vérifié le 2026-09-08 via platform.claude.com/docs/en/build-with-claude/embeddings.) C’est la réponse exacte, mais ce n’est pas la seule option. Le tableau ci-dessous compare Voyage AI à deux modèles d’embedding open source que vous pouvez appeler via un point d’accès compatible OpenAI sur Novita AI, sans ajouter un deuxième SDK à votre pile technique.
| Modèle | Prix par million de tokens | Longueur du contexte | Point d’accès compatible OpenAI |
|---|---|---|---|
Voyage voyage-4 (fournisseur recommandé par Anthropic) |
0,06 $ | 32 000 tokens | Non — utilise le propre SDK/format REST de Voyage |
| BAAI BGE-M3 (Novita AI) | 0,01 $ | 8 192 tokens | Oui — /openai/v1/embeddings |
| Qwen3 Embedding 8B (Novita AI) | 0,07 $ | 32 768 tokens | Oui — /openai/v1/embeddings |
(Vérifié le 2026-09-08. Prix et longueur de contexte de Voyage voyage-4 via docs.voyageai.com/docs/pricing et platform.claude.com/docs/en/build-with-claude/embeddings. Prix/contexte de BGE-M3 et Qwen3 Embedding 8B via novita.ai/pricing : BGE-M3 listé avec un contexte de 8192, prix d’entrée 0,01 $/Mt ; Qwen3 Embedding 8B listé avec une taille de contexte de 32768, prix d’entrée 0,07 $/Mt. Compatibilité des points d’accès via raw.githubusercontent.com/novitalabs/novita-skills/main/skills/novita-ai/references/llm-api.md : POST /openai/v1/embeddings.)
Pourquoi Anthropic ne propose pas de modèle d’embedding
Claude est conçu pour la génération et le raisonnement — chat, utilisation d’outils, workflows agents. Les embeddings sont un problème différent : transformer du texte en un vecteur de longueur fixe pour la recherche de similarité, le clustering ou la récupération. Plutôt que de construire et maintenir un modèle d’embedding séparé, la documentation d’Anthropic recommande d’évaluer « une variété de fournisseurs d’embedding pour trouver la meilleure solution pour votre cas d’utilisation spécifique », avec Voyage AI nommé comme option principale couverte dans leur guide.
Cela a son importance pour la façon dont vous architecturez un pipeline RAG basé sur Claude : vous aurez toujours besoin d’un deuxième appel API vers un point d’accès non Anthropic pour l’étape d’embedding, que ce soit Voyage ou autre chose.
Option 1 : Voyage AI (voie recommandée par Anthropic)
| Modèle | Longueur du contexte | Prix par million de tokens | Niveau gratuit |
|---|---|---|---|
voyage-4-large |
32 000 tokens | 0,12 $ | 200 premiers millions de tokens gratuits |
voyage-4 |
32 000 tokens | 0,06 $ | 200 premiers millions de tokens gratuits |
voyage-4-lite |
32 000 tokens | 0,02 $ | 200 premiers millions de tokens gratuits |
(Vérifié le 2026-09-08 via platform.claude.com/docs/en/build-with-claude/embeddings pour les noms de modèles/longueur de contexte, et docs.voyageai.com/docs/pricing pour les chiffres du niveau gratuit et par token : « Les 200 premiers millions de tokens pour voyage-4-large, voyage-4, voyage-4-lite… sont gratuits pour chaque compte ».)
Le point d’accès de Voyage AI est POST https://api.voyageai.com/v1/embeddings, en utilisant son propre SDK ou un appel REST direct — pas le format du SDK OpenAI. C’est un choix solide si vous voulez le fournisseur approuvé par Anthropic et que cela ne vous dérange pas d’avoir un compte et une relation de facturation séparés pour les embeddings.
Option 2 : Embeddings open source compatibles OpenAI sur Novita AI
Si vous préférez tout garder derrière un client compatible OpenAI plutôt que d’ajouter un SDK spécifique à Voyage, Novita AI héberge des modèles d’embedding open source derrière le même point d’accès /openai/v1/embeddings que vous utiliseriez déjà pour les complétions de chat.
BGE-M3 prend en charge plus de 100 langues et combine la récupération dense, multi-vecteurs et sparse en un seul modèle, avec une fenêtre de contexte de 8 192 tokens — suffisante pour la plupart des morceaux de documents dans un pipeline RAG. (Vérifié le 2026-09-08 via novita.ai/pricing : « Capable de traiter plus de 100 langues et des entrées allant de courtes phrases à de longs documents (jusqu’à 8 192 tokens)… en tête des benchmarks comme MIRACL et MKQA ».)
Qwen3 Embedding 8B s’est classé n°1 sur le classement multilingue MTEB avec un score de 70,58 lors de sa sortie en juin 2025, et prend en charge une fenêtre de contexte plus longue de 32 768 tokens que BGE-M3. (Vérifié le 2026-09-08 via la fiche du modèle Hugging Face Qwen/Qwen3-Embedding-8B, qui rapporte le score multilingue MTEB de 70,58 et le classement n°1.) Il coûte plus cher par token que BGE-M3 mais gère des entrées plus longues sans avoir à les diviser.
Appel depuis du code qui utilise déjà le SDK OpenAI
from openai import OpenAI
import os
client = OpenAI(
base_url="https://api.novita.ai/openai/v1",
api_key=os.environ["NOVITA_API_KEY"],
)
response = client.embeddings.create(
model="baai/bge-m3",
input="Anthropic recommande Voyage AI pour les embeddings, mais ce texte est embeddé avec BGE-M3 à la place.",
)
print(response.data[0].embedding[:5]) # premières 5 dimensions
Remplacez model="baai/bge-m3" par model="qwen/qwen3-embedding-8b" pour utiliser le modèle à contexte plus long. Les deux acceptent une chaîne ou un tableau de chaînes comme input et renvoient data[].embedding sous forme de tableau de flottants, correspondant à la forme de réponse des embeddings OpenAI. (Vérifié le 2026-09-08 via raw.githubusercontent.com/novitalabs/novita-skills/main/skills/novita-ai/references/llm-api.md : POST /openai/v1/embeddings, paramètres input et model, « Renvoie data[].embedding (tableau de flottants) ».)
Lequel correspond à votre pipeline
Si vous êtes déjà profondément dans l’écosystème d’Anthropic et que vous voulez le fournisseur qu’ils vérifient explicitement, Voyage AI est la voie avec le moins de friction — vous obtenez une sortie à dimensions variables de style Matryoshka et des modèles adaptés à la récupération de code et multilingue. Si votre pipeline est basé sur le SDK OpenAI (LangChain, LlamaIndex, ou un client personnalisé pointant vers un point d’accès /embeddings) et que vous voulez éviter un deuxième SDK juste pour l’étape d’embedding, BGE-M3 ou Qwen3 Embedding 8B sur Novita AI s’intègrent avec un simple changement d’URL de base et aucune nouvelle bibliothèque cliente.
Le coût est l’autre levier : BGE-M3 à 0,01 $ par million de tokens est moins cher que tous les modèles Voyage, y compris voyage-4-lite à 0,02 $. Si vos fenêtres de contexte tiennent dans la limite de 8 192 tokens de BGE-M3, c’est le coût par token le plus bas parmi les quatre options comparées ici. Si vous avez besoin d’embedder des morceaux plus longs sans les diviser, la fenêtre de 32 768 tokens de Qwen3 Embedding 8B correspond à la famille voyage-4 de Voyage pour un prix par token similaire (0,07 $ contre 0,06 $).
FAQ
Claude dispose-t-il d’une fonctionnalité d’embedding intégrée ?
Non. La documentation d’Anthropic indique directement que Claude ne propose pas de modèle d’embedding et oriente les développeurs vers des fournisseurs tiers, principalement Voyage AI.
Puis-je utiliser les embeddings Voyage AI avec Claude dans le même pipeline ?
Oui — c’est le modèle prévu. Vous appelez Claude pour la génération et Voyage AI séparément pour les embeddings ; il n’existe pas de point d’accès combiné.
Existe-t-il une alternative moins chère que Voyage AI qui fonctionne avec du code de style OpenAI ?
Oui. Des modèles open source comme BAAI BGE-M3 et Qwen3 Embedding 8B sont hébergés sur Novita AI derrière un point d’accès /embeddings compatible OpenAI, à 0,01 $ et 0,07 $ par million de tokens respectivement, tous deux en dessous du tarif intermédiaire de Voyage.
Quelle fenêtre de contexte choisir ?
BGE-M3 plafonne à 8 192 tokens par entrée ; Qwen3 Embedding 8B et les modèles actuels de Voyage prennent en charge 32 000+ tokens. Choisissez en fonction de la taille de vos plus gros morceaux, pas de votre taille moyenne.