Anthropic propose-t-il une API d'embeddings ? Que choisir à la place

Anthropic propose-t-il une API d'embeddings ? Que choisir à la place

Non — Anthropic ne propose pas son propre modèle d’embedding. La documentation d’Anthropic est claire : « Anthropic ne propose pas son propre modèle d’embedding » et redirige les développeurs vers Voyage AI comme partenaire recommandé pour les embeddings. (Vérifié le 08/09/2026 sur platform.claude.com/docs/en/build-with-claude/embedddings.) C’est la réponse exacte, mais ce n’est pas la seule option. Le tableau ci-dessous compare Voyage AI à deux modèles d’embedding open-source que vous pouvez appeler via un endpoint compatible OpenAI sur Novita AI, sans ajouter un second SDK à votre stack.

Modèle Prix par million de tokens Longueur de contexte Endpoint compatible OpenAI
Voyage voyage-4 (fournisseur recommandé par Anthropic) 0,06 $ 32 000 tokens Non — utilise son propre SDK/format REST
BAAI BGE-M3 (Novita AI) 0,01 $ 8 192 tokens Oui — /openai/v1/embeddings
Qwen3 Embedding 8B (Novita AI) 0,07 $ 32 768 tokens Oui — /openai/v1/embeddings

(Vérifié le 08/09/2026. Tarifs et longueur de contexte de Voyage voyage-4 via docs.voyageai.com/docs/pricing et platform.claude.com/docs/en/build-with-claude/embeddings. Tarifs/contexte de BGE-M3 et Qwen3 Embedding 8B via novita.ai/pricing : BGE-M3 listé avec un contexte de 8192, tarif d’entrée à 0,01 $/Mt ; Qwen3 Embedding 8B listé avec une taille de contexte de 32768, tarif d’entrée à 0,07 $/Mt. Compatibilité des endpoints via raw.githubusercontent.com/novitalabs/novita-skills/main/skills/novita-ai/references/llm-api.md : POST /openai/v1/embeddings.)

Pourquoi Anthropic ne fournit pas de modèle d’embedding

Claude est conçu pour la génération et le raisonnement — chat, utilisation d’outils, workflows agentiques. Les embeddings sont un problème différent : transformer du texte en un vecteur de longueur fixe pour la recherche de similarité, le clustering ou la récupération. Plutôt que de construire et maintenir un modèle d’embedding séparé, la documentation d’Anthropic recommande d’évaluer « une variété de fournisseurs d’embeddings pour trouver la meilleure solution pour votre cas d’utilisation spécifique », Voyage AI étant nommé comme l’option principale couverte dans leur guide.

Cela a son importance pour la façon dont vous architectez un pipeline RAG basé sur Claude : vous aurez toujours besoin d’un deuxième appel API vers un endpoint non-Anthropic pour l’étape d’embedding, que ce soit Voyage ou autre chose.

Option 1 : Voyage AI (chemin recommandé par Anthropic)

Modèle Longueur de contexte Prix par million de tokens Niveau gratuit
voyage-4-large 32 000 tokens 0,12 $ 200 premiers millions de tokens gratuits
voyage-4 32 000 tokens 0,06 $ 200 premiers millions de tokens gratuits
voyage-4-lite 32 000 tokens 0,02 $ 200 premiers millions de tokens gratuits

(Vérifié le 08/09/2026 via platform.claude.com/docs/en/build-with-claude/embeddings pour les noms de modèles/longueur de contexte, et docs.voyageai.com/docs/pricing pour les chiffres du niveau gratuit et par token : « Les premiers 200 millions de tokens pour voyage-4-large, voyage-4, voyage-4-lite… sont gratuits pour chaque compte. »)

L’endpoint de Voyage AI est POST https://api.voyageai.com/v1/embeddings, utilisant son propre SDK ou un appel REST direct — pas le format du SDK OpenAI. C’est un choix solide si vous voulez le fournisseur approuvé par Anthropic et que cela ne vous dérange pas d’avoir un compte et une relation de facturation séparés pour les embeddings.

Option 2 : Embeddings open-source compatibles OpenAI sur Novita AI

Si vous préférez garder le tout derrière un seul client compatible OpenAI plutôt que d’ajouter un SDK spécifique à Voyage, Novita AI héberge des modèles d’embedding open-source derrière le même endpoint /openai/v1/embeddings que vous utiliseriez déjà pour les complétions de chat.

BGE-M3 prend en charge plus de 100 langues et combine la récupération dense, multi-vecteur et sparse en un seul modèle, avec une fenêtre de contexte de 8 192 tokens — suffisante pour la plupart des morceaux de documents dans un pipeline RAG. (Vérifié le 08/09/2026 via novita.ai/pricing : « Capable de traiter plus de 100 langues et des entrées allant de phrases courtes à des documents longs (jusqu’à 8 192 tokens)… en tête des benchmarks comme MIRACL et MKQA. »)

Qwen3 Embedding 8B s’est classé n°1 au classement multilingue MTEB avec un score de 70,58 lors de sa sortie en juin 2025, et prend en charge une fenêtre de contexte plus longue de 32 768 tokens que BGE-M3. (Vérifié le 08/09/2026 via la fiche du modèle Qwen/Qwen3-Embedding-8B sur Hugging Face, qui rapporte le score multilingue MTEB de 70,58 et le classement n°1.) Il coûte plus par token que BGE-M3 mais traite des entrées plus longues sans découpage.

Appel depuis un code qui utilise déjà le SDK OpenAI

from openai import OpenAI
import os

client = OpenAI(
    base_url="https://api.novita.ai/openai/v1",
    api_key=os.environ["NOVITA_API_KEY"],
)

response = client.embeddings.create(
    model="baai/bge-m3",
    input="Anthropic recommande Voyage AI pour les embeddings, mais ce texte est encodé avec BGE-M3 à la place.",
)

print(response.data[0].embedding[:5])  # 5 premières dimensions

Remplacez model="baai/bge-m3" par model="qwen/qwen3-embedding-8b" pour utiliser le modèle à contexte plus long. Les deux acceptent une chaîne ou un tableau de chaînes comme input et renvoient data[].embedding sous forme de tableau flottant, correspondant à la forme de réponse des embeddings OpenAI. (Vérifié le 08/09/2026 via raw.githubusercontent.com/novitalabs/novita-skills/main/skills/novita-ai/references/llm-api.md : POST /openai/v1/embeddings, paramètres input et model, « Renvoie data[].embedding (tableau flottant). »)

Lequel correspond à votre pipeline

Si vous êtes déjà profondément dans l’écosystème d’Anthropic et souhaitez le fournisseur qu’ils approuvent explicitement, Voyage AI est la voie avec le moins de friction — vous obtenez une sortie à dimensions variables de style Matriochka et des modèles optimisés pour le code et la récupération multilingue. Si votre pipeline est basé sur le SDK OpenAI (LangChain, LlamaIndex, ou un client personnalisé pointant vers un endpoint /embeddings) et que vous souhaitez éviter un deuxième SDK juste pour l’étape d’embedding, BGE-M3 ou Qwen3 Embedding 8B sur Novita AI s’intègrent avec un simple changement d’URL de base et sans nouvelle bibliothèque cliente.

Le coût est l’autre levier : BGE-M3 à 0,01 $ par million de tokens est moins cher que tous les modèles Voyage, y compris voyage-4-lite à 0,02 $. Si vos fenêtres de contexte tiennent dans la limite de 8 192 tokens de BGE-M3, c’est le coût par token le plus bas des quatre options comparées ici. Si vous avez besoin d’encoder des morceaux plus longs sans les diviser, la fenêtre de 32 768 tokens de Qwen3 Embedding 8B correspond à la famille voyage-4 de Voyage à un prix par token similaire (0,07 $ contre 0,06 $).

FAQ

Est-ce que Claude dispose d’une fonctionnalité d’embedding intégrée ? Non. La documentation d’Anthropic indique directement que Claude ne propose pas de modèle d’embedding et oriente les développeurs vers des fournisseurs tiers, principalement Voyage AI.

Puis-je utiliser les embeddings de Voyage AI avec Claude dans le même pipeline ? Oui — c’est le modèle prévu. Vous appelez Claude pour la génération et Voyage AI séparément pour les embeddings ; il n’y a pas de point de terminaison combiné.

Existe-t-il une alternative moins chère à Voyage AI qui fonctionne toujours avec du code de style OpenAI ? Oui. Des modèles open-source comme BAAI BGE-M3 et Qwen3 Embedding 8B sont hébergés sur Novita AI derrière un endpoint /embeddings compatible OpenAI, à 0,01 $ et 0,07 $ par million de tokens respectivement, tous deux en dessous des tarifs intermédiaires de Voyage.

Quelle fenêtre de contexte dois-je choisir ? BGE-M3 plafonne à 8 192 tokens par entrée ; Qwen3 Embedding 8B et les modèles actuels de Voyage prennent en charge 32 000+ tokens. Choisissez en fonction de la taille de vos plus gros morceaux, pas de la taille moyenne.

Articles recommandés