Não — a Anthropic não oferece seu próprio modelo de embedding. A própria documentação da Anthropic afirma claramente: “A Anthropic não oferece seu próprio modelo de embedding”, e direciona os desenvolvedores para a Voyage AI como sua parceira recomendada para embeddings. (Verificado em 2026-09-08 via platform.claude.com/docs/en/build-with-claude/embeddings.) Essa é a resposta correta, mas não é a única opção. A tabela abaixo compara a Voyage AI com dois modelos de embedding open-source que você pode chamar através de um endpoint compatível com a OpenAI na Novita AI, sem adicionar um segundo SDK à sua stack.
| Modelo | Preço por milhão de tokens | Comprimento do contexto | Endpoint compatível com OpenAI |
|---|---|---|---|
Voyage voyage-4 (fornecedor recomendado pela Anthropic) |
$0,06 | 32.000 tokens | Não — usa o próprio SDK/formato REST da Voyage |
| BAAI BGE-M3 (Novita AI) | $0,01 | 8.192 tokens | Sim — /openai/v1/embeddings |
| Qwen3 Embedding 8B (Novita AI) | $0,07 | 32.768 tokens | Sim — /openai/v1/embeddings |
(Verificado em 2026-09-08. Preço e tamanho do contexto do Voyage voyage-4 via docs.voyageai.com/docs/pricing e platform.claude.com/docs/en/build-with-claude/embeddings. Preço/contexto do BGE-M3 e Qwen3 Embedding 8B via novita.ai/pricing: BGE-M3 listado com contexto 8192, preço de entrada $0,01/Mt; Qwen3 Embedding 8B listado com context_size 32768, preço de entrada $0,07/Mt. Compatibilidade de endpoint via raw.githubusercontent.com/novitalabs/novita-skills/main/skills/novita-ai/references/llm-api.md: POST /openai/v1/embeddings.)
Por que a Anthropic Não Disponibiliza um Modelo de Embedding
O Claude foi construído para geração e raciocínio — chat, uso de ferramentas, fluxos de trabalho agentivos. Embeddings são um problema diferente: transformar texto em um vetor de tamanho fixo para busca por similaridade, clustering ou recuperação. Em vez de construir e manter um modelo de embedding separado, a documentação da Anthropic recomenda avaliar “uma variedade de fornecedores de embeddings para encontrar a melhor opção para seu caso de uso específico”, com a Voyage AI nomeada como a principal opção abordada no guia.
Isso é importante para como você arquiteta um pipeline RAG baseado em Claude: você sempre precisará de uma segunda chamada de API para um endpoint que não seja da Anthropic para a etapa de embedding, seja Voyage ou outra opção.
Opção 1: Voyage AI (Caminho Recomendado pela Anthropic)
| Modelo | Comprimento do contexto | Preço por milhão de tokens | Nível gratuito |
|---|---|---|---|
voyage-4-large |
32.000 tokens | $0,12 | Primeiros 200M tokens grátis |
voyage-4 |
32.000 tokens | $0,06 | Primeiros 200M tokens grátis |
voyage-4-lite |
32.000 tokens | $0,02 | Primeiros 200M tokens grátis |
(Verificado em 2026-09-08 via platform.claude.com/docs/en/build-with-claude/embeddings para nomes de modelos/tamanho do contexto, e docs.voyageai.com/docs/pricing para os valores do nível gratuito e por token: “Os primeiros 200 milhões de tokens para voyage-4-large, voyage-4, voyage-4-lite… são gratuitos para toda conta.”)
O endpoint da Voyage AI é POST https://api.voyageai.com/v1/embeddings, usando seu próprio SDK ou uma chamada REST direta — não o formato do SDK da OpenAI. É uma escolha sólida se você quiser o fornecedor endossado pela Anthropic e não se importar com uma conta separada e relacionamento de faturamento para embeddings.
Opção 2: Embeddings Open-Source Compatíveis com OpenAI na Novita AI
Se você preferir manter tudo em um único cliente compatível com OpenAI em vez de adicionar um SDK específico da Voyage, a Novita AI hospeda modelos de embedding open-source por trás do mesmo endpoint /openai/v1/embeddings que você já usaria para conclusões de chat.
BGE-M3 suporta mais de 100 idiomas e combina recuperação densa, multi-vetor e esparsa em um único modelo, com uma janela de contexto de 8.192 tokens — o suficiente para a maioria dos chunks de documentos em um pipeline RAG. (Verificado em 2026-09-08 via novita.ai/pricing: “Capaz de processar mais de 100 idiomas e entradas que variam de frases curtas a documentos longos (até 8.192 tokens)… superando benchmarks como MIRACL e MKQA.”)
Qwen3 Embedding 8B ficou em 1º lugar no ranking multilíngue do MTEB com uma pontuação de 70,58 em seu lançamento em junho de 2025, e suporta uma janela de contexto mais longa de 32.768 tokens do que o BGE-M3. (Verificado em 2026-09-08 via o card do modelo Qwen/Qwen3-Embedding-8B no Hugging Face, que relata a pontuação multilíngue de 70,58 no MTEB e o ranking nº 1.) Custa mais por token do que o BGE-M3, mas lida com entradas mais longas sem necessidade de chunking.
Chamando a Partir de Código que Já Usa o SDK da OpenAI
from openai import OpenAI
import os
client = OpenAI(
base_url="https://api.novita.ai/openai/v1",
api_key=os.environ["NOVITA_API_KEY"],
)
response = client.embeddings.create(
model="baai/bge-m3",
input="A Anthropic recomenda a Voyage AI para embeddings, mas este texto está sendo incorporado com BGE-M3.",
)
print(response.data[0].embedding[:5]) # primeiras 5 dimensões
Substitua model="baai/bge-m3" por model="qwen/qwen3-embedding-8b" para usar o modelo de contexto mais longo. Ambos aceitam uma string ou array de strings como input e retornam data[].embedding como um array float, correspondendo à forma da resposta de embeddings da OpenAI. (Verificado em 2026-09-08 via raw.githubusercontent.com/novitalabs/novita-skills/main/skills/novita-ai/references/llm-api.md: POST /openai/v1/embeddings, parâmetros input e model, “Retorna data[].embedding (array float).”)
Qual deles se adequa ao seu Pipeline
Se você já está profundamente no ecossistema da Anthropic e quer o fornecedor que eles explicitamente aprovam, a Voyage AI é o caminho com menos atrito — você obtém saída de dimensão variável no estilo Matryoshka e modelos ajustados para código e recuperação multilíngue. Se o seu pipeline é baseado no SDK da OpenAI (LangChain, LlamaIndex ou um cliente personalizado apontado para um endpoint /embeddings) e você quer evitar um segundo SDK apenas para a etapa de embedding, o BGE-M3 ou o Qwen3 Embedding 8B na Novita AI se encaixam com uma mudança de URL base e nenhuma nova biblioteca de cliente.
O custo é outra alavanca: o BGE-M3 a $0,01 por milhão de tokens é mais barato que todos os modelos da Voyage, incluindo o voyage-4-lite a $0,02. Se suas janelas de contexto cabem dentro do limite de 8.192 tokens do BGE-M3, esse é o menor custo por token das quatro opções comparadas aqui. Se você precisa incorporar chunks mais longos sem dividi-los, a janela de 32.768 tokens do Qwen3 Embedding 8B corresponde à família voyage-4 da Voyage a um preço por token semelhante ($0,07 contra $0,06).
FAQ
O Claude possui um recurso de embeddings integrado?
Não. A documentação da Anthropic afirma diretamente que o Claude não oferece um modelo de embedding e direciona os desenvolvedores para provedores terceiros, principalmente a Voyage AI.
Posso usar embeddings da Voyage AI com o Claude no mesmo pipeline?
Sim — esse é o padrão pretendido. Você chama o Claude para geração e a Voyage AI separadamente para embeddings; não existe um endpoint combinado.
Existe uma alternativa mais barata à Voyage AI que ainda funcione com código no estilo OpenAI?
Sim. Modelos open-source como BAAI BGE-M3 e Qwen3 Embedding 8B são hospedados na Novita AI por trás de um endpoint /embeddings compatível com OpenAI, a $0,01 e $0,07 por milhão de tokens respectivamente, ambos abaixo do preço de nível médio da Voyage.
Qual janela de contexto devo escolher?
O BGE-M3 tem um limite de 8.192 tokens por entrada; o Qwen3 Embedding 8B e os modelos de última geração da Voyage suportam ambos 32.000+ tokens. Escolha com base no tamanho do maior chunk, não na média.