A Anthropic tem uma API de embeddings? O que usar em vez dela

A Anthropic tem uma API de embeddings? O que usar em vez dela

Não — a Anthropic não oferece um modelo de embeddings próprio. A documentação da própria Anthropic afirma isso claramente: “A Anthropic não oferece um modelo de embeddings próprio”, e indica aos desenvolvedores a Voyage AI como a parceira recomendada para embeddings. (Verificado em 08/09/2026 via platform.claude.com/docs/en/build-with-claude/embeddings.) Essa é a resposta correta, mas não é a única opção. A tabela abaixo compara a Voyage AI com dois modelos de embeddings de código aberto que você pode chamar por meio de um endpoint compatível com OpenAI na Novita AI, sem adicionar um segundo SDK à sua stack.

Modelo Preço por milhão de tokens Tamanho do contexto Endpoint compatível com OpenAI
Voyage voyage-4 (fornecedor recomendado pela Anthropic) $0.06 32.000 tokens Não — usa o próprio SDK/formato REST da Voyage
BAAI BGE-M3 (Novita AI) $0.01 8.192 tokens Sim — /openai/v1/embeddings
Qwen3 Embedding 8B (Novita AI) $0.07 32.768 tokens Sim — /openai/v1/embeddings

(Verificado em 08/09/2026. Preço e tamanho de contexto do Voyage voyage-4 via docs.voyageai.com/docs/pricing e platform.claude.com/docs/en/build-with-claude/embeddings. Preço/contexto de BGE-M3 e Qwen3 Embedding 8B via novita.ai/pricing: BGE-M3 listado com contexto 8192, preço de entrada $0.01/Mt; Qwen3 Embedding 8B listado com context_size 32768, preço de entrada $0.07/Mt. Compatibilidade do endpoint via raw.githubusercontent.com/novitalabs/novita-skills/main/skills/novita-ai/references/llm-api.md: POST /openai/v1/embeddings.)

Por que a Anthropic não disponibiliza um modelo de embeddings

O Claude é projetado para geração e raciocínio — chat, uso de ferramentas, fluxos baseados em agentes. Embeddings são um problema diferente: transformar texto em um vetor de comprimento fixo para busca por similaridade, clustering ou recuperação. Em vez de criar e manter um modelo de embeddings separado, a documentação da Anthropic recomenda avaliar “uma variedade de fornecedores de embeddings para encontrar a melhor opção para seu caso de uso específico”, com a Voyage AI citada como a principal opção abordada no guia.

Isso importa para a arquitetura de um pipeline de RAG baseado no Claude: você sempre precisará de uma segunda chamada de API para um endpoint que não seja da Anthropic na etapa de embeddings, seja a Voyage ou outra solução.

Opção 1: Voyage AI (o caminho recomendado pela Anthropic)

Modelo Tamanho do contexto Preço por milhão de tokens Camada gratuita
voyage-4-large 32.000 tokens $0.12 Primeiros 200 milhões de tokens grátis
voyage-4 32.000 tokens $0.06 Primeiros 200 milhões de tokens grátis
voyage-4-lite 32.000 tokens $0.02 Primeiros 200 milhões de tokens grátis

(Verificado em 08/09/2026 via platform.claude.com/docs/en/build-with-claude/embeddings para nomes de modelos/tamanho de contexto e docs.voyageai.com/docs/pricing para os valores de camada gratuita e por token: “Os primeiros 200 milhões de tokens para voyage-4-large, voyage-4, voyage-4-lite… são gratuitos para toda conta.”)

O endpoint da Voyage AI é POST https://api.voyageai.com/v1/embeddings, usando o próprio SDK da Voyage ou uma chamada REST direta — não o formato do SDK da OpenAI. É uma escolha sólida se você quiser o fornecedor endossado pela Anthropic e não se importar em ter uma conta e relação de cobrança separadas para embeddings.

Opção 2: Embeddings de código aberto compatíveis com OpenAI na Novita AI

Se você prefere manter tudo em um único cliente compatível com OpenAI, em vez de adicionar um SDK específico da Voyage, a Novita AI hospeda modelos de embeddings de código aberto no mesmo endpoint /openai/v1/embeddings que você já usaria para chat completions.

O BGE-M3 suporta mais de 100 idiomas e combina busca densa, multivetorial e esparsa em um único modelo, com uma janela de contexto de 8.192 tokens — suficiente para a maioria dos fragmentos de documentos em um pipeline de RAG. (Verificado em 08/09/2026 via novita.ai/pricing: “Capaz de processar mais de 100 idiomas e entradas que vão de frases curtas a documentos extensos (até 8.192 tokens)… superando benchmarks como MIRACL e MKQA.”)

O Qwen3 Embedding 8B ficou em 1.º lugar no ranking multilíngue do MTEB, com uma pontuação de 70,58 em seu lançamento de junho de 2025, e suporta uma janela de contexto maior, de 32.768 tokens, em comparação ao BGE-M3. (Verificado em 08/09/2026 via ficha do modelo Qwen/Qwen3-Embedding-8B no Hugging Face, que relata a pontuação multilíngue de 70,58 no MTEB e a posição nº 1.) Ele custa mais por token do que o BGE-M3, mas processa entradas mais longas sem necessidade de dividi-las em partes menores.

Chamando a partir de código que já usa o SDK da OpenAI

from openai import OpenAI
import os

client = OpenAI(
    base_url="https://api.novita.ai/openai/v1",
    api_key=os.environ["NOVITA_API_KEY"],
)

response = client.embeddings.create(
    model="baai/bge-m3",
    input="Anthropic recommends Voyage AI for embeddings, but this text is being embedded with BGE-M3 instead.",
)

print(response.data[0].embedding[:5])  # first 5 dimensions

Substitua model="baai/bge-m3" por model="qwen/qwen3-embedding-8b" para usar o modelo com contexto mais longo. Ambos aceitam uma string ou um array de strings como input e retornam data[].embedding como um array de floats, seguindo o formato de resposta de embeddings da OpenAI. (Verificado em 08/09/2026 via raw.githubusercontent.com/novitalabs/novita-skills/main/skills/novita-ai/references/llm-api.md: POST /openai/v1/embeddings, parâmetros input e model, “Retorna data[].embedding (array de floats)”. )

Qual modelo usar no seu pipeline

Se você já está profundamente integrado ao ecossistema da Anthropic e quer o fornecedor que a Anthropic avalia explicitamente, a Voyage AI é o caminho com menos atrito — você tem saída de dimensão variável no estilo Matryoshka e modelos ajustados para código e recuperação multilíngue. Se o seu pipeline é baseado no SDK da OpenAI (LangChain, LlamaIndex ou um cliente personalizado apontando para um endpoint /embeddings) e você quer evitar um segundo SDK apenas para a etapa de embeddings, o BGE-M3 ou o Qwen3 Embedding 8B na Novita AI se integram com uma mudança da base URL e nenhuma nova biblioteca de cliente.

O custo é outra alavanca: o BGE-M3 a $0.01 por milhão de tokens é mais barato que todos os modelos da Voyage, incluindo o voyage-4-lite a $0.02. Se suas janelas de contexto cabem no limite de 8.192 tokens do BGE-M3, ele oferece o menor custo por token entre as quatro opções comparadas aqui. Se você precisa gerar embeddings de trechos mais longos sem dividi-los, a janela de 32.768 tokens do Qwen3 Embedding 8B equivale à família voyage-4 da Voyage, com preço por token semelhante ($0.07 contra $0.06).

FAQ

O Claude tem um recurso de embeddings integrado? Não. A documentação da Anthropic afirma diretamente que o Claude não oferece um modelo de embeddings e orienta os desenvolvedores a usarem provedores de terceiros, principalmente a Voyage AI.

Posso usar embeddings da Voyage AI com o Claude no mesmo pipeline? Sim — é esse o padrão pretendido. Você chama o Claude para geração e a Voyage AI separadamente para embeddings; não existe um endpoint combinado.

Existe uma alternativa mais barata à Voyage AI que ainda funcione com código no estilo OpenAI? Sim. Modelos de código aberto como o BAAI BGE-M3 e o Qwen3 Embedding 8B são hospedados na Novita AI por trás de um endpoint /embeddings compatível com OpenAI, a $0.01 e $0.07 por milhão de tokens, respectivamente, ambos abaixo do preço da camada intermediária da Voyage.

Qual janela de contexto devo escolher? O BGE-M3 tem limite de 8.192 tokens por entrada; o Qwen3 Embedding 8B e os modelos da geração atual da Voyage suportam mais de 32.000 tokens. Escolha com base no maior tamanho de trecho que você vai processar, não no tamanho médio.

Artigos recomendados