¿Anthropic tiene una API de embeddings? Qué usar en su lugar

¿Anthropic tiene una API de embeddings? Qué usar en su lugar

No — Anthropic no ofrece su propio modelo de embeddings. La documentación oficial de Anthropic lo afirma claramente: “Anthropic does not offer its own embedding model”, y remite a los desarrolladores a Voyage AI como su socio recomendado para embeddings. (Verificado el 2026-09-08 en platform.claude.com/docs/en/build-with-claude/embeddings.) Esa es la respuesta precisa, pero no es la única opción. La siguiente tabla compara Voyage AI con dos modelos de embeddings de código abierto que puedes invocar a través de un endpoint compatible con OpenAI en Novita AI, sin añadir un segundo SDK a tu stack.

Modelo Precio por millón de tokens Longitud de contexto Endpoint compatible con OpenAI
Voyage voyage-4 (proveedor recomendado por Anthropic) $0.06 32,000 tokens No — utiliza su propio SDK/formato REST
BAAI BGE-M3 (Novita AI) $0.01 8,192 tokens Sí — /openai/v1/embeddings
Qwen3 Embedding 8B (Novita AI) $0.07 32,768 tokens Sí — /openai/v1/embeddings

(Verificado el 2026-09-08. Precios y longitudes de contexto de Voyage voyage-4 según docs.voyageai.com/docs/pricing y platform.claude.com/docs/en/build-with-claude/embeddings. BGE-M3 y Qwen3 Embedding 8B precios/contexto según novita.ai/pricing: BGE-M3 listado con contexto 8192, precio de entrada $0.01/Mt; Qwen3 Embedding 8B listado con context_size 32768, precio de entrada $0.07/Mt. Compatibilidad de endpoint según raw.githubusercontent.com/novitalabs/novita-skills/main/skills/novita-ai/references/llm-api.md: POST /openai/v1/embeddings.)

Por qué Anthropic no incluye un modelo de embeddings

Claude está diseñado para generación y razonamiento — chat, uso de herramientas, flujos de trabajo agentivos. Los embeddings son un problema diferente: convertir texto en un vector de longitud fija para búsqueda por similitud, agrupación o recuperación. En lugar de construir y mantener un modelo de embeddings separado, la documentación de Anthropic recomienda evaluar “una variedad de proveedores de embeddings para encontrar el mejor ajuste para tu caso de uso específico”, con Voyage AI nombrado como la opción principal cubierta en su guía.

Esto es importante para cómo arquitecturas una tubería RAG basada en Claude: siempre necesitarás una segunda llamada API a un endpoint que no sea de Anthropic para el paso de embeddings, ya sea Voyage u otro.

Opción 1: Voyage AI (el camino recomendado por Anthropic)

Modelo Longitud de contexto Precio por millón de tokens Capa gratuita
voyage-4-large 32,000 tokens $0.12 Primeros 200M tokens gratis
voyage-4 32,000 tokens $0.06 Primeros 200M tokens gratis
voyage-4-lite 32,000 tokens $0.02 Primeros 200M tokens gratis

(Verificado el 2026-09-08 en platform.claude.com/docs/en/build-with-claude/embeddings para nombres de modelos/longitud de contexto, y docs.voyageai.com/docs/pricing para las cifras de capa gratuita y por token: “Los primeros 200 millones de tokens para voyage-4-large, voyage-4, voyage-4-lite… son gratuitos para cada cuenta”.)

El endpoint de Voyage AI es POST https://api.voyageai.com/v1/embeddings, utilizando su propio SDK o una llamada REST directa — no el formato del SDK de OpenAI. Es una opción sólida si deseas el proveedor avalado por Anthropic y no te importa tener una cuenta y relación de facturación separada para embeddings.

Opción 2: Embeddings de código abierto compatibles con OpenAI en Novita AI

Si prefieres mantener todo detrás de un cliente compatible con OpenAI en lugar de añadir un SDK específico de Voyage, Novita AI alberga modelos de embeddings de código abierto detrás del mismo endpoint /openai/v1/embeddings que ya usarías para las finalizaciones de chat.

BGE-M3 soporta más de 100 idiomas y combina recuperación densa, multivectorial y dispersa en un solo modelo, con una ventana de contexto de 8,192 tokens — suficiente para la mayoría de los fragmentos de documentos en una tubería RAG. (Verificado el 2026-09-08 en novita.ai/pricing: “Capaz de procesar más de 100 idiomas y entradas que van desde frases cortas hasta documentos extensos (hasta 8,192 tokens)… superando puntos de referencia como MIRACL y MKQA”.)

Qwen3 Embedding 8B ocupó el puesto n.º 1 en el ranking multilingüe de MTEB con una puntuación de 70.58 a partir de su lanzamiento en junio de 2025, y soporta una ventana de contexto más larga de 32,768 tokens. (Verificado el 2026-09-08 a través de la tarjeta del modelo Qwen/Qwen3-Embedding-8B en Hugging Face, que reporta la puntuación multilingüe de MTEB de 70.58 y el puesto n.º 1.) Cuesta más por token que BGE-M3 pero maneja entradas más largas sin necesidad de dividir en fragmentos.

Llamarlo desde código que ya usa el SDK de OpenAI

from openai import OpenAI
import os

client = OpenAI(
    base_url="https://api.novita.ai/openai/v1",
    api_key=os.environ["NOVITA_API_KEY"],
)

response = client.embeddings.create(
    model="baai/bge-m3",
    input="Anthropic recommends Voyage AI for embeddings, but this text is being embedded with BGE-M3 instead.",
)

print(response.data[0].embedding[:5])  # first 5 dimensions

Cambia model="baai/bge-m3" por model="qwen/qwen3-embedding-8b" para usar el modelo de contexto más largo. Ambos aceptan una cadena o un array de cadenas como input y devuelven data[].embedding como un array de flotantes, coincidiendo con la forma de la respuesta de embeddings de OpenAI. (Verificado el 2026-09-08 en raw.githubusercontent.com/novitalabs/novita-skills/main/skills/novita-ai/references/llm-api.md: POST /openai/v1/embeddings, parámetros input y model, “Devuelve data[].embedding (array de flotantes)”.)

Cuál se adapta a tu tubería

Si ya estás inmerso en el ecosistema de Anthropic y deseas el proveedor que ellos verifican explícitamente, Voyage AI es el camino con la menor fricción — obtienes salidas de dimensión variable estilo Matryoshka y modelos ajustados para código y recuperación multilingüe. Si tu tubería está basada en el SDK de OpenAI (LangChain, LlamaIndex, o un cliente personalizado apuntando a un endpoint /embeddings) y deseas evitar un segundo SDK solo para el paso de embeddings, BGE-M3 o Qwen3 Embedding 8B en Novita AI se integran con un cambio de URL base y sin nueva biblioteca cliente.

El costo es la otra palanca: BGE-M3 a $0.01 por millón de tokens es más barato que cualquier modelo de Voyage, incluyendo voyage-4-lite a $0.02. Si tus ventanas de contexto caben dentro del límite de 8,192 tokens de BGE-M3, ese es el costo por token más bajo de las cuatro opciones comparadas aquí. Si necesitas incrustar fragmentos más largos sin dividirlos, la ventana de 32,768 tokens de Qwen3 Embedding 8B iguala a la familia voyage-4 de Voyage a un precio por token similar ($0.07 frente a $0.06).

Preguntas frecuentes

¿Tiene Claude una función de embeddings integrada? No. La documentación de Anthropic afirma directamente que Claude no ofrece un modelo de embeddings y dirige a los desarrolladores a proveedores externos, principalmente Voyage AI.

¿Puedo usar embeddings de Voyage AI con Claude en la misma tubería? Sí — ese es el patrón previsto. Llamas a Claude para generación y a Voyage AI por separado para embeddings; no hay un endpoint combinado.

¿Hay una alternativa más barata a Voyage AI que aún funcione con código estilo OpenAI? Sí. Modelos de código abierto como BAAI BGE-M3 y Qwen3 Embedding 8B están alojados en Novita AI detrás de un endpoint /embeddings compatible con OpenAI, a $0.01 y $0.07 por millón de tokens respectivamente, ambos por debajo del precio de nivel medio de Voyage.

¿Qué ventana de contexto debería elegir? BGE-M3 tiene un límite de 8,192 tokens por entrada; Qwen3 Embedding 8B y los modelos de generación actual de Voyage soportan más de 32,000 tokens. Elige según el tamaño de tu fragmento más grande, no el promedio.

Artículos recomendados