No — Anthropic no ofrece su propio modelo de embedding. La documentación de Anthropic lo dice claramente: «Anthropic no ofrece su propio modelo de embedding», y dirige a los desarrolladores hacia Voyage AI como su socio recomendado para embeddings. (Verificado el 2026-09-08 a través de platform.claude.com/docs/en/build-with-claude/embeddings.) Esa es la respuesta correcta, pero no es la única opción. La tabla siguiente compara Voyage AI con dos modelos de embedding open-source a los que puedes llamar mediante un endpoint compatible con OpenAI en Novita AI, sin añadir un segundo SDK a tu stack.
| Modelo | Precio por millón de tokens | Longitud de contexto | Endpoint compatible con OpenAI |
|---|---|---|---|
Voyage voyage-4 (proveedor recomendado por Anthropic) |
$0.06 | 32 000 tokens | No — usa el SDK/formato REST propio de Voyage |
| BAAI BGE-M3 (Novita AI) | $0.01 | 8192 tokens | Sí — /openai/v1/embeddings |
| Qwen3 Embedding 8B (Novita AI) | $0.07 | 32 768 tokens | Sí — /openai/v1/embeddings |
(Verificado el 2026-09-08. Precios y longitud de contexto de Voyage voyage-4 según docs.voyageai.com/docs/pricing y platform.claude.com/docs/en/build-with-claude/embeddings. Precios/contexto de BGE-M3 y Qwen3 Embedding 8B según novita.ai/pricing: BGE-M3 listado con contexto 8192, precio de entrada $0.01/Mt; Qwen3 Embedding 8B listado con contexto_size 32768, precio de entrada $0.07/Mt. Compatibilidad de endpoints según raw.githubusercontent.com/novitalabs/novita-skills/main/skills/novita-ai/references/llm-api.md: POST /openai/v1/embeddings.)
Por qué Anthropic no incluye un modelo de embedding
Claude está diseñado para generación y razonamiento — chat, uso de herramientas, flujos de trabajo agentivos. Los embeddings son un problema diferente: convertir texto en un vector de longitud fija para búsqueda por similitud, agrupamiento o recuperación. En lugar de construir y mantener un modelo de embedding separado, la documentación de Anthropic recomienda evaluar «diversos proveedores de embeddings para encontrar el más adecuado para tu caso de uso específico», siendo Voyage AI la opción principal cubierta en su guía.
Esto es importante para la arquitectura de un pipeline RAG basado en Claude: siempre necesitarás una segunda llamada API a un endpoint que no sea de Anthropic para el paso de embedding, ya sea Voyage u otra opción.
Opción 1: Voyage AI (la ruta recomendada por Anthropic)
| Modelo | Longitud de contexto | Precio por millón de tokens | Nivel gratuito |
|---|---|---|---|
voyage-4-large |
32 000 tokens | $0.12 | Primeros 200M tokens gratis |
voyage-4 |
32 000 tokens | $0.06 | Primeros 200M tokens gratis |
voyage-4-lite |
32 000 tokens | $0.02 | Primeros 200M tokens gratis |
(Verificado el 2026-09-08 a través de platform.claude.com/docs/en/build-with-claude/embeddings para nombres de modelo/longitud de contexto, y docs.voyageai.com/docs/pricing para las cifras del nivel gratuito y por token: «Los primeros 200 millones de tokens para voyage-4-large, voyage-4, voyage-4-lite… son gratuitos para cada cuenta».)
El endpoint de Voyage AI es POST https://api.voyageai.com/v1/embeddings, usando su propio SDK o una llamada REST directa — no el formato del SDK de OpenAI. Es una opción sólida si deseas el proveedor avalado por Anthropic y no te importa tener una cuenta y relación de facturación separada para los embeddings.
Opción 2: Embeddings open-source compatibles con OpenAI en Novita AI
Si prefieres mantener todo detrás de un único cliente compatible con OpenAI en lugar de añadir un SDK específico de Voyage, Novita AI aloja modelos de embedding open-source tras el mismo endpoint /openai/v1/embeddings que ya usarías para completaciones de chat.
BGE-M3 admite más de 100 idiomas y combina recuperación densa, multi-vector y dispersa en un solo modelo, con una ventana de contexto de 8192 tokens — suficiente para la mayoría de los fragmentos de documentos en un pipeline RAG. (Verificado el 2026-09-08 a través de novita.ai/pricing: «Capaz de procesar más de 100 idiomas y entradas que van desde frases cortas hasta documentos extensos (hasta 8192 tokens)… superando benchmarks como MIRACL y MKQA».)
Qwen3 Embedding 8B ocupó el puesto n.º 1 en el ranking multilingüe de MTEB con una puntuación de 70.58 desde su lanzamiento en junio de 2025, y admite una ventana de contexto más larga de 32 768 tokens que BGE-M3. (Verificado el 2026-09-08 a través de la tarjeta del modelo Qwen/Qwen3-Embedding-8B en Hugging Face, que reporta la puntuación multilingüe de MTEB de 70.58 y el puesto n.º 1.) Cuesta más por token que BGE-M3, pero procesa entradas más largas sin necesidad de fragmentación.
Cómo llamarlo desde código que ya usa el SDK de OpenAI
from openai import OpenAI
import os
client = OpenAI(
base_url="https://api.novita.ai/openai/v1",
api_key=os.environ["NOVITA_API_KEY"],
)
response = client.embeddings.create(
model="baai/bge-m3",
input="Anthropic recomienda Voyage AI para embeddings, pero este texto se está incrustando con BGE-M3 en su lugar.",
)
print(response.data[0].embedding[:5]) # primeras 5 dimensiones
Cambia model="baai/bge-m3" por model="qwen/qwen3-embedding-8b" para usar el modelo de contexto más largo. Ambos aceptan una cadena o un array de cadenas como input y devuelven data[].embedding como un array de flotantes, coincidiendo con la forma de respuesta de embeddings de OpenAI. (Verificado el 2026-09-08 a través de raw.githubusercontent.com/novitalabs/novita-skills/main/skills/novita-ai/references/llm-api.md: POST /openai/v1/embeddings, parámetros input y model, «Devuelve data[].embedding (array de flotantes)».)
Cuál se adapta a tu pipeline
Si ya estás inmerso en el ecosistema de Anthropic y deseas el proveedor que ellos verifican explícitamente, Voyage AI es la ruta con menor fricción: obtienes salida de dimensión variable tipo Matryoshka y modelos ajustados para código y recuperación multilingüe. Si tu pipeline se basa en el SDK de OpenAI (LangChain, LlamaIndex o un cliente personalizado apuntando a un endpoint /embeddings) y quieres evitar un segundo SDK solo para el paso de embedding, BGE-M3 o Qwen3 Embedding 8B en Novita AI se integran con solo cambiar la URL base y sin necesidad de una nueva librería cliente.
El coste es la otra palanca: BGE-M3 a $0.01 por millón de tokens es más barato que cualquier modelo de Voyage, incluyendo voyage-4-lite a $0.02. Si tus ventanas de contexto caben dentro del límite de 8192 tokens de BGE-M3, ese es el coste por token más bajo de las cuatro opciones comparadas aquí. Si necesitas incrustar fragmentos más largos sin dividirlos, la ventana de 32 768 tokens de Qwen3 Embedding 8B iguala a la familia voyage-4 de Voyage con un precio por token similar ($0.07 frente a $0.06).
FAQ
¿Claude tiene una función de embeddings integrada?
No. La documentación de Anthropic indica directamente que Claude no ofrece un modelo de embedding y dirige a los desarrolladores a proveedores externos, principalmente Voyage AI.
¿Puedo usar embeddings de Voyage AI con Claude en el mismo flujo de trabajo?
Sí — ese es el patrón previsto. Llamas a Claude para generación y a Voyage AI por separado para los embeddings; no existe un endpoint combinado.
¿Existe una alternativa más barata que Voyage AI que aún funcione con código estilo OpenAI?
Sí. Modelos open-source como BAAI BGE-M3 y Qwen3 Embedding 8B están alojados en Novita AI tras un endpoint /embeddings compatible con OpenAI, a $0.01 y $0.07 por millón de tokens respectivamente, ambos por debajo del precio medio de Voyage.
¿Qué ventana de contexto debería elegir?
BGE-M3 tiene un límite de 8192 tokens por entrada; Qwen3 Embedding 8B y los modelos actiales de Voyage admiten más de 32 000 tokens. Elige según tamaño máximo de tus fragmentos, no el promedio.