- Las cuatro categorías de opciones de API de LLM de un vistazo
- Categoría 1: API directas de proveedores
- Categoría 2: Capas de API unificadas y agregadores
- Categoría 3: Gateways de API
- Categoría 4: Endpoints autoalojados y de modelos abiertos
- Compara las cuatro categorías
- Cómo encaja Novita AI en la taxonomía
- Cómo elegir una opción de API de LLM
- Preguntas frecuentes
- Artículos recomendados
Las principales opciones de API de LLM son las API directas de proveedores, las API de LLM unificadas, los gateways de API y los endpoints autoalojados o de modelos abiertos. Las API directas de proveedores conectan tu aplicación con los modelos de un único proveedor. Las API de LLM unificadas colocan múltiples modelos detrás de una única interfaz. Los gateways de API añaden enrutamiento y controles de políticas a endpoints que ya utilizas. Los endpoints autoalojados te dan el mayor control, pero también el mayor trabajo de infraestructura.
La elección correcta depende del problema que estés resolviendo. Un equipo que prototipa con varios modelos puede valorar una API unificada. Un equipo de plataforma que estandariza la observabilidad puede necesitar un gateway. Una carga de trabajo regulada o un modelo personalizado de pesos abiertos puede justificar el autoalojamiento. Trata esto primero como una taxonomía y luego compara proveedores dentro de la categoría que encaje.
Las cuatro categorías de opciones de API de LLM de un vistazo
| Categoría | Cómo funciona | Normalmente encaja |
|---|---|---|
| API directa de proveedor | Tu aplicación llama al endpoint alojado del creador del modelo | Un modelo propietario o de frontera específico es un requisito indispensable |
| API unificada / agregador | Una API expone modelos de varios proveedores o familias de modelos | Necesitas elección de modelos sin mantener muchas integraciones |
| Gateway de API | El middleware enruta y gobierna las solicitudes a los endpoints que configuras | Necesitas fallbacks, observabilidad, límites de velocidad o controles de políticas |
| Endpoint autoalojado / de modelo abierto | Despliegas y sirves pesos de modelos en infraestructura que controlas | Necesitas control de la ruta de datos, servicio personalizado o capacidad predecible de alto volumen |
Estas categorías se pueden combinar. Por ejemplo, un gateway puede situarse delante de proveedores directos y una API unificada, mientras que un endpoint autoalojado gestiona una carga de trabajo sensible. Novita AI abarca las categorías de API unificada e infraestructura de modelos abiertos a través de sus productos LLM API, Agent Sandbox y GPU Cloud.
Categoría 1: API directas de proveedores
Una API directa de proveedor es la interfaz alojada propia del creador del modelo. La API Chat Completions de OpenAI, la API Messages de Anthropic y la API Gemini de Google ilustran el patrón. El proveedor controla la publicación del modelo, el comportamiento del endpoint, los precios, los límites de velocidad y las condiciones de tratamiento de datos.
Elige esta categoría cuando: tu producto dependa de un modelo o unas características concretas de un proveedor, y los términos y el comportamiento operativo del proveedor cumplan tus requisitos.
| Dimensión | API directa de proveedor |
|---|---|
| Coste | El precio de uso lo establece el proveedor; compara entrada, salida, entrada en caché y otras unidades facturables cuando corresponda |
| Control | Seleccionas entre los modelos y parámetros admitidos de ese proveedor |
| Complejidad operativa | Baja para una integración; mayor cuando cada proveedor tiene su propio SDK, autenticación y convenciones de respuesta |
| Latencia | Depende de la región de servicio del proveedor, la cola, el modelo, el tamaño de la solicitud y la ruta de red |
| Cumplimiento | Revisa la retención, la residencia, los subencargados y los términos contractuales del proveedor para tu carga de trabajo |
El principal inconveniente es la dependencia. Un adaptador fino alrededor del cliente del proveedor puede mantener portable el código de la aplicación si cambian los precios, los nombres de los modelos o el comportamiento del endpoint. No asumas que parámetros con nombres similares o formatos de llamada a herramientas de dos proveedores se comportan de forma idéntica.
Categoría 2: Capas de API unificadas y agregadores
Una capa de API unificada presenta una única interfaz sobre múltiples modelos. La plataforma puede alojar los modelos, mantener relaciones con proveedores o exponer un catálogo de endpoints de modelos. Tu aplicación envía solicitudes a una única URL base y utiliza una única cuenta, mientras que la plataforma gestiona el acceso específico de cada modelo detrás de esa interfaz.
Novita AI encaja en esta categoría a través de su LLM API y su endpoint de chat completions compatible con OpenAI. Su catálogo de modelos es la fuente que debes consultar para la disponibilidad actual de modelos; un modelo mencionado en una entrada de blog no debe tratarse como una promesa de acceso actual.
Elige esta categoría cuando: estés evaluando varios modelos, quieras reducir la sobrecarga de integración o prefieras un único contrato de API y relación de facturación para una aplicación multi-modelo.
| Dimensión | API unificada / agregador |
|---|---|
| Coste | Consulta los precios actuales de la plataforma y cualquier recargo, mínimo o cargo específico por modelo |
| Control | Eliges entre los modelos admitidos por la plataforma; los controles de la infraestructura subyacente siguen siendo limitados |
| Complejidad operativa | Menor que mantener tú mismo cada integración de proveedor, pero sigues siendo responsable del enrutamiento de la aplicación y las comprobaciones de calidad |
| Latencia | Depende del modelo seleccionado, la cola de la plataforma, la región y cualquier salto a un proveedor |
| Cumplimiento | Evalúa el tratamiento de datos de la plataforma y las políticas de cualquier relación subyacente con proveedores |
La compatibilidad con OpenAI puede reducir el trabajo de migración, pero no es una equivalencia de comportamiento. Comprueba los límites de contexto, la salida estructurada, la llamada a herramientas, el streaming, los errores y los campos de solicitud específicos del modelo antes de cambiar el tráfico de producción.
Categoría 3: Gateways de API
Un gateway de API es un middleware entre tu aplicación y uno o más endpoints de LLM. Herramientas como LiteLLM y Portkey representan esta categoría. Un gateway puede centralizar credenciales, enrutar por modelo o carga de trabajo, añadir reglas de fallback, registrar el uso, aplicar límites de velocidad y exponer logs o trazas.
Un gateway no aloja ni mejora automáticamente los modelos que tiene detrás. Gobierna la ruta de solicitud que configuras. Por ejemplo, la guía de integración de Portkey y Novita AI utiliza Portkey como gateway y Novita AI como endpoint.
Elige esta categoría cuando: ya tengas acceso a endpoints, pero necesites un único plano de control operativo para enrutamiento, observabilidad, políticas de acceso o comportamiento de fallback.
| Dimensión | Gateway de API |
|---|---|
| Coste | Coste de alojamiento del gateway o del servicio gestionado más el coste del endpoint subyacente |
| Control | Alto control sobre enrutamiento, reintentos, fallbacks, presupuestos y políticas; el comportamiento del modelo sigue dependiendo del endpoint |
| Complejidad operativa | Media; el gateway se convierte en otro componente de producción que hay que asegurar, monitorizar y actualizar |
| Latencia | Añade procesamiento y normalmente otro salto de red; mídela en tu ruta en lugar de asumir una sobrecarga fija |
| Cumplimiento | Depende del despliegue del gateway, los logs, las credenciales y cada endpoint al que pueda llegar |
El modo de fallo habitual es tratar el fallback como una garantía. Un fallback puede mantener una solicitud en marcha mientras cambia la calidad, la semántica de las herramientas o el tratamiento de datos. Define qué sustituciones se permiten para cada carga de trabajo y registra cuándo cambia una ruta.
Categoría 4: Endpoints autoalojados y de modelos abiertos
El autoalojamiento significa servir pesos de modelos abiertos en infraestructura que gestionas o dedicas a tu carga de trabajo. Un servidor de inferencia como vLLM expone el modelo a través de una API, mientras que tu equipo gestiona los archivos del modelo, las GPU, el escalado, las actualizaciones, la red y la observabilidad.
La GPU Cloud de Novita AI proporciona una ruta de infraestructura para desplegar modelos de pesos abiertos. Esto es diferente de la LLM API compartida: tú eliges la forma de despliegue y asumes la responsabilidad de operar el endpoint.
Elige esta categoría cuando: necesites un modelo o una configuración de servicio que una API alojada no ofrezca, tengas requisitos estrictos de ruta de datos o tengas una carga de trabajo estable que haga que valga la pena operar capacidad dedicada.
| Dimensión | Endpoint autoalojado / de modelo abierto |
|---|---|
| Coste | Costes de GPU, almacenamiento, ancho de banda y operaciones; la capacidad fija puede desperdiciarse con tráfico en ráfagas |
| Control | El mayor control sobre la versión del modelo, los parámetros de servicio, el batching, la red y la ubicación del despliegue |
| Complejidad operativa | La más alta; planifica el aprovisionamiento, la carga de modelos, las comprobaciones de estado, el escalado, el parcheo y la respuesta a incidentes |
| Latencia | Depende del hardware, el batching, la concurrencia, el tamaño del modelo y dónde se ejecuten los clientes |
| Cumplimiento | Más control sobre la ruta de datos, pero el cumplimiento sigue dependiendo de la infraestructura, el software y los procesos que operas |
El autoalojamiento no es automáticamente más barato ni más privado. Compara el coste total de la capacidad y las operaciones con el uso actual de la API, y verifica que los logs, las copias de seguridad, la telemetría y las rutas de soporte sigan la misma política de datos que el tráfico de inferencia.
Compara las cuatro categorías
| Dimensión de evaluación | Proveedor directo | API unificada / agregador | Gateway de API | Autoalojado / modelo abierto |
|---|---|---|---|---|
| Estructura de costes | Precio de uso del proveedor | Precio de plataforma y modelo | Precio de gateway más endpoint | Capacidad de GPU y operaciones |
| Flexibilidad de modelos | Principalmente el catálogo de un proveedor | Amplia dentro del catálogo de la plataforma | Cualquier endpoint accesible | Cualquier modelo compatible que puedas servir |
| Control del servicio | Definido por el proveedor | Definido por la plataforma | Control de enrutamiento y políticas | Control total del despliegue |
| Carga operativa | Baja al principio | De baja a media | Media | Alta |
| Latencia | Dependiente del proveedor | Dependiente de la plataforma y el modelo | Añade la ruta del gateway | Dependiente del hardware y la configuración |
| Control de datos | Definido por el proveedor | Definido por la plataforma | Importan tanto el gateway como el endpoint | Definido por la infraestructura y los procesos |
| Razón más sólida para elegirlo | Un modelo o una característica específicos | Acceso rápido a múltiples modelos | Operaciones centralizadas | Personalización o control de la ruta de datos |
Cómo encaja Novita AI en la taxonomía
Novita AI es una nube de IA y agentes, más que un gateway de API. Encaja en dos categorías de este mapa:
- API unificada / agregador: La Novita AI LLM API ofrece un único punto de entrada de API y una interfaz compatible con OpenAI. Revisa el catálogo de modelos para conocer la disponibilidad actual antes de seleccionar un modelo.
- Infraestructura de modelos abiertos: GPU Cloud admite a equipos que quieren desplegar y operar modelos de pesos abiertos en capacidad dedicada.
- Ejecución de agentes: Novita Agent Sandbox aborda la capa de runtime para agentes que necesitan código, navegador, archivos u otras herramientas junto a un endpoint de LLM.
Esa combinación es útil cuando la decisión no es solo «¿qué API de modelo?», sino también «¿dónde ejecutará el agente sus herramientas?». No elimina la necesidad de evaluar el comportamiento del modelo, el tratamiento de datos, el coste o la idoneidad operativa para una carga de trabajo concreta.
Cómo elegir una opción de API de LLM
Usa estas preguntas antes de comparar listas de proveedores:
- ¿Un modelo o proveedor es innegociable? Empieza con un proveedor directo cuando un modelo propietario o una característica específica del proveedor sea esencial. Si la sustitución es aceptable, una API unificada puede facilitar la exploración.
- ¿A dónde pueden ir los datos de las solicitudes y los logs? Traza la ruta completa, incluidos los logs del gateway, la retención del proveedor, las copias de seguridad, la telemetría y el acceso del soporte. No infieras el cumplimiento a partir de la palabra “gateway” o “privado”.
- ¿El tráfico es en ráfagas o predecible? Las API alojadas evitan pagar por GPU inactivas. La capacidad dedicada puede tener sentido para cargas de trabajo estables y de alto rendimiento, pero calcula usando tus prompts, concurrencia, utilización y tiempo de operaciones reales.
- ¿Qué controles son requisitos operativos? Elige un gateway o controles de plataforma cuando necesites enrutamiento centralizado, presupuestos, observabilidad o reglas de fallback. Mantén explícitas las políticas de calidad y sustitución.
- ¿Cuánta infraestructura puede operar el equipo? Las API directas suelen minimizar las operaciones iniciales. El autoalojamiento da más control a cambio de trabajo de despliegue y fiabilidad continua.
Preguntas frecuentes
¿Cuál es la diferencia entre una API de LLM y un gateway de API?
Una API de LLM sirve respuestas de modelos. Un gateway de API se sitúa entre tu aplicación y una o más API de LLM para añadir enrutamiento, control de acceso, observabilidad, limitación de velocidad, caché o lógica de fallback. Son capas complementarias, no categorías de proveedores intercambiables.
¿Qué significa compatible con OpenAI?
Significa que un endpoint sigue lo suficiente de la forma de solicitud y respuesta de OpenAI como para que el código de cliente compatible se conecte, a menudo cambiando la URL base y la clave de API. No garantiza la misma calidad del modelo, longitud de contexto, comportamiento de herramientas, detalles de streaming o semántica de errores. Prueba las características exactas que utiliza tu aplicación.
¿Puede una aplicación usar más de una categoría?
Sí. Una arquitectura de producción puede usar una API unificada para el tráfico general, un gateway para enrutamiento y observabilidad, acceso directo para una característica específica de un proveedor y un endpoint autoalojado para una carga de trabajo sensible o personalizada. Las categorías describen capas y modelos operativos, no productos mutuamente excluyentes.
¿Es el autoalojamiento siempre la opción más privada o más barata?
No. El autoalojamiento puede mejorar el control sobre la ruta de datos de inferencia, pero tus logs, copias de seguridad, proveedor de infraestructura y operadores siguen importando. También puede conllevar costes de capacidad inactiva y mantenimiento. Compara el coste completo de la carga de trabajo y el flujo de datos con las alternativas alojadas.
¿Es Novita AI un proveedor directo, un agregador o un gateway?
Novita AI encaja en las categorías de API unificada e infraestructura de modelos abiertos. Su LLM API proporciona un punto de entrada compartido a los modelos de su catálogo, mientras que GPU Cloud admite flujos de trabajo de despliegue dedicados. No es un gateway de API cuyo rol principal sea situarse delante de proveedores externos.
Fuentes y enlaces de disponibilidad verificados el 3 de septiembre de 2026: Novita LLM API, documentación de la API de Novita, catálogo de modelos de Novita, referencia de la API de OpenAI, referencia de la API de Anthropic, documentación de la API de Google Gemini, documentación de LiteLLM, documentación de Portkey y documentación de vLLM.
