- Cuándo usar esta guía de inicio rápido
- Paso 1: Consigue tu clave de API de Novita
- Paso 2: Confirma el ID del modelo y el endpoint
- Paso 3: Envía tu primera solicitud
- Paso 4: Lee la respuesta
- Paso 5: Revisa precios, límites y errores comunes
- Ejemplo en Python
- Ejemplo con cURL
- Parámetros clave
- Solución de problemas
- Preguntas frecuentes
- Artículos recomendados
Kimi K3 está disponible a través de la API serverless de Novita AI con el ID de modelo moonshotai/kimi-k3, un endpoint de chat compatible con OpenAI, una ventana de contexto de 1,048,576 tokens y un ajuste de salida máxima de 1,048,576 tokens indicado en su página del modelo. Esta guía de inicio rápido muestra cómo autenticarte, enviar una primera solicitud, interpretar la respuesta y planificar el precio por tokens de Kimi K3 antes de conectarlo a una aplicación más grande.
Cuándo usar esta guía de inicio rápido
Usa esta guía cuando quieras probar Kimi K3 desde una aplicación que ya hable el formato de API de OpenAI. Es un punto de partida práctico para flujos de trabajo de ingeniería de software de contexto largo, análisis de documentos, investigación y razonamiento donde la solicitud puede contener considerablemente más contexto que un prompt de chat típico.
La página del modelo de Kimi K3 en Novita describe un modelo de 2,8 billones de parámetros con comprensión visual nativa y una ventana de contexto de 1M de tokens. La misma página lista entradas de texto, imagen y vídeo con salida de texto, además de acceso serverless, salida estructurada, razonamiento y llamada de funciones. Trátalas como capacidades a verificar contra la forma de tu solicitud prevista, en lugar de asumir que cada función del SDK de OpenAI tiene un comportamiento idéntico entre modelos.
Esto no es una comparativa de benchmarks. El objetivo es lograr que una solicitud autenticada funcione y luego darte suficiente detalle operativo para decidir si Kimi K3 se ajusta a tu carga de trabajo.
Paso 1: Consigue tu clave de API de Novita
Crea o selecciona una cuenta de Novita AI, abre los ajustes de tus claves de API y crea una clave para uso en el servidor. Mantén la clave fuera de los paquetes frontend, los repositorios públicos, los cuadernos compartidos fuera de tu equipo y el historial del shell siempre que sea posible.
Configura la clave como variable de entorno antes de ejecutar cualquiera de los ejemplos:
export NOVITA_API_KEY="your_api_key_here"
Usa una clave de proyecto o temporal si la configuración de tu cuenta lo permite. Rota la clave después de una demo pública o ante cualquier posible exposición.
Paso 2: Confirma el ID del modelo y el endpoint
Mantén los datos de conexión juntos para que un nombre visible no reemplace accidentalmente el identificador real del modelo:
| Campo | Valor |
|---|---|
| ID del modelo | moonshotai/kimi-k3 |
| URL base | https://api.novita.ai/openai/v1 |
| Endpoint de chat completions | https://api.novita.ai/openai/v1/chat/completions |
| Ventana de contexto | 1,048,576 tokens |
| Ajuste de salida máxima | 1,048,576 tokens |
| Capacidades de entrada | Texto, imagen, vídeo |
| Capacidad de salida | Texto |
| Tipo de acceso | API serverless |
La página del modelo de Kimi K3 es la fuente de verdad sobre disponibilidad, límites actuales, capacidades y precios. Vuelve a consultarla antes de lanzar algo porque las configuraciones y los precios de los modelos pueden cambiar.
Paso 3: Envía tu primera solicitud
Empieza con una solicitud corta de solo texto. Un prompt pequeño facilita distinguir los problemas de autenticación o enrutamiento de los problemas de prompt a nivel de aplicación.
Por ejemplo, pide a Kimi K3 que devuelva una lista de verificación de implementación breve:
List the three biggest risks when adding retries to a streaming API client. Return one sentence per risk.
Mantén un valor modesto en el primer max_tokens. Una salida amplia solo es útil después de que la solicitud básica, el análisis de la respuesta y el manejo de errores funcionen correctamente.
Paso 4: Lee la respuesta
La respuesta compatible con OpenAI coloca el texto del asistente en choices[0].message.content para una finalización de chat estándar sin streaming. Conserva los metadatos de la respuesta y los campos de uso en tu aplicación si necesitas rastreo de solicitudes o contabilidad de costes.
Para una integración en producción, registra al menos:
- El ID del modelo y la marca de tiempo de la solicitud.
- El ID de solicitud del proveedor, cuando lo devuelva el cliente o las cabeceras de la respuesta.
- El uso de tokens de prompt y de completions.
- El número de reintentos y el estado HTTP.
- Si la solicitud usó contenido de solo texto o multimodal.
Una vez que la primera llamada tenga éxito, prueba prompts que se parezcan a tu carga de trabajo real: archivos fuente largos, varios documentos, un esquema de herramientas o un contrato de respuesta estructurada. Un prompt corto exitoso verifica la conectividad, no la calidad en producción.
Paso 5: Revisa precios, límites y errores comunes
La página del modelo de Novita lista precios serverless de $3 por millón de tokens de entrada, $0.30 por millón de tokens de lectura en caché y $15 por millón de tokens de salida para Kimi K3. Tu estimación debe incluir ambas partes de la solicitud, los reintentos y la cantidad de contexto que envías repetidamente.
La página también lista estos niveles de tasa de solicitud:
| Nivel | Solicitudes por minuto | Tokens por minuto |
|---|---|---|
| T1 | 30 | 50,000,000 |
| T2 | 100 | 50,000,000 |
| T3 | 1,000 | 50,000,000 |
| T4 | 3,000 | 50,000,000 |
| T5 | 6,000 | 50,000,000 |
El nivel aplicable depende de tu cuenta. No trates la tabla como una garantía de que cada proyecto comienza en T1 o de que cada carga de trabajo puede usar la tasa máxima mostrada.
Los errores comunes en la primera integración incluyen:
- Olvidar la cabecera
Authorization: Bearero configurar una variable de entorno incorrecta. - Enviar
kimi-k3o un nombre comercial en lugar demoonshotai/kimi-k3. - Usar
https://api.novita.ai/openaicomo URL base del SDK cuando el cliente espera la ruta versionada.../openai/v1. - Enviar un cuerpo de solicitud que no sea JSON válido.
- Configurar un límite de salida mayor de lo que tu aplicación puede almacenar o procesar.
- Asumir que un cuerpo de solicitud multimodal es idéntico en todos los SDK o familias de modelos.
Ejemplo en Python
Instala el cliente de Python de OpenAI en tu entorno y luego ejecuta este ejemplo con NOVITA_API_KEY definida:
pip install openai
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["NOVITA_API_KEY"],
base_url="https://api.novita.ai/openai/v1",
)
response = client.chat.completions.create(
model="moonshotai/kimi-k3",
messages=[
{
"role": "system",
"content": "You are a concise engineering assistant.",
},
{
"role": "user",
"content": "List three risks when adding retries to a streaming API client.",
},
],
temperature=0.2,
max_tokens=300,
)
print(response.choices[0].message.content)
El ejemplo usa intencionadamente una finalización corta. Aumenta los presupuestos de contexto y salida solo después de haber añadido timeouts, reintentos, registro y seguimiento de uso adecuados para tu aplicación.
Ejemplo con cURL
La misma solicitud se puede probar sin un SDK:
payload='{
"model": "moonshotai/kimi-k3",
"messages": [
{
"role": "system",
"content": "You are a concise engineering assistant."
},
{
"role": "user",
"content": "List three risks when adding retries to a streaming API client."
}
],
"temperature": 0.2,
"max_tokens": 300
}'
curl --request POST "https://api.novita.ai/openai/v1/chat/completions" \
--header "Authorization: Bearer $NOVITA_API_KEY" \
--header "Content-Type: application/json" \
--data "$payload"
Parámetros clave
| Parámetro | Qué controla | Primer valor razonable |
|---|---|---|
model |
El modelo alojado que responde a la solicitud | moonshotai/kimi-k3 |
messages |
Turnos de conversación de sistema, usuario y asistente | Un mensaje de sistema y uno de usuario |
temperature |
Variabilidad de la salida | 0.2 para pruebas repetibles |
max_tokens |
Salida generada máxima | 300, luego auméntalo deliberadamente |
stream |
Si la salida llega de forma incremental | Déjalo deshabilitado mientras depuras |
tools |
Definiciones de funciones disponibles para el modelo | Añádelo después de que el chat básico funcione |
response_format |
Requisitos de salida estructurada | Valida el JSON devuelto antes de usarlo |
Para entradas de imagen o vídeo, confirma el formato actual de solicitud en la documentación del modelo y la API antes de añadirlas a tu aplicación. Las etiquetas de capacidades en una página de modelo no sustituyen probar la estructura de contenido exacta que usa tu librería cliente.
Solución de problemas
Fallo de autenticación
Comprueba que NOVITA_API_KEY esté definida en el mismo proceso que ejecuta la solicitud. Confirma que la cabecera usa Bearer, no un parámetro de consulta ni un nombre de credencial diferente.
El modelo no se encuentra
Usa el ID exacto moonshotai/kimi-k3. El nombre visible del modelo no es un sustituto válido del ID de modelo de la API.
La solicitud es rechazada
Reduce los valores del prompt y de max_tokens, valida el cuerpo JSON y confirma que el endpoint es /openai/v1/chat/completions. Si la solicitud usa imágenes, vídeo, tools o salida estructurada, elimina esos campos y añádelos de nuevo uno a uno.
Las solicitudes son lentas o tienen límites de tasa
Mide los recuentos de tokens de prompt y de salida, reduce el contexto repetido innecesario y añade backoff exponencial acotado para respuestas reintentables. Comprueba el nivel de tasa actual de tu cuenta en lugar de asumir el nivel más alto de la tabla de la página del modelo.
La respuesta está incompleta
Inspecciona el motivo de finalización y los datos de uso. Un valor pequeño de max_tokens puede detener una respuesta larga antes de tiempo; aumentarlo también incrementa la cantidad de salida que tu aplicación puede pagar y procesar.
Preguntas frecuentes
¿Qué ID de modelo debo enviar para Kimi K3?
Envía moonshotai/kimi-k3 en el campo model.
¿Qué endpoint usa el cliente de OpenAI?
Establece la URL base del SDK en https://api.novita.ai/openai/v1. La solicitud de chat completions se envía a https://api.novita.ai/openai/v1/chat/completions.
¿Cuán grande es la ventana de contexto de Kimi K3?
La página del modelo de Novita indica una ventana de contexto de 1,048,576 tokens y un ajuste de salida máxima de 1,048,576 tokens. Consulta la página antes del despliegue para ver actualizaciones.
¿Es gratuito llamar a Kimi K3?
Aquí no se afirma que sea de acceso gratuito. La página del modelo lista precios serverless basados en tokens, así que revisa el precio actual que se muestra para tu cuenta y modelo antes de enviar solicitudes grandes.
¿Debo empezar con una solicitud multimodal?
No. Empieza con una solicitud pequeña de solo texto para que la autenticación, la selección del endpoint, el análisis de la respuesta y el manejo de errores sean fáciles de verificar. Añade entradas multimodales después de que ese camino sea estable.
Artículos recomendados
- Kimi K3 en Novita AI: precios, contexto de 1M y cuándo elegirlo frente a K2
- Inicio rápido de la API MiniMax M3 con Novita AI
- Cómo acceder a Kimi K2 Thinking: guía completa de configuración para desarrolladores
- Uso de LlamaIndex con Novita AI: guía paso a paso
Fuentes
- Página del modelo de Kimi K3 — ID de modelo, disponibilidad, capacidades, contexto, límites, precios y niveles de tasa; consultada el 22 de julio de 2026.
- Referencia de la API de Novita AI: Crear chat completion — ruta de chat completion compatible con OpenAI; consultada el 22 de julio de 2026.
