- Cuándo usar este inicio rápido
- Paso 1: Obtenga su clave de API de Novita
- Paso 2: Confirme el ID del modelo y el endpoint
- Paso 3: Envíe su primera solicitud
- Paso 4: Lea la respuesta
- Paso 5: Verifique precios, límites y errores comunes
- Ejemplo en Python
- Ejemplo con cURL
- Parámetros clave
- Solución de problemas
- Preguntas frecuentes
- Artículos recomendados
Kimi K3 está disponible a través de la API serverless de Novita AI con el ID de modelo moonshotai/kimi-k3, un endpoint de chat compatible con OpenAI, una ventana de contexto de 1,048,576 tokens y una configuración de salida máxima de 1,048,576 tokens listada en su página de modelo. Este inicio rápido muestra cómo autenticarse, enviar una primera solicitud, analizar la respuesta y planificar el precio por token de Kimi K3 antes de conectarlo a una aplicación más grande.
Cuándo usar este inicio rápido
Utilice esta guía cuando desee probar Kimi K3 desde una aplicación que ya hable el formato de API de OpenAI. Es un punto de partida práctico para flujos de trabajo de ingeniería de software de contexto largo, análisis de documentos, investigación y razonamiento donde la solicitud pueda contener sustancialmente más contexto que un mensaje de chat típico.
La página de modelo de Kimi K3 en Novita describe un modelo de 2.8 billones de parámetros con comprensión visual nativa y una ventana de contexto de 1M de tokens. La misma página enumera entradas de texto, imagen y video con salida de texto, además de acceso serverless, salida estructurada, razonamiento y llamada a funciones. Trate estas capacidades como características que debe verificar con respecto a la forma prevista de su solicitud, en lugar de asumir que cada característica del SDK de OpenAI tiene un comportamiento idéntico en todos los modelos.
Esto no es una comparación de referencia. El objetivo es lograr que una solicitud autenticada funcione, y luego proporcionarle suficientes detalles operativos para decidir si Kimi K3 se adapta a su carga de trabajo.
Paso 1: Obtenga su clave de API de Novita
Cree o seleccione una cuenta de Novita AI, abra la configuración de su clave de API y cree una clave para uso del lado del servidor. Mantenga la clave fuera de los paquetes del frontend, repositorios públicos, cuadernos compartidos fuera de su equipo y el historial del shell siempre que sea posible.
Configure la clave como una variable de entorno antes de ejecutar cualquiera de los ejemplos:
export NOVITA_API_KEY="su_clave_api_aqui"
Utilice una clave de proyecto o temporal cuando la configuración de su cuenta lo admita. Rote la clave después de una demostración pública o cualquier sospecha de exposición.
Paso 2: Confirme el ID del modelo y el endpoint
Mantenga los detalles de conexión juntos para que un nombre para mostrar no reemplace accidentalmente el identificador real del modelo:
| Campo | Valor |
|---|---|
| ID del modelo | moonshotai/kimi-k3 |
| URL base | https://api.novita.ai/openai/v1 |
| Endpoint de completaciones de chat | https://api.novita.ai/openai/v1/chat/completions |
| Ventana de contexto | 1,048,576 tokens |
| Configuración máxima de salida | 1,048,576 tokens |
| Capacidades de entrada | Texto, imagen, video |
| Capacidad de salida | Texto |
| Tipo de acceso | API serverless |
La página de modelo de Kimi K3 es la fuente de verdad para disponibilidad, límites actuales, capacidades y precios. Vuelva a consultarla antes de implementar, ya que las configuraciones y precios del modelo pueden cambiar.
Paso 3: Envíe su primera solicitud
Comience con una solicitud corta de solo texto. Un mensaje pequeño facilita la separación de problemas de autenticación o enrutamiento de problemas de nivel de aplicación con el mensaje.
Por ejemplo, pídale a Kimi K3 que devuelva una lista de verificación de implementación corta:
Enumere los tres mayores riesgos al agregar reintentos a un cliente de API de streaming. Devuelva una oración por riesgo.
Mantenga modesto el primer valor de max_tokens. Una gran asignación de salida es útil solo después de que la solicitud básica, el análisis de la respuesta y el manejo de errores funcionen correctamente.
Paso 4: Lea la respuesta
La respuesta compatible con OpenAI coloca el texto del asistente en choices[0].message.content para una completación de chat estándar no streaming. Conserve los metadatos de la respuesta y los campos de uso en su aplicación si necesita seguimiento de solicitudes o contabilidad de costos.
Para una integración de producción, registre al menos:
- El ID del modelo y la marca de tiempo de la solicitud.
- El ID de solicitud del proveedor, cuando lo devuelva el cliente o los encabezados de respuesta.
- El uso de tokens de mensaje y completación.
- El número de reintentos y el estado HTTP.
- Si la solicitud usó solo texto o contenido multimodal.
Una vez que la primera llamada tenga éxito, pruebe mensajes que se asemejen a su carga de trabajo real: archivos fuente largos, varios documentos, un esquema de herramienta o un contrato de respuesta estructurada. Un mensaje corto exitoso verifica la conectividad, no la calidad de producción.
Paso 5: Verifique precios, límites y errores comunes
La página de modelo de Novita enumera los precios serverless de $3 por millón de tokens de entrada, $0.30 por millón de tokens de lectura en caché y $15 por millón de tokens de salida para Kimi K3. Su estimación debe incluir ambos lados de la solicitud, los reintentos y la cantidad de contexto que envíe repetidamente.
La página también enumera estos niveles de tasa de solicitud:
| Nivel | Solicitudes por minuto | Tokens por minuto |
|---|---|---|
| T1 | 30 | 50,000,000 |
| T2 | 100 | 50,000,000 |
| T3 | 1,000 | 50,000,000 |
| T4 | 3,000 | 50,000,000 |
| T5 | 6,000 | 50,000,000 |
El nivel aplicable depende de su cuenta. No trate la tabla como una promesa de que cada proyecto comienza en T1 o que cada carga de trabajo puede usar la tasa máxima mostrada.
Los errores comunes en la primera integración incluyen:
- Faltar el encabezado
Authorization: Bearero configurar la variable de entorno incorrecta. - Enviar
kimi-k3o un nombre de marketing en lugar demoonshotai/kimi-k3. - Usar
https://api.novita.ai/openaicomo URL base del SDK cuando el cliente espera la ruta versionada.../openai/v1. - Enviar un cuerpo de solicitud que no sea JSON válido.
- Establecer un límite de salida mayor de lo que su aplicación puede almacenar o procesar.
- Asumir que un cuerpo de solicitud multimodal es idéntico en todos los SDK o familias de modelos.
Ejemplo en Python
Instale el cliente de Python de OpenAI en su entorno, luego ejecute este ejemplo con NOVITA_API_KEY configurada:
pip install openai
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["NOVITA_API_KEY"],
base_url="https://api.novita.ai/openai/v1",
)
response = client.chat.completions.create(
model="moonshotai/kimi-k3",
messages=[
{
"role": "system",
"content": "You are a concise engineering assistant.",
},
{
"role": "user",
"content": "List three risks when adding retries to a streaming API client.",
},
],
temperature=0.2,
max_tokens=300,
)
print(response.choices[0].message.content)
El ejemplo usa intencionalmente una completación corta. Aumente los presupuestos de contexto y salida solo después de haber agregado límites de tiempo, reintentos, registro y seguimiento de uso apropiados para su aplicación.
Ejemplo con cURL
La misma solicitud se puede probar sin un SDK:
payload='{
"model": "moonshotai/kimi-k3",
"messages": [
{
"role": "system",
"content": "You are a concise engineering assistant."
},
{
"role": "user",
"content": "List three risks when adding retries to a streaming API client."
}
],
"temperature": 0.2,
"max_tokens": 300
}'
curl --request POST "https://api.novita.ai/openai/v1/chat/completions" \
--header "Authorization: Bearer $NOVITA_API_KEY" \
--header "Content-Type: application/json" \
--data "$payload"
Parámetros clave
| Parámetro | Qué controla | Primer valor sensato |
|---|---|---|
model |
El modelo alojado que responde la solicitud | moonshotai/kimi-k3 |
messages |
Turnos de conversación de sistema, usuario y asistente | Un mensaje de sistema y uno de usuario |
temperature |
Variabilidad de la salida | 0.2 para pruebas repetibles |
max_tokens |
Salida generada máxima | 300, luego aumente deliberadamente |
stream |
Si la salida llega incrementalmente | Déjelo deshabilitado mientras depura |
tools |
Definiciones de funciones disponibles para el modelo | Agregue después de que el chat básico funcione |
response_format |
Requisitos de salida estructurada | Valide el JSON devuelto antes de usarlo |
Para entradas de imagen o video, confirme el formato de solicitud actual en la documentación del modelo y la API antes de agregarlos a su aplicación. Las etiquetas de capacidad en una página de modelo no reemplazan la prueba de la estructura de contenido exacta que usa su biblioteca cliente.
Solución de problemas
La autenticación falla
Verifique que NOVITA_API_KEY esté configurada en el mismo proceso que ejecuta la solicitud. Confirme que el encabezado use Bearer, no un parámetro de consulta ni un nombre de credencial diferente.
El modelo no se encuentra
Use el ID exacto moonshotai/kimi-k3. El nombre para mostrar del modelo no es un sustituto válido del ID del modelo de API.
La solicitud es rechazada
Reduzca los valores del mensaje y max_tokens, valide el cuerpo JSON y confirme que el endpoint sea /openai/v1/chat/completions. Si la solicitud usa imágenes, video, herramientas o salida estructurada, elimine esos campos y agréguelos de uno en uno.
Las solicitudes son lentas o tienen límite de tasa
Mida los recuentos de tokens de mensaje y salida, reduzca el contexto repetido innecesario y agregue retroceso exponencial acotado para respuestas reintentables. Verifique el nivel de tasa actual de su cuenta en lugar de asumir el nivel más alto en la tabla de la página del modelo.
La respuesta está incompleta
Inspeccione el motivo de finalización y los datos de uso. Un valor pequeño de max_tokens puede detener una respuesta larga antes de tiempo; aumentarlo también incrementa la cantidad de salida que su aplicación puede pagar y procesar.
Preguntas frecuentes
¿Qué ID de modelo debo enviar para Kimi K3?
Envíe moonshotai/kimi-k3 en el campo model.
¿Qué endpoint usa el cliente de OpenAI?
Configure la URL base del SDK en https://api.novita.ai/openai/v1. La solicitud de completaciones de chat se envía a https://api.novita.ai/openai/v1/chat/completions.
¿Qué tan grande es la ventana de contexto de Kimi K3?
La página de modelo de Novita enumera una ventana de contexto de 1,048,576 tokens y una configuración de salida máxima de 1,048,576 tokens. Consulte la página antes de la implementación para conocer las actualizaciones.
¿Llamar a Kimi K3 es gratuito?
No se afirma ningún acceso gratuito aquí. La página del modelo enumera los precios serverless basados en tokens, por lo que debe verificar los precios actuales que se muestran para su cuenta y modelo antes de enviar solicitudes grandes.
¿Debo comenzar con una solicitud multimodal?
No. Comience con una solicitud pequeña de solo texto para que la autenticación, la selección del endpoint, el análisis de la respuesta y el manejo de errores sean fáciles de verificar. Agregue entradas multimodales después de que esa ruta sea estable.
Artículos recomendados
- Inicio rápido de la API MiniMax M3 con Novita AI
- Cómo acceder al pensamiento de Kimi K2: Guía de configuración completa para desarrolladores
- Uso de LlamaIndex con Novita AI: Una guía paso a paso
Fuentes
- Página de modelo de Kimi K3 — ID del modelo, disponibilidad, capacidades, contexto, límites, precios y niveles de tasa; consultado el 22 de julio de 2026.
- Referencia de API de Novita AI: Crear completación de chat — ruta de completación de chat compatible con OpenAI; consultado el 22 de julio de 2026.
