Guía de inicio rápido de Kimi K3 para flujos de trabajo de API de contexto largo

Guía de inicio rápido de Kimi K3 para flujos de trabajo de API de contexto largo

Kimi K3 está disponible a través de la API serverless de Novita AI con el ID de modelo moonshotai/kimi-k3, un endpoint de chat compatible con OpenAI, una ventana de contexto de 1,048,576 tokens y un ajuste de salida máxima de 1,048,576 tokens indicado en su página del modelo. Esta guía de inicio rápido muestra cómo autenticarte, enviar una primera solicitud, interpretar la respuesta y planificar el precio por tokens de Kimi K3 antes de conectarlo a una aplicación más grande.

Cuándo usar esta guía de inicio rápido

Usa esta guía cuando quieras probar Kimi K3 desde una aplicación que ya hable el formato de API de OpenAI. Es un punto de partida práctico para flujos de trabajo de ingeniería de software de contexto largo, análisis de documentos, investigación y razonamiento donde la solicitud puede contener considerablemente más contexto que un prompt de chat típico.

La página del modelo de Kimi K3 en Novita describe un modelo de 2,8 billones de parámetros con comprensión visual nativa y una ventana de contexto de 1M de tokens. La misma página lista entradas de texto, imagen y vídeo con salida de texto, además de acceso serverless, salida estructurada, razonamiento y llamada de funciones. Trátalas como capacidades a verificar contra la forma de tu solicitud prevista, en lugar de asumir que cada función del SDK de OpenAI tiene un comportamiento idéntico entre modelos.

Esto no es una comparativa de benchmarks. El objetivo es lograr que una solicitud autenticada funcione y luego darte suficiente detalle operativo para decidir si Kimi K3 se ajusta a tu carga de trabajo.

Paso 1: Consigue tu clave de API de Novita

Crea o selecciona una cuenta de Novita AI, abre los ajustes de tus claves de API y crea una clave para uso en el servidor. Mantén la clave fuera de los paquetes frontend, los repositorios públicos, los cuadernos compartidos fuera de tu equipo y el historial del shell siempre que sea posible.

Configura la clave como variable de entorno antes de ejecutar cualquiera de los ejemplos:

export NOVITA_API_KEY="your_api_key_here"

Usa una clave de proyecto o temporal si la configuración de tu cuenta lo permite. Rota la clave después de una demo pública o ante cualquier posible exposición.

Paso 2: Confirma el ID del modelo y el endpoint

Mantén los datos de conexión juntos para que un nombre visible no reemplace accidentalmente el identificador real del modelo:

Campo Valor
ID del modelo moonshotai/kimi-k3
URL base https://api.novita.ai/openai/v1
Endpoint de chat completions https://api.novita.ai/openai/v1/chat/completions
Ventana de contexto 1,048,576 tokens
Ajuste de salida máxima 1,048,576 tokens
Capacidades de entrada Texto, imagen, vídeo
Capacidad de salida Texto
Tipo de acceso API serverless

La página del modelo de Kimi K3 es la fuente de verdad sobre disponibilidad, límites actuales, capacidades y precios. Vuelve a consultarla antes de lanzar algo porque las configuraciones y los precios de los modelos pueden cambiar.

Paso 3: Envía tu primera solicitud

Empieza con una solicitud corta de solo texto. Un prompt pequeño facilita distinguir los problemas de autenticación o enrutamiento de los problemas de prompt a nivel de aplicación.

Por ejemplo, pide a Kimi K3 que devuelva una lista de verificación de implementación breve:

List the three biggest risks when adding retries to a streaming API client. Return one sentence per risk.

Mantén un valor modesto en el primer max_tokens. Una salida amplia solo es útil después de que la solicitud básica, el análisis de la respuesta y el manejo de errores funcionen correctamente.

Paso 4: Lee la respuesta

La respuesta compatible con OpenAI coloca el texto del asistente en choices[0].message.content para una finalización de chat estándar sin streaming. Conserva los metadatos de la respuesta y los campos de uso en tu aplicación si necesitas rastreo de solicitudes o contabilidad de costes.

Para una integración en producción, registra al menos:

  • El ID del modelo y la marca de tiempo de la solicitud.
  • El ID de solicitud del proveedor, cuando lo devuelva el cliente o las cabeceras de la respuesta.
  • El uso de tokens de prompt y de completions.
  • El número de reintentos y el estado HTTP.
  • Si la solicitud usó contenido de solo texto o multimodal.

Una vez que la primera llamada tenga éxito, prueba prompts que se parezcan a tu carga de trabajo real: archivos fuente largos, varios documentos, un esquema de herramientas o un contrato de respuesta estructurada. Un prompt corto exitoso verifica la conectividad, no la calidad en producción.

Paso 5: Revisa precios, límites y errores comunes

La página del modelo de Novita lista precios serverless de $3 por millón de tokens de entrada, $0.30 por millón de tokens de lectura en caché y $15 por millón de tokens de salida para Kimi K3. Tu estimación debe incluir ambas partes de la solicitud, los reintentos y la cantidad de contexto que envías repetidamente.

La página también lista estos niveles de tasa de solicitud:

Nivel Solicitudes por minuto Tokens por minuto
T1 30 50,000,000
T2 100 50,000,000
T3 1,000 50,000,000
T4 3,000 50,000,000
T5 6,000 50,000,000

El nivel aplicable depende de tu cuenta. No trates la tabla como una garantía de que cada proyecto comienza en T1 o de que cada carga de trabajo puede usar la tasa máxima mostrada.

Los errores comunes en la primera integración incluyen:

  • Olvidar la cabecera Authorization: Bearer o configurar una variable de entorno incorrecta.
  • Enviar kimi-k3 o un nombre comercial en lugar de moonshotai/kimi-k3.
  • Usar https://api.novita.ai/openai como URL base del SDK cuando el cliente espera la ruta versionada .../openai/v1.
  • Enviar un cuerpo de solicitud que no sea JSON válido.
  • Configurar un límite de salida mayor de lo que tu aplicación puede almacenar o procesar.
  • Asumir que un cuerpo de solicitud multimodal es idéntico en todos los SDK o familias de modelos.

Ejemplo en Python

Instala el cliente de Python de OpenAI en tu entorno y luego ejecuta este ejemplo con NOVITA_API_KEY definida:

pip install openai
import os

from openai import OpenAI


client = OpenAI(
    api_key=os.environ["NOVITA_API_KEY"],
    base_url="https://api.novita.ai/openai/v1",
)

response = client.chat.completions.create(
    model="moonshotai/kimi-k3",
    messages=[
        {
            "role": "system",
            "content": "You are a concise engineering assistant.",
        },
        {
            "role": "user",
            "content": "List three risks when adding retries to a streaming API client.",
        },
    ],
    temperature=0.2,
    max_tokens=300,
)

print(response.choices[0].message.content)

El ejemplo usa intencionadamente una finalización corta. Aumenta los presupuestos de contexto y salida solo después de haber añadido timeouts, reintentos, registro y seguimiento de uso adecuados para tu aplicación.

Ejemplo con cURL

La misma solicitud se puede probar sin un SDK:

payload='{
  "model": "moonshotai/kimi-k3",
  "messages": [
    {
      "role": "system",
      "content": "You are a concise engineering assistant."
    },
    {
      "role": "user",
      "content": "List three risks when adding retries to a streaming API client."
    }
  ],
  "temperature": 0.2,
  "max_tokens": 300
}'

curl --request POST "https://api.novita.ai/openai/v1/chat/completions" \
  --header "Authorization: Bearer $NOVITA_API_KEY" \
  --header "Content-Type: application/json" \
  --data "$payload"

Parámetros clave

Parámetro Qué controla Primer valor razonable
model El modelo alojado que responde a la solicitud moonshotai/kimi-k3
messages Turnos de conversación de sistema, usuario y asistente Un mensaje de sistema y uno de usuario
temperature Variabilidad de la salida 0.2 para pruebas repetibles
max_tokens Salida generada máxima 300, luego auméntalo deliberadamente
stream Si la salida llega de forma incremental Déjalo deshabilitado mientras depuras
tools Definiciones de funciones disponibles para el modelo Añádelo después de que el chat básico funcione
response_format Requisitos de salida estructurada Valida el JSON devuelto antes de usarlo

Para entradas de imagen o vídeo, confirma el formato actual de solicitud en la documentación del modelo y la API antes de añadirlas a tu aplicación. Las etiquetas de capacidades en una página de modelo no sustituyen probar la estructura de contenido exacta que usa tu librería cliente.

Solución de problemas

Fallo de autenticación

Comprueba que NOVITA_API_KEY esté definida en el mismo proceso que ejecuta la solicitud. Confirma que la cabecera usa Bearer, no un parámetro de consulta ni un nombre de credencial diferente.

El modelo no se encuentra

Usa el ID exacto moonshotai/kimi-k3. El nombre visible del modelo no es un sustituto válido del ID de modelo de la API.

La solicitud es rechazada

Reduce los valores del prompt y de max_tokens, valida el cuerpo JSON y confirma que el endpoint es /openai/v1/chat/completions. Si la solicitud usa imágenes, vídeo, tools o salida estructurada, elimina esos campos y añádelos de nuevo uno a uno.

Las solicitudes son lentas o tienen límites de tasa

Mide los recuentos de tokens de prompt y de salida, reduce el contexto repetido innecesario y añade backoff exponencial acotado para respuestas reintentables. Comprueba el nivel de tasa actual de tu cuenta en lugar de asumir el nivel más alto de la tabla de la página del modelo.

La respuesta está incompleta

Inspecciona el motivo de finalización y los datos de uso. Un valor pequeño de max_tokens puede detener una respuesta larga antes de tiempo; aumentarlo también incrementa la cantidad de salida que tu aplicación puede pagar y procesar.

Preguntas frecuentes

¿Qué ID de modelo debo enviar para Kimi K3?

Envía moonshotai/kimi-k3 en el campo model.

¿Qué endpoint usa el cliente de OpenAI?

Establece la URL base del SDK en https://api.novita.ai/openai/v1. La solicitud de chat completions se envía a https://api.novita.ai/openai/v1/chat/completions.

¿Cuán grande es la ventana de contexto de Kimi K3?

La página del modelo de Novita indica una ventana de contexto de 1,048,576 tokens y un ajuste de salida máxima de 1,048,576 tokens. Consulta la página antes del despliegue para ver actualizaciones.

¿Es gratuito llamar a Kimi K3?

Aquí no se afirma que sea de acceso gratuito. La página del modelo lista precios serverless basados en tokens, así que revisa el precio actual que se muestra para tu cuenta y modelo antes de enviar solicitudes grandes.

¿Debo empezar con una solicitud multimodal?

No. Empieza con una solicitud pequeña de solo texto para que la autenticación, la selección del endpoint, el análisis de la respuesta y el manejo de errores sean fáciles de verificar. Añade entradas multimodales después de que ese camino sea estable.

Artículos recomendados

Fuentes