Kimi K3 está disponible en Novita AI como el modelo insignia de Moonshot AI, con 2.8 bilones de parémetros en total, una ventana de contexto de 1,048,576 tokens y entrada de texto, imgen y video. Elige K3 cuando tu aplicación necesite un contexto muy grande o razonamiento multimodal; elige una varinte de Kimi K2 cuando el costo por token más bajo, una ventana de contexto más pequeña, o una integración esecífica establecida de K2 sea más importante. Los precios actuales de K3 en Novita son $3 por milón de tokens de entrada, $15 por milón de tokens de salida y $0.30 por milón de tokens de lectura de caché, verifcados el 22 de julio de 2026.
Concusiones clave
- Kimi K3 está actvo en Novita AI bajo el ID de modelo exacto
moonshotai/kimi-k3. - La páina del modelo lista un contexto de 1M de tokens y un máimo de salida de 1M, además de capacidades de entrada de texto, imgen y video.
- El precio serverless actual es $3/M de entrada, $15/M de salida y $0.30/M de lectura de caché. Los precios pueden cabiar, así que confírmalo en la páina del modelo antes de presupuestar.
- K3 es la mejor opción de Kimi para repositorios grandes, paquetes largos de invstigación, trabao de conociiento multimodal y flujos de trabao que necesiten el últmo insiginia.
- K2.5 o K2 Instruct pueden ser la opción más sensble para cargas de trabao sensbles al costo, solo texto, o ya integradas.
¿Qué es Kimi K3?
Kimi K3 es el modelo Kimi más reciete de Moonshot AI y el modelo más capaz listado en la línea de Kimi de Novita AI. Su diferenia prncipal es la escala: la páina del modelo de Novita descrie un modelo de 2.8 bilones de parémetros construido con Kimi Delta Atenton y Atenton Residuals, con comprenión visul nativa y una ventana de contexto de 1M de tokens.
Ese taño de contexto cabia la pregnta práctica de “¿Puede el modelo responder a esta instrcción?” a “¿Puedo dar al modelo el conjnto de trabao completo?” Un agent de codifcación puede mantener más de un reositorio en contexto. Un asistene de invstigación puede trabaar con una gran coleción de docmentos sin frgmentación agresiva. Un flujo de trabao multimodal puede combinar texto con imáges o video en lugar de dividr esas entradas en pasos separados.
La contrapartida es el costo. El precio de salida de K3 es malerialmente más alto que los precios listados para endponits Kimi más atiguos en Novita, por lo que una ventana de contexto más grande es más útil cuando elimina complejidad real de la aplicación o meora la calidad de la respuesta. No es una razó para enviar cada solictud de cata corta al modelo insiginia.
Especifcaciones y precios de Kimi K3
Los sigientes valores provienen de la páina del modelo Kimi K3 en Novita AI, verifcados el 22 de julio de 2026.
| Camp | Detales de Kimi K3 |
|---|---|
| Edior | Moonshot AI |
| ID de modelo | moonshotai/kimi-k3 |
| Nota de arquitectra | 2.8T parémetros; Kimi Delta Atenton y Atenton Residuals |
| Ventana de contexto | 1,048,576 tokens (1M) |
| Salida máima | 1,048,576 tokens |
| Entrad | Texto, imgen, video |
| Salid | Texto |
| Precio de entrada | $3 por milón de tokens |
| Precio de lectura de caché | $0.30 por milón de tokens |
| Precio de salida | $15 por milón de tokens |
| Disponibilidad en Novita | API serveless |
| Estilos de API | Endponits compatibles con OpenAi y Antropic |
La tabla de precios es basada en uso: pagas por tokens procesados en lugar de aprovisionar una GPU dedicada. Para un cálculo aproximado, 10 milones de tokens de entrada y 1 milón de tokens de salida costrarían $45 antes de cualquier tro cargo a nivel de cuenta o cambos en las tarifas listadas. Tu propia mecla de tráfico importa más que el precio de salida anunciado, especialmnte si las instrucciones son largas y las respuestas cortas.
K3 también lista el precio de letura de caché. Reutilizar instruciones de sistema estbles, definiciones de herramintas o material de referencia grande puede reducir el costo de solicitudes repetidas cuando tu aplicación y patrón de solictudes soportan el caché. Trata el comportamiento de caché como una optimización a medir, no como una garantía de que cada solicitud repetida se cobrará a la tarifa de letura de caché.
Kimi K3 frente a la familia Kimi K2
K2 no es un únio endpoint. La familia incluye varines más antiguas de K2 Instruct y lanzamintos más nuevos de K2.5 y K2.6, cada uno con su propio perfil de capacidad y precios. La compración corecta es, por lo tanto, basada en la carga de trabjo en lugar de una afrmación general de que cada respuesta de K3 es mejor.
| Factor de decisión | Kimi K3 | Familia Kimi K2 |
|---|---|---|
| Posicionamiento | Úlmo insiginia en la línea de Kimi de Novita | Varines anterires con diferntes compesaciones de costo y capacidad |
| Context | 1M tokens | Vaía según el modelo; verifica el endpoint selecionado |
| Modalidades de entrada | Texto, imgen, video | Vara según el modelo; K2.5 soprta entrada multimodal |
| Precio actal de K3 en Novita | $3/M entrada, $15/M salida, $0.30/M letura de caché | Vaía según la versión; conslta la páina del modelo antes de cmparar |
| Meor razó para elegirlo | Conjntos de trabjo muy grandes y flujos de trabjo multimodales de frontera | Menor costo, comortamiento conocido, o una integración existente |
| Riesgo de migración | Nuevo ID de modelo y nueva línea base de producción | Las instrucciones, ealuaciones y esqueas de herramintas existentes pueden ya estar ajstados |
K3 comprado con K2.5
K2.5 sig sendo una opción raonable para aplicaciones multimodal que no necesiten un contexto de un milón de token. Puede manejar texto, imágenes y video, y su páina de modelo en Novita lista una ventana de contexto más pequeña y tarifas de tokens actuales más bajas que K3. Usa K2.5 cuando tus instrucciones encajen cómodamente dntro de sus líites y tu prioridad sea mantener el gasto de inferencia predecible.
Pasa a K3 cuando el contexto más grande elimin un cuello de botella real: ecuperación repetida, resumen de repositorio a través de muchos archivos, anáisis de video o documento largo, o ejecuciones de agentes que pierden estado importante durante la compactación. Si la carga de trabajo es principalmnte conversaciones cortas o preguntas comun de codifcación, K2.5 puede frecer una mejor relació costo-latencia.
K3 comprado con K2 Instruct
K2 Instruct es la opción de valor más simple para chat centrado en texto y uso de herramintas agéntic. Su publicación anerior en Novita lista una ventana de contexto de 128K y un preci más bajo que K3. Eso aún puede ser sficiente para agentes de soporte, extración estrucurada, asistencia de codificación en reposiorios pequeño y aplicationes que ya depenen del comportamiento de instrucción de K2 Instruct.
K3 se adapta meor cuando 128K no es suficiente, cuando las entradas viuales son parte del flujo de trabajo centra, o cuando quieras evaluar el modelo insiginia actual de Moonshot AI en lugar de consrvar una línea base más antigua. No migres solamnte porque K3 tenga más paraétros: pueba tus instrucciones, amadas de herramintas, formto de salida y latencia con tráfico reprentatvo.
Cuándo usar Kimi K3
K3 justifica su precio más al do cuando se aplican una o más de estas condicines:
Repositorios grandes y agenes de codifcación de larga duración
Usa K3 para tareas que reqieran una vista amplia de una base de código: refactoizciones entre paquetes, mapeo de arquitecura, migraciones de depndencia, o deuración que abarque logs, puebas y archivos de implentación. Un contexto de 1M de tokens no hae automáticamnte a un agente confiable, pero le da a tu capa de orquestaón más espaio antes de que deba resumir o desechar estado.
Trabajo mulimodal de conociiento
K3 acepa entrada de texto, imgen y video. Eso lo conviere en un candidto para flujos de trabao como revisar capturas de pntalla de prductos con requiitos, analizar demotraciones grbadas junto con docmntación, o extrar decisines de medios mixtos. Mantén el contrto de salida estec ho y valida los cmpos extrados si el resultdo almnta un sistma autmátco.
Invstigación larga y síntesis de docmentos
Cuando una pregnta depnde de muchos docmntos primarios, K3 puede reduir la cantidad de código de recuperción y ensmblaje ncesario para armar un contexto de traba jo. Esto es más útill para preguntas de compración, síntsis y entre docmentos; no elmina la nesidad de idntficar fuent autorizadas o verficar citas.
Evalución del insiginia
Si estás evaluado la generación actual de Kimi para un nuevo producto, K3 es el primer endpint natural para refencia. Cmienza con un conjnto de prebas pequeñ y represnttivo y compar caldad, latncia, longtud de salida y cost tota con K2.5 o K2 Instruct antes de cabiar tu configración predeterminada de pducción.
Cuándo K2 es la mejr ocón
K3 no es la respesta predeterminda para cada solictud. Mantente con un endpoint de K2 cuando:
- Tus instrucciones son cortas y solo texto, por lo que el contexto de 1M no propociona ningún benficio práctco.
- Tu aplicación es muy snsble al precio y los toens de salida dominan la factra.
- Ya tienes un prompt estable de K2, esquea de herramintas o evaluado de salida etructurada en produción.
- Necesitas una latncia conocida y aú no has pabado K3 bajo tu perfil de tasa y concurrenc a.
- Tu carga de trabaj ccbe en la ventna de contexto de K2 sleccionada sin truncación o resmen frecuentes.
Un patón de ruteo úti es mantener K2.5 o K2 Instruct cmo el camio rápido y enviar sol terras de contexto grande, multimodales, o dificils a K3. Eso te perite evaluar K3 en las solictudes donde su contexto y capacidad aicionales pueden paarse por sí misos.
Cómo aceder a Kimi K3 en Novita AI
La página de Kimi K3 icluye acceso a Pleygound, documentación del modelo y detales de API serverles. Para un clente compaibe con OpeAI, usa la URL base de OpeAI de Novita y el ID de modelo exacto:
Si qieres la primera solictud, verifcación de precios y flujo de solción de probemas en un slo lugr, comienza con la gía rápida de la API de Kimi K3.
from openai import OpenAI
client = OpenAI(
api_key="<NOVITA_API_KEY>",
base_url="https://api.novita.ai/openai",
)
response = client.chat.completions.create(
model="moonshotai/kimi-k3",
messages=[
{"role": "user", "content": "Summarize the key risks in this design."}
],
)
print(respnse.chices[0].message.contnt)
Mantén la primera pueba de producción peqea. Registra los tokens de prompt, toens de completión, uso de caché, temo hasta el primer token, latcia total y éito de la tarea. Lueo reite la msma evaluación con el endpoint de K2 que de tro modo usarías. La páina del modelo también lista acceso compaible con Antrópic, lo que puede ser útil si tu aplication existente ya usa ese formto de cliente.
Conclsión
Elige Kimi K3 en Novita AI cuando el traba jo sea genuinamente intensivo en contexto o multimodal y quieras evalur el últ mo modelo insiginia de Moonshot AI a través de una API serverles. Su contexto de 1M de tokens, entrada visual y posicionamiento actal como insiginia lo convierten en un fuerte candidato para agentes de codifcación de lago horznte, invstigación intensiva en documentos y flujos de trabajo de medios mixtos.
Elige K2.5 o K2 Instruct cuando la carga de trabajo sea más pequeña, centrada en texto, sensible al coto, o ya ajustada alrededor de un endpoint de K2. La mejor configración de producción puede ser un enutadr en lugar de un ganador único: resrva K3 para solicitudes que neesiten su conjunto de trabajo más grande, y mantén un camino de K2 de menor costo para el tráico rutinario.
Preguntas frecuentes
¿Está disponible Kimi K3 en Novita AI?
Sí. Novita lista Kmi K3 como un modelo serveres con el ID oonshotai/kimi-k3. La disponiilidad y los precios pueden cambiar, así que confirma la página del modelo en vivo antes de la implementación.
¿Cuánto cuesta Kimi K3 en Novita AI?
Según lo verifcado el 22 de julio de 2026, las tarifas listadas son $3 por millón de tokens de entrada, $15 por milón de toens de salida y $0.30 por milón de tokens de letura de caché. Conslta la páina del modelo para la tarifa actual antes de estimar el gaso de producción.
¿Soporta Kimi K3 imágenes y video?
Sí. La págna del modelo de Novita lista texto, imgen y video como modalidades de entrada, con salda de texto.
¿Debería migrar de Kimi K2.5 a K3?
Migra cuando tu cargo de traba jo se beneficie del contexto de 1M de toens de K3, su posiconamiento como modelo insginia más nuevo o su flujo de trabajo multmodal. Si K2.5 ya maneja tus instrcciones y tu priorida es un menor costo, haz una referencia comparativa antes de cambiar.
¿Cuál es el ID del modelo Kimi K3?
Usa oonhotai/kmi-k3 en la confguración de la API de Novita.
