Kimi K3 API 장기 컨텍스트 워크플로우 빠른 시작

Kimi K3 API 장기 컨텍스트 워크플로우 빠른 시작

Kimi K3는 Novita AI의 서버리스 API를 통해 사용할 수 있으며, 모델 ID는 moonshotai/kimi-k3이고, OpenAI 호환 채팅 엔드포인트, 1,048,576 토큰 컨텍스트 윈도우, 그리고 모델 페이지에 명시된 1,048,576 토큰 최대 출력 설정을 제공합니다. 이 빠른 시작 가이드는 인증 방법, 첫 번째 요청 전송, 응답 파싱, 그리고 Kimi K3를 대규모 애플리케이션에 연결하기 전에 토큰 가격 책정을 계획하는 방법을 보여줍니다.

이 빠른 시작 가이드를 사용해야 하는 경우

이미 OpenAI API 형식을 사용하는 애플리케이션에서 Kimi K3를 테스트하려는 경우 이 가이드를 사용하세요. 이는 일반적인 채팅 프롬프트보다 훨씬 많은 컨텍스트를 포함할 수 있는 장기 컨텍스트 소프트웨어 엔지니어링, 문서 분석, 연구 및 추론 워크플로우를 위한 실용적인 출발점입니다.

Kimi K3의 Novita 모델 페이지는 2.8조 개의 파라미터를 가진 모델로, 기본 시각 이해와 1M 토큰 컨텍스트 윈도우를 제공한다고 설명합니다. 같은 페이지에는 텍스트, 이미지, 비디오 입력과 텍스트 출력, 서버리스 액세스, 구조화된 출력, 추론, 함수 호출이 나열되어 있습니다. 이러한 기능들은 모든 OpenAI SDK 기능이 모델 간에 동일하게 동작한다고 가정하지 말고, 의도한 요청 형태에 대해 검증해야 할 기능으로 취급하세요.

이는 벤치마크 비교가 아닙니다. 목표는 하나의 인증된 요청을 작동시키고, Kimi K3가 워크로드에 적합한지 결정할 수 있을 만큼 충분한 운영 세부 정보를 제공하는 것입니다.

1단계: Novita API 키 받기

Novita AI 계정을 생성하거나 선택하고, API 키 설정을 열고, 서버 측 사용을 위한 키를 생성하세요. 키를 프론트엔드 번들, 공개 저장소, 팀 외부에 공유되는 노트북, 가능하면 셸 히스토리에서 멀리 두세요.

두 예제를 실행하기 전에 키를 환경 변수로 설정하세요:

export NOVITA_API_KEY="your_api_key_here"

계정 설정이 지원하는 경우 프로젝트 또는 임시 키를 사용하세요. 공개 데모 또는 노출이 의심되는 경우 키를 교체하세요.

2단계: 모델 ID와 엔드포인트 확인

연결 세부 정보를 함께 유지하여 표시 이름이 실제 모델 식별자를 실수로 대체하지 않도록 하세요:

필드
모델 ID moonshotai/kimi-k3
Base URL https://api.novita.ai/openai/v1
채팅 완료 엔드포인트 https://api.novita.ai/openai/v1/chat/completions
컨텍스트 윈도우 1,048,576 토큰
최대 출력 설정 1,048,576 토큰
입력 기능 텍스트, 이미지, 비디오
출력 기능 텍스트
액세스 유형 서버리스 API

Kimi K3 모델 페이지는 가용성, 현재 제한 사항, 기능 및 가격 책정에 대한 사실의 출처입니다. 배송 전에 다시 확인하세요. 모델 구성과 가격은 변경될 수 있습니다.

3단계: 첫 번째 요청 보내기

짧은 텍스트 전용 요청으로 시작하세요. 작은 프롬프트는 인증 또는 라우팅 문제를 애플리케이션 수준의 프롬프트 문제와 쉽게 분리할 수 있게 해줍니다.

예를 들어, Kimi K3에게 짧은 구현 체크리스트를 반환하도록 요청하세요:

스트리밍 API 클라이언트에 재시도를 추가할 때 발생하는 세 가지 가장 큰 위험을 나열하세요. 위험당 한 문장으로 반환하세요.

첫 번째 max_tokens 값은 적당하게 유지하세요. 큰 출력 허용량은 기본 요청, 응답 파싱 및 오류 처리가 올바르게 작동한 후에만 유용합니다.

4단계: 응답 읽기

OpenAI 호환 응답은 표준 비스트리밍 채팅 완료의 경우 choices[0].message.content에 어시스턴트의 텍스트를 배치합니다. 요청 추적 또는 비용 회계가 필요한 경우 애플리케이션에서 응답 메타데이터 및 사용량 필드를 보존하세요.

프로덕션 통합의 경우 최소한 다음을 기록하세요:

  • 모델 ID 및 요청 타임스탬프.
  • 클라이언트 또는 응답 헤더에서 반환된 제공자 요청 ID.
  • 프롬프트 및 완료 토큰 사용량.
  • 재시도 횟수 및 HTTP 상태.
  • 요청이 텍스트 전용인지 멀티모달 콘텐츠를 사용했는지 여부.

첫 번째 호출이 성공하면 실제 워크로드와 유사한 프롬프트(긴 소스 파일, 여러 문서, 도구 스키마 또는 구조화된 응답 계약)를 테스트하세요. 성공적인 짧은 프롬프트는 연결성을 확인할 뿐, 프로덕션 품질을 보장하지 않습니다.

5단계: 가격 책정, 제한 사항 및 일반적인 오류 확인

Novita 모델 페이지는 Kimi K3에 대한 서버리스 가격을 **입력 토큰 100만 개당 3달러 **, ** 캐시된 읽기 토큰 100만 개당 0.30달러 , ** 출력 토큰 100만 개당 15달러로 제시합니다. 예상 비용에는 요청의 양측, 재시도 및 반복적으로 전송하는 컨텍스트의 양이 포함되어야 합니다.

페이지에는 또한 다음과 같은 요청 속도 계층이 나열되어 있습니다:

계층 분당 요청 수 분당 토큰 수
T1 30 50,000,000
T2 100 50,000,000
T3 1,000 50,000,000
T4 3,000 50,000,000
T5 6,000 50,000,000

적용 가능한 계층은 계정에 따라 다릅니다. 모든 프로젝트가 T1에서 시작하거나 모든 워크로드가 표시된 최대 속도를 사용할 수 있다는 약속으로 테이블을 취급하지 마세요.

첫 번째 통합 시 흔한 오류는 다음과 같습니다:

  • Authorization: Bearer 헤더가 누락되었거나 잘못된 환경 변수를 설정한 경우.
  • moonshotai/kimi-k3 대신 kimi-k3 또는 마케팅 이름을 보낸 경우.
  • SDK가 버전이 지정된 .../openai/v1 경로를 예상할 때 https://api.novita.ai/openai를 SDK Base URL로 사용한 경우.
  • 유효한 JSON이 아닌 요청 본문을 보낸 경우.
  • 애플리케이션이 저장하거나 처리할 수 있는 것보다 큰 출력 제한을 설정한 경우.
  • 멀티모달 요청 본문이 모든 SDK 또는 모델 제품군에서 동일하다고 가정한 경우.

Python 예제

환경에 OpenAI Python 클라이언트를 설치하고 NOVITA_API_KEY가 설정된 상태에서 이 예제를 실행하세요:

pip install openai
import os

from openai import OpenAI


client = OpenAI(
    api_key=os.environ["NOVITA_API_KEY"],
    base_url="https://api.novita.ai/openai/v1",
)

response = client.chat.completions.create(
    model="moonshotai/kimi-k3",
    messages=[
        {
            "role": "system",
            "content": "You are a concise engineering assistant.",
        },
        {
            "role": "user",
            "content": "List three risks when adding retries to a streaming API client.",
        },
    ],
    temperature=0.2,
    max_tokens=300,
)

print(response.choices[0].message.content)

이 예제는 의도적으로 짧은 완료를 사용합니다. 애플리케이션에 적합한 타임아웃, 재시도, 로깅 및 사용량 추적을 추가한 후에만 컨텍스트 및 출력 예산을 늘리세요.

cURL 예제

동일한 요청을 SDK 없이 테스트할 수 있습니다:

payload='{
  "model": "moonshotai/kimi-k3",
  "messages": [
    {
      "role": "system",
      "content": "You are a concise engineering assistant."
    },
    {
      "role": "user",
      "content": "List three risks when adding retries to a streaming API client."
    }
  ],
  "temperature": 0.2,
  "max_tokens": 300
}'

curl --request POST "https://api.novita.ai/openai/v1/chat/completions" \
  --header "Authorization: Bearer $NOVITA_API_KEY" \
  --header "Content-Type: application/json" \
  --data "$payload"

주요 파라미터

파라미터 제어하는 항목 적절한 첫 번째 값
model 요청에 응답하는 호스팅된 모델 moonshotai/kimi-k3
messages 시스템, 사용자 및 어시스턴트 대화 턴 하나의 시스템 메시지와 하나의 사용자 메시지
temperature 출력 변동성 반복 가능한 테스트를 위해 0.2
max_tokens 생성된 최대 출력 300, 그런 다음 의도적으로 높임
stream 출력이 증분 방식으로 도착하는지 여부 디버깅하는 동안 비활성화 상태 유지
tools 모델에 사용 가능한 함수 정의 기본 채팅이 작동한 후 추가
response_format 구조화된 출력 요구 사항 사용하기 전에 반환된 JSON 검증

이미지 또는 비디오 입력의 경우, 애플리케이션에 추가하기 전에 모델 및 API 문서에서 현재 요청 형식을 확인하세요. 모델 페이지의 기능 레이블은 클라이언트 라이브러리에서 사용하는 정확한 콘텐츠 구조를 테스트하는 것을 대체하지 않습니다.

문제 해결

인증 실패

요청을 실행하는 동일한 프로세스에서 NOVITA_API_KEY가 설정되어 있는지 확인하세요. 헤더가 쿼리 파라미터나 다른 자격 증명 이름이 아닌 Bearer를 사용하는지 확인하세요.

모델을 찾을 수 없음

정확한 ID moonshotai/kimi-k3를 사용하세요. 모델 표시 이름은 API 모델 ID의 유효한 대체물이 아닙니다.

요청이 거부됨

프롬프트와 max_tokens 값을 줄이고, JSON 본문의 유효성을 검사하고, 엔드포인트가 /openai/v1/chat/completions인지 확인하세요. 요청이 이미지, 비디오, 도구 또는 구조화된 출력을 사용하는 경우 해당 필드를 제거하고 한 번에 하나씩 다시 추가하세요.

요청이 느리거나 속도 제한이 걸림

프롬프트 및 출력 토큰 수를 측정하고, 불필요하게 반복되는 컨텍스트를 줄이고, 재시도 가능한 응답에 대해 제한된 지수 백오프를 추가하세요. 모델 페이지 테이블에서 가장 높은 계층을 가정하기보다는 계정의 현재 속도 계층을 확인하세요.

응답이 불완전함

완료 이유 및 사용량 데이터를 검사하세요. 작은 max_tokens 값은 긴 답변을 일찍 중단시킬 수 있습니다. 값을 높이면 애플리케이션이 지불하고 처리해야 하는 출력량도 증가합니다.

FAQ

Kimi K3에 대해 어떤 모델 ID를 보내야 하나요?

model 필드에 moonshotai/kimi-k3를 보내세요.

OpenAI 클라이언트는 어떤 엔드포인트를 사용하나요?

SDK Base URL을 https://api.novita.ai/openai/v1로 설정하세요. 채팅 완료 요청은 https://api.novita.ai/openai/v1/chat/completions로 전송됩니다.

Kimi K3의 컨텍스트 윈도우 크기는 얼마인가요?

Novita 모델 페이지에는 1,048,576 토큰 컨텍스트 윈도우와 1,048,576 토큰 최대 출력 설정이 나와 있습니다. 배포 전에 페이지에서 업데이트를 확인하세요.

Kimi K3를 무료로 호출할 수 있나요?

여기서는 무료 액세스 주장이 없습니다. 모델 페이지에는 토큰 기반 서버리스 가격이 나와 있으므로, 대규모 요청을 보내기 전에 계정 및 모델에 대해 표시된 현재 가격을 확인하세요.

멀티모달 요청으로 시작해야 하나요?

아니요. 인증, 엔드포인트 선택, 응답 파싱 및 오류 처리를 쉽게 확인할 수 있도록 작은 텍스트 전용 요청으로 시작하세요. 해당 경로가 안정화된 후에 멀티모달 입력을 추가하세요.

추천 문서

출처