Novita AI LLM, API

Ling 3.0 Flash Sante 퀵 스타트: 첫 번째 채팅 API 호출

Ling 3.0 Flash Sante 퀵 스타트: 첫 번째 채팅 API 호출

이 퀵 스타트 가이드는 Novita의 OpenAI 호환 API를 통해 Ling 3.0 Flash Sante에 첫 번째 텍스트 채팅 완료 요청을 보내는 방법을 보여줍니다. 기본 URL로 https://api.novita.ai/openai를, 모델 ID로 inclusionai/ling-3.0-flash-sante를, 요청 경로로 POST https://api.novita.ai/openai/v1/chat/completions를 사용하세요. 현재 Novita 목록에는 토큰당 약 51억 개의 활성 파라미터를 가진 124B 파라미터 Mixture-of-Experts 모델, 262,144 토큰 컨텍스트 윈도우, 32,768 토큰 최대 출력, 텍스트 입력 및 출력, 추론, 함수 호출이 명시되어 있습니다. 이 페이지는 구현 가이드이며 출시 개요가 아닙니다. 모델 포지셔닝, 적합성 안내 및 현재 가격은 Ling 3.0 Flash Sante on Novita AI: Free API, Specs, and Pricing을 참조하세요.

Ling 3.0 Flash Sante Python 및 cURL 통합 튜토리얼

이 페이지는 인증 방법, 모델 경로 확인, 소규모 요청 전송 및 응답 파싱에 대한 실용적인 질문이 있을 때 사용하세요. 임상 워크플로우를 선택하거나 고위험 사용 사례에 대한 모델을 검증하기 위한 것이 아닌 첫 번째 통합 테스트를 위해 설계되었습니다.

Ling 3.0 Flash Sante는 텍스트 모델입니다. 호스팅된 목록은 의학 지식 추론, 임상 안전성, 증거 기반 검색 및 장기 의료 작업을 강조하는 동시에 일반 추론, 코딩 및 에이전트 기능도 나열합니다. 이러한 레이블은 모델의 의도된 기능 영역을 설명하지만, 사용자 데이터에 대한 평가, 출처 확인, 개인정보 보호 통제 또는 자격을 갖춘 검토를 대체하지 않습니다.

1단계: Novita API 키 받기

Novita API 키를 생성한 후 소스 코드 관리 밖에 보관하세요. 로컬 스모크 테스트의 경우 환경 변수로 내보냅니다:

export NOVITA_API_KEY="your_api_key"

키를 브라우저 번들, 공개 저장소 또는 클라이언트 측 애플리케이션에 넣지 마세요. 배포된 서비스의 경우 서비스의 시크릿 관리자에서 키를 로드하고 팀의 자격 증명 정책에 따라 교체하세요.

2단계: 모델 ID 및 엔드포인트 확인

애플리케이션 코드를 작성하기 전에 라이브 Ling 3.0 Flash Sante 모델 페이지를 확인하세요. 아래 값은 2026년 9월 4일에 확인되었습니다.

필드 값
모델 ID inclusionai/ling-3.0-flash-sante
기본 URL https://api.novita.ai/openai
채팅 완료 엔드포인트 POST https://api.novita.ai/openai/v1/chat/completions
컨텍스트 윈도우 262,144 토큰 (256K로 표시)
최대 출력 32,768 토큰 (32K로 표시)
입력 및 출력 텍스트
나열된 기능 함수 호출, 추론
카탈로그 요청 속도 분당 30 요청
나열된 입력 가격 1M 토큰당 $0
나열된 출력 가격 1M 토큰당 $0

가격, 제한 사항 및 가용성은 라이브 카탈로그 값입니다. 예산을 책정하거나 통합을 프로덕션으로 전환하기 전에 다시 확인하세요. 카탈로그 요청 속도 값은 모든 계정이나 워크로드가 동일한 처리량을 받을 것이라는 약속이 아닙니다.

3단계: 첫 번째 요청 보내기

짧고 민감하지 않은 프롬프트로 시작하세요. 소규모 요청은 긴 컨텍스트, 도구 또는 애플리케이션별 데이터를 추가하기 전에 인증 및 라우팅 오류를 분리합니다.

curl "https://api.novita.ai/openai/v1/chat/completions" \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer ${NOVITA_API_KEY}" \
  -d '{
    "model": "inclusionai/ling-3.0-flash-sante",
    "messages": [
      {
        "role": "system",
        "content": "You are a concise technical assistant. Do not provide diagnosis or treatment advice."
      },
      {
        "role": "user",
        "content": "Return a three-item checklist for testing a text classification API."
      }
    ],
    "max_tokens": 256,
    "temperature": 0.2
  }'

요청은 표준 messages 배열과 모델의 정확한 ID를 사용합니다. max_tokens 값은 스모크 테스트를 위해 의도적으로 작게 설정되었습니다. 요청, 응답 파싱, 타임아웃 처리 및 오류 처리가 안정적으로 작동한 후에만 값을 늘리세요.

4단계: 응답 읽기

성공적인 채팅 완료는 첫 번째 선택지에 어시스턴트 메시지를 반환합니다. 클라이언트 또는 서비스에서는 JSON을 파싱하기 전에 상태 코드를 확인한 다음 방어적으로 응답을 처리하세요:

{
  "choices": [
    {
      "message": {
        "role": "assistant",
        "content": "1. Prepare representative labeled inputs.\n2. Measure classification accuracy and refusal behavior.\n3. Inspect errors before increasing traffic."
      }
    }
  ]
}

첫 번째 테스트에서는 다음을 확인하세요:

  • 요청이 성공적인 HTTP 응답을 반환하는지
  • choices[0].message.content에 어시스턴트 텍스트가 포함되어 있는지
  • 반환된 model이 필드가 있을 때 예상된 모델인지
  • 애플리케이션이 누락된 콘텐츠, 200이 아닌 응답 및 타임아웃을 처리하는지
  • 로그에 요청 메타데이터는 포함되지만 API 키나 불필요한 민감 입력은 절대 포함되지 않는지

성공적인 HTTP 응답을 의료 또는 규제 워크플로우가 준비되었다는 증거로 취급하지 마세요. 이는 이 요청 경로, 자격 증명, 모델 ID 및 기본 응답 파서가 함께 작동한다는 것만 확인할 뿐입니다.

5단계: 가격, 제한 사항 및 일반 오류 확인

실제 트래픽을 사용하기 전에 가격, 컨텍스트, 최대 출력, 지원되는 기능 및 요청 속도 정보에 대해 라이브 모델 페이지를 다시 확인하세요. 그런 다음 애플리케이션에 중요한 제한 사항을 테스트하세요: 긴 프롬프트, 출력 트렁케이션, 재시도, 동시 요청 및 도구 호출 파싱.

가장 흔한 첫 호출 실페는 간단합니다:

  • 401 또는 인증 오류: NOVITA_API_KEY가 설저되지 않았거나, 만료되었거나, 형식이 잘못되었거나, 베어러 토큰으로 전송되지 않았습니다.
  • 모델을 찾을 수 없음: 요청에 표시 이름 또는 오타가 inclusionai/ling-3.0-flash-sante 대신 사용 되었습니다.
  • 404 엔드포인트 오류: 클라이언트가 /v1/chatz/ompletions 경로를 중복하 거나 생략했습니 다. SDK 구성에서는 기본 URL만 사용하고, cURL에서는 전체 URL을 사요하세요.
  • 400 요청 오류: JSON 구문과 지원되는 파일드를 확인하세요. model과 messages로 시작한 다음 선택적 파라미터를 하나씩 추가하세요.
  • 429 요율 제한 응답: 제한된 지수 백오프를 적용하고, 동시성을 줄이며, 트래픽을 현재 계정 및 카탈로그 제한과 비교하세요.
  • 잘린 답변: 애플리케이션이 더 많은 출력이 필요할 때 max_tokens를 늘리되, 모델의 현재 최대값과 총 컨텍스트 예산 내에 머도록 하세요.

Python 예제

OpenAI Python SDK는 Novita의 호환 기본 URL을 사용할 수 있습니다. 자체 환경에 SDK를 설치하고, NOVITA_API_KEY를 설정한 상태로 유지하며, 서버 측 프로세스에서 이 예제를 실행하세요:

import os

from openai import OpenAI


client = OpenAI(
    base_url="https://api.novita.ai/openai",
    api_key=os.environ["NOVITA_API_KEY"],
)

response = client.chat.completions.create(
    model="inclusionai/ling-3.0-flash-sante",
    messages=[
        {
            "role": "system",
            "content": "You are a concise technical assistant. Do not provide diagnosis or treatment advice.",
        },
        {
            "role": "user",
            "content": "Explain how to test a text API response parser in three steps.",
        },
    ],
    max_tokens=256,
    temperature=0.2,
)

print(response.choices[0].message.content)

이 예제는 일반적인 채팅 완료 필드만 사용합니다. 작동이 확인되면 애플리케이션별 시스팀 명령, 구저화된 출력 처리 또는 도구를 추가하고 각 변경 사항을 독립적으로 테스트하세요.

cURL 예제

쉘 기반 통합 확인을 위해 요청을 스크립트에 유지하고 HTTP 오류 시 명확하게 실패하도록 하세요:

curl --fail-with-body "https://api.novita.ai/openai/v1/chat/completions" \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer ${NOVITA_API_KEY}" \
  -d '{
    "model": "inclusionai/ling-3.0-flash-sante",
    "messages": [
      {
        "role": "user",
        "content": "List three checks for a reliable JSON response parser."
      }
    ],
    "max_tokens": 256,
    "temperature": 0.2
  }'

--fail-with-body는 HTTP 오류에 대해 cURL이 실패 상태를 반환하면서 디버깅을 위해 응답 본문을 유지하도록 합니다. 프롬프트나 기타 민감 데이터가 포함된 경우 해당 본문을 공개 로그에 붙여넣지 마세요.

주요 파라미터

  • model: 호스팅된 정확한 모델 ID인 inclusionai/ling-3.0-flash-sante를 사용하세요.
  • messages: 역할/콘텐츠 객체로 대화 기록을 제공하세요. 시스템 지침을 구체적으로 유지하고 예상 출력 형식을 명시적으로 만드세요.
  • max_tokens: 작업에 적절한 출력 상한을 설정하세요. 현재 카탈로그 최대값은 32,768 토큰이지만, 더 작은 값으로 초기 테스트를 더 쉽게 검사할 수 있습니다.
  • temperature: 낮은 값은 반복 가능한 추출 또는 분류 테스트를 더 쉽게 비교할 수 있습니다. 하나의 설정이 보편적으로 최고라고 가정하지 말고 자체 프롬프트에 미치는 영향을 측정하세요.
  • tools: 목록에는 함수 호출이 포함됩니다. 도구를 추가하는 경우, 좁은 스키마를 정의하고, 애플리케이션에서 인수를 검증하며, 모델 외부에서 실행을 유지하세요.
  • 추론 제어: 목록에는 추론이 포함되지만, 모든 선택적 추론 필드가 SDK 간에 이식 가능하다고 가정하지 마세요. 공급자별 필드를 추가하기 전에 현재 API 참조와 모델 동작을 확인하세요.

건강 관련 텍스트의 경우 생성과 검증을 분리하세요. 애플리케이션이 처리할 권한이 있는 데이터만 제공하고, 가능한 경우 출처 참조를 유지하며, 결과물을 자격을 갖춘 검토자에게 전달하세요. 이 글은 진단이나 치료 지침을 제공하지 않습니다.

문제 해결

요청이 실패하면 가장 작은 재현 가능한 호출로 축소하세요: 정확한 모델 ID, 하나의 사용자 메시지, 낮은 max_tokens 값 및 베어러 헤더. 이렇게 하면 계정 문제와 클라이언트 �퍼 문제를 구분하기 쉬워집니다.

최소 cURL 호출이 성공하지만 SDK 호출이 실패하는 경 우, 안전한 로컬 디버깅 환경에서 SDK의 해결된 요청 URL을 출려하고 https://api.novita.ai/openai/v1/chat/completions과 비요하세요. 인증 헤더는 출럭하지 마세요. 두 호출 모두 성공하지만 애플리케이션 출력이 신뢰할 수 없는 경우, 통합과 모델 액세스 테스트를 작업 품질 평가와 분리하여 유지하세요.

긴 컨텍스트 작업의 경우 262,144 토큰 컨텍스트 상한선 아래에서 시작하세요. 입력 메시지, 도구 정의 및 예상 출력을 함께 계산한 다음 대표적인 요청으로 잘림 및 타임아웃 동작을 테스트하세요. 큰 광고 컨텍스트가 모든 프롬프트가 유용하거나 경제적일 것이라는 것을 보장하지는 않습니다.

FAQ

어떤 모델 ID를 보내야 하나요?

inclusionai/ling-3.0-flash-sante를 보내세요. 표시 이름인 "Ling 3.0 Flash Sante"는 요청 본문의 모델 ID를 대체하지 않습니다.

퀵 스타트는 어떤 엔드포인트를 사용하나요?

OpenAI 호환 채팅 완료 경로인 https://api.novita.ai/openai/v1/chat/completions를 사용합니다. SDK 구성에서는 https://api.novita.ai/openai를 기본 URL로 사용하고 SDK가 버전 경로를 추하도록 하세요.

호스팅된 모델은 멀티모달인가요?

현재 Novita 목록은 텍스트를 입력 및 출력 모달리티로 식별합니다. 라이브 모델 목록이 명시적으로 지원을 추가하지 않는 한 이미지나 오디오 콘텐츠를 보내지 마세요.

임상 결정에 사용할 수 있나요?

이 퀵 스타트는 API 통합 가이드이지 임상 지침이 아닙니다. 성공적인 API 응답은 임상 안전성, 사실 정확성, 규제 적합성 또는 보호된 정보 처리 권한을 확립하지 않습니다. 제안된 사용에 대해 자격을 갖춘 도메인 전문가와 환경에 필요한 통제 장치를 통해 평가하세요.

추천 문서

관련 게시글