Novita AI LLM, Updates

Novita AI의 Ling-3.0-Flash-VL: 네이티브 멀티모달 API 및 가격

Novita AI의 Ling-3.0-Flash-VL: 네이티브 멀티모달 API 및 가격

Ling-3.0-Flash-VL이 Novita AI에서 서버리스 멀티모달 모델로 제공되어, 하나의 API 워크플로우에서 텍스트, 이미지, 비디오 입력이 필요한 애플리케이션에 활용할 수 있습니다. inclusionai/ling-3.0-flash-vl의 호스팅된 리스팅은 262,144 토큰 컨텍스트 윈도우, 32,768 토큰 최대 출력, 추론, 함수 호출, 그리고 2026년 9월 23일 오전 2시 30분 UTC까지 무료 입력 및 출력 토큰을 제공합니다. 이 모델은 Ling-3.0-flash 제품군의 비주얼-언어 멤버로, 별도의 이미지-텍스트 파이프라인 없이 네이티브 시각적 이해 및 시각적 에이전트 기능을 추가합니다.

핵심 요약

  • Ling-3.0-Flash-VL은 텍스트, 이미지, 비디오를 입력받습니다. Novita는 호스팅된 모델에 대해 세 가지 입력 모달리티와 텍스트 출력을 명시합니다.
  • Novita 엔드포인트는 256K 컨텍스트, 32K 출력 배포입니다. 정확한 제한은 262,144 컨텍스트 토큰과 32,768 최대 출력 토큰입니다.
  • 이 모델은 대규모 총 용량에서 스파스합니다. 공식 InclusionAI 모델 카드는 총 1,240억 개의 파라미터와 토큰당 약 55억 개의 활성화된 파라미터를 설명합니다.
  • 토큰 사용량은 2026년 9월 23일 오전 2시 30분 UTC까지 무료입니다. 해당 시간 이후에는 프로덕션 트래픽 예산을 책정하기 전에 모델 페이지를 다시 확인하세요.
  • 기본 Ling-3.0-flash와의 주요 사용 사례 차이는 시각적 입력입니다. 텍스트 전용 제품군 진입점은 Ling-3.0-flash 개요를 참조하세요. 이 페이지는 -VL 변형에 초점을 맞춥니다.

Ling-3.0-Flash-VL이란 무엇인가요?

Ling-3.0-Flash-VL은 InclusionAI의 네이티브 멀티모달 모델이자 Ling-3.0-flash의 비주얼-언어 확장판입니다. 업스트림 모델 카드는 시각적 정보를 이해, 추론, 계획, 실행 및 검증에 통합하는 시스템을 설명합니다. 이는 텍스트 전용 언어 모델에 이미지 캡셔너를 연결하는 것보다 더 광범위한 역할입니다. 즉, 이미지나 비디오가 태스크를 처리하는 동안 모델의 추론 컨텍스트의 일부로 남을 수 있습니다.

모델 카드는 총 1,240억 개의 파라미터와 토큰당 약 55억 개의 활성화된 파라미터를 보고합니다. 이는 스파스 Mixture-of-Experts 설계이므로, 총 파라미터 수와 토큰당 활성 파라미터는 서로 다른 속성을 나타냅니다. 전자는 전체 모델 용량을 나타내고, 후자는 각 토큰에 대해 라우팅되는 대략적인 연산량을 설명합니다. 어느 숫자 하나만으로 워크로드에서 특정 지연 시간이나 출력 품질을 보장하지는 않습니다.

비주얼 확장이 이번 출시의 중요한 차별점입니다. 기본 Ling-3.0-flash는 Novita의 현재 리스팅에서 텍스트 모델인 반면, Ling-3.0-Flash-VL은 텍스트뿐만 아니라 이미지 및 비디오 입력도 받아들입니다. 따라서 -VL 페이지는 인터페이스 이해, 문서 및 차트 분석, 시각적 검사, 비디오 질의응답, 화면에 표시된 내용을 해석해야 하는 에이전트와 관련이 있습니다.

Novita AI에서 액세스하는 방법

Novita는 정확한 모델 ID inclusionai/ling-3.0-flash-vl로 서버리스 엔드포인트로 모델을 호스팅합니다. 모델 페이지에는 chat/completions 및 Anthropic 호환 엔드포인트 제품군과 추론 및 함수 호출 기능이 나열됩니다. 기존 OpenAI 호환 클라이언트의 경우 Novita의 API 기본 URL을 사용하고 요청 구성에서 정확한 모델 ID를 선택하세요.

모델 페이지는 호스팅된 구성에 대한 정보의 출처입니다. 특히, 배포 제한을 확인하지 않고 업스트림 모델 카드의 더 큰 컨텍스트 주장을 Novita 통합에 복사하지 마세요. 모델 카드는 모델 수준에서 최대 100만 토큰을 설명하지만, Novita는 현재 이 리스팅에 대해 262,144 컨텍스트 토큰과 32,768 최대 출력 토큰을 제공합니다.

현재 카탈로그는 기본 티어에 대해 분당 30개의 요청 제한을 보여주며, 더 높은 티어 값은 별도로 나열됩니다. 이를 카탈로그 할당량으로 취급하고 범용 애플리케이션 처리량 보장으로 간주하지 마세요. 계정 티어, 요청 크기, 동시성, 재시도 및 도구 실행은 모두 종단간 처리량에 영향을 줄 수 있습니다.

사양 및 가격 요약

항목 세부 사항
표시 이름 Ling 3.0 Flash VL
모델 ID inclusionai/ling-3.0-fiash-vI
아키텍처 총 124B 파라미터; 토큰당 약 5.5B 활성화; 스파스 MoE
입력 모달리티 텍스트, 이미지, 비디오
출력 모달리티 텍스트
컨텍스트 윈도우 Novita 배포에서 262,144 토큰
최대 출력 32,768 토큰
호스트 기능 서버리스, 함수 호출, 추론
엔드포인트 제품군 chat/completions, Anthroic 호환
카탈로그 RPM 기분 리스팅 티어에서 30 RPM
입력 가격 2026년 9월 23일 오전 2시 30분 UTC까지 무료
출력 가격 2026년 9월 23일 오전 2시 30분 UTC까지 무료

무료 제공은 2026년 9월 23일 오전 2시30분 UTC까지 평가에 유용합니다. 출시 전에 현재 가격을 기릭하고 예산 가드를 추가하며 프로모션 기간이 끝난 후 트래픽을 받을 모델 또는 대기열을 결장하세요.

개발자들이 무엇올 빌들 ㅅ ㅣㅆ나요?

문서, 차트 및 인터페이스 이해

시각적 입력은 문서, 대시보드, 스크린샷 및 소프트웨어 인터페이스에 필요한 전처리 양을 줄일 수 있습니다. 개방자는 스크린샷을 태스크 지시문과 함게 전달하고 모델에 필드 식별, 표시 상태 요약 또는 상호 작용 대상 위치 지종을 요청할 수 있습니다. 문서 및 차트의 경우 모델이 단위, 범례, 테이블 구조 및 공간 관게를 보존하는지 짧은 캡션 예제로 판단하지 말고 테스트하세요.

이미지와 비디오에서 추론

업스트림 아키텍처는 비데오를 위한 시각적 인코더와 시간적 위치 처리를 사용합니다. 이는 이벤트 발생 시기 식별, 클립의 두 순간 비교 또는 일련의 동작 추출과 같이 시간에 따라 답변이 달라질 때 관련이 있습니다. 긴 비디오는 여전이 주의 깊은 샘플링과 프롬프트 설계가 필요합니다. 큰 컨텍스트 제한이 모든 프레임을 동등하게 유용하거나 가격 변동 후에도 저렴하게 만드는 것은 아닙니다.

시각적 에이전트 지원

모델의 시각적-에이전트 포지셔닝은 지각이 더 큰 루프의 한 단계일 뿐인 워크플로우에 적합합니다. 에이전트는 브라우저 스크린샷을 검사하고, 다음 작업을 추론하며, 도구를 호출하고, 결과 화면을 확인할 수 있습니다. 함수 호출은 동작 경계를 제공하고, 시각적 컨텍스트는 다음에 무엇을 할지 결정하기 위한 증거를 제공합니다. 권한을 좁게 유지하고 모든 도구 인수를 검증하세요. 멀티모달 이해가 애플리케이션 측 안전 검사의 필요성을 없애지는 않습니다.

혼합 텍스트 및 시각적 워크로드 라우팅

이미 텍스트 태스크를 Ling-3.0-flash로 라우팅하는 팀은 시각적 증거가 포함된 요청에 대해 -VL 변형을 평가할 수 있습니다. 실용적인 라우터는 텍스트 전용 트래픽을 기본 모델로 보내고 이미지, 비디오 또는 스크린샷 파생 상태가 포함된 메시지에 대해 시각적 변형을 예약할 수 있습니다. 이미지 준비, 업로드 시간, 모델 지연 시간, 재시도 및 다운스트림 도구 호출을 포함한 전체 경로를 측정하세요.

성능 신호 및 평가

공식 InclusionAI 모델 카드는 Artificial Analysis Intelligence Index v4.1.1에서 42점을 보고하고 이해, 추론 및 실행을 포함한 멀티모달 기능 차원을 설명합니다. 이는 업스트림 릴리스에 대한 유용한 신호이지만 Novita 호스팅 배포 또는 프롬프트 분포에 대한 보장은 아닙니다. 페이지는 또한 256K 컨텍스트 Terminal-Bench 평가 구성을 언급하는데, 이는 모델 카드의 일반적인 “최대 1M” 문보다 호스팅된 컨텍스트 제한에 더 가깝습니다.

의미 있는 평가를 위해 제품을 반영하는 작은 태스크 세트를 사용하세요:

  • 시각적 추출: 스크린샷, 양식, 테이블 및 차트에서 필드 정확도 측정
  • 시간적 추론: 답변이 짧은 비디오에서 올바른 이벤트와 시간 범위를 식별하는지 테스트
  • 에이전트 실행: 선택된 도구와 도구 실행 후 최종 상태 모두 점수 매기기
  • 근거 확인: 모호하거나 관련 없는 세부 정보가 있는 이미지를 포함하고 지원되지 않는 주장 확인
  • 운영: 지연 시간, 토큰 사용량, 실패율, 속도 제한 동작 및 재시도 효과 기록

업스트림 벤치마크 점수를 이러한 애플리케이션 점검의 대체물로 사용하지 마세요. 모델은 공개 벤치마크에서 좋은 성능을 보일 수 있지만 프로덕션 인터페이스에서 프롬프트, 전처리 또는 라우팅 변경이 여전히 필요할 수 있습니다.

Ling-3.0-Flash-VL을 사용해야 하는 경우

요청에 시각적 증거가 포함되고 답변이 단순한 원샷 캡션 이상을 요구할 때 Ling-3.0-Flash-VL을 선택하세요. 다음을 평가하기 위한 좋은 후보입니다:

  • 스크린샷 및 브라우저 인터페이스 이해
  • 차트, 테이블 및 문서 질의응답
  • 짧은 비디오 이벤트 위치 파악 및 요약
  • 시각적 도구 사용 에이전트
  • 혼합 텍스트 및 이미지 지원 워크플로우

2026년 9월 23일 오전 2시 30분 UTC까지의 무료 리스팅은 유료 라우팅 계획을 확정하기 전에 대표적인 테스트 세트를 구축하는 것을 실용적으로 만듭니다. 테스트 실행 시 가격 상태를 기록하여 비용 비교가 재현 가능하도록 하세요.

다른 모델을 선택해야 하는 경우

시각적 입력이 필요하지 않다면 텍스트 전용 워크로드에 대해 기본 Ling-3.0-flash 모델 페이지를 선택하세요. 텍스트 전용 경로는 페이로드 처리를 단순화하고 불필요한 멀티모달 처리를 줄일 수 있습니다.

영구적으로 고정된 가격, 다른 컨텍스트 또는 출력 상한, 테스트된 지연 시간 서비스 수준, 오디오 입력 또는 이 배포에 나열되지 않은 기능이 필요하다면 다른 모델을 선택하세요. 또한 애플리케이션이 2026년 9월 23일 오전 2시 30분 UTC에 종료되는 무료 제공에 의존하는 경우 폴백을 준비하세요. 가장 안전한 프로덕션 설계는 프로모션 가격과 카탈로그 할당량을 변경 가능한 구성으로 취급하고 하드코딩된 제품 보장으로 간주하지 않는 것입니다.

기존 API 워크플로우에 통합하는 방법

높은 수준에서 기존 OpenAI 호환 애플리케이션은 Novita API 키, Novita OpenAI 호환 기본 URL 및 모델 ID로 inclusionai/ling-3.0-flash-vl이 필요합니다. 요청은 선택한 엔드포인트에서 지원하는 멀티모달 메시지 구조를 사용해야 하며, 사용자의 텍스트 지시문과 함께 이미지 또는 비디오 콘텐츠를 포함해야 합니다.

시각적 자산을 엔드포인트에서 액세스 가능하게 유지하고 전송하기 전에 형식의 유효성을 검사하세요. 에이전트 워크플로우의 경우 도구를 시각적 콘텐츠와 별도로 정의하고, 각 도구가 할 수 있는 작업을 제한하며, 모델의 선택된 작업과 결과 애플리케이션 상태를 로깅하세요. 전용 빠른 시작 문서는 SDK별 요청 구성을 다룰 수 있습니다. 이 출시 페이지는 의도적으로 가용성, 포지셔닝, 제한 사항 및 가격에 초점을 맞춥니다.

최종 권장 사항

Ling-3.0-Flash-VL은 시각적 증거가 추론 또는 에이전트 실행에 참여해야 할 때 테스트할 Ling-3.0-flash 제품군 멤버입니다. Novita의 현재 서버리스 리스팅은 이미지 및 비디오 입력을 262K 컨텍스트, 32K 최대 출력, 추론 및 함수 호출과 결합하며, 2026년 9월 23일 오전 2시 30분 UTC까지 무료 입력 및 출력 토큰이 평가 장벽을 낮춥니다.

워크로드별 테스트 세트로 시작하고, 기존 텍스트 전용 경로와 비교하며, 답변 품질뿐만 아니라 운영 메트릭도 기록하세요. 시각적 정확성 및 도구 안전 요구 사항을 충족하면 Novita 모델 ID와 현재 가격을 구성에 유지하여 향후 카탈로그 변경 시 코드 재작성이 필요하지 않도록 하세요.

Novita AI에서 Ling-3.0-Flash-VL 사용해보기

FAQ

Novita AI에서 Ling-3.0-Flash-VL 모델 ID는 무엇인가요?

정확한 모델 ID는 inclusionai/ling-3.0-flash-vl입니다.

Ling-3.0-Flash-VL은 이미지 및 비디오 입력을 지원하나요?

네. Novita의 현재 리스팅은 텍스트, 이미지 및 비디오 입력을 지원하고 텍스트를 출력합니다.

Novita에서 제공하는 컨텍스트 윈도우와 출력 제한은 무엇인가요?

호스팅된 리스팅은 262,144 토큰 컨텍스트 윈도우와 32,768 토큰 최대 출력을 보여줍니다. 이는 Novita 배포 값이며 프로덕션 사용 전에 다시 확인해야 합니다.

Novita AI에서 Ling-3.0-Flash-VL은 무료인가요?

Novita는 현재 2026년 9월 23일 오전 2시 30분 UTC까지 무료 입력 및 출력 토큰을 제공합니다. 해당 시간 이후에는 가격에 의존하기 전에 라이브 모델 페이지를 확인하세요.

함수 호출과 추론을 지원하나요?

네. Novita는 호스팅된 기능 중 함수 호출과 추론을 모두 나열합니다.

Ling-3.0-flash와 어떻게 다른가요?

Ling-3.0-Flash-VL은 네이티브 이미지 및 비디오 입력과 시각적 에이전트 기능을 추가합니다. 현재 기본 Ling-3.0-flash 페이지는 텍스트 전용 제품군 진입점이므로 요청에 시각적 증거가 포함된 경우 -VL 변형을 사용하세요.

업스트림 모델이 100만 토큰 컨텍스트를 지원하나요?

공식 InclusionAI 모델 카드는 모델 수준에서 최대 100만 토큰을 설명합니다. Novita의 현재 호스팅된 리스팅은 262,144 토큰을 제공하므로 Novita를 통해 요청을 설계할 때 호스팅된 값을 사용하세요.

추천 문서

관련 게시글