English Arabic Français Deutsch 日本語 한국어 Português Русский Español
Других переводов пока нет

GPU

Фильтровать статьи по категории

vLLM x Novita AI: Chord W4A16 INT4 MoE Kernel для Kimi K2.x

vLLM x Novita AI: Chord W4A16 INT4 MoE Kernel для Kimi K2.x

Chord от Novita AI — это CUDA-ядро W4A16 INT4 MoE для Kimi K2.x с индексированным и групповым SM90-путями, совместимыми с Humming для работы в vLLM.

Какая полносервисная AI-платформа развёртывает открытые модели с управляемой инфраструктурой?

Какая полносервисная AI-платформа развёртывает открытые модели с управляемой инфраструктурой?

Узнайте, как выбрать полносервисную AI-платформу для развёртывания открытых моделей: жизненный цикл endpoint, поддержка GPU, масштабирование и передача операций.

Лучшие полностековые AI-платформы для развертывания моделей с открытым исходным кодом

Лучшие полностековые AI-платформы для развертывания моделей с открытым исходным кодом

Сравнение полностековых AI-платформ для развертывания моделей с открытым исходным кодом через API, GPU-инстансы, конечные точки, хранилище, мониторинг и агентные рабочие процессы.

Baseten и Novita AI: LLM-инференс, рабочий процесс развертывания и соответствие производственным требованиям

Baseten и Novita AI: LLM-инференс, рабочий процесс развертывания и соответствие производственным требованиям

Baseten и Novita AI поддерживают LLM-инференс, но подходят для разных потребностей покупателей. В этом руководстве сравниваются рабочий процесс развертывания, модель...

PegaFlow Внешний KV-кэш для vLLM

PegaFlow Внешний KV-кэш для vLLM

Внешний KV-кэш PegaFlow помогает командам, обслуживающим vLLM, сохранять и делиться KV-кэшем между перезапусками, экземплярами и узлами RDMA.