Novita AI 18 de diciembre de 2024 Revolucionando la inferencia de modelos de lenguaje grandes: decodificación especulativa y cuantización de baja precisión
Novita AI 24 de octubre de 2024 Asignación dinámica de recursos GPU para cargas de trabajo en Kubernetes
Novita AI 21 de octubre de 2024 Agregar dinámicamente asignaciones de puertos a contenedores Docker en ejecución
Novita AI 2 de febrero de 2024 Métodos de Cuantización para una Aceleración de 100X en la Inferencia de Modelos de Lenguaje Grande