27 июля 2026 года, одновременно с публикацией весов, команда vLLM выпустила поддержку Kimi K3 «с первого дня» — включая оптимизированные ядра для архитектуры Kimi Delta Attention и интеграцию со спекулятивным декодером DSpark от Inferact.

Kimi K3 на 16 GPU GB300 NVL72: 370 токенов в секунду с DSpark
Что случилось
Без DSpark vLLM обслуживает Kimi K3 со скоростью 118 токенов в секунду на конфигурации TP16 из 16 GPU NVIDIA GB300 NVL72. С включённым DSpark скорость вырастает до 370 токенов в секунду — ускорение в 3,14 раза. По данным vLLM Blog, такой прирост достигается за счёт спекулятивного декодирования, при котором лёгкий черновик предсказывает несколько токенов вперёд, а основная модель верифицирует их пакетом.
Как это работает технически
Kimi K3 использует гибридную архитектуру Kimi Delta Attention (KDA): линейное внимание чередуется с полным. vLLM реализовал для неё специальные CUDA-ядра и два режима кеширования — интервальный (каждые 32 тыс. токенов) и Marconi-стиль (кеш при повторном запросе). Для длинных контекстов поддерживается последовательный параллелизм с разделением prefill и decode на отдельные узлы. Минимальная конфигурация для запуска модели — 8 GPU NVIDIA с памятью 80 ГБ каждый (итого 640 ГБ); веса занимают около 594 ГБ в формате MXFP4.
Что это значит для разработчиков
370 токенов в секунду на одного пользователя — это уровень, при котором 1 млн токенов контекста Kimi K3 перестаёт быть узким местом по скорости даже в интерактивных сценариях. Для команд, которые уже держат multi-GPU кластеры под открытые модели, day-0 поддержка в vLLM означает, что переход на Kimi K3 не требует ждать патчей или форков: всё работает в стандартном стеке.
