Kimi Delta Attention (KDA): что это за механизм внимания и как он ускоряет декодирование

Kimi Delta Attention (KDA) — гибридный механизм линейного внимания, который лежит в основе Kimi K3, флагманской модели Moonshot AI с 2,8 триллиона параметров. По данным официального техноблога компании, KDA позволяет модели декодировать текст до 6,3 раза быстрее в контексте на миллион токенов — именно этот механизм и разбираем ниже.

KDA работает в паре со вторым компонентом архитектуры — Attention Residuals (AttnRes), который даёт около 25% прироста эффективности обучения при менее чем 2% дополнительных вычислительных затрат.

Что такое Kimi Delta Attention простыми словами

Классическое внимание трансформера считает связи между каждой парой токенов — при росте контекста до миллиона токенов вычисления и память растут квадратично. KDA заменяет это состоянием фиксированного размера и обучаемыми гейтами, которые решают, что помнить, а что забыть.

Сравнение обычного внимания и Kimi Delta Attention по скорости декодирования на длинном контексте
KDA ускоряет декодирование до 6,3× на контексте в миллион токенов.

В техническом блоге релиза Moonshot AI описывает KDA как «эффективный фундамент для масштабирования внимания» — механизм, который улучшает информационный поток через длину последовательности вместо того, чтобы линейно наращивать объём хранимых данных вместе с длиной контекста.

Место KDA в архитектуре Kimi K3

Гибридное линейное внимание KDA работает в паре с Attention Residuals. Вместе эти два компонента дают 2,5-кратный прирост общей эффективности масштабирования по сравнению с предыдущей моделью Kimi K2 — так утверждает сама компания в техническом блоге о релизе.

Как KDA развивает идею Gated DeltaNet

Предшественник механизма внимания Kimi Delta Attention — Gated DeltaNet — использует один общий забывающий гейт на весь вектор состояния: все измерения памяти забываются или сохраняются синхронно. KDA идёт дальше и разбивает это решение на уровень отдельных измерений.

Посимвольный (channel-wise) гейтинг. KDA заменяет скалярный гейт Gated DeltaNet диагональной матрицей гейтов — каждое измерение памяти независимо решает, сохранять информацию или забывать её, вместо единого решения на весь вектор состояния.

Delta update rule. Гейтинг в KDA комбинируется с правилом обновления по дельте — состояние переписывается на основе разницы между новым и предсказанным значением, что даёт точную, а не приблизительную перезапись памяти.

Аппаратная оптимизация чанками. Для скорости KDA использует DPLR-матрицы и разбивает рекуррентное вычисление на независимые блоки (чанки) — то, что раньше считалось строго последовательно, теперь параллелится на Tensor Cores современных ускорителей.

Как отмечает разбор архитектуры на DigitalOcean, именно такое сочетание тонкого посимвольного контроля памяти и аппаратно-дружественного параллелизма отличает KDA от более ранних вариантов линейного внимания:

Kimi Delta Attention сочетает channel-wise gating с delta update rule и хардвер-эффективным чанкованием, что делает линейное внимание практически применимым на масштабе миллиона токенов.

DigitalOcean, разбор архитектуры Kimi Linear

Из-за этого гибридный механизм внимания KDA обходится дешевле по памяти на длинных последовательностях, но требует более сложного обучения гейтов на этапе тренировки модели.

Ключевые отличия KDA от Gated DeltaNet сводятся к трём пунктам:

  • гейтинг переходит от одного скалярного значения к диагональной матрице на всё измерение состояния;
  • обновление памяти построено на delta update rule, а не на простом накоплении;
  • вычисление разбито на чанки, что позволяет загружать Tensor Cores параллельно, а не последовательно.

Разница между двумя механизмами линейного внимания видна в сводной таблице.

ХарактеристикаGated DeltaNetKimi Delta Attention
Тип гейта забыванияСкалярный (общий на весь вектор)Диагональная матрица (посимвольный)
Правило обновленияDelta update ruleDelta update rule + channel-wise гейтинг
Аппаратная оптимизацияПоследовательное вычислениеЧанкованное, параллельное на Tensor Cores

Гибридная схема: KDA плюс полное внимание

Линейное внимание слабее полного внимания на очень дальних, точных зависимостях между токенами, расположенными далеко друг от друга в тексте. Поэтому чистое линейное внимание в Kimi K3 не используют одно.

Причины, по которым архитектура остаётся гибридной, а не полностью линейной:

  • фиксированное состояние KDA теряет часть точности на очень длинных, разреженных зависимостях;
  • MLA восстанавливает эту точность за счёт полного пересчёта связей между токенами в своём слое;
  • соотношение 3:1 подобрано так, чтобы издержки полного внимания оставались минимальными, а качество — сопоставимым с чистым MLA.

Соотношение слоёв в архитектуре Kimi Linear

В архитектуре Kimi Linear на каждые три слоя KDA приходится один слой полного внимания MLA, которое компенсирует эту слабость на длинных, точных зависимостях. Ниже — сводка того, что даёт такая комбинация на практике.

ПараметрКлассическое вниманиеГибрид KDA + MLA (Kimi Linear)
Рост вычислений с длиной контекстаКвадратичныйПрактически линейный
Использование KV-кэшаБазовый уровень (100%)Минус 75%
Скорость декодирования на 1M токеновБазовый уровень (1x)До 6x быстрее
Соотношение слоёвТолько полное внимание3 слоя KDA : 1 слой MLA

Комбинация KDA и MLA снижает использование KV-кэша на 75% и увеличивает пропускную способность декодирования до 6 раз на контексте в 1 миллион токенов — это контекстное окно на 1 миллион токенов становится практически применимым, а не только заявленным числом.

Attention Residuals: второй компонент архитектуры

Если KDA отвечает за эффективность по длине последовательности, то Attention Residuals работает по глубине сети — выборочно извлекает представления слоёв, а не накапливает их равномерно, как это делают обычные residual-соединения в трансформере.

Два компонента архитектуры дополняют друг друга по разным осям:

  • KDA оптимизирует работу с длиной контекста — от коротких запросов до 1 миллиона токенов;
  • Attention Residuals оптимизирует работу с глубиной сети — сколько слоёв нужно пройти сигналу до финального представления.

Как устроено извлечение представлений

Вместо того чтобы прибавлять выход каждого слоя к общему потоку по одинаковой схеме, Attention Residuals выбирает, какие представления из глубины сети действительно полезны для текущего вычисления, и передаёт дальше именно их.

Цена и эффект

По данным независимого разбора релиза, AttnRes даёт около 25% более высокую эффективность обучения при менее чем 2% дополнительных вычислительных затрат — почти бесплатный прирост качества относительно стоимости тренировки модели.

Что это значит для модели Kimi K3 в цифрах

KDA и AttnRes — часть архитектуры модели Kimi K3 на 2,8 триллиона параметров, где MoE-часть (Stable LatentMoE) активирует лишь 16 из 896 экспертов на токен. Открытые веса модели делают архитектуру KDA проверяемой независимыми исследователями — подробнее в разборе открытых весов и их проверяемости.

Благодаря KDA и связанной оптимизации кэша скорость декодирования в целевой конфигурации достигает 8700 токенов в секунду, а коэффициент попадания кэша в задачах кодирования превышает 90% — по данным независимого разбора релиза MarkTechPost. Kimi K3 запущена 16 июля 2026 года, открытые веса модели ожидаются 27 июля 2026 года.

Проверить, как гибридное линейное внимание Kimi K3 отражается на скорости конкретной задачи, можно по шагам:

  1. Определите длину контекста задачи — эффект KDA заметен от десятков тысяч токенов и растёт к отметке 1M.
  2. Сравните KV-кэш до и после — на длинных контекстах гибрид KDA + MLA экономит до 75% памяти под кэш.
  3. Проверьте задержку первого токена — она снижается за счёт фиксированного размера состояния KDA вместо растущего KV-кэша.
  4. Оцените скорость декодирования — в целевой конфигурации Moonshot AI заявляет до 8700 токенов в секунду.
  5. Для кодовых задач учтите коэффициент попадания кэша — у Kimi K3 он превышает 90%, что снижает стоимость повторных запросов.

Все технические разборы релизов моделей Moonshot AI и других лабораторий собраны на AI-Flip — там же следите за обновлениями по теме.

Основные архитектурные компоненты Kimi K3, о которых стоит помнить:

  • Kimi Delta Attention (KDA) — гибридное линейное внимание с посимвольным гейтингом.
  • Attention Residuals (AttnRes) — селективное извлечение представлений по глубине сети.
  • MLA — слой полного внимания, компенсирующий слабость KDA на дальних зависимостях.
  • Stable LatentMoE — MoE-фреймворк, активирующий 16 из 896 экспертов на токен.

FAQ

keyboard_arrow_up