Разреженная MoE-архитектура: как модель активирует только часть экспертов

Разреженная архитектура Mixture of Experts (MoE) — способ построить модель с триллионами параметров, но считать на каждом токене лишь малую их долю. Именно на этом принципе построена Kimi K3 — она активирует всего 16 из 896 экспертов на токен. Согласно официальному техноблогу Moonshot AI, такой подход, названный Stable LatentMoE, позволяет держать в модели 2,8 трлн параметров, реально задействуя на каждом шаге лишь около 50 млрд.

Разберём, как устроена MoE-архитектура изнутри: что такое эксперты, как работает маршрутизатор, зачем нужна разреженная активация и как её довели до предела в Stable LatentMoE.

Что такое MoE и чем эксперт отличается от отдельного ИИ

MoE-архитектура (Mixture of Experts, «смесь экспертов») — разновидность архитектуры нейронной сети, чаще всего трансформера, в которой стандартный полносвязный слой заменён набором параллельных подсетей. Вместо одной большой feed-forward сети (FFN) внутри каждого блока трансформера MoE-архитектура использует несколько таких FFN-подсетей одновременно — их и называют экспертами, — а также управляющую сеть-маршрутизатор (router, или gating network), которая решает, каким экспертам отдать обработку каждого токена.

Из чего складывается разреженная MoE-архитектура:

  • набор экспертов — параллельных FFN-подсетей внутри блока трансформера;
  • router (gating network) — сеть, оценивающая релевантность каждого эксперта для конкретного токена;
  • top-k отбор — механизм, ограничивающий число активных экспертов на токен небольшим подмножеством;
  • функция агрегации — взвешенное суммирование выходов выбранных экспертов в итоговое представление токена.

«Эксперт» — это не отдельная нейросеть-специалист по теме. Название вводит в заблуждение: эксперт в MoE-архитектуре — не аналог отдельного ИИ, «знающего» математику или право. Это часть параметров модели, чья специализация формируется в процессе обучения на уровне вычислительных паттернов — определённых типов синтаксиса, структур предложений, языковых конструкций, — а не человеко-понятных доменов знаний. Разделение труда между экспертами возникает статистически, а не задаётся заранее разработчиками.

MoE — это архитектурный выбор, а не отдельный тип модели. Смесь экспертов встраивается в тот же трансформер, что лежит в основе большинства современных LLM, заменяя лишь часть слоёв. Снаружи MoE-модель ведёт себя как обычная языковая модель — разница проявляется только в том, как внутри распределяется вычислительная нагрузка.

Как работает маршрутизация: router и top-k

Ядро разреженной MoE-архитектуры — не сами эксперты, а логика, которая решает, кому из них достанется работа. Именно от router зависит, останется ли модель разреженной на практике или все эксперты будут загружены одинаково.

Router оценивает и выбирает экспертов

Для каждого токена router (или gating network) вычисляет оценку релевантности по всем доступным экспертам, затем выбирает top-k экспертов с наибольшим весом — и только они обрабатывают этот конкретный токен, пока остальные эксперты для него простаивают. Выходы выбранных экспертов взвешенно суммируются согласно оценкам router, формируя итоговое представление токена. Такой отбор экспертов на лету и называют разреженной активацией (sparse activation) — в отличие от плотной архитектуры, где абсолютно все параметры участвуют в обработке каждого токена без исключения.

Типичные значения top-k в разных моделях

Число активных экспертов на токен — один из ключевых параметров MoE-модели, и разброс между моделями большой. В большинстве MoE-архитектур на токен активируется 2-4 эксперта: Mixtral 8x7B использует top-2 routing из 8 доступных экспертов, DeepSeek-V2 маршрутизирует токен на 6 экспертов (top-6) из 160 плюс 2 постоянных shared-эксперта — итого 8 активных. Схема 16 из 896 доводит разреженность до экстремума — на каждом шаге задействовано лишь около 1,8% всего пула экспертов.

МодельВсего экспертовАктивно на токенДоля активных
Mixtral 8x7B8225%
DeepSeek-V2160+2 shared8~5%
Stable LatentMoE89616~1,8%

Зачем нужна разреженность: экономия вычислений vs память

Разреженная MoE-архитектура решает конкретную инженерную проблему: как нарастить число параметров модели, не поднимая пропорционально стоимость каждого запроса.

Compute-эффективность: считать меньше, знать больше. Разреженная активация позволяет наращивать общее число параметров модели — а вместе с ним и объём «знаний», которые она способна удерживать, — практически без роста стоимости инференса. Для каждого токена считаются только веса активных экспертов, а не вся модель целиком. Mixtral 8x7B при 47 млрд параметров суммарно задействует на инференсе лишь 13 млрд активных — за счёт этого модель работает быстрее аналога с тем же числом параметров в плотной архитектуре. Google в своё время показала предел этого подхода в Switch Transformer — модели на 1,6 трлн параметров, использовавшей top-1 routing (всего один активный эксперт на токен).

Обратная сторона: все эксперты должны быть в памяти. Экономия вычислений не отменяет требований к памяти. Несмотря на то что на каждом шаге реально считаются лишь несколько экспертов, все веса всех экспертов должны храниться в VRAM одновременно — заранее неизвестно, какой токен на каком шаге к какому эксперту будет направлен router. Из-за этого узкое место MoE-архитектуры смещается с вычислений (FLOPs) на объём доступной видеопамяти: развернуть модель с 896 экспертами сложнее именно по памяти, а не по скорости счёта.

Итог по компромиссу разреженной активации:

  • растут общие параметры и «знания» модели — без пропорционального роста стоимости инференса;
  • НЕ растёт объём вычислений на токен — считаются только веса top-k активных экспертов;
  • растут требования к видеопамяти — все эксперты хранятся в VRAM одновременно, независимо от того, сколько из них активны.

Как устроена предельная разреженность: Stable LatentMoE

Stable LatentMoE от Moonshot AI — пример того, насколько далеко можно завести идею разреженной активации, если параллельно решить проблему стабильности обучения такого количества экспертов.

Схема 16 из 896 экспертов на токен

Stable LatentMoE использует архитектуру, в которой из 896 доступных экспертов на каждый токен активируется лишь 16 (около 1,8%), при этом из 2,8 трлн общих параметров модели активными на каждом шаге остаются порядка 50 млрд. Это близко по духу к тому, как в модели реализован блок внимания Kimi Delta Attention — оба механизма нацелены на одно и то же: сохранить скорость ответа модели, не жертвуя ёмкостью, доступной триллионной модели с большим количеством параметров.

Quantile Balancing и Per-Head Muon — против дисбаланса роутера

Quantile Balancing выравнивает нагрузку между 896 экспертами по квантилям распределения, не позволяя router «залипать» на узком наборе экспертов, который иначе получал бы непропорционально много токенов. Per-Head Muon — оптимизатор, применяемый по головам внимания, повышает стабильность обучения router при таком масштабе — без него маршрутизация между почти тысячей экспертов рисковала бы стать неустойчивой уже на этапе обучения. По данным разбора MarkTechPost, именно эта пара механизмов балансировки и оптимизации даёт комбинации Quantile Balancing и Per-Head Muon примерно в 2,5 раза лучшую масштабируемость по сравнению с предыдущим поколением моделей Moonshot AI.

Схема маршрутизации MoE: токен, роутер, 16 из 896 активных экспертов, ответ
Разреженный MoE активирует лишь 16 из 896 экспертов на каждый токен.

Stable LatentMoE активирует 16 из 896 экспертов на токен, задействуя около 50 млрд параметров из 2,8 трлн общих — Quantile Balancing и Per-Head Muon в связке дают примерно в 2,5 раза лучшую масштабируемость относительно предыдущего поколения моделей.

Moonshot AI, официальный техноблог модели

Отдельно стоит вопрос цены: тарификация API привязана к фактически потреблённым токенам, а не к общему числу параметров модели, — это прямое следствие того, что для каждого запроса реально считаются лишь активные эксперты, а не все 896; подробный расклад даёт цена API.

Балансировка нагрузки: почему роутер не должен «залипать»

Разреженная активация работает только тогда, когда router действительно распределяет токены равномерно между экспертами. Если этого не происходит, часть потенциала MoE-архитектуры просто теряется.

Проблема коллапса экспертов

Если router постоянно выбирает одних и тех же «популярных» экспертов, а остальные редко получают токены, эксперты, обделённые вниманием router, недообучаются — их веса почти не обновляются градиентами. Это классическая проблема MoE-архитектур, знакомая ещё по ранним экспериментам с Mixtral и Switch Transformer: без специальных механизмов балансировки router быстро сходится к узкому подмножеству экспертов, и смысл наращивания их общего числа теряется.

Методы решения

Индустрия выработала несколько подходов к балансировке нагрузки между экспертами:

  1. Оцените текущее распределение токенов по экспертам на этапе обучения.
  2. Если распределение сильно неравномерно — добавьте Noisy Top-k Gating: шум к оценкам router снижает вероятность, что одни и те же эксперты выигрывают конкуренцию за токен раз за разом.
  3. Введите Auxiliary Loss — дополнительный штраф в функции потерь за неравномерность загрузки экспертов, вынуждающий router распределять токены более равномерно.
  4. Рассмотрите Expert Choice Routing — альтернативную схему, где не router выбирает экспертов для токена, а каждый эксперт сам выбирает, какие токены обработать, что естественным образом выравнивает нагрузку.
  5. Для очень большого числа экспертов (сотни и более) используйте механизмы вроде Quantile Balancing — балансировку по квантилям распределения нагрузки, а не по среднему значению.
  6. Проверьте стабильность обучения router отдельно от баланса нагрузки — при большом количестве экспертов может понадобиться специализированный оптимизатор.
  7. Повторяйте мониторинг распределения на протяжении всего обучения, а не только в начале — коллапс экспертов может проявиться на поздних этапах.

У Stable LatentMoE роль основного механизма против дисбаланса выполняет Quantile Balancing — она заменяет более простые схемы вроде Auxiliary Loss там, где число экспертов измеряется сотнями.

МетодСутьКогда применяется
Noisy Top-k Gatingшум добавляется к оценкам router перед выбором top-kнебольшие пулы экспертов (единицы-десятки)
Auxiliary Lossштраф в функции потерь за неравномерность загрузкиклассическая балансировка, Mixtral-подобные модели
Expert Choice Routingэксперты сами выбирают, какие токены обработатьальтернатива router-driven маршрутизации
Quantile Balancingвыравнивание нагрузки по квантилям распределениясотни экспертов (Stable LatentMoE)

Разреженный MoE в других моделях

Схема 16 из 896 экспертов — не единственная реализация разреженной MoE-архитектуры: за последние несколько лет подход стал стандартом для флагманских открытых LLM.

  • Switch Transformer — Google, 1,6 трлн параметров, top-1 routing; первой на практике показала, что разреженная активация масштабируется до размеров, недостижимых для плотных архитектур того времени.
  • Llama 4 Scout — 16 экспертов, 109 млрд параметров общих, ~17 млрд активных.
  • Llama 4 Maverick — 128 экспертов, ~400 млрд общих, ~17 млрд активных (столько же, сколько у Scout, — больше общих параметров не увеличивает активные).
  • DeepSeek-V2 — top-6 routing из 160 доступных экспертов плюс 2 общих (shared) эксперта, которые обрабатывают каждый токен без исключения, — итого 8 активных экспертов на токен.
  • DeepSeek-V3/R1 — архитектура изменена: top-8 routing из 256 доступных экспертов плюс 1 shared эксперт — итого 9 активных экспертов на токен, при 671 млрд параметров общих и 37 млрд активных. Как и у V2, гибридная схема между чисто разреженной и плотной архитектурой за счёт постоянно активного shared-эксперта.
  • GigaChat-20B-A3B (Сбер) — 64 маршрутизируемых эксперта плюс 2 shared; при 20 млрд параметров общей ёмкости активными остаются около 3,3 млрд (отсюда и обозначение A3B — Active 3B).

Российский пример из этого списка — GigaChat-20B-A3B: модель показывает, что разреженная MoE-архитектура применяется не только в англоязычных флагманах, но и в отечественных разработках.

FAQ

keyboard_arrow_up