Kimi K3: разбор флагманской модели Moonshot AI — 2,8 триллиона параметров, контекст 1M и открытые веса
16 июля 2026 года китайская компания Moonshot AI представила флагманскую модель Kimi K3 — крупнейшую открытую языковую модель из когда-либо выпущенных публично.

Kimi K3 (её также ищут как «Kimi 3») — это MoE-модель на 2,8 триллиона параметров с контекстом 1 миллион токенов, нативным зрением и открытыми весами. Подробности архитектуры и бенчмарков компания опубликовала в техноблоге Kimi K3. В независимых рейтингах модель заняла место сразу за Claude Fable 5 и GPT-5.6 Sol, заметно обойдя Claude Opus 4.8.
Что такое Kimi K3 и почему это важно
Kimi K3 — это официальное название модели, которую многие ищут как «Kimi 3». Путаницы здесь нет: речь об одной и той же флагманской системе Moonshot AI, анонсированной 16 июля 2026 года. Открытая модель Kimi K3 сразу заняла место среди систем мирового уровня, что для открытых весов раньше было редкостью.
Релиз уже называют «вторым DeepSeek-шоком». Так его окрестили после того, как китайская модель Kimi K3 от Moonshot AI приблизилась по качеству к топовым закрытым системам США, оставаясь при этом открытой. Реакция рынков оказалась резкой:
- акции TSMC — минус 7%;
- SoftBank — минус 9%;
- Nvidia — минус 1,2%;
- бумаги z.ai в Гонконге — минус 30%.
Moonshot AI основана в 2023 году под руководством Yang Zhilin и за три года превратилась в одну из главных китайских лабораторий ИИ наравне с DeepSeek и z.ai (создателем GLM-5.2).
Архитектура: 2,8 триллиона параметров и MoE
За компактную работу флагмана Kimi K3 отвечает разреженная архитектура Stable LatentMoE — она позволяет держать огромный суммарный объём параметров, но активировать на каждый токен лишь малую их часть. Сам принцип Mixture-of-Experts не нов, но именно в Kimi K3 его довели до масштаба, ранее недоступного открытым моделям.
2,8T параметров, но активны единицы процентов
Из 896 экспертов Stable LatentMoE на каждый токен включаются только 16 — это около 1,8% от общего числа, или порядка 50 миллиардов активных параметров. Формально Kimi K3 — первая открытая модель класса 3 триллионов параметров, доведённая до продакшена, а не оставшаяся исследовательским прототипом.

Что улучшилось по сравнению с Kimi K2
Moonshot AI заявляет примерно 2,5-кратный прирост масштабируемости обучения относительно предыдущего поколения Kimi K2. Из технических изменений, обеспечивших этот скачок, выделяются три:
- Quantile Balancing — убирает часть ручных эвристик балансировки нагрузки между экспертами;
- Per-Head Muon — покомпонентная оптимизация внимания на уровне отдельных голов;
- квантование MXFP4/MXFP8 — снижает вычислительные затраты при инференсе без ощутимой потери качества.
Kimi Delta Attention (KDA) и Attention Residuals
Главное архитектурное новшество Kimi K3 — механизм внимания, спроектированный специально под работу с очень длинным контекстом.
Что такое Kimi Delta Attention
Kimi Delta Attention (KDA) — это гибридное линейное внимание, которое даёт до 6,3 раза более быстрое декодирование при работе с контекстом на миллион токенов. Простыми словами: обычное внимание трансформеров пересчитывает связи между всеми токенами заново, и чем длиннее текст, тем дороже становится каждый следующий шаг генерации. KDA частично заменяет этот пересчёт линейным механизмом, поэтому стоимость генерации на длинном контексте растёт медленнее.

Attention Residuals простыми словами
Attention Residuals (AttnRes) избирательно достаёт нужные представления по глубине сети, а не копит их равномерно на каждом слое, как это делают классические residual-связи. По данным Moonshot AI, это даёт примерно на 25% более высокую эффективность обучения при дополнительных затратах меньше 2%.
Контекст 1M токенов и нативное зрение
Второй столп Kimi K3 — по-настоящему длинный контекст в сочетании с мультимодальностью «из коробки». Максимальная длина контекстного окна — 1 миллион токенов, а стандартный лимит на генерацию по умолчанию составляет 131 072 токена, но его можно расширить до тех же 1 048 576. На практике в 1M токенов помещается:
- объёмная кодовая база из нескольких десятков файлов;
- несколько книг среднего размера целиком;
- многочасовая переписка или лог агентной сессии без потери связности между началом и концом;
- видеоряд вместе с сопроводительным текстом благодаря нативному зрению.
Модель понимает текст, изображения и видео без отдельных адаптеров, а режим рассуждений (thinking mode) в Kimi K3 включён по умолчанию — модель «думает» перед ответом на каждый запрос, а не только по специальной команде.
Бенчмарки и место в рейтинге
Ключевой вопрос для любой новой модели — как она соотносится с конкурентами. По данным независимых замеров, Kimi K3 занимает третье место в общем рейтинге, уступая только Claude Fable 5 и GPT-5.6 Sol, но существенно опережая Claude Opus 4.8.
Где Kimi K3 в рейтинге
Такое место в топ-3 — редкость для открытой модели: обычно open-weight системы отстают от закрытых флагманов на поколение. Kimi K3 сокращает этот разрыв почти до нуля, оставаясь при этом моделью со свободно скачиваемыми весами.
Конкретные баллы
| Бенчмарк | Kimi K3 | Что измеряет |
|---|---|---|
| GPQA-Diamond | 93,5 | экспертные научные вопросы |
| BrowseComp | 91,2 | поиск и работа с вебом |
| OmniDocBench | 91,1 | понимание документов |
| Program Bench | 77,8 | программирование |
Независимую агрегацию таких результатов ведёт Artificial Analysis — по их методике Kimi K3 закрепилась в тройке лидеров среди всех протестированных систем, включая закрытые. Отдельная деталь по методологии: результат 91,2 на BrowseComp получен с компакцией контекста, срабатывающей на отметке 300К токенов — без неё, на полном окне 1M, показатель модели составляет 90,4.
Open-weight: лицензия и дата весов
Kimi K3 — не просто доступная через API модель, а open-weight релиз: веса можно скачать, развернуть на собственной инфраструктуре и дообучить под свою задачу. Технически это стало возможным благодаря разреженной MoE-архитектуре (см. раздел выше), которую Moonshot AI оптимизировала для распределённого инференса, что снижает порог входа для локального хостинга по сравнению с плотными моделями сопоставимого размера.

Полные веса Kimi K3 станут доступны для скачивания 27 июля 2026 года — на момент анонса доступ к модели открыт через веб-сервисы Moonshot AI и API. Сама компания описывает релиз так:
Kimi K3 — это открытый фронтир интеллекта: модель с 2,8 триллионами параметров, которую можно изучать, размещать на собственных серверах и дообучать самостоятельно.
Техноблог Kimi K3, Moonshot AI
Это продолжает линию, начатую предыдущим поколением Kimi K2: Moonshot AI системно делает ставку на открытые веса вместо закрытой модели распространения, которую использует, например, Anthropic для линейки Claude.
Цена API и как попробовать
Разрыв в качестве между Kimi K3 и топовыми закрытыми моделями почти закрыт, а вот в цене разрыв остаётся огромным — и не в пользу американских конкурентов.

Сколько стоит
По документации Kimi API Platform, цена за миллион токенов входа составляет $3 при промахе кэша и $0,30 при попадании в кэш, а выход стоит $15 за миллион токенов. Для сравнения с ближайшими конкурентами по рейтингу:
| Модель | Цена выхода за 1M токенов |
|---|---|
| Kimi K3 | $15 |
| Claude Fable 5 | $50 |
| GLM-5.2 | $4,40 |
| DeepSeek V4 | $0,87 |
Даже без учёта скидки на кэш Kimi K3 более чем втрое дешевле Claude Fable 5 при сопоставимом месте в рейтинге качества.
Где попробовать
Опробовать модель можно несколькими способами:
- зайти на Kimi.com и выбрать модель Kimi K3 в чате;
- открыть Kimi Work — рабочее пространство для документов и агентных задач;
- запустить Kimi Code для программирования с длинным контекстом;
- получить ключ на Kimi API Platform и обратиться к модели по идентификатору
kimi-k3; - дождаться 27 июля 2026 года и развернуть открытые веса локально.
FAQ
Ключевые узлы Kimi K3 разбираем отдельно: механизм внимания KDA, контекстное окно 1M токенов, разреженную MoE-архитектуру, открытые веса и цену API за токены.
