Контекстное окно в 1 миллион токенов: что это даёт на практике
Контекстное окно объёмом 1 миллион токенов — одна из главных характеристик новой флагманской модели Moonshot AI. Согласно официальной документации platform.kimi.ai, это примерно в 4 раза больше, чем у предыдущей версии модели (256 тыс. токенов). Такой объём у Kimi K3 позволяет за один запрос удерживать в памяти целую кодовую базу, десятки документов или книгу среднего размера.
Ниже — точные лимиты по входу и выходу, архитектура, которая делает работу с таким контекстом быстрой, и практические примеры того, что реально помещается в 1 миллион токенов.
Точные лимиты: вход, выход и дефолт
Официальная документация platform.kimi.ai фиксирует контекстное окно флагманской модели Kimi ровно в 1 миллион токенов — весь этот объём доступен для входных данных: промпта, приложенных файлов и истории диалога.
Контекстное окно на входе
Ограничение в 1 000 000 токенов относится именно ко входу — сюда считается всё, что модель получает перед началом генерации ответа. Это не лимит на переписку в целом, а объём одного запроса: чем длиннее диалог или приложенные документы, тем ближе к потолку в 1 миллион токенов подходит запрос.
Лимит вывода — не путать с контекстом
Отдельно задаётся длина ответа: параметр max_completion_tokens можно поднять до 1 048 576 токенов, но по умолчанию модель отвечает в пределах 131 072 токенов. Для большинства задач дефолта достаточно — высокий лимит нужен, когда модель должна сгенерировать очень длинный текст или код целиком за один проход.
Три цифры, которые стоит зафиксировать:
- контекст на входе — 1 000 000 токенов;
- дефолтная длина вывода — 131 072 токена;
- максимальная длина вывода при явной настройке — 1 048 576 токенов.
| Параметр | Значение |
|---|---|
| Контекстное окно (вход) | 1 000 000 токенов |
| Длина вывода по умолчанию | 131 072 токена |
| Максимальная длина вывода | 1 048 576 токенов |
| Тарификация | pay-as-you-go, без надбавки за длину контекста |
Архитектура: почему миллион токенов не тормозит
Сам по себе рост контекста ничего не стоил бы без изменений в механизме внимания — без них декодировка на объёме в миллион токенов была бы слишком медленной для практического использования.
Kimi Delta Attention (KDA). Гибридный механизм линейного внимания — по данным технического разбора MarkTechPost, именно он даёт до 6,3 раза более быструю декодировку в контекстах на миллион токенов по сравнению со стандартным механизмом внимания. Без KDA миллионный контекст был бы практически неюзабелен по скорости.
Attention Residuals и MoE. Attention Residuals (AttnRes) заменяют стандартные остаточные соединения и дают около 25% прироста эффективности обучения. Отдельно архитектура MoE через фреймворк Stable LatentMoE активирует на каждый токен 16 из 896 экспертов — совокупно с KDA и AttnRes это дало прирост эффективности масштабирования примерно в 2,5 раза относительно Kimi K2.
Итог по трём компонентам архитектуры:
- Kimi Delta Attention — до 6,3x ускорение декодировки на контексте 1M;
- Attention Residuals — около 25% прироста эффективности обучения;
- Stable LatentMoE — 16 из 896 экспертов активны на каждый токен;
- совокупный эффект — рост эффективности масштабирования примерно в 2,5 раза к K2.
Модель предоставляет контекстное окно объёмом 1 миллион токенов. Максимальная длина вывода может быть установлена до 1 048 576 токенов, значение по умолчанию — 131 072 токена.
Kimi API Platform, официальная документация
Модель также обладает нативным пониманием изображений и видео — эти данные тоже учитываются в общем лимите контекстного окна наравне с текстом. В официальном блоге Moonshot AI уточняется, что режим рассуждений при этом включён по умолчанию — контекст в 1 миллион токенов обрабатывается моделью в режиме мышления, а не в упрощённом «быстром» режиме.
Что реально помещается в 1 миллион токенов
Абстрактная цифра «миллион токенов» становится понятнее на конкретных примерах: это объём, в который помещаются задачи, ранее требовавшие ручного разбиения на части.
Код и разработка
В контекст помещается большая кодовая база целиком — модель может держать в памяти сотни файлов проекта одновременно, не теряя связи между модулями. Это делает работу с моделью удобной для долгосрочных задач программирования и ревью больших репозиториев.

Документы, книги и исследования
Миллион токенов — это десятки документов и отчётов, полная техническая документация продукта или книга среднего объёма. Для исследовательских задач это означает возможность загрузить весь массив материалов по теме в один запрос, а не резать его на части.
Длинные логи и переписки
Тот же объём покрывает длинные логи выполнения, историю переписки или серию встреч — всё это можно анализировать целиком, без потери контекста между фрагментами.
Чтобы быстро прикинуть, поместится ли задача в контекст без дробления на части:
- Оцените объём материала в словах или строках кода.
- Переведите объём в токены — для русского и английского текста ориентир около 1,3-1,5 токена на слово, для кода — примерно 1 токен на 3-4 символа.
- Прибавьте объём системного промпта и истории диалога, если запрос не первый.
- Сравните итоговую сумму с лимитом в 1 000 000 токенов.
- Если сумма близка к потолку — уберите из запроса не относящиеся к задаче файлы или сократите историю переписки.
Ограничения: большой контекст — не идеальная память
Даже при контексте в 1 миллион токенов модель не гарантирует идеальное удержание каждой детали — при работе с очень длинными документами есть риск, что часть информации будет пропущена или интерпретирована неточно. Это не специфика конкретной модели, а общее свойство работы с длинным контекстом у современных LLM: чем дальше от начала или конца запроса расположен фрагмент, тем выше шанс, что модель уделит ему меньше внимания при формировании ответа.
Практический вывод простой: важные факты, извлечённые моделью из большого контекста, стоит перепроверять отдельным запросом или сверкой с первоисточником, а не принимать на веру только потому, что документ был загружен целиком. В первую очередь это касается:
- точных цифр и дат из середины длинного документа;
- условий договоров и юридических формулировок;
- ссылок на конкретные страницы или разделы в объёмных техдокументах.
Контекст 1M против Kimi K2 (256K)
Предыдущее поколение — Kimi K2 — работало с контекстом порядка 256 тысяч токенов. благодаря переходу на открытые веса и новой архитектуре этот показатель вырос примерно в 4 раза, и это расширение стало возможным именно благодаря архитектурным изменениям, а не просто увеличением вычислительных мощностей. Что именно изменилось между поколениями:
- контекстное окно выросло с ~256 000 до 1 000 000 токенов;
- стандартный механизм внимания заменён на Kimi Delta Attention;
- добавлены Attention Residuals для более эффективного обучения;
- совокупная эффективность масштабирования выросла примерно в 2,5 раза.
| Параметр | Kimi K2 | Kimi K3 |
|---|---|---|
| Контекстное окно | ~256 000 токенов | 1 000 000 токенов |
| Механизм внимания | стандартный | Kimi Delta Attention |
| Рост относительно K2 | — | ~4x по контексту |
