GLM-5.2: что умеет флагманская открытая модель с контекстом 1 млн токенов
GLM-5.2 — флагманская открытая языковая модель, которую 13 июня 2026 выпустила Z.ai (Zhipu AI). Главное отличие — контекст вырос до 1 000 000 токенов, впятеро больше 200K у GLM-5.1, при этом цены API не изменились.
MoE-архитектура на ~744-753 млрд параметров и лицензия MIT делают модель заточенной под многочасовые агентные задачи и кодинг с открытыми весами.
Что такое GLM-5.2 и кто её сделал
Флагманская языковая модель Z.ai (Zhipu AI) вышла 13 июня 2026 года. Открытие исходного кода состоялось неделей позже релиза в облаке и API — обычная для Zhipu AI практика постепенного раскрытия.
Модель доступна сразу в нескольких форматах:
- через API по OpenAI-совместимому протоколу;
- в браузерном чате Z.ai;
- в 20+ агентных средах, включая Claude Code, OpenCode и ZCode.
Флагман линейки GLM
Нейросеть GLM изначально заточена под long-horizon задачи — многочасовую непрерывную работу агента над кодовой базой, рефакторингом и тестами, а не только на короткие диалоговые ответы. Это отличает GLM-5.2 от предыдущих версий линейки, где упор делался на разговорные и общие задачи.
Для сравнения ключевых версий линейки:
| Модель | Дата релиза | Лицензия |
|---|---|---|
| GLM-5.1 | ранее 2026 | MIT |
| GLM-5.2 | 13 июня 2026 | MIT |
Контекст 1 млн токенов — главное отличие от GLM-5.1
Рост окна контекста — центральное изменение релиза, и оно напрямую влияет на то, какие задачи модель способна держать в памяти без потери связности.
Впятеро больше контекста
Контекст вырос с 200K токенов у GLM-5.1 до 1 000 000 у GLM-5.2 — сплошное окно без деления на чанки, вывод при этом ограничен 128K (131 072) токенами. Такого объёма хватает, чтобы уместить целый репозиторий среднего размера вместе с тестами и всей историей диалога с агентом, не прибегая к суммаризации или дроблению контекста на части.
| Параметр | GLM-5.1 | GLM-5.2 |
|---|---|---|
| Контекст | 200 000 токенов | 1 000 000 токенов |
| Вывод | до 128K | до 128K (131 072) |
| Индексация | без IndexShare | IndexShare |

IndexShare и ускорение
Стабильность окна в 1 млн токенов держится за счёт механизма IndexShare: один лёгкий индексатор переиспользуется на каждые 4 слоя разреженного внимания, что снижает число операций на токен в 2.9 раза при длине контекста 1M по сравнению с GLM-5.1. Дополнительный слой Multi-Token Prediction увеличивает длину блока генерируемого ответа на 20%, что заметно ускоряет инференс именно в агентных сценариях с длинными цепочками действий.
Характеристики и архитектура MoE
Архитектурно GLM-5.2 — модель смеси экспертов (Mixture-of-Experts), где на каждый токен активируется лишь часть параметров, что экономит вычисления при сохранении ёмкости всей сети.
Параметры и режимы. MoE-архитектура: ~744-753 млрд параметров всего, из них активных на токен — ~40-98 млрд по разным замерам. Модальность одна — текст на входе и на выходе, без изображений и аудио. Модель поддерживает два уровня reasoning effort: High — баланс качества и расхода токенов для повседневных задач, и Max — для сложных многошаговых сценариев, где важна глубина рассуждения больше скорости.
Открытые веса. Лицензия MIT снимает почти все ограничения на коммерческое использование и дообучение — редкий случай для модели такого масштаба, обычно флагманы такого уровня остаются закрытыми.
Из архитектурных решений, которые отличают GLM-5.2 от типичной плотной модели, стоит выделить:
- разреженную активацию экспертов — на каждый токен работает лишь часть из ~744-753 млрд параметров;
- два независимых режима рассуждения (High и Max) вместо единственного фиксированного;
- открытую публикацию весов под MIT сразу вместе с релизом в облаке.
| Характеристика | Значение |
|---|---|
| Всего параметров | ~744-753 млрд |
| Активных на токен | ~40-98 млрд |
| Модальность | текст → текст |
| Reasoning effort | High / Max |
| Лицензия | MIT |
Бенчмарки: где GLM-5.2 в топе
Главный аргумент в пользу GLM-5.2 — не архитектурные детали, а результаты на прикладных бенчмарках кодинга и агентных задач, где модель обгоняет предыдущую версию с большим отрывом.
Кодинг и агентные тесты
Как измерить прогресс модели на практике, можно по следующим шагам:
- Сравнить Terminal-Bench 2.1 — у GLM-5.2 результат 81.0 против 63.5 у GLM-5.1 (+17.5 пункта), что делает её сильнейшей открытой моделью и единственной, преодолевшей отметку в 80%.
- Проверить FrontierSWE — 74.4%, второе место после закрытой Opus 4.8 (75.1%).
- Оценить SWE-bench Pro — 62.1% против 58.4% у предыдущей версии.
- Посмотреть AIME 2026 — 99.2%, почти предельный результат на математических задачах олимпиадного уровня.
- Сверить Design Arena — 1360 Elo, модель обошла Claude Fable 5 (1350) в задачах генерации интерфейсов.
Zhipu AI формулирует стратегию развития линейки так:
Мы открываем веса наших моделей, потому что верим: прогресс в ИИ ускоряется, когда исследователи по всему миру могут проверять, дообучать и улучшать одну и ту же архитектуру, а не начинать с нуля.
Zhipu AI, релиз-нот GLM-5.2
Эта ставка на открытость видна и в цифрах: разрыв с предыдущей версией на большинстве бенчмарков превышает 10 пунктов, а по кодингу и агентным задачам GLM-5.2 приближается к лучшим закрытым моделям на рынке. Ниже — сводная таблица по всем ключевым замерам, чтобы масштаб прогресса был виден сразу.
Резюме сравнения по ключевым бенчмаркам:
| Бенчмарк | GLM-5.1 | GLM-5.2 |
|---|---|---|
| Terminal-Bench 2.1 | 63.5 | 81.0 |
| FrontierSWE | — | 74.4 (2 место после Opus 4.8) |
| SWE-bench Pro | 58.4 | 62.1 |
| AIME 2026 | — | 99.2 |
| Design Arena (Elo) | — | 1360 |
Цены API и локальный запуск
Разработчикам, планирующим подключить модель к своим проектам, важны два вопроса — сколько стоит API и можно ли развернуть модель у себя. Подробный разбор тарифов и подключения — в материале про API GLM.
Тарифы API
Согласно официальному прайс-листу Z.ai, цены на GLM-5.2 остались на уровне GLM-5.1 (за 1 млн токенов): входные токены — $1.40, входные из кэша — $0.26, выходные — $4.40. API совместимо с форматом OpenAI Chat Completions, endpoint — api.z.ai, имя модели в запросах — glm-5.2 (для полного окна контекста используется идентификатор glm-5.2[1m]).
Локальный запуск
Веса модели опубликованы на Hugging Face под организацией zai-org и на ModelScope под лицензией MIT. Развернуть GLM-5.2 на ноутбуке не получится — требования к памяти зависят от точности весов:
- FP8 — около 754 ГБ только под веса;
- BF16 — около 1.5 ТБ;
- 4-битная квантизация — 370-400 ГБ, минимальный вариант из практически применимых.
Для локального инференса нужно серверное железо уровня нескольких GPU H100, что делает это решение доступным в основном исследовательским лабораториям и крупным компаниям, а не индивидуальным разработчикам.
Материнская компания модели, Zhipu AI, подробнее описана в отдельном обзоре — Zhipu AI, где разобрана история компании и вся линейка GLM.
