GLM-5.2: что умеет флагманская открытая модель с контекстом 1 млн токенов

GLM-5.2 — флагманская открытая языковая модель, которую 13 июня 2026 выпустила Z.ai (Zhipu AI). Главное отличие — контекст вырос до 1 000 000 токенов, впятеро больше 200K у GLM-5.1, при этом цены API не изменились.

MoE-архитектура на ~744-753 млрд параметров и лицензия MIT делают модель заточенной под многочасовые агентные задачи и кодинг с открытыми весами.

Что такое GLM-5.2 и кто её сделал

Флагманская языковая модель Z.ai (Zhipu AI) вышла 13 июня 2026 года. Открытие исходного кода состоялось неделей позже релиза в облаке и API — обычная для Zhipu AI практика постепенного раскрытия.

Модель доступна сразу в нескольких форматах:

  • через API по OpenAI-совместимому протоколу;
  • в браузерном чате Z.ai;
  • в 20+ агентных средах, включая Claude Code, OpenCode и ZCode.

Флагман линейки GLM

Нейросеть GLM изначально заточена под long-horizon задачи — многочасовую непрерывную работу агента над кодовой базой, рефакторингом и тестами, а не только на короткие диалоговые ответы. Это отличает GLM-5.2 от предыдущих версий линейки, где упор делался на разговорные и общие задачи.

Для сравнения ключевых версий линейки:

МодельДата релизаЛицензия
GLM-5.1ранее 2026MIT
GLM-5.213 июня 2026MIT

Контекст 1 млн токенов — главное отличие от GLM-5.1

Рост окна контекста — центральное изменение релиза, и оно напрямую влияет на то, какие задачи модель способна держать в памяти без потери связности.

Впятеро больше контекста

Контекст вырос с 200K токенов у GLM-5.1 до 1 000 000 у GLM-5.2 — сплошное окно без деления на чанки, вывод при этом ограничен 128K (131 072) токенами. Такого объёма хватает, чтобы уместить целый репозиторий среднего размера вместе с тестами и всей историей диалога с агентом, не прибегая к суммаризации или дроблению контекста на части.

ПараметрGLM-5.1GLM-5.2
Контекст200 000 токенов1 000 000 токенов
Выводдо 128Kдо 128K (131 072)
Индексациябез IndexShareIndexShare
Контекстное окно GLM-5.2 — 1 млн токенов против 200 тыс. у прошлых версий
GLM-5.2 получила контекст 1 млн токенов — впятеро больше, чем у GLM-5.1

IndexShare и ускорение

Стабильность окна в 1 млн токенов держится за счёт механизма IndexShare: один лёгкий индексатор переиспользуется на каждые 4 слоя разреженного внимания, что снижает число операций на токен в 2.9 раза при длине контекста 1M по сравнению с GLM-5.1. Дополнительный слой Multi-Token Prediction увеличивает длину блока генерируемого ответа на 20%, что заметно ускоряет инференс именно в агентных сценариях с длинными цепочками действий.

Характеристики и архитектура MoE

Архитектурно GLM-5.2 — модель смеси экспертов (Mixture-of-Experts), где на каждый токен активируется лишь часть параметров, что экономит вычисления при сохранении ёмкости всей сети.

Параметры и режимы. MoE-архитектура: ~744-753 млрд параметров всего, из них активных на токен — ~40-98 млрд по разным замерам. Модальность одна — текст на входе и на выходе, без изображений и аудио. Модель поддерживает два уровня reasoning effort: High — баланс качества и расхода токенов для повседневных задач, и Max — для сложных многошаговых сценариев, где важна глубина рассуждения больше скорости.

Открытые веса. Лицензия MIT снимает почти все ограничения на коммерческое использование и дообучение — редкий случай для модели такого масштаба, обычно флагманы такого уровня остаются закрытыми.

Из архитектурных решений, которые отличают GLM-5.2 от типичной плотной модели, стоит выделить:

  • разреженную активацию экспертов — на каждый токен работает лишь часть из ~744-753 млрд параметров;
  • два независимых режима рассуждения (High и Max) вместо единственного фиксированного;
  • открытую публикацию весов под MIT сразу вместе с релизом в облаке.
ХарактеристикаЗначение
Всего параметров~744-753 млрд
Активных на токен~40-98 млрд
Модальностьтекст → текст
Reasoning effortHigh / Max
ЛицензияMIT

Бенчмарки: где GLM-5.2 в топе

Главный аргумент в пользу GLM-5.2 — не архитектурные детали, а результаты на прикладных бенчмарках кодинга и агентных задач, где модель обгоняет предыдущую версию с большим отрывом.

Кодинг и агентные тесты

Как измерить прогресс модели на практике, можно по следующим шагам:

  1. Сравнить Terminal-Bench 2.1 — у GLM-5.2 результат 81.0 против 63.5 у GLM-5.1 (+17.5 пункта), что делает её сильнейшей открытой моделью и единственной, преодолевшей отметку в 80%.
  2. Проверить FrontierSWE — 74.4%, второе место после закрытой Opus 4.8 (75.1%).
  3. Оценить SWE-bench Pro — 62.1% против 58.4% у предыдущей версии.
  4. Посмотреть AIME 2026 — 99.2%, почти предельный результат на математических задачах олимпиадного уровня.
  5. Сверить Design Arena — 1360 Elo, модель обошла Claude Fable 5 (1350) в задачах генерации интерфейсов.

Zhipu AI формулирует стратегию развития линейки так:

Мы открываем веса наших моделей, потому что верим: прогресс в ИИ ускоряется, когда исследователи по всему миру могут проверять, дообучать и улучшать одну и ту же архитектуру, а не начинать с нуля.

Zhipu AI, релиз-нот GLM-5.2

Эта ставка на открытость видна и в цифрах: разрыв с предыдущей версией на большинстве бенчмарков превышает 10 пунктов, а по кодингу и агентным задачам GLM-5.2 приближается к лучшим закрытым моделям на рынке. Ниже — сводная таблица по всем ключевым замерам, чтобы масштаб прогресса был виден сразу.

Резюме сравнения по ключевым бенчмаркам:

БенчмаркGLM-5.1GLM-5.2
Terminal-Bench 2.163.581.0
FrontierSWE74.4 (2 место после Opus 4.8)
SWE-bench Pro58.462.1
AIME 202699.2
Design Arena (Elo)1360

Цены API и локальный запуск

Разработчикам, планирующим подключить модель к своим проектам, важны два вопроса — сколько стоит API и можно ли развернуть модель у себя. Подробный разбор тарифов и подключения — в материале про API GLM.

Тарифы API

Согласно официальному прайс-листу Z.ai, цены на GLM-5.2 остались на уровне GLM-5.1 (за 1 млн токенов): входные токены — $1.40, входные из кэша — $0.26, выходные — $4.40. API совместимо с форматом OpenAI Chat Completions, endpoint — api.z.ai, имя модели в запросах — glm-5.2 (для полного окна контекста используется идентификатор glm-5.2[1m]).

Локальный запуск

Веса модели опубликованы на Hugging Face под организацией zai-org и на ModelScope под лицензией MIT. Развернуть GLM-5.2 на ноутбуке не получится — требования к памяти зависят от точности весов:

  • FP8 — около 754 ГБ только под веса;
  • BF16 — около 1.5 ТБ;
  • 4-битная квантизация — 370-400 ГБ, минимальный вариант из практически применимых.

Для локального инференса нужно серверное железо уровня нескольких GPU H100, что делает это решение доступным в основном исследовательским лабораториям и крупным компаниям, а не индивидуальным разработчикам.

Материнская компания модели, Zhipu AI, подробнее описана в отдельном обзоре — Zhipu AI, где разобрана история компании и вся линейка GLM.

FAQ

keyboard_arrow_up