GLM-4.6: обзор модели Zhipu AI — параметры, контекст 200K и бенчмарки
GLM-4.6 — открытая MoE-модель китайской лаборатории Zhipu AI, вышедшая 30 сентября 2025 года. Модель доступна в чате Z.ai, а её технические характеристики подробно описаны в карточке модели на Hugging Face. Прямой ответ: 357 млрд параметров, контекст 200K токенов, лицензия MIT.
В статье разберём архитектуру модели, результаты по семи бенчмаркам (SWE-bench Verified 68%, AIME 2025 93.9%), чем GLM-4.6 отличается от GLM-4.5 и как запустить её локально или через облако — это один из разборов ИИ-моделей в нашем каталоге нейросетей.
Что такое GLM-4.6 и кто её создал
GLM-4.6 — флагманская большая языковая модель китайской компании Zhipu AI, работающей под брендом Z.ai. Модель построена по принципу разреженной активации: вместо того чтобы задействовать все параметры на каждый запрос, она включает только часть «экспертов» сети. Такой подход позволяет открытой модели GLM-4.6 конкурировать с более дорогими проприетарными системами при разумных затратах на инференс.
Разработчик и место в линейке
Zhipu AI выпустила GLM-4.6 30 сентября 2025 года как прямой преемник GLM-4.5 — предыдущего флагмана линейки. Релиз стал промежуточным шагом перед следующим поколением GLM-5, которое подняло планку бенчмарков ещё выше. Подробнее о самой компании-разработчике и её продуктовой линейке — на странице Zhipu AI.
Zhipu AI позиционирует модель как рабочий инструмент для разработчиков и агентных сценариев, а не как экспериментальную демонстрацию возможностей. Об этом говорит и набор бенчмарков, на которые компания делает ставку: кодинг, работа с инструментами и длинные агентные цепочки задач — а не только классические тесты понимания текста.
Архитектура и параметры
MoE-модель GLM-4.6 использует архитектуру Mixture of Experts — сеть разбита на специализированные подмодули («эксперты»), и роутер выбирает, какие из них активировать для конкретного токена.
MoE и 357 млрд параметров
Общее число параметров модели — около 357 млрд, но на каждый обрабатываемый токен активируется лишь около 32 млрд. Разница между общим и активным числом параметров — ключевая особенность архитектуры Mixture of Experts: она даёт качество ответа, сопоставимое с крупной плотной моделью, но при заметно меньшей вычислительной стоимости одного прохода.
Такое соотношение объясняет, почему GLM-4.6 конкурентоспособна по цене API относительно DeepSeek V3 и других MoE-моделей — при сравнимом качестве инференс требует меньше активных вычислений на токен.
Контекстное окно 200K и эффективность токенов
Одно из главных изменений в нейросети GLM-4.6 по сравнению с предыдущей версией — расширенное контекстное окно и более экономный расход токенов на сопоставимые задачи.
Расширенный контекст
Контекст вырос со 128K токенов у GLM-4.5 до 200K токенов у GLM-4.6, а максимальный объём генерации достигает 128K токенов за один ответ. Такой запас позволяет держать в одном сеансе:
- крупные кодовые базы целиком, без разбивки на части;
- многотомную техническую документацию;
- длинные логи выполнения и отладки без обрезки контекста.
Для агентных сценариев, где модель последовательно читает файлы проекта и держит в памяти историю действий, такой запас особенно важен — здесь и раскрывается смысл называть систему «нейросеть GLM»: нейросеть GLM работает не только с текстом, но и с длинными рабочими сессиями.

Экономия токенов
На внутреннем бенчмарке CC-Bench, который измеряет реальные агентные задачи по разработке, GLM-4.6 расходует примерно на 15% меньше токенов, чем GLM-4.5, при сопоставимом качестве решений. На длинных многошаговых сессиях (планирование, написание кода, отладка) экономия токенов достигает 15–30%, что напрямую снижает стоимость API-запросов при интенсивном использовании.
| Параметр | GLM-4.5 | GLM-4.6 |
|---|---|---|
| Контекст (вход) | 128K токенов | 200K токенов |
| Макс. генерация | — | 128K токенов |
| Расход токенов на CC-Bench | база | −15% |
| Экономия на длинных сессиях | — | 15–30% |
Бенчмарки GLM-4.6
Zhipu AI опубликовала результаты модели по семи независимым тестам, охватывающим несколько прикладных направлений:
- реальный кодинг и работу с open-source репозиториями (SWE-bench Verified, LiveCodeBench v6);
- математические рассуждения (AIME 2025, GPQA);
- поиск и работу с браузером (BrowseComp);
- взаимодействие с терминалом и агентные сценарии (Terminal-Bench, CC-Bench).
Результаты по семи тестам
Все приведённые цифры — self-reported данные Zhipu AI, опубликованные компанией при релизе модели; независимая верификация третьими сторонами на момент написания статьи ограничена.
| Бенчмарк | Результат GLM-4.6 |
|---|---|
| SWE-bench Verified | 68,0% |
| AIME 2025 | 93,9% |
| GPQA | 81,0% |
| LiveCodeBench v6 | 82,8% |
| BrowseComp | 45,1% |
| Terminal-Bench | 40,5% |
| CC-Bench (win rate vs Claude Sonnet 4) | 48,6% |
SWE-bench Verified проверяет способность модели решать реальные issue из open-source репозиториев на GitHub, а AIME 2025 — сложные соревновательные математические задачи. Высокий результат на AIME (93,9%) и одновременно сильный SWE-bench (68,0%) показывают, что модель одинаково хорошо справляется и с формальной логикой, и с прикладным кодингом.
Чем GLM-4.6 отличается от GLM-4.5
Разработчики Zhipu AI выделяют пять направлений, по которым GLM-4.6 продвинулась относительно предыдущей версии линейки.
- Контекст. Окно выросло со 128K до 200K токенов — почти на 56% больше.
- Расход токенов. На сопоставимых задачах модель тратит примерно на 15% меньше токенов.
- Кодинг и агентность. Улучшены результаты в реальных задачах разработки внутри Claude Code, Cline и Roo Code — популярных агентных IDE-плагинов.
- Tool calling. Модель поддерживает вызов инструментов (tool calling) прямо во время инференса, а не только по завершении генерации ответа.
- Естественность письма. Формулировки ближе к человеческим предпочтениям — меньше шаблонных канцелярских оборотов, характерных для более ранних версий.
Сравнение с конкурентами
Открытая модель GLM-4.6 сопоставляется Zhipu AI напрямую с двумя ориентирами рынка — Claude Sonnet 4 и DeepSeek V3.
GLM-4.6 против Claude Sonnet 4 и DeepSeek V3
На CC-Bench GLM-4.6 показывает win rate 48,6% против Claude Sonnet 4 — это близко к паритету, то есть модели решают задачи примерно с равным успехом. По сравнению с DeepSeek-V3.2-Exp GLM-4.6 достигает конкурентной производительности при меньшем расходе токенов на решение аналогичных задач. Среди ограничений текущей версии разработчики отмечают:
- более слабый результат в задачах символьной математики по сравнению с DeepSeek-V3.2-Exp;
- редкие случаи галлюцинаций при длинных агентных цепочках;
- отставание от Claude Sonnet 4.5 по отдельным независимым замерам SWE-bench Verified.
Планка с тех пор поднялась ещё выше: следующее поколение GLM-5.2 улучшило результаты по большинству тестов относительно GLM-4.6.
Как использовать GLM-4.6
Модель доступна двумя способами: через облачный API Z.ai или локальным развёртыванием открытых весов.
Быстрый старт через API. Для тех, кому не нужна локальная инфраструктура, доступ к модели даёт API Z.ai: цена входных токенов $0,60, выходных — $2,20 за 1 млн токенов. На запуске модели действовал промо-тариф GLM Coding Plan от $3 в месяц с фиксированным лимитом запросов на кодинг-задачи; актуальные цены стоит уточнять на сайте Z.ai, так как тарифы подписки со временем меняются. Через Z.ai можно попробовать модель без установки — прямо в браузере.
Открытые веса и локальный запуск. Полные веса модели опубликованы на Hugging Face, а код инференса и вспомогательные скрипты — в репозитории на GitHub. Лицензия MIT разрешает свободное коммерческое использование, модификацию и распространение без отчислений разработчику. Для локального инференса подходит один из трёх фреймворков:
- vLLM — для высокопроизводительного серверного развёртывания;
- SGLang — оптимизирован под многокарточные конфигурации;
- PyTorch Transformers — базовый вариант для тестов и небольших нагрузок.
Локальный запуск модели проходит в несколько шагов:
- Скачать веса модели с Hugging Face (репозиторий zai-org/GLM-4.6).
- Проверить требования к видеопамяти — из-за размера MoE-модели нужен многокарточный GPU-сервер или квантованная версия.
- Установить один из поддерживаемых фреймворков инференса: vLLM, SGLang или PyTorch Transformers.
- Загрузить веса в выбранный фреймворк и указать конфигурацию контекстного окна.
- Запустить тестовый инференс-запрос и сверить формат ответа с документацией.
- Настроить tool calling, если планируется агентный сценарий использования.
- Развернуть API-обёртку (например, через vLLM OpenAI-совместимый сервер) для интеграции с существующими инструментами.
API и облако
Помимо базового API, Zhipu AI предлагает пакетные тарифы для команд разработчиков с приоритетным доступом и увеличенными лимитами запросов в минуту — это особенно актуально для агентных пайплайнов, где один сценарий может генерировать десятки последовательных запросов.
Локальный запуск и лицензия
MIT-лицензия делает GLM-4.6 одной из немногих топовых MoE-моделей, которые можно встроить в коммерческий продукт без юридических ограничений на использование выходных данных. Это отличает модель от части конкурентов, распространяемых под более строгими research-only лицензиями. Сам текст лицензии формулирует это разрешение предельно широко:
Permission is hereby granted, free of charge, to any person obtaining a copy of this software and associated documentation files (the «Software»), to deal in the Software without restriction, including without limitation the rights to use, copy, modify, merge, publish, distribute, sublicense, and/or sell copies of the Software.
MIT License, Open Source Initiative
