GLM API: цены, ключ и подключение к Claude Code и OpenAI SDK
Программный доступ к моделям GLM открывает Z.ai — через API можно встроить генерацию текста и кода в свои приложения, IDE-плагины и автономных агентов. Флагман GLM-5.2 стоит $1.40 за миллион входных токенов и $4.40 за миллион выходных — заметно дешевле большинства западных аналогов при сопоставимом качестве.
Ниже — актуальный прайс по всем моделям линейки, пошаговое получение ключа, тарифы Coding Plan для разработчиков и запуск открытых весов на своём железе.
Сколько стоит API по моделям
Оплата в GLM API устроена по принципу pay-as-you-go: платите только за фактически потраченные токены, отдельно за вход (промпт) и отдельно за выход (ответ модели). Разброс цен внутри линейки почти пятикратный — от полностью бесплатных Flash-моделей до флагмана с расширенным контекстом.
| Модель | Вход, $/1M токенов | Выход, $/1M токенов |
|---|---|---|
| GLM-5.2 | 1.40 | 4.40 |
| GLM-5 | 1.00 | 3.20 |
| GLM-5-Turbo | 1.20 | 4.00 |
| GLM-4.7 | 0.60 | 2.20 |
| GLM-4.7-Flash / GLM-4.5-Flash | бесплатно | бесплатно |
Прайс pay-as-you-go
Для сравнения с рынком: Claude Sonnet 5 обходится примерно в $2 за вход и $10 за выход на миллион токенов, а GPT-5.4 mini — около $0.75/$4.50. GLM-5.2 конкурирует по цене с младшими моделями западных провайдеров, но даёт контекстное окно до 1M токенов — этого хватает на анализ целых кодовых баз или длинных документов за один запрос. Актуальный прайс-лист всегда стоит сверять на официальной странице тарификации Z.ai.

Бесплатные модели и доп. услуги
GLM-4.7-Flash и GLM-4.5-Flash в официальном прайсе не тарифицируются вовсе — они подходят для тестовых интеграций, черновых прогонов и лёгких задач без ограничений по бюджету. Помимо текстовых моделей, в API доступны и вспомогательные инструменты:
- веб-поиск через API — около $0.01 за один вызов;
- генерация изображений GLM-Image — примерно $0.015 за одно изображение;
- пробный баланс для новых аккаунтов, которого хватает на первые тесты без оплаты;
- отдельная тарификация для батч-запросов (обычно дешевле обычных вызовов).
Как получить API-ключ
Ключ для GLM API выдаётся через личный кабинет Z.ai Open Platform и работает во всех совместимых SDK и клиентах — от простого curl-запроса до Claude Code. Разберём процесс по шагам и разберём типичные ошибки, с которыми сталкиваются при первом подключении.
Пошагово
- Зарегистрируйтесь на Z.ai Open Platform (z.ai/model-api) — понадобится только email.
- Перейдите в раздел API Keys в личном кабинете.
- Нажмите «Создать ключ» и задайте ему понятное имя (например, по проекту).
- Скопируйте ключ сразу — повторно он в открытом виде не показывается.
- Сохраните ключ в переменную окружения (
ZAI_API_KEY), а не в код приложения. - Проверьте ключ тестовым запросом к любой модели, например к бесплатной Flash-версии.
Ключ выдаётся бесплатно, для первых тестов банковская карта не требуется. Прежде чем выбирать конкретную модель под задачу, полезно свериться с разбором GLM против DeepSeek — там видно, где линейка GLM сильнее и дешевле.
Типичные ошибки
При интеграции чаще всего встречаются три типа сбоев:
- 401 Invalid API Key — ключ не активирован, скопирован с опечаткой или используется не тот endpoint;
- 429 Too Many Requests — превышен лимит запросов в минуту или в день для текущего тарифа;
- Insufficient balance — на счету закончились средства, при этом биллинг может обновляться с задержкой около суток после пополнения.
GLM Coding Plan: подписка для кодинга
Coding Plan — это фиксированная подписка вместо оплаты за токены, рассчитанная на разработчиков, которые держат модель постоянно включённой в IDE или в агентском воркфлоу. Вместо непредсказуемого счёта за токены пользователь платит фиксированную сумму в месяц и получает лимит промптов в неделю.
| Тариф | Ориентировочная цена/мес | Особенность |
|---|---|---|
| Lite | от ~$18 | базовый лимит промптов в неделю |
| Pro | выше Lite | кратно больше промптов, приоритет очереди |
| Max | самый дорогой | максимальный недельный лимит |
| Team | по местам | тарифы Pro/Max на команду |
Когда выгоднее подписка
При активной ежедневной работе агента в редакторе кода подписка Coding Plan предсказуемее, чем pay-as-you-go — расход не зависит от объёма токенов на длинных сессиях с контекстом до 1M. Для разовых или редких запросов через API, наоборот, обычно выгоднее оплата по факту без подписки. Точные цены и недельные квоты стоит уточнять в официальной документации, поскольку тарифная сетка периодически пересматривается.
Совместимость с инструментами
Работает как drop-in замена в OpenAI SDK. Достаточно сменить base_url на адрес Z.ai и указать имя модели (например, glm-5.2) — весь остальной код, использующий стандартный клиент OpenAI, продолжает работать без переписывания.
Подключается к Claude Code через отдельный endpoint. Для Anthropic-совместимых клиентов у Z.ai есть выделенный маршрут /api/anthropic — GLM встаёт на место модели Claude через переменные окружения, без правок в самом Claude Code. Официальный формат запросов и параметров описан в справочнике API Z.ai.
Поддерживает function calling и структурированный вывод. API умеет tool/function calling, JSON mode, structured outputs, потоковую генерацию (streaming) и настройку reasoning_effort для управления глубиной рассуждений модели.
Интегрируется в популярные редакторы и агентские фреймворки. Подтверждена работа с Cline, OpenCode, Roo Code, Cursor, n8n и LangChain — везде через тот же OpenAI- или Anthropic-совместимый интерфейс. Разницу в поведении моделей при кодинге удобно оценить на примере отдельного разбора возможностей GLM-4.6.
Permission is hereby granted, free of charge, to any person obtaining a copy of this software… to deal in the Software without restriction, including without limitation the rights to use, copy, modify, merge, publish, distribute, sublicense, and/or sell copies of the Software.
MIT License, Open Source Initiative
Локальный запуск открытых весов
Помимо облачного API, часть моделей линейки GLM распространяется как открытые веса — их можно скачать и развернуть на собственном сервере без обращения к облаку Z.ai вообще.
Открытые веса и лицензия MIT
Веса GLM-5.2 опубликованы под лицензией MIT, приведённой выше в оригинальной формулировке Open Source Initiative — она разрешает коммерческое использование, модификацию, fine-tuning и создание форков без выплат правообладателю. Это принципиально отличает GLM от большинства закрытых западных моделей, доступных только через платный API. Файлы весов публикуются на HuggingFace под организацией zai-org.
Требования к железу
Развернуть модель у себя можно через inference-движки vLLM или SGLang. На практике это означает:
- для флагманской модели с полным контекстом 1M нужен серьёзный сервер — порядка 8 карт H100/H200 80GB (по некоторым оценкам минимум 4×H100 80GB, но с урезанным контекстом ~128K);
- младшие модели линейки (GLM-4.7 и ниже) запускаются на куда более скромном железе;
- после self-host плата за токены не взимается — только стоимость своего оборудования и электричества;
- обновления весов выходят отдельно от облачной версии и требуют ручной установки.
