GLM API: цены, ключ и подключение к Claude Code и OpenAI SDK

Программный доступ к моделям GLM открывает Z.ai — через API можно встроить генерацию текста и кода в свои приложения, IDE-плагины и автономных агентов. Флагман GLM-5.2 стоит $1.40 за миллион входных токенов и $4.40 за миллион выходных — заметно дешевле большинства западных аналогов при сопоставимом качестве.

Ниже — актуальный прайс по всем моделям линейки, пошаговое получение ключа, тарифы Coding Plan для разработчиков и запуск открытых весов на своём железе.

Сколько стоит API по моделям

Оплата в GLM API устроена по принципу pay-as-you-go: платите только за фактически потраченные токены, отдельно за вход (промпт) и отдельно за выход (ответ модели). Разброс цен внутри линейки почти пятикратный — от полностью бесплатных Flash-моделей до флагмана с расширенным контекстом.

МодельВход, $/1M токеновВыход, $/1M токенов
GLM-5.21.404.40
GLM-51.003.20
GLM-5-Turbo1.204.00
GLM-4.70.602.20
GLM-4.7-Flash / GLM-4.5-Flashбесплатнобесплатно

Прайс pay-as-you-go

Для сравнения с рынком: Claude Sonnet 5 обходится примерно в $2 за вход и $10 за выход на миллион токенов, а GPT-5.4 mini — около $0.75/$4.50. GLM-5.2 конкурирует по цене с младшими моделями западных провайдеров, но даёт контекстное окно до 1M токенов — этого хватает на анализ целых кодовых баз или длинных документов за один запрос. Актуальный прайс-лист всегда стоит сверять на официальной странице тарификации Z.ai.

Дешёвый API GLM против более дорогих западных аналогов
Одно из преимуществ GLM — дешёвый API по сравнению с западными моделями

Бесплатные модели и доп. услуги

GLM-4.7-Flash и GLM-4.5-Flash в официальном прайсе не тарифицируются вовсе — они подходят для тестовых интеграций, черновых прогонов и лёгких задач без ограничений по бюджету. Помимо текстовых моделей, в API доступны и вспомогательные инструменты:

  • веб-поиск через API — около $0.01 за один вызов;
  • генерация изображений GLM-Image — примерно $0.015 за одно изображение;
  • пробный баланс для новых аккаунтов, которого хватает на первые тесты без оплаты;
  • отдельная тарификация для батч-запросов (обычно дешевле обычных вызовов).

Как получить API-ключ

Ключ для GLM API выдаётся через личный кабинет Z.ai Open Platform и работает во всех совместимых SDK и клиентах — от простого curl-запроса до Claude Code. Разберём процесс по шагам и разберём типичные ошибки, с которыми сталкиваются при первом подключении.

Пошагово

  1. Зарегистрируйтесь на Z.ai Open Platform (z.ai/model-api) — понадобится только email.
  2. Перейдите в раздел API Keys в личном кабинете.
  3. Нажмите «Создать ключ» и задайте ему понятное имя (например, по проекту).
  4. Скопируйте ключ сразу — повторно он в открытом виде не показывается.
  5. Сохраните ключ в переменную окружения (ZAI_API_KEY), а не в код приложения.
  6. Проверьте ключ тестовым запросом к любой модели, например к бесплатной Flash-версии.

Ключ выдаётся бесплатно, для первых тестов банковская карта не требуется. Прежде чем выбирать конкретную модель под задачу, полезно свериться с разбором GLM против DeepSeek — там видно, где линейка GLM сильнее и дешевле.

Типичные ошибки

При интеграции чаще всего встречаются три типа сбоев:

  • 401 Invalid API Key — ключ не активирован, скопирован с опечаткой или используется не тот endpoint;
  • 429 Too Many Requests — превышен лимит запросов в минуту или в день для текущего тарифа;
  • Insufficient balance — на счету закончились средства, при этом биллинг может обновляться с задержкой около суток после пополнения.

GLM Coding Plan: подписка для кодинга

Coding Plan — это фиксированная подписка вместо оплаты за токены, рассчитанная на разработчиков, которые держат модель постоянно включённой в IDE или в агентском воркфлоу. Вместо непредсказуемого счёта за токены пользователь платит фиксированную сумму в месяц и получает лимит промптов в неделю.

ТарифОриентировочная цена/месОсобенность
Liteот ~$18базовый лимит промптов в неделю
Proвыше Liteкратно больше промптов, приоритет очереди
Maxсамый дорогоймаксимальный недельный лимит
Teamпо местамтарифы Pro/Max на команду

Когда выгоднее подписка

При активной ежедневной работе агента в редакторе кода подписка Coding Plan предсказуемее, чем pay-as-you-go — расход не зависит от объёма токенов на длинных сессиях с контекстом до 1M. Для разовых или редких запросов через API, наоборот, обычно выгоднее оплата по факту без подписки. Точные цены и недельные квоты стоит уточнять в официальной документации, поскольку тарифная сетка периодически пересматривается.

Совместимость с инструментами

Работает как drop-in замена в OpenAI SDK. Достаточно сменить base_url на адрес Z.ai и указать имя модели (например, glm-5.2) — весь остальной код, использующий стандартный клиент OpenAI, продолжает работать без переписывания.

Подключается к Claude Code через отдельный endpoint. Для Anthropic-совместимых клиентов у Z.ai есть выделенный маршрут /api/anthropic — GLM встаёт на место модели Claude через переменные окружения, без правок в самом Claude Code. Официальный формат запросов и параметров описан в справочнике API Z.ai.

Поддерживает function calling и структурированный вывод. API умеет tool/function calling, JSON mode, structured outputs, потоковую генерацию (streaming) и настройку reasoning_effort для управления глубиной рассуждений модели.

Интегрируется в популярные редакторы и агентские фреймворки. Подтверждена работа с Cline, OpenCode, Roo Code, Cursor, n8n и LangChain — везде через тот же OpenAI- или Anthropic-совместимый интерфейс. Разницу в поведении моделей при кодинге удобно оценить на примере отдельного разбора возможностей GLM-4.6.

Permission is hereby granted, free of charge, to any person obtaining a copy of this software… to deal in the Software without restriction, including without limitation the rights to use, copy, modify, merge, publish, distribute, sublicense, and/or sell copies of the Software.

MIT License, Open Source Initiative

Локальный запуск открытых весов

Помимо облачного API, часть моделей линейки GLM распространяется как открытые веса — их можно скачать и развернуть на собственном сервере без обращения к облаку Z.ai вообще.

Открытые веса и лицензия MIT

Веса GLM-5.2 опубликованы под лицензией MIT, приведённой выше в оригинальной формулировке Open Source Initiative — она разрешает коммерческое использование, модификацию, fine-tuning и создание форков без выплат правообладателю. Это принципиально отличает GLM от большинства закрытых западных моделей, доступных только через платный API. Файлы весов публикуются на HuggingFace под организацией zai-org.

Требования к железу

Развернуть модель у себя можно через inference-движки vLLM или SGLang. На практике это означает:

  • для флагманской модели с полным контекстом 1M нужен серьёзный сервер — порядка 8 карт H100/H200 80GB (по некоторым оценкам минимум 4×H100 80GB, но с урезанным контекстом ~128K);
  • младшие модели линейки (GLM-4.7 и ниже) запускаются на куда более скромном железе;
  • после self-host плата за токены не взимается — только стоимость своего оборудования и электричества;
  • обновления весов выходят отдельно от облачной версии и требуют ручной установки.

FAQ

keyboard_arrow_up