Qwen-Image-3.0: что умеет третье поколение генератора изображений от Alibaba
Qwen-Image-3.0 — третье поколение базовой text-to-image модели серии Qwen-Image, разработанной командой Qwen (Alibaba) и анонсированной 21 июля 2026 года. Центральная идея версии сведена к одному слову — «Real» (кит. 实): авторы делают ставку не на эстетику, а на практическую пользу и достоверность контента. Подробности о модели опубликованы в официальном блоге Qwen.

Главное нововведение версии — поддержка ультра-длинного промпта до 4.5K токенов, нативная работа с 12 языками и более 20 шрифтами, а также способность за один проход собирать сложный контент: инфографику, математические формулы, интерфейсы. Доступ на старте открыт по приглашению через API.
Что такое Qwen-Image-3.0 и кто её сделал
Модель одной строкой
Qwen-Image-3.0 — базовая (foundation) text-to-image модель, третье поколение серии Qwen-Image. Разработчик — команда Qwen (Alibaba). Официальный анонс состоялся 21 июля 2026 года на блоге qwen.ai. Серия изначально проектировалась как инструмент не для художников, а для тех, кому нужны достоверные, насыщенные данными изображения: таблицы, инфографика, формулы, интерфейсы.
Нейросеть Qwen-Image-3.0 продолжает линию, которую команда Alibaba начала в августе 2025 года с первым выпуском Qwen-Image. С каждым поколением приоритет смещался от базовой генерации к профессиональным сценариям использования — и 3.0 на сегодня — флагман всей линейки.
Философия версии — «Real»
Ключевую концепцию 3.0 авторы описывают через слово «Real» (实). Смысл прост: модель должна генерировать изображения, которые практически полезны, а не просто красиво выглядят. Под «реальностью» понимаются читаемый текст, точные формулы, узнаваемые элементы интерфейсов и корректная инфографика — то, что проверяется фактически, а не эстетически.
Этот подход отличает генератор изображений Qwen от конкурентов, ориентированных на художественные стили. Практическая полезность как философия формирует весь набор возможностей 3.0: от длины промпта до приоритета рендеринга текста над «живописностью» деталей.
Что нового в Qwen-Image-3.0
Ультра-длинный промпт до 4.5K токенов
Модель принимает ввод до 4.5K токенов (около 4500) — и это главный технический шаг версии. Для сравнения, в Qwen-Image-2.0 потолок инструкции составлял около 1k токенов. За счёт расширенного ввода модель обрабатывает детальные технические задания: точное описание структуры инфографики, многостраничные схемы, сложные диаграммы с условными обозначениями.

За один проход модель генерирует формулы, геометрические фигуры, логические выкладки и многослойные UI-интерфейсы — без необходимости в пост-обработке или ручной склейке частей. Это принципиально меняет сценарии применения: третье поколение Qwen-Image становится инструментом для создания готовых документов, а не просто изображений-иллюстраций.
Инфографика и мелкий читаемый текст за один проход
Заявлена генерация целых инфографических сеток и читаемого мелкого текста размером порядка 10 пикселей — в одном прогоне без пост-обработки. Это профильная сильная сторона всей серии: рендеринг сложного текста, особенно на нелатинских шрифтах, был заложен ещё в первой версии.
Ниже — сравнение ключевых возможностей трёх поколений:
| Возможность | Qwen-Image 1.0 | Qwen-Image 2.0 | Qwen-Image 3.0 |
|---|---|---|---|
| Максимальный промпт | — | ~1k токенов | 4.5K токенов |
| Языки | — | — | 12 нативно |
| Шрифты | — | профессиональная типографика | 20+ нативно |
| Разрешение | — | 2K нативно | не указано |
| Открытые веса | да (Apache-2.0) | да | нет |
| Техотчёт в день релиза | да | да | нет |
Текст, языки и шрифты
Рендеринг текста — исторически главная специализация серии Qwen-Image. В самой первой версии акцент делался на корректном отображении китайских иероглифов в сгенерированных изображениях, с чем большинство западных моделей справлялись плохо.
12 языков и более 20 шрифтов
Третье поколение нативно поддерживает 12 языков и более 20 шрифтов. Это открывает применение в коммерческих задачах: постеры, обложки социальных сетей, карточки товаров, презентации — на нескольких языках без ручного наложения текста.
Многоязычный рендеринг «из коробки» означает, что промпт можно писать на нужном языке, а не переводить задание на английский в надежде получить нужный шрифт и читаемость. 12 языков — конкретный заявленный порог; полный список языков в официальном анонсе не детализирован.

Это особенно важно для коммерческих проектов Alibaba, охватывающих азиатские рынки, где качество отображения нелатинских символов критично для продуктового дизайна, электронной коммерции и локализованного маркетинга.
Как получить доступ к Qwen-Image-3.0
Доступ по приглашению через API
На старте после анонса доступ к третьему поколению — по приглашению (invite-only) через API. API-триал доступен на chat.qwen.ai; полноценную интеграцию в Qwen Chat команда обозначила как ближайший шаг. Официальная цена (прайсинг) на момент анонса не раскрыта.
Ниже — краткий гайд по тому, как войти в программу раннего доступа:
- Зайдите на chat.qwen.ai и создайте аккаунт или войдите через существующий.
- Перейдите в раздел генерации изображений и проверьте наличие опции Qwen-Image-3.0.
- Если модель ещё не доступна — запросите invite через форму раннего доступа на qwen.ai.
- После получения приглашения — подключитесь к API и протестируйте возможности через API-триал.
- Следите за официальными обновлениями в репозитории QwenLM — там публикуются новости о расширении доступа.
Ситуация с доступностью типична для крупных релизов: сначала ограниченный круг пользователей и партнёров, затем постепенное расширение. Для тех, кто не попал в первую волну, ближайшая альтернатива — предыдущие открытые версии серии.
Открытые веса и лицензия: главное отличие от 1.0 и 2.0
У 3.0 пока нет открытых весов
Это принципиальный разворот по сравнению с историей серии. Qwen-Image 1.0 вышла с открытыми весами под лицензией Apache-2.0 и техническим отчётом в день релиза (arXiv:2508.02324). Qwen-Image-2.0 также вышла с открытыми весами и лицензией Apache-2.0, но без отдельного технического отчёта. Версия 3.0, напротив, представлена без карточки модели, без лицензии, без числа параметров, без загружаемых весов, без бенчмарков и без техотчёта.
Qwen-Image focuses on text rendering ability… real-world texts like Chinese are particularly hard to render for most image generation models.
QwenLM/Qwen-Image — официальный репозиторий
Для тех, кому необходим локальный запуск или интеграция в собственный пайплайн, актуальны открытые предыдущие версии. Они размещены на Hugging Face (Qwen) и ModelScope. В частности, Qwen-Image-2512 — наиболее актуальная открытая версия из семейства, признанная сильнейшей open-source моделью в более чем 10 000 слепых раундов AI Arena.

Сравнение политики открытости по версиям:
| Версия | Открытые веса | Лицензия | Техотчёт | Доступ |
|---|---|---|---|---|
| Qwen-Image 1.0 | да | Apache-2.0 | arXiv:2508.02324 | Hugging Face, ModelScope |
| Qwen-Image-Edit | да | Apache-2.0 | — | Hugging Face, ModelScope |
| Qwen-Image-2.0 | да | Apache-2.0 | — | Hugging Face, ModelScope |
| Qwen-Image-2512 | да | Apache-2.0 | — | Hugging Face, ModelScope |
| Qwen-Image-3.0 | нет | не раскрыта | нет | invite-only API |
Место в линейке Qwen-Image
Серия Qwen-Image прошла путь от базовой open-source модели до закрытого флагмана всего за один год. Каждый выпуск решал конкретную задачу, а не просто улучшал общие показатели.
От Qwen-Image 1.0 до 3.0
- Qwen-Image (04.08.2025) — базовая модель на 20 миллиардов параметров, архитектура MMDiT. Открытые веса, технический отчёт на arXiv (arXiv:2508.02324), нативная поддержка в ComfyUI с 5 августа 2025 года.
- Qwen-Image-Edit (18.08.2025) — редактирование изображений по текстовой инструкции; открытые веса.
- Qwen-Image-2.0 — поддержка инструкций до 1k токенов, нативное разрешение 2K (7 соотношений сторон от 1:1 до 2:3), профессиональная типографика (PPT, постеры, комиксы), более лёгкая архитектура.
- Qwen-Image-2512 (31.12.2025) — реалистичные люди, снижение «AI-эффекта», усиленный рендер текста; в 10 000+ слепых раундов AI Arena — сильнейшая open-source модель.
- Qwen-Image-3.0 (21.07.2026) — текущий флагман: промпт до 4.5K токенов, 12 языков, 20+ шрифтов, упор на достоверность; закрытый API без открытых весов.
Полный список выпусков и технические детали доступны в официальном репозитории QwenLM/Qwen-Image на GitHub.
