Qwen-Image-3.0: что умеет третье поколение генератора изображений от Alibaba

Qwen-Image-3.0 — третье поколение базовой text-to-image модели серии Qwen-Image, разработанной командой Qwen (Alibaba) и анонсированной 21 июля 2026 года. Центральная идея версии сведена к одному слову — «Real» (кит. 实): авторы делают ставку не на эстетику, а на практическую пользу и достоверность контента. Подробности о модели опубликованы в официальном блоге Qwen.

Эволюция серии Qwen-Image: от 1.0 (2025) до 3.0 (2026)
За год серия Qwen-Image прошла путь от открытой базовой модели до закрытого флагмана 3.0

Главное нововведение версии — поддержка ультра-длинного промпта до 4.5K токенов, нативная работа с 12 языками и более 20 шрифтами, а также способность за один проход собирать сложный контент: инфографику, математические формулы, интерфейсы. Доступ на старте открыт по приглашению через API.

Что такое Qwen-Image-3.0 и кто её сделал

Модель одной строкой

Qwen-Image-3.0 — базовая (foundation) text-to-image модель, третье поколение серии Qwen-Image. Разработчик — команда Qwen (Alibaba). Официальный анонс состоялся 21 июля 2026 года на блоге qwen.ai. Серия изначально проектировалась как инструмент не для художников, а для тех, кому нужны достоверные, насыщенные данными изображения: таблицы, инфографика, формулы, интерфейсы.

Нейросеть Qwen-Image-3.0 продолжает линию, которую команда Alibaba начала в августе 2025 года с первым выпуском Qwen-Image. С каждым поколением приоритет смещался от базовой генерации к профессиональным сценариям использования — и 3.0 на сегодня — флагман всей линейки.

Философия версии — «Real»

Ключевую концепцию 3.0 авторы описывают через слово «Real» (实). Смысл прост: модель должна генерировать изображения, которые практически полезны, а не просто красиво выглядят. Под «реальностью» понимаются читаемый текст, точные формулы, узнаваемые элементы интерфейсов и корректная инфографика — то, что проверяется фактически, а не эстетически.

Этот подход отличает генератор изображений Qwen от конкурентов, ориентированных на художественные стили. Практическая полезность как философия формирует весь набор возможностей 3.0: от длины промпта до приоритета рендеринга текста над «живописностью» деталей.

Что нового в Qwen-Image-3.0

Ультра-длинный промпт до 4.5K токенов

Модель принимает ввод до 4.5K токенов (около 4500) — и это главный технический шаг версии. Для сравнения, в Qwen-Image-2.0 потолок инструкции составлял около 1k токенов. За счёт расширенного ввода модель обрабатывает детальные технические задания: точное описание структуры инфографики, многостраничные схемы, сложные диаграммы с условными обозначениями.

Длина промпта: Qwen-Image 2.0 — 1K токенов, Qwen-Image 3.0 — 4.5K токенов
Потолок промпта вырос примерно в 4,5 раза — с 1K токенов в 2.0 до 4.5K в 3.0

За один проход модель генерирует формулы, геометрические фигуры, логические выкладки и многослойные UI-интерфейсы — без необходимости в пост-обработке или ручной склейке частей. Это принципиально меняет сценарии применения: третье поколение Qwen-Image становится инструментом для создания готовых документов, а не просто изображений-иллюстраций.

Инфографика и мелкий читаемый текст за один проход

Заявлена генерация целых инфографических сеток и читаемого мелкого текста размером порядка 10 пикселей — в одном прогоне без пост-обработки. Это профильная сильная сторона всей серии: рендеринг сложного текста, особенно на нелатинских шрифтах, был заложен ещё в первой версии.

Ниже — сравнение ключевых возможностей трёх поколений:

ВозможностьQwen-Image 1.0Qwen-Image 2.0Qwen-Image 3.0
Максимальный промпт~1k токенов4.5K токенов
Языки12 нативно
Шрифтыпрофессиональная типографика20+ нативно
Разрешение2K нативноне указано
Открытые весада (Apache-2.0)данет
Техотчёт в день релизададанет

Текст, языки и шрифты

Рендеринг текста — исторически главная специализация серии Qwen-Image. В самой первой версии акцент делался на корректном отображении китайских иероглифов в сгенерированных изображениях, с чем большинство западных моделей справлялись плохо.

12 языков и более 20 шрифтов

Третье поколение нативно поддерживает 12 языков и более 20 шрифтов. Это открывает применение в коммерческих задачах: постеры, обложки социальных сетей, карточки товаров, презентации — на нескольких языках без ручного наложения текста.

Многоязычный рендеринг «из коробки» означает, что промпт можно писать на нужном языке, а не переводить задание на английский в надежде получить нужный шрифт и читаемость. 12 языков — конкретный заявленный порог; полный список языков в официальном анонсе не детализирован.

Что нового в Qwen-Image-3.0: до 4.5K токенов, 12 языков, 20+ шрифтов, инфографика за один проход
Ключевые нововведения 3.0: длинный промпт, 12 языков, 20+ шрифтов и готовая инфографика за один проход

Это особенно важно для коммерческих проектов Alibaba, охватывающих азиатские рынки, где качество отображения нелатинских символов критично для продуктового дизайна, электронной коммерции и локализованного маркетинга.

Как получить доступ к Qwen-Image-3.0

Доступ по приглашению через API

На старте после анонса доступ к третьему поколению — по приглашению (invite-only) через API. API-триал доступен на chat.qwen.ai; полноценную интеграцию в Qwen Chat команда обозначила как ближайший шаг. Официальная цена (прайсинг) на момент анонса не раскрыта.

Ниже — краткий гайд по тому, как войти в программу раннего доступа:

  1. Зайдите на chat.qwen.ai и создайте аккаунт или войдите через существующий.
  2. Перейдите в раздел генерации изображений и проверьте наличие опции Qwen-Image-3.0.
  3. Если модель ещё не доступна — запросите invite через форму раннего доступа на qwen.ai.
  4. После получения приглашения — подключитесь к API и протестируйте возможности через API-триал.
  5. Следите за официальными обновлениями в репозитории QwenLM — там публикуются новости о расширении доступа.

Ситуация с доступностью типична для крупных релизов: сначала ограниченный круг пользователей и партнёров, затем постепенное расширение. Для тех, кто не попал в первую волну, ближайшая альтернатива — предыдущие открытые версии серии.

Открытые веса и лицензия: главное отличие от 1.0 и 2.0

У 3.0 пока нет открытых весов

Это принципиальный разворот по сравнению с историей серии. Qwen-Image 1.0 вышла с открытыми весами под лицензией Apache-2.0 и техническим отчётом в день релиза (arXiv:2508.02324). Qwen-Image-2.0 также вышла с открытыми весами и лицензией Apache-2.0, но без отдельного технического отчёта. Версия 3.0, напротив, представлена без карточки модели, без лицензии, без числа параметров, без загружаемых весов, без бенчмарков и без техотчёта.

Qwen-Image focuses on text rendering ability… real-world texts like Chinese are particularly hard to render for most image generation models.

QwenLM/Qwen-Image — официальный репозиторий

Для тех, кому необходим локальный запуск или интеграция в собственный пайплайн, актуальны открытые предыдущие версии. Они размещены на Hugging Face (Qwen) и ModelScope. В частности, Qwen-Image-2512 — наиболее актуальная открытая версия из семейства, признанная сильнейшей open-source моделью в более чем 10 000 слепых раундов AI Arena.

Открытые веса: Qwen-Image 1.0 и 2.0 — Apache-2.0, Qwen-Image 3.0 — по приглашению без весов
Главный разворот: 1.0 и 2.0 выходили с открытыми весами под Apache-2.0, а 3.0 доступна только по приглашению

Сравнение политики открытости по версиям:

ВерсияОткрытые весаЛицензияТехотчётДоступ
Qwen-Image 1.0даApache-2.0arXiv:2508.02324Hugging Face, ModelScope
Qwen-Image-EditдаApache-2.0Hugging Face, ModelScope
Qwen-Image-2.0даApache-2.0Hugging Face, ModelScope
Qwen-Image-2512даApache-2.0Hugging Face, ModelScope
Qwen-Image-3.0нетне раскрытанетinvite-only API

Место в линейке Qwen-Image

Серия Qwen-Image прошла путь от базовой open-source модели до закрытого флагмана всего за один год. Каждый выпуск решал конкретную задачу, а не просто улучшал общие показатели.

От Qwen-Image 1.0 до 3.0

  • Qwen-Image (04.08.2025) — базовая модель на 20 миллиардов параметров, архитектура MMDiT. Открытые веса, технический отчёт на arXiv (arXiv:2508.02324), нативная поддержка в ComfyUI с 5 августа 2025 года.
  • Qwen-Image-Edit (18.08.2025) — редактирование изображений по текстовой инструкции; открытые веса.
  • Qwen-Image-2.0 — поддержка инструкций до 1k токенов, нативное разрешение 2K (7 соотношений сторон от 1:1 до 2:3), профессиональная типографика (PPT, постеры, комиксы), более лёгкая архитектура.
  • Qwen-Image-2512 (31.12.2025) — реалистичные люди, снижение «AI-эффекта», усиленный рендер текста; в 10 000+ слепых раундов AI Arena — сильнейшая open-source модель.
  • Qwen-Image-3.0 (21.07.2026) — текущий флагман: промпт до 4.5K токенов, 12 языков, 20+ шрифтов, упор на достоверность; закрытый API без открытых весов.

Полный список выпусков и технические детали доступны в официальном репозитории QwenLM/Qwen-Image на GitHub.

FAQ

keyboard_arrow_up