Qwen-Image 3.0: что умеет третье поколение генератора изображений от Alibaba

21 июля 2026 года Alibaba официально представила Qwen-Image-3.0 — третье поколение базовой модели генерации и редактирования изображений семейства Qwen-Image. Модель разработана командой Qwen (Tongyi Lab) и подробно описана в официальном анонсе Qwen.

Главное отличие третьего поколения — ставка на применимость: приём промптов до 4500 токенов, нативная поддержка 12 языков и более 20 шрифтов, а также читаемый текст размером до 10 пикселей за один проход без постобработки.

Ключевые характеристики Qwen-Image 3.0: 4500 токенов, 12 языков, 20+ шрифтов, текст от 10 пикселей
Четыре главных параметра Qwen-Image 3.0 — длина промпта, языки, шрифты и минимальный читаемый текст

Что такое Qwen-Image 3.0 и когда она вышла

Qwen-Image — семейство моделей генерации и редактирования изображений от Alibaba, развивающееся с августа 2025 года. Каждое поколение решало свою задачу: первое поставило рекорды по рендерингу текста, второе добавило профессиональную типографику и лёгкую архитектуру, третье сделало упор на длину промпта и многоязычность.

Место в линейке Qwen-Image

Первая версия (Qwen-Image 1.0) вышла в августе 2025 года как 20B MMDiT-модель — Multimodal Diffusion Transformer. Она отличалась особенно сильным рендерингом китайского текста, открытыми весами под лицензией Apache 2.0 и техническим отчётом на arXiv. Qwen-Image-2.0 (февраль 2026) расширила возможности: профессиональная типографика, нативное разрешение 2K, единый режим генерации и редактирования. Qwen-Image 3.0, анонсированная 21 июля 2026 года, сосредоточилась на самой болезненной точке — ограниченной длине инструкции и поддержке языков.

Ключевые возможности и характеристики

Нейросеть Qwen-Image 3.0 получила три принципиально новых параметра по сравнению с предшественниками. Все характеристики взяты из официального анонса Qwen.

ХарактеристикаQwen-Image 3.0
Максимальная длина промпта4500 токенов (4.5K)
Поддерживаемые языки12 нативно
Поддерживаемые шрифты20+
Минимальный размер читаемого текста10 пикселей
ДоступQwen Chat + API
Открытые весаНе выпущены

Сверхдлинный промпт — до 4500 токенов

Рост в 4.5 раза к прошлому поколению — один из ключевых технических показателей релиза. Предыдущее поколение принимало около 1000 токенов, что ограничивало сложность описаний. При работе со сценами, требующими детального описания — раскадровки фильмов, диаграммы знаний, многоэлементные страницы описания товара — исполнитель больше не обязан сжимать требования или разбивать задачу на несколько запросов.

График максимальной длины промпта по версиям Qwen-Image: 1.0 и 2.0 — 1000 токенов, 3.0 — 4500 токенов
Длина промпта выросла с ~1000 токенов у прошлых версий до 4500 у Qwen-Image 3.0

Возможность передать полное техническое задание одним промптом меняет рабочий процесс для дизайнеров и маркетологов: детали не теряются при сокращении, а все элементы изображения согласованы с единым описанием.

Текст, языки и шрифты

Третье поколение Qwen-Image поддерживает 12 языков нативно и более 20 шрифтов. Читаемый текст размером до 10 пикселей рендерится за один проход — без постобработки и ручного наложения надписей. Рендеринг мелкого текста традиционно остаётся слабым местом диффузионных моделей, и работа с 10-пиксельными надписями в один проход — заметный шаг для этого класса задач.

Серия Qwen-Image изначально создавалась с акцентом на текст в изображениях — особенно на китайские иероглифы. Третье поколение распространяет это преимущество на 11 дополнительных языков.

Что Qwen-Image 3.0 генерирует за один проход

Одно из ключевых преимуществ модели — способность создавать сложные композиционные изображения без разбивки на этапы. Официальный блог Qwen демонстрирует несколько типов таких задач.

Плотная инфографика и формулы

Генератор изображений Qwen 3.0 способен создать за один запрос сетку 3×3 из девяти несвязанных инфографик на разные темы: физические схемы, доказательства из теории групп, биологические пояснения. В одном изображении сосуществуют математические формулы, геометрические фигуры и логические выкладки.

Что Qwen-Image 3.0 создаёт за один проход: инфографика, формулы, интерфейсы, раскадровки, веб-страницы, товары
Типы контента, которые модель собирает за один проход — от инфографики и формул до интерфейсов и e-commerce

Для академических и образовательных материалов это означает возможность создавать многотематические иллюстрации к лекциям или статьям без ручной сборки в графическом редакторе.

Многослойные интерфейсы

Модель строит вложенные UI: редактор кода, окно чата и мессенджер могут оказаться на одном изображении с корректным отображением каждого элемента. Этот режим полезен для мокапов продуктов, презентаций и обучающих материалов, где нужно показать несколько состояний интерфейса одновременно.

Практический фокус: польза, а не только «красивые картинки»

Третье поколение позиционируется как инструмент для прикладных задач. В официальном анонсе Qwen выделены несколько направлений, где модель показывает практические результаты: длинные инструкции, многоязычный текст и контент на основе реальных данных.

Фотореалистичные текстуры. Кожа, волосы, бумага — категории, где диффузионные модели исторически давали неровное качество. Qwen-Image 3.0 работает с этими текстурами как с приоритетным направлением.

Редактирование и реставрация. Рукописные пометки на существующих изображениях, реставрация живописи — задачи, где важна точность наложения нового контента на имеющийся.

Контент по данным. Генерация прогноза погоды для конкретного города и даты, визуализация веб-страниц, интерфейсы стримов, изображения для e-commerce с точными деталями — всё это входит в заявленный диапазон возможностей.

Такой список практических сценариев отличает позиционирование Qwen-Image 3.0 от моделей, конкурирующих в первую очередь на художественных бенчмарках.

Чем Qwen-Image 3.0 отличается от 2.0 и 1.0

Эволюция серии наглядно прослеживается в сравнительной таблице. Данные по версиям 1.0 и 2.0 взяты из репозитория QwenLM на GitHub и официального блога семейства Qwen-Image.

ВерсияДатаДлина промптаКлючевое отличиеОткрытые веса / лицензия
Qwen-Image 1.0Август 2025~1000 токенов20B MMDiT, сильный рендеринг текстаДа, Apache 2.0
Qwen-Image 2.0Февраль 2026~1000 токеновПроф. типографика, нативные 2K, единый режимНе выпущены
Qwen-Image 3.021 июля 20264500 токенов12 языков, 20+ шрифтов, текст 10 пикселейНе выпущены

Эволюция серии

Первое поколение закладывало базу: архитектура MMDiT, акцент на текст (особенно китайский), открытость. Второе развивало качество: профессиональная типографика, нативное разрешение 2K, объединение генерации и редактирования в единый режим. Третье меняет приоритет — от качества изображения к длине и сложности инструкции, а также к многоязычности.

Важно: Qwen-Image-2.0 публиковала собственный технический отчёт. У третьего поколения ни отчёта, ни открытых весов, ни опубликованных бенчмарков на момент релиза нет. Это принципиальное изменение стратегии выпуска.

Открытые веса, бенчмарки и лицензия: чего Alibaba не выпустила

Что это значит для пользователя

Qwen-Image 3.0 на момент выхода доступна исключительно как сервис — скачать модель, развернуть локально или интегрировать через открытые веса невозможно. Не опубликованы ни число параметров, ни результаты на бенчмарках, ни лицензионные условия для коммерческого использования.

Сравнение открытости Qwen-Image 1.0 и 3.0: у 1.0 открытые веса, Apache 2.0 и техотчёт, у 3.0 только сервис без весов и бенчмарков
В отличие от открытой Qwen-Image 1.0, версия 3.0 доступна только как онлайн-сервис — без весов и бенчмарков

Предыдущие версии остаются открытыми: веса Qwen-Image 1.0 доступны на Hugging Face под лицензией Apache 2.0, технический отчёт опубликован на arXiv. Для разработчиков, которым нужно локальное развёртывание или воспроизводимость, первое поколение остаётся единственным доступным вариантом в линейке.

Такая политика выпуска — закрытый сервис без открытых весов — характерна для «прикладных» итераций: компания тестирует спрос и сценарии использования, прежде чем принять решение об открытии модели.

Как попробовать Qwen-Image 3.0

Протестировать модель можно через Qwen Chat — официальный интерфейс команды Qwen. Доступ открыт без установки дополнительного ПО.

Как попробовать Qwen-Image 3.0 в четыре шага: открыть chat.qwen.ai, выбрать модель, ввести промпт, скачать результат
Тест Qwen-Image 3.0 в Qwen Chat занимает четыре шага — от входа на chat.qwen.ai до скачивания результата

Шаг за шагом:

  1. Перейдите на chat.qwen.ai
  2. Зарегистрируйтесь или войдите через аккаунт Alibaba / сторонний провайдер
  3. В выборе модели укажите Qwen-Image (убедитесь, что выбрана версия 3.0)
  4. Введите промпт — можно на русском: модель поддерживает 12 языков нативно
  5. Для сложных сцен используйте детальное описание — до 4500 токенов
  6. Скачайте результат или передайте в цепочку редактирования

API-доступ заявлен, однако стоимость использования на момент публикации официально не раскрыта. Актуальные условия следует уточнять напрямую в документации Qwen.

FAQ

keyboard_arrow_up