Китайская компания Alibaba выпустила 20 сентября 2026 года свою новую модель для генерации изображений — Qwen-Image-2.1. Эта версия стала первым открытым (open source) релизом серии Qwen-Image за последнее время. Модель доступна для бесплатного скачивания и может запускаться локально, например, через популярную платформу ComfyUI.
Основные характеристики Qwen-Image-2.1
- Объём модели: 7 миллиардов параметров;
- Тип доступа: открытая свободная модель;
- Поддержка: генерация и редактирование изображений;
- Особенность: создание прозрачных PNG изображений;
- Работа с множественными референсами: возможность генерации на основе нескольких исходных изображений;
- Поддержка японских подсказок (промптов): можно задавать запросы на японском языке;
- Совместимость: используется в ComfyUI с соответствующими шаблонами.
В сравнении с более крупной моделью Qwen-Image-2512 (январь 2026) версия 2.1 является компактнее, но при этом превосходит по мощности закрытые модели, такие как Nano Banana 2.0 от Google и GPT-Image-1.5 от OpenAI.
Работа с Qwen-Image-2.1 в ComfyUI
Для запуска генерации изображений в ComfyUI необходимо выбрать шаблон «Qwen Image 2.1: Text to Image». При первом использовании система запросит скачивание трёх компонентов:
- диффузионной модели
qwen_image_2.1_int8_convrot.safetensors; - текстового энкодера
qwen3vl_8b_int8_convrot.safetensors; - VAE модели
qwen_image_2.1_vae_bf16.safetensors.
После загрузки и обновления интерфейса можно вводить описание изображения и запускать генерацию. Запросы можно задавать на японском языке.
Пример генерации
Один из примеров запроса был следующим: «Фотография. Горничная сидит на кондиционере на улице. Японская женщина. У неё красные волосы стрижки в стиле волка. Она читает газету, держа в рот леденец. Заголовок газеты: ‘GIGAZINE’ и ‘Image generation AI Qwen-Image-2.0 appears’.
Главной особенностью сгенерированного изображения стала высокая реалистичность человеческой фигуры. Однако некоторые детали, например, текст на газете и форма кондиционера, оказались искажены.
Изменение параметра seed позволило получить другую вариацию с корректным отображением текста. Несмотря на то, что качество уступает онлайн-сервисам вроде ChatGPT и Gemini, отсутствие ограничений по количеству попыток даёт возможность подобрать удачные изображения путём многократной генерации.
Производительность
На ПК с видеокартой Intel Arc Pro B70 Creator 32GB и процессором AMD Ryzen 5 7600X генерация изображения в разрешении 1024 x 1024 с 25 шагами заняла примерно 45 секунд для первого запуска и около 30 секунд для последующих.
Создание прозрачных PNG изображений
Qwen-Image-2.1 умеет создавать прозрачные изображения в формате PNG без сложных настроек, достаточно добавить в промпт слова «transparent PNG».
Например, для промпта «Transparent PNG. Полнотелая иллюстрация стилизованной горничной с короткими чёрными волосами и оранжевой заколкой в форме буквы ‘G’. Она стоит прямо и смотрит вперёд. Фон прозрачный.» была сгенерирована прозрачная картинка, которая при увеличении сохраняла альфа-канал и могла корректно отображаться в графических редакторах, таких как GIMP.
Функция редактирования изображений
Модель также поддерживает редактирование исходных изображений с помощью текстовых подсказок. Для этого используется шаблон «Qwen Image 2.1: Image Editing» в ComfyUI.
Примерно так это работает: задаётся исходное изображение и описание желаемого изменения. В одном из тестов было задано:
- Сцена с презентацией продукта в большом зале;
- На экране показывается первое изображение (из анонса Alibaba);
- Презентатор — горничная из второго (прозрачного) изображения;
- Горничная стоит на сцене и указывает на экран;
- Добавлена речевая облачко с текстом «Amazing!».
Несмотря на общую адекватность результата, в изображении проявились проблемы: искажения структуры, некорректное преобразование текста на изогнутом экране, лишние руки. Для получения удачных результатов иногда необходимо много попыток и отбор наиболее удачных.
В локальном сообществе популярна техника использования улучшителей промптов, которые адаптируют текстовое описание под возможности ИИ через большие языковые модели (LLM). Это может улучшить итоговое качество изображения.
Правовой статус и лицензия
Лицензия Qwen-Image-2.1 запрещает коммерческое использование, однако по заявлению официального аккаунта Alibaba в социальной сети X (бывший Twitter), права на изображения, созданные с помощью модели, принадлежат пользователям.
«Outputs are not part of the licensed Materials. Users retain the rights to images and other content they generate using the model.»
Выводы
Qwen-Image-2.1 представляет собой мощный инструмент для генерации и редактирования изображений с открытым исходным кодом. Его преимущества включают поддержку японских запросов и возможность создавать прозрачные PNG изображения без сложных настроек. Несмотря на некоторые недостатки качества и необходимости подбора параметров, модель удобна для локального использования на компьютерах с современной видеокартой.
Её открытость и гибкость делают Qwen-Image-2.1 привлекательным решением для разработчиков, исследователей и энтузиастов, желающих экспериментировать с генерацией изображений без ограничений облачных сервисов.
Кроме того, интеграция с ComfyUI упрощает запуск и тестирование модели, а возможность применять промпт-улучшители и работать с несколькими референсами расширяет творческий потенциал использования.
Таким образом, Qwen-Image-2.1 занимает заметное место среди современных ИИ-инструментов для работы с генерированным изображением, особенно для пользователей, ориентированных на локальный запуск и экспериментирование с различными языковыми запросами.
Прокомментировать в Телеграм: https://t.me/n8nhow
Подписаться на канал обучения n8n: https://t.me/n8ncoaching

