Китайская компания Alibaba выпустила 20 сентября 2026 года ИИ для генерации изображений Qwen-Image-2.1. Эта модель представляет собой бесплатный и открытый вариант в серии Qwen-Image. Пользователи могут загружать её и запускать локально, используя среды выполнения, такие как ComfyUI. Среди ключевых возможностей — создание прозрачных PNG и генерация изображений на основе нескольких эталонных картинок.
Обзор модели Qwen-Image-2.1
Ранее серия Qwen-Image была выпущена как открытая, однако версии Qwen-Image-2.0 (февраль 2026) и Qwen-Image-3.0 (июль 2026) появились как закрытые модели. Новая версия 2.1, напротив, вновь является открытой и доступна для бесплатного скачивания и локального запуска.
Модель оснащена 7 миллиардами параметров, что меньше, чем у Qwen-Image-2512 (январь 2026), но превосходит закрытые модели, такие как Google Nano Banana 2.0 и OpenAI GPT-Image-1.5.
Работа с Qwen-Image-2.1 в ComfyUI
Для запуска модели в ComfyUI необходимо в списке шаблонов выбрать Qwen Image 2.1: Text to Image. Если появляется сообщение об отсутствии моделей, система предлагает скачать необходимые компоненты:
- диффузионную модель
qwen_image_2.1_int8_convrot.safetensors; - текстовый энкодер
qwen3vl_8b_int8_convrot.safetensors; - VAE
qwen_image_2.1_vae_bf16.safetensors.
После загрузки и перезапуска интерфейса можно вводить текстовые описания (даже на японском) и генерировать изображения.
Пример генерации изображения
Один из примеров с подсказкой: «Фотография. Горничная сидит на уличном кондиционере. Японская женщина. У неё рыжие волосы в стиле волчий срез. Она читает газету, держа леденец во рту. Заголовок газеты: ‘GIGAZINE’ и ‘Появился ИИ для генерации изображений Qwen-Image-2.0’.» Основная особенность изображения — очень реалистичное изображение человека, но текст газеты и кондиционер были сгенерированы с искажениями.
При изменении случайного начального параметра (seed) текст на газете становится более точным. Хотя качество ниже, чем у онлайн-сервисов вроде ChatGPT или Gemini, отсутствие ограничения по числу попыток позволяет получать качественные изображения путём многократной генерации.
Производительность модели
На конфигурации ПК с видеокартой Intel Arc Pro B70 Creator 32GB и процессором AMD Ryzen 5 7600X генерация изображения размером 1024 × 1024 пикселей и количеством шагов 25 занимает около 45 секунд при первом запуске и 30 секунд при последующих.
Создание прозрачных PNG
Модель Qwen-Image-2.1 поддерживает генерацию прозрачных PNG без сложных настроек — достаточно указать в подсказке слова «transparent PNG». Например, с подсказкой:
«Transparent PNG. Иллюстрация в полный рост стилизованной горничной. У неё короткие чёрные волосы и оранжевая заколка в форме буквы ‘G’. Она стоит прямо и смотрит вперёд. Фон прозрачный.»
Полученное изображение сохраняет прозрачность, что подтверждается открытием в графическом редакторе GIMP с полностью прозрачным фоном.
Редактирование изображений с Qwen-Image-2.1
Редактирование в ComfyUI осуществляется через шаблон Qwen Image 2.1: Image Editing. Редакция изображения происходит путём загрузки исходной картинки и текста-подсказки. В одном из примеров была использована комбинация корпоративного изображения Alibaba и сгенерированного прозрачного PNG горничной с подсказкой, описывающей сцену пресс-конференции и добавляющей речь героини в виде облачка.
Хотя результат в целом соответствует подсказкам, встречаются ошибки: непрогнутая надпись на изогнутом экране, искажения структуры и наличие лишних конечностей у персонажа. Такие ошибки характерны для ИИ-моделей, особенно при сложных сценах.
Для повышения качества редактирования и генерации рекомендуют использовать prompt enhancer — инструменты на базе больших языковых моделей (LLM), которые оптимизируют подсказки под формат, лучше воспринимаемый ИИ для генерации изображений.
Лицензия и права на сгенерированные изображения
В лицензии Qwen-Image-2.1 указано, что коммерческое использование запрещено. Однако официальный аккаунт Alibaba в сети X (бывший Twitter) подтверждает, что права на созданные изображения принадлежат пользователям:
«Выходные данные не входят в лицензионный материал. Пользователи сохраняют права на изображения и другой контент, сгенерированный с помощью модели.»
Заключение
Qwen-Image-2.1 представляет собой мощную и доступную модель для генерации и редактирования изображений с поддержкой нескольких особенностей, таких как прозрачные PNG и сложные подсказки на японском языке. Несмотря на некоторые технические ограничения и требовательность к вычислительным ресурсам, возможность бесплатного локального использования делает её привлекательным инструментом для энтузиастов и профессионалов.
Модель особенно удобна в среде ComfyUI и позволяет экспериментировать с параметрами генерации, включая смену начального ключа для улучшения результата. Также перспективным направлением является использование подсказок с усилением (prompt enhancement) для повышения качества генерации и редактирования.
Таким образом, Qwen-Image-2.1 — пример быстро прогрессирующего сегмента ИИ для визуального творчества с открытым доступом, который может существенно расширить возможности локального производства цифрового контента.
Прокомментировать в Телеграм: https://t.me/n8nhow
Подписаться на канал обучения n8n: https://t.me/n8ncoaching

