Тестирование ИИ для генерации и редактирования изображений Qwen-Image-2.1: поддержка японских подсказок и создание прозрачных PNG

Китайская компания Alibaba выпустила 20 сентября 2026 года ИИ для генерации изображений Qwen-Image-2.1. Эта модель представляет собой бесплатный и открытый вариант в серии Qwen-Image. Пользователи могут загружать её и запускать локально, используя среды выполнения, такие как ComfyUI. Среди ключевых возможностей — создание прозрачных PNG и генерация изображений на основе нескольких эталонных картинок.

Обзор модели Qwen-Image-2.1

Ранее серия Qwen-Image была выпущена как открытая, однако версии Qwen-Image-2.0 (февраль 2026) и Qwen-Image-3.0 (июль 2026) появились как закрытые модели. Новая версия 2.1, напротив, вновь является открытой и доступна для бесплатного скачивания и локального запуска.

Модель оснащена 7 миллиардами параметров, что меньше, чем у Qwen-Image-2512 (январь 2026), но превосходит закрытые модели, такие как Google Nano Banana 2.0 и OpenAI GPT-Image-1.5.

Работа с Qwen-Image-2.1 в ComfyUI

Для запуска модели в ComfyUI необходимо в списке шаблонов выбрать Qwen Image 2.1: Text to Image. Если появляется сообщение об отсутствии моделей, система предлагает скачать необходимые компоненты:

  • диффузионную модель qwen_image_2.1_int8_convrot.safetensors;
  • текстовый энкодер qwen3vl_8b_int8_convrot.safetensors;
  • VAE qwen_image_2.1_vae_bf16.safetensors.

После загрузки и перезапуска интерфейса можно вводить текстовые описания (даже на японском) и генерировать изображения.

Пример генерации изображения

Один из примеров с подсказкой: «Фотография. Горничная сидит на уличном кондиционере. Японская женщина. У неё рыжие волосы в стиле волчий срез. Она читает газету, держа леденец во рту. Заголовок газеты: ‘GIGAZINE’ и ‘Появился ИИ для генерации изображений Qwen-Image-2.0’.» Основная особенность изображения — очень реалистичное изображение человека, но текст газеты и кондиционер были сгенерированы с искажениями.

При изменении случайного начального параметра (seed) текст на газете становится более точным. Хотя качество ниже, чем у онлайн-сервисов вроде ChatGPT или Gemini, отсутствие ограничения по числу попыток позволяет получать качественные изображения путём многократной генерации.

Производительность модели

На конфигурации ПК с видеокартой Intel Arc Pro B70 Creator 32GB и процессором AMD Ryzen 5 7600X генерация изображения размером 1024 × 1024 пикселей и количеством шагов 25 занимает около 45 секунд при первом запуске и 30 секунд при последующих.

Создание прозрачных PNG

Модель Qwen-Image-2.1 поддерживает генерацию прозрачных PNG без сложных настроек — достаточно указать в подсказке слова «transparent PNG». Например, с подсказкой:

«Transparent PNG. Иллюстрация в полный рост стилизованной горничной. У неё короткие чёрные волосы и оранжевая заколка в форме буквы ‘G’. Она стоит прямо и смотрит вперёд. Фон прозрачный.»

Полученное изображение сохраняет прозрачность, что подтверждается открытием в графическом редакторе GIMP с полностью прозрачным фоном.

Редактирование изображений с Qwen-Image-2.1

Редактирование в ComfyUI осуществляется через шаблон Qwen Image 2.1: Image Editing. Редакция изображения происходит путём загрузки исходной картинки и текста-подсказки. В одном из примеров была использована комбинация корпоративного изображения Alibaba и сгенерированного прозрачного PNG горничной с подсказкой, описывающей сцену пресс-конференции и добавляющей речь героини в виде облачка.

Хотя результат в целом соответствует подсказкам, встречаются ошибки: непрогнутая надпись на изогнутом экране, искажения структуры и наличие лишних конечностей у персонажа. Такие ошибки характерны для ИИ-моделей, особенно при сложных сценах.

Для повышения качества редактирования и генерации рекомендуют использовать prompt enhancer — инструменты на базе больших языковых моделей (LLM), которые оптимизируют подсказки под формат, лучше воспринимаемый ИИ для генерации изображений.

Лицензия и права на сгенерированные изображения

В лицензии Qwen-Image-2.1 указано, что коммерческое использование запрещено. Однако официальный аккаунт Alibaba в сети X (бывший Twitter) подтверждает, что права на созданные изображения принадлежат пользователям:

«Выходные данные не входят в лицензионный материал. Пользователи сохраняют права на изображения и другой контент, сгенерированный с помощью модели.»

Заключение

Qwen-Image-2.1 представляет собой мощную и доступную модель для генерации и редактирования изображений с поддержкой нескольких особенностей, таких как прозрачные PNG и сложные подсказки на японском языке. Несмотря на некоторые технические ограничения и требовательность к вычислительным ресурсам, возможность бесплатного локального использования делает её привлекательным инструментом для энтузиастов и профессионалов.

Модель особенно удобна в среде ComfyUI и позволяет экспериментировать с параметрами генерации, включая смену начального ключа для улучшения результата. Также перспективным направлением является использование подсказок с усилением (prompt enhancement) для повышения качества генерации и редактирования.

Таким образом, Qwen-Image-2.1 — пример быстро прогрессирующего сегмента ИИ для визуального творчества с открытым доступом, который может существенно расширить возможности локального производства цифрового контента.




Прокомментировать в Телеграм: https://t.me/n8nhow

Подписаться на канал обучения n8n: https://t.me/n8ncoaching

Советы, обучающие курсы, компьютерная грамотность
Обзор конфиденциальности

На этом сайте используются файлы cookie, что позволяет нам обеспечить наилучшее качество обслуживания пользователей. Информация о файлах cookie хранится в вашем браузере и выполняет такие функции, как распознавание вас при возвращении на наш сайт и помощь нашей команде в понимании того, какие разделы сайта вы считаете наиболее интересными и полезными.