Тестирование ИИ для генерации и редактирования изображений Qwen-Image-2.1: поддержка японских подсказок и создание прозрачных PNG

Китайская компания Alibaba выпустила 20 сентября 2026 года свою новую модель для генерации изображений — Qwen-Image-2.1. Эта версия стала первым открытым (open source) релизом серии Qwen-Image за последнее время. Модель доступна для бесплатного скачивания и может запускаться локально, например, через популярную платформу ComfyUI.

Основные характеристики Qwen-Image-2.1

  • Объём модели: 7 миллиардов параметров;
  • Тип доступа: открытая свободная модель;
  • Поддержка: генерация и редактирование изображений;
  • Особенность: создание прозрачных PNG изображений;
  • Работа с множественными референсами: возможность генерации на основе нескольких исходных изображений;
  • Поддержка японских подсказок (промптов): можно задавать запросы на японском языке;
  • Совместимость: используется в ComfyUI с соответствующими шаблонами.

В сравнении с более крупной моделью Qwen-Image-2512 (январь 2026) версия 2.1 является компактнее, но при этом превосходит по мощности закрытые модели, такие как Nano Banana 2.0 от Google и GPT-Image-1.5 от OpenAI.

Работа с Qwen-Image-2.1 в ComfyUI

Для запуска генерации изображений в ComfyUI необходимо выбрать шаблон «Qwen Image 2.1: Text to Image». При первом использовании система запросит скачивание трёх компонентов:

  • диффузионной модели qwen_image_2.1_int8_convrot.safetensors;
  • текстового энкодера qwen3vl_8b_int8_convrot.safetensors;
  • VAE модели qwen_image_2.1_vae_bf16.safetensors.

После загрузки и обновления интерфейса можно вводить описание изображения и запускать генерацию. Запросы можно задавать на японском языке.

Пример генерации

Один из примеров запроса был следующим: «Фотография. Горничная сидит на кондиционере на улице. Японская женщина. У неё красные волосы стрижки в стиле волка. Она читает газету, держа в рот леденец. Заголовок газеты: ‘GIGAZINE’ и ‘Image generation AI Qwen-Image-2.0 appears’.

Главной особенностью сгенерированного изображения стала высокая реалистичность человеческой фигуры. Однако некоторые детали, например, текст на газете и форма кондиционера, оказались искажены.

Изменение параметра seed позволило получить другую вариацию с корректным отображением текста. Несмотря на то, что качество уступает онлайн-сервисам вроде ChatGPT и Gemini, отсутствие ограничений по количеству попыток даёт возможность подобрать удачные изображения путём многократной генерации.

Производительность

На ПК с видеокартой Intel Arc Pro B70 Creator 32GB и процессором AMD Ryzen 5 7600X генерация изображения в разрешении 1024 x 1024 с 25 шагами заняла примерно 45 секунд для первого запуска и около 30 секунд для последующих.

Создание прозрачных PNG изображений

Qwen-Image-2.1 умеет создавать прозрачные изображения в формате PNG без сложных настроек, достаточно добавить в промпт слова «transparent PNG».

Например, для промпта «Transparent PNG. Полнотелая иллюстрация стилизованной горничной с короткими чёрными волосами и оранжевой заколкой в форме буквы ‘G’. Она стоит прямо и смотрит вперёд. Фон прозрачный.» была сгенерирована прозрачная картинка, которая при увеличении сохраняла альфа-канал и могла корректно отображаться в графических редакторах, таких как GIMP.

Функция редактирования изображений

Модель также поддерживает редактирование исходных изображений с помощью текстовых подсказок. Для этого используется шаблон «Qwen Image 2.1: Image Editing» в ComfyUI.

Примерно так это работает: задаётся исходное изображение и описание желаемого изменения. В одном из тестов было задано:

  • Сцена с презентацией продукта в большом зале;
  • На экране показывается первое изображение (из анонса Alibaba);
  • Презентатор — горничная из второго (прозрачного) изображения;
  • Горничная стоит на сцене и указывает на экран;
  • Добавлена речевая облачко с текстом «Amazing!».

Несмотря на общую адекватность результата, в изображении проявились проблемы: искажения структуры, некорректное преобразование текста на изогнутом экране, лишние руки. Для получения удачных результатов иногда необходимо много попыток и отбор наиболее удачных.
В локальном сообществе популярна техника использования улучшителей промптов, которые адаптируют текстовое описание под возможности ИИ через большие языковые модели (LLM). Это может улучшить итоговое качество изображения.

Правовой статус и лицензия

Лицензия Qwen-Image-2.1 запрещает коммерческое использование, однако по заявлению официального аккаунта Alibaba в социальной сети X (бывший Twitter), права на изображения, созданные с помощью модели, принадлежат пользователям.

«Outputs are not part of the licensed Materials. Users retain the rights to images and other content they generate using the model.»

Выводы

Qwen-Image-2.1 представляет собой мощный инструмент для генерации и редактирования изображений с открытым исходным кодом. Его преимущества включают поддержку японских запросов и возможность создавать прозрачные PNG изображения без сложных настроек. Несмотря на некоторые недостатки качества и необходимости подбора параметров, модель удобна для локального использования на компьютерах с современной видеокартой.

Её открытость и гибкость делают Qwen-Image-2.1 привлекательным решением для разработчиков, исследователей и энтузиастов, желающих экспериментировать с генерацией изображений без ограничений облачных сервисов.

Кроме того, интеграция с ComfyUI упрощает запуск и тестирование модели, а возможность применять промпт-улучшители и работать с несколькими референсами расширяет творческий потенциал использования.

Таким образом, Qwen-Image-2.1 занимает заметное место среди современных ИИ-инструментов для работы с генерированным изображением, особенно для пользователей, ориентированных на локальный запуск и экспериментирование с различными языковыми запросами.




Прокомментировать в Телеграм: https://t.me/n8nhow

Подписаться на канал обучения n8n: https://t.me/n8ncoaching

Советы, обучающие курсы, компьютерная грамотность
Обзор конфиденциальности

На этом сайте используются файлы cookie, что позволяет нам обеспечить наилучшее качество обслуживания пользователей. Информация о файлах cookie хранится в вашем браузере и выполняет такие функции, как распознавание вас при возвращении на наш сайт и помощь нашей команде в понимании того, какие разделы сайта вы считаете наиболее интересными и полезными.