Тестирование ИИ для генерации и редактирования изображений Qwen-Image-2.1: поддержка японских подсказок и создание прозрачных PNG

Китайская компания Alibaba 20 сентября 2026 года выпустила новую версию своего ИИ для генерации изображений — Qwen-Image-2.1. Эта модель является бесплатной и открытой для скачивания. Благодаря этому пользователи могут запускать её локально на своих компьютерах, используя различные среды выполнения, например ComfyUI.

Ключевые особенности Qwen-Image-2.1:

  • Поддержка японских текстовых подсказок.
  • Возможность создания прозрачных PNG-изображений.
  • Генерация изображений на основе нескольких ссылочных изображений.

Обзор серии Qwen-Image

Серия Qwen-Image начиналась с открытых моделей, однако Qwen-Image-2.0 (февраль 2026) и Qwen-Image-3.0 (июль 2026) были закрытыми. Возвращение к открытому формату произошло с релизом Qwen-Image-2.1, что обеспечивает доступ к модели для всех желающих и возможность локального запуска бесплатно.

В опубликованной Alibaba сравнительной диаграмме различных ИИ для генерации изображений Qwen-Image-2.1 имеет около 7 миллиардов параметров. Она компактнее, чем модель Qwen-Image-2512, вышедшая в январе 2026, но мощнее по сравнению с некоторыми закрытыми аналогами — например, Google Nano Banana 2.0 и OpenAI GPT-Image-1.5.

Тестирование Qwen-Image-2.1 в ComfyUI

Для запуска модели требуется загрузить несколько компонентов:

  • Диффузионная модель qwen_image_2.1_int8_convrot.safetensors
  • Текстовый энкодер qwen3vl_8b_int8_convrot.safetensors
  • VAE qwen_image_2.1_vae_bf16.safetensors

После установки и перезапуска среды ComfyUI можно вводить описание для генерации изображения. Программа поддерживает ввод подсказок на японском языке.

В тесте была сформирована фотография по подсказке: «Фотография. Горничная сидит на наружном блоке кондиционера. Японка с красной стрижкой в стиле волка. Читает газету, держа в рту леденец. Заголовок газеты содержит слова ‘GIGAZINE’ и ‘Image generation AI Qwen-Image-2.0 appears’.» Особое внимание привлекает фотореалистичность человеческой фигуры, несмотря на некоторую искаженность кондиционера и некорректное отображение текста газеты.

Путём изменения значения «seed» удалось получить изображение, где текст газеты отображается правильно. Хотя качество уступает онлайн-сервисам вроде ChatGPT или Gemini, отсутствие ограничений по числу генераций позволяет экспериментировать и получать хорошие результаты.

Производительность на типичной конфигурации ПК

Использовался ПК с видеокартой Intel Arc Pro B70 Creator 32GB и процессором AMD Ryzen 5 7600X. При разрешении 1024 х 1024 пикселей и 25 шагах генерация первого изображения заняла примерно 45 секунд, дальнейшие — около 30 секунд.

Создание прозрачных PNG

Одна из интересных функций Qwen-Image-2.1 — возможность создавать изображения с прозрачным фоном без сложных настроек. Для этого достаточно добавить в текст подсказки слова «transparent PNG».

В качестве примера было сгенерировано стилизованное изображение горничной в полный рост с короткими чёрными волосами и оранжевой заколкой в форме буквы «G». Фон полностью прозрачный, что подтверждается проверкой в графическом редакторе GIMP.

Редактирование изображений с помощью Qwen-Image-2.1

Редактирование основано на подаче исходного изображения и текста-подсказки. В одном из тестов была создана сцена, где горничная с прозрачного PNG стояла на сцене перед большим экраном, отображающим другое изображение. Горничная указывала на экран и говорила: «Amazing!».

В результате получилась в целом правильная композиция, однако имелись некоторые неточности, например, отсутствие искажения текстового облака при кривизне экрана, искажения элементов изображения и лишние конечности у персонажа.

Вероятность успешного результата с первого раза была невысока, что потребовало многократной генерации и выбора подходящих вариантов. В сообществе локальной генерации изображений популярна техника prompt enhancer — улучшение подсказок с помощью больших языковых моделей, которые подготавливают подсказку в оптимальной форме для ИИ. Такая практика может повысить качество результатов и для Qwen-Image-2.1.

Правовой аспект использования

Лицензия Qwen-Image-2.1 содержит пункт, запрещающий коммерческое использование модели, но в официальном аккаунте Alibaba в X (Twitter) уточняется, что права на изображения, созданные с помощью ИИ, принадлежат пользователю.

«Выходные изображения не относятся к лицензионным материалам. Пользователи сохраняют права на созданный с помощью модели контент.» — Qwen (@Alibaba_Qwen), 21 сентября 2026

Выводы

Qwen-Image-2.1 представляет собой сбалансированное решение в области генерации и редактирования изображений с открытым доступом. Благодаря компактному размеру модели и поддержке японских текстовых подсказок она может найти широкое применение у разработчиков и энтузиастов, заинтересованных в локальной работе с ИИ и создании контента без ограничений на число генераций.

Возможность создания прозрачных PNG изначально упрощает подготовку иллюстраций для дизайна и рекламы, а функция редактирования изображений расширяет спектр творческих задач. Однако для достижения высокого качества и точности по-прежнему требуется работа с подсказками и подбор параметров генерации. Использование дополнительных инструментов, например, prompt enhancer, обещает улучшить результаты.

Доступность модели для локальной работы без ограничений создает благоприятную основу для дальнейшего развития и адаптации Qwen-Image-2.1 в различных сферах визуального контента.




Прокомментировать в Телеграм: https://t.me/n8nhow

Подписаться на канал обучения n8n: https://t.me/n8ncoaching

Советы, обучающие курсы, компьютерная грамотность
Обзор конфиденциальности

На этом сайте используются файлы cookie, что позволяет нам обеспечить наилучшее качество обслуживания пользователей. Информация о файлах cookie хранится в вашем браузере и выполняет такие функции, как распознавание вас при возвращении на наш сайт и помощь нашей команде в понимании того, какие разделы сайта вы считаете наиболее интересными и полезными.