Qwen Image 2.1 в ComfyUI: компактная модель, которая умеет всё
Приветствую всех! Хоть и запоздав, но хочу сделать пост про новую модель Qwen Image 2.1, т.к это очень крутая и качественная модель, которая при своих 7B параметрах умудряется конкурировать с топовыми моделями.
Почему я написал, что она умеет всё? Она в прямом смысле умеет всё. Эта модель прекрасно справляется с разного рода задачами без каких-то сложных махинаций. Она объединяет в себе и t2i, и i2i, и edit (умный фотошоп), а так же умеет генерировать картинки с прозрачным фоном (да-да, можете генерировать сразу готовые стикеры), и всё это нативно.
В этом посте я расскажу про то как скачать и запустить её в Comfy UI.
Для тех кто не знаком с Comfy UI, но очень хочет познакомиться предлагаю ознакомиться с моим прошлым постом:
Глава 1. Что умеет Qwen Image 2.1?
1.1) Генерация изображений (Text-to-Image)
Qwen Image 2.1 умеет генерировать картинки по текстовому описанию как и любая диффузионная модель. Однако её нативное разрешение это 2К (2048х2048), у любой SDXL модели это 1024х1024. Такое разрешение в 2К дает возможность генерировать сразу детализированную картинку.
Далее. Одна из самых частых проблем диффузионных моделей это текст на картинках. В SDXL буквы часто превращаются в кашу (и адекватно работает только с английским), в Flux 1.D лучше, но всё равно не идеально (всё так же только английский), в Flux 2 kleine уже хорошо, а Qwen Image 2.1 делает это очень хорошо и даже длинные тексты на русском не превращаются в кашу. Т.е делать афиши, вывески, мемы и т.д вполне комфортно.
1.2) Редактирование изображений (Image Edit)
Вот тут начинается самое интересное. Qwen Image 2.1 это не просто генератор, а полноценный нативный редактор. И работает он через референсные изображения, причем загрузить можно до 10 референсов. Т.е модели можно писать что откуда взять и она с этим разберется. Примеры использования: поменять фон, поменять объект, поменять позу, добавить объект, убрать объект, убрать фон, перенести стиль и т.д. И можно это делать разными способами: прописав в промпте, обвести на референсе каким-то цветом объект и обращаться в промпте по цвету, через маски.
И в отличии от FLUX 2 kleine с которой адекватно редактировать без масок не получится... У Qwen Image 2.1 это получается прекрасно т.к если ты просишь поменять только цвет волос, то она сделает именно это, а вся остальная часть останется прежней (И это просто через промпт). Т.е мороки ноль, ничего настраивать не нужно.
1.3) Нативная прозрачность (RGBA)
Ну как я и писал ранее... Эта модель может спокойно нативно генерировать стики. Т.е другими словами Qwen Image 2.1 умеет генерировать картинки с прозрачным фоном (формат RGBA, где альфа-канал отвечает за прозрачность).
Глава 2. Установка в ComfyUI
2.1) Где брать файлы?
Идем на Hugging Face:
И качаем саму модель diffusion_models: qwen_image_2.1_bf16.safetensors или же более компактную qwen_image_2.1_int8_convrot.safetensors
text_encoder: qwen3vl_8b_bf16.safetensors или qwen3vl_8b_int8_convrot.safetensors или qwen3vl_8b_w4a8.safetensors.
VAE: qwen_image_2.1_vae_bf16.safetensors
И кидаем это всё в соответствующие одноименные папки.
2.4) Workflow
Их можно найти либо в самом Comfy UI, либо сделать самому.
Здесь я вам оставлю все нужные воркфлоу, а именно свой простенький t2i с апскейлом и воркфлоу с control net, edit взят из самого Comfy UI.
Воркфлоу кидаем в "Ваш диск":\"папка с Comfy UI"\user\default\workflows
В моем воркфлоу с t2i указаны комбинации sampler + scheduler которые выдают стабильные генерации. Их получилось не мало, хотя по итогу использоваться будет лишь парочка).
Глава 3. Генерация
Я использую модель и CLIP в int8 версии. Напоминаю, что сборка у меня RTX 4070 + DDR5 32gb. И при генерации VRAM она съедает 10.6 гб + 18 гб ОЗУ (Используется(сжатая)) и выделенной 37гб.
3.1) T2I
Ставлю euler a + simple, 25 шагов и разрешение 769 на 1120. Генерация заняла 24 секунды.
Пишу такой промпт: A fierce female warrior with long flowing crimson hair, striking red eyes, wearing ornate black and silver armor with intricate gothic designs, glowing red gemstones embedded in the metal, detailed leather straps and metallic pauldrons, high-quality fantasy art, cinematic lighting, soft natural sunlight, sharp focus on face and armor, realistic skin texture, subtle freckles, delicate facial features, art by Artgerm, Greg Rutkowski, and Ilya Kuvshinov, digital painting, hyper-detailed, 8k resolution, fantasy style, dramatic atmosphere
И шаблонный негатив: Smeared face. fuzzy picture. bad anatomy, ugly, badly drawn, broken arms, mutated, mutilated, mutation, deformation, 6 fingers, 7 fingers, 4 fingers, extra fingers, extra arm, extra leg, extra limbs. bad eyes. Poor picture quality. Blurred picture. Smeared eyes. Not clear eyes. 1 leg. 3 legs. Defective legs. Defective face. Poor face quality.
Получаем такие результаты (без апскейла):
Так же сделаю генерацию в 50 шагов:
Теперь напишу просто: Молодая девушка держит в руках табличку с надписью "Пример текста".
3.2) Edit
В этой части мы немного поиграемся с самой первой нашей сгенерированной картинкой. Используем воркфлоу для edit и просто в промпте пишем инструкцию. Далее я прикреплю просто результаты:
Здесь представлены по порядку: исходник, просьба сменить цвет волос, просьба показать её в полный рост, просьба сделать легкую улыбку и наконец картинка без фона. Причем обратите внимание как она хорошо в конце её вырезала.
Естественно можно попросить сделать и другие вещи, но тут я просто хотел показать как хорошо она сохраняет то, что было на исходнике.
3.3) Control Net
На самом деле модель может перенимать позу с референса, но делает это не стабильно (по моим тестам). Так что для большей точности используем Control Net. Открываем мой воркфлоу с Control Net, нам надо раздобыть модель Control Net. Качаем её отсюда:
И кидаем в одноименную папку.
По поводу openpose. Я заметил, что в отличии от SDXL моделей она хуже работает со скелетами без трекинга лица. Т.е если использовать скелет без трекинга головы, то она может её сгенерировать как угодно в отличии от SDXL моделей. А вот если берем скелет с трекингом лица, то всё прекрасно. Но если у вас таких нет, то просто пропишите в промпте поворот головы или направление взгляда и всё.
Сборник поз с разметкой лица есть в одной из папок с позами, которые я прикреплял в одном из своих постов. Дублирую ссылку:
Описывать наверно работу воркфлоу мне не стоит т.к вы сами увидите новые ноды в отличии от t2i и легко разберетесь куда что вставлять. Для нод вам надо будет скачать плагин (Comfy UI сам предложит скачать вам недостающее).
Заключение
Пожалуй на этом закончу этот пост. Я думаю, что смог рассказать тот минимум который необходим чтобы использовать все функции модели и надеюсь, что у вас не возникнет проблем, а если и возникнут, то приглашаю в комментарии под постом, я постараюсь ответить на любые вопросы.
Как итог, модель получилась очень интересной и многофункциональной, а главное, что все функции работают довольно хорошо. Во всяком случае лично меня она заинтересовала куда больше, чем FLUX 2 Kleine на момент выхода. В посте были показаны сырые картинки которые взяты сразу после обычной генерации, причем почти все сгенерированы в 25 шагов. Если использовать апскейл и inpaint через маски, то можно достичь очень качественных результатов.
На этом конец. Благодарю всех за внимание!