Mage-Flow — Эффективная базовая модель нативного разрешения для генерации и редактирования изображений (T2I-модель на 4B параметров от Microsoft Asia)
Mage-Flow — это компактная генеративная архитектура масштаба 4B (4 миллиарда параметров), созданная для эффективного синтеза изображений по тексту и их редактирования на основе инструкций. Вместо того чтобы бездумно наращивать объем до десятков миллиардов параметров, создатели Mage-Flow добились качества, сопоставимого с передовыми решениями (SOTA). Это стало возможным благодаря тщательному совместному проектированию токенизатора, базовой сети и системы в целом. В результате модель работает быстро, требует мало памяти и легко дообучается в условиях реалистичных вычислительных бюджетов.
В основе архитектуры лежат два взаимосвязанных компонента:
- Mage-VAE — легкий высокоточный латентный токенизатор (одношаговое диффузионное кодирование/декодирование с KL-регуляризацией латентных якорей).
- NR-MMDiT — общая мультимодальная диффузионная модель-трансформер нативного разрешения (4B), обученная методом сопоставления выпрямленных потоков (rectified flow matching) в латентном пространстве Mage-VAE.
В сочетании с упаковкой данных в нативном разрешении и инфраструктурой обучения на базе слитых (fused) ядер, эта архитектура легла в основу двух решений: Mage-Flow для генерации по тексту и Mage-Flow-Edit для редактирования по инструкциям. Обе версии представлены в базовом варианте (Base), с выравниванием (RL-aligned) и в виде 4-шаговой турбо-версии (Turbo).
✨ Ключевые особенности
- Компактность и конкурентоспособность. Единое семейство моделей на 4B параметров не только не уступает, но порой и превосходит куда более тяжеловесные открытые системы (Qwen-Image 20B, Z-Image 6B, FLUX.2 32B, FireRed-Image-Edit 20B).
- Эффективный токенизатор. Mage-VAE не уступает FLUX.2-VAE в точности реконструкции, потребляя при этом примерно в 12 раз меньше вычислительных ресурсов (MACs) на пиксель при кодировании и в 22 раза меньше — при декодировании. Тем самым VAE перестает быть «бутылочным горлышком» при работе с высоким разрешением.
- Нативное разрешение. Один и тот же чекпойнт способен генерировать изображения размером от 512 до 2048 пикселей в любых пропорциях, включая экстремальный формат 4:1 (например, 512×2048 или 2048×512).
- Системное ускорение. Упаковка в нативном разрешении (FlashAttention с переменной длиной + 2D RoPE для каждого семпла) и слитые ядра CUDA сократили время обучения на шаг с ~1,93 до ~0,78 секунды (ускорение в ~2,5 раза). Условные и безусловные ветви CFG теперь выполняются за один объединенный проход.
- Полное семейство. Доступны варианты Base, RL-aligned и 4-шаговая модель Turbo — как для генерации, так и для редактирования.
- Универсальное редактирование. Mage-Flow-Edit поддерживает семантическое изменение контента, трансформацию внешнего вида, реставрацию изображений и структурно-согласованные генерации в рамках единой модели, управляемой как текстом, так и картинкой-исходником. (См. галереи примеров в отчете).
- Интерактивный отклик. При разрешении 1024² на одной видеокарте A100 время обработки составляет: 0,59 с/изображение для Mage-Flow-Turbo и 1,02 с/редактирование для Mage-Flow-Edit-Turbo. Пиковое потребление памяти — около 18–20 ГБ (самый низкий показатель среди сопоставимых систем).
Примеры из галлереи можете посмотреть на официальной странице модели https://huggingface.co/microsoft/Mage-Flow
Галереи:
- Общие сцены
- Портреты
- Кулинария и натюрморты
- Рендеринг английского текста
- Рендеринг китайского текста
- Редактирование по инструкциям — изменение внешности, контента, сцены/объекта, креативная обработка людей, низкоуровневые правки и реставрация (исходник → результат). (Первая панель открыта; нажмите на заголовок, чтобы развернуть остальные).
Возможности редактирования:
- Различное редактирование I
- Различное редактирование II
- Локальное изменение контента и объектов
- Трансформация сцены, объекта и ракурса
- Изменение внешнего вида и художественный рендеринг
- Креативная обработка людей
- Низкоуровневое зрение и условная реконструкция
- Двунаправленная деградация и реставрация
Обходит ли она Flux 2 Klein 4B?
На самом деле, Mage-Flow демонстрирует более высокую оценку возможностей (capability score: 49% против 48%) — она чуть точнее следует промпту, чем Klein, и справляется с этим за 4 шага вместо полного цикла сэмплирования. Однако изображения от Klein пользователи оценивают как более эстетичные, поэтому в общем зачете побеждает именно он (~51 у Klein против 47 у Mage-Flow). Вторая открытая 4B-модель на рынке, Bonsai Ternary 4B, дышит им в спину (~47).
Так что речь скорее не о том, что «Microsoft "уделала" FLUX», а о том, что каждая модель лидирует в своей нише: Mage-Flow — в скорости и точности следования промпту, а Klein — в эстетике кадра.
Извлечение объектов из изображения
1: Промпт: extract the coat (извлечь пальто) В результате получается классическое предметное фото вещи, которую вы хотите выделить.
2: Промпт: extract the woman. (извлечь женщину) С людьми это тоже работает; по умолчанию фон становится белым.
3: Промпт: extract the woman. make the background a green screen. (извлечь женщину. сделать фон хромакеем) Снова выделяем человека, но на этот раз меняем фон на другой — в данном случае на зеленый экран.
Карты глубины, нормалей и поз (Depth, normal, pose maps)
4: Промпт: create a depth map of the image. (создать карту глубины изображения) Аналогичный подход работает с картами нормалей и картами поз (см. следующие два примера).
4a: Промпт: create a normal map of the image. (создать карту нормалей изображения)
4b: Промпт: create a pose map of the image. (создать карту поз изображения) Это добавит скелетный каркас позы для всех людей в кадре.
Изменение деталей изображения
5: Промпт: change her hair to a short blonde hair. (сделать ей короткие светлые волосы)
5a: Промпт: change the background to a waterpark. change her clothes to a swimsuit. (поменять фон на аквапарк. переодеть её в купальник) Можно вносить сразу несколько изменений одним промптом.
6: Промпт: right side view. the woman is sitting on a bench on a busy street corner. she is waving at a car that is passing by her. remove the coat. she is wearing overalls and a yellow t-shirt. it is daytime. (вид справа. женщина сидит на скамейке на оживленном перекрестке. она машет проезжающей мимо машине. убрать пальто. на ней комбинезон и желтая футболка. день.) Для промпта можно использовать самые разные ракурсы. Иногда, правда, понимание модели, где «право», а где «лево», расходится с вашим, но этим грешат почти все ИИ.
Ссылки: Модели для версии ComfyUI (трансформер, текстовый энкодер CLIP и VAE) доступны по ссылке: https://huggingface.co/Comfy-Org/Mage-Flow
Если вам нужна модель CLIP без цензуры, вы найдете её здесь: https://huggingface.co/DreamFast/Qwen3-VL-4b-Heretic-ComfyUI