Mage-Flow — Эффективная базовая модель нативного разрешения для генерации и редактирования изображений (T2I-модель на 4B параметров от Microsoft Asia)

Mage-Flow — Эффективная базовая модель нативного разрешения для генерации и редактирования изображений (T2I-модель на 4B параметров от Microsoft Asia)

Mage-Flow — это компактная генеративная архитектура масштаба 4B (4 миллиарда параметров), созданная для эффективного синтеза изображений по тексту и их редактирования на основе инструкций. Вместо того чтобы бездумно наращивать объем до десятков миллиардов параметров, создатели Mage-Flow добились качества, сопоставимого с передовыми решениями (SOTA). Это стало возможным благодаря тщательному совместному проектированию токенизатора, базовой сети и системы в целом. В результате модель работает быстро, требует мало памяти и легко дообучается в условиях реалистичных вычислительных бюджетов.

В основе архитектуры лежат два взаимосвязанных компонента:

  • Mage-VAE — легкий высокоточный латентный токенизатор (одношаговое диффузионное кодирование/декодирование с KL-регуляризацией латентных якорей).
  • NR-MMDiT — общая мультимодальная диффузионная модель-трансформер нативного разрешения (4B), обученная методом сопоставления выпрямленных потоков (rectified flow matching) в латентном пространстве Mage-VAE.

В сочетании с упаковкой данных в нативном разрешении и инфраструктурой обучения на базе слитых (fused) ядер, эта архитектура легла в основу двух решений: Mage-Flow для генерации по тексту и Mage-Flow-Edit для редактирования по инструкциям. Обе версии представлены в базовом варианте (Base), с выравниванием (RL-aligned) и в виде 4-шаговой турбо-версии (Turbo).

✨ Ключевые особенности

  • Компактность и конкурентоспособность. Единое семейство моделей на 4B параметров не только не уступает, но порой и превосходит куда более тяжеловесные открытые системы (Qwen-Image 20B, Z-Image 6B, FLUX.2 32B, FireRed-Image-Edit 20B).
  • Эффективный токенизатор. Mage-VAE не уступает FLUX.2-VAE в точности реконструкции, потребляя при этом примерно в 12 раз меньше вычислительных ресурсов (MACs) на пиксель при кодировании и в 22 раза меньше — при декодировании. Тем самым VAE перестает быть «бутылочным горлышком» при работе с высоким разрешением.
  • Нативное разрешение. Один и тот же чекпойнт способен генерировать изображения размером от 512 до 2048 пикселей в любых пропорциях, включая экстремальный формат 4:1 (например, 512×2048 или 2048×512).
  • Системное ускорение. Упаковка в нативном разрешении (FlashAttention с переменной длиной + 2D RoPE для каждого семпла) и слитые ядра CUDA сократили время обучения на шаг с ~1,93 до ~0,78 секунды (ускорение в ~2,5 раза). Условные и безусловные ветви CFG теперь выполняются за один объединенный проход.
  • Полное семейство. Доступны варианты Base, RL-aligned и 4-шаговая модель Turbo — как для генерации, так и для редактирования.
  • Универсальное редактирование. Mage-Flow-Edit поддерживает семантическое изменение контента, трансформацию внешнего вида, реставрацию изображений и структурно-согласованные генерации в рамках единой модели, управляемой как текстом, так и картинкой-исходником. (См. галереи примеров в отчете).
  • Интерактивный отклик. При разрешении 1024² на одной видеокарте A100 время обработки составляет: 0,59 с/изображение для Mage-Flow-Turbo и 1,02 с/редактирование для Mage-Flow-Edit-Turbo. Пиковое потребление памяти — около 18–20 ГБ (самый низкий показатель среди сопоставимых систем).
Mage-Flow — Эффективная базовая модель нативного разрешения для генерации и редактирования изображений (T2I-модель на 4B параметров от Microsoft Asia)

Примеры из галлереи можете посмотреть на официальной странице модели https://huggingface.co/microsoft/Mage-Flow

Галереи:

  • Общие сцены
  • Портреты
  • Кулинария и натюрморты
  • Рендеринг английского текста
  • Рендеринг китайского текста
  • Редактирование по инструкциям — изменение внешности, контента, сцены/объекта, креативная обработка людей, низкоуровневые правки и реставрация (исходник → результат). (Первая панель открыта; нажмите на заголовок, чтобы развернуть остальные).
Mage-Flow — Эффективная базовая модель нативного разрешения для генерации и редактирования изображений (T2I-модель на 4B параметров от Microsoft Asia)

Возможности редактирования:

  • Различное редактирование I
  • Различное редактирование II
  • Локальное изменение контента и объектов
  • Трансформация сцены, объекта и ракурса
  • Изменение внешнего вида и художественный рендеринг
  • Креативная обработка людей
  • Низкоуровневое зрение и условная реконструкция
  • Двунаправленная деградация и реставрация

Обходит ли она Flux 2 Klein 4B?

На самом деле, Mage-Flow демонстрирует более высокую оценку возможностей (capability score: 49% против 48%) — она чуть точнее следует промпту, чем Klein, и справляется с этим за 4 шага вместо полного цикла сэмплирования. Однако изображения от Klein пользователи оценивают как более эстетичные, поэтому в общем зачете побеждает именно он (~51 у Klein против 47 у Mage-Flow). Вторая открытая 4B-модель на рынке, Bonsai Ternary 4B, дышит им в спину (~47).

Так что речь скорее не о том, что «Microsoft "уделала" FLUX», а о том, что каждая модель лидирует в своей нише: Mage-Flow — в скорости и точности следования промпту, а Klein — в эстетике кадра.

Извлечение объектов из изображения

1: Промпт: extract the coat (извлечь пальто) В результате получается классическое предметное фото вещи, которую вы хотите выделить.

Mage-Flow — Эффективная базовая модель нативного разрешения для генерации и редактирования изображений (T2I-модель на 4B параметров от Microsoft Asia)

2: Промпт: extract the woman. (извлечь женщину) С людьми это тоже работает; по умолчанию фон становится белым.

Mage-Flow — Эффективная базовая модель нативного разрешения для генерации и редактирования изображений (T2I-модель на 4B параметров от Microsoft Asia)

3: Промпт: extract the woman. make the background a green screen. (извлечь женщину. сделать фон хромакеем) Снова выделяем человека, но на этот раз меняем фон на другой — в данном случае на зеленый экран.

Mage-Flow — Эффективная базовая модель нативного разрешения для генерации и редактирования изображений (T2I-модель на 4B параметров от Microsoft Asia)

Карты глубины, нормалей и поз (Depth, normal, pose maps)

4: Промпт: create a depth map of the image. (создать карту глубины изображения) Аналогичный подход работает с картами нормалей и картами поз (см. следующие два примера).

Mage-Flow — Эффективная базовая модель нативного разрешения для генерации и редактирования изображений (T2I-модель на 4B параметров от Microsoft Asia)

4a: Промпт: create a normal map of the image. (создать карту нормалей изображения)

Mage-Flow — Эффективная базовая модель нативного разрешения для генерации и редактирования изображений (T2I-модель на 4B параметров от Microsoft Asia)

4b: Промпт: create a pose map of the image. (создать карту поз изображения) Это добавит скелетный каркас позы для всех людей в кадре.

Mage-Flow — Эффективная базовая модель нативного разрешения для генерации и редактирования изображений (T2I-модель на 4B параметров от Microsoft Asia)

Изменение деталей изображения

5: Промпт: change her hair to a short blonde hair. (сделать ей короткие светлые волосы)

Mage-Flow — Эффективная базовая модель нативного разрешения для генерации и редактирования изображений (T2I-модель на 4B параметров от Microsoft Asia)

5a: Промпт: change the background to a waterpark. change her clothes to a swimsuit. (поменять фон на аквапарк. переодеть её в купальник) Можно вносить сразу несколько изменений одним промптом.

Mage-Flow — Эффективная базовая модель нативного разрешения для генерации и редактирования изображений (T2I-модель на 4B параметров от Microsoft Asia)

6: Промпт: right side view. the woman is sitting on a bench on a busy street corner. she is waving at a car that is passing by her. remove the coat. she is wearing overalls and a yellow t-shirt. it is daytime. (вид справа. женщина сидит на скамейке на оживленном перекрестке. она машет проезжающей мимо машине. убрать пальто. на ней комбинезон и желтая футболка. день.) Для промпта можно использовать самые разные ракурсы. Иногда, правда, понимание модели, где «право», а где «лево», расходится с вашим, но этим грешат почти все ИИ.

Mage-Flow — Эффективная базовая модель нативного разрешения для генерации и редактирования изображений (T2I-модель на 4B параметров от Microsoft Asia)

Ссылки: Модели для версии ComfyUI (трансформер, текстовый энкодер CLIP и VAE) доступны по ссылке: https://huggingface.co/Comfy-Org/Mage-Flow

Если вам нужна модель CLIP без цензуры, вы найдете её здесь: https://huggingface.co/DreamFast/Qwen3-VL-4b-Heretic-ComfyUI

2
1
1