Xiaomi MiMo: триллион параметров, из которых работает четыре процента

Пять релизов за четырнадцать месяцев — от рассуждающей модели на семь миллиардов параметров до разреженного флага на триллион. Веса выложены под MIT, работающая часть триллиона — 42 млрд параметров на токен, то есть около четырёх процентов от общего объёма.

Полтора года от текста к омнимодальности

MiMo — это не один чекпойнт, а зонтик для нескольких релизов. Под ним вышли: рассуждающая MiMo-7B в мае 2025-го, зрение MiMo-VL, аудио MiMo-Audio, модель для роботов и машин MiMo-Embodied, разреженные MoE поколения V2 и V2.5. Общего у них — имя и команда, а не архитектура.

Хронология выглядит так:

  • май 2025 — MiMo-7B, обучение с нуля на 25 трлн токенов ради рассуждений;
  • июнь 2025 — MiMo-VL-7B: картинки, видео, OCR, интерфейсы;
  • декабрь 2025 — MiMo-V2-Flash: 309 млрд параметров всего, 15 млрд активных;
  • апрель 2026 — V2.5 и V2.5-Pro, лицензия MIT;
  • июнь 2026 — UltraSpeed и скорость выше тысячи токенов в секунду.

Что принимает на вход

MiMo-V2.5 — нативная омнимодальность. Всего параметров 310 млрд, активных — 15 млрд, рядом работают визуальный энкодер на 729 млн и аудиоэнкодер на 261 млн. Вход — текст, картинки, видео и звук; выход — текст и вызовы инструментов. Отдельно идут MiMo-V2.5-ASR для распознавания речи под Apache 2.0 и семейство TTS: синтез, голос по описанию, клонирование по короткой записи.

Флагман: 384 эксперта, восемь на токен

MiMo-V2.5-Pro — разреженная смесь экспертов. Всего параметров 1.02 трлн, на каждый токен активируются 42 млрд. В модели семьдесят слоёв и 384 эксперта, для одного токена выбираются восемь. Контекст — до 1 048 576 токенов, веса открыты под MIT.

Как удешевили длинный контекст

Главный приём — ограниченное окно внимания. 60 слоёв из 70 смотрят только на 128 предыдущих токенов, и лишь 10 слоёв обрабатывают весь контекст. Чтобы дешёвое окно не портило качество, в модель встроен обучаемый «сток внимания»: голова может не расходовать вероятность на бесполезных соседей и «сбросить» её в пустоту.

Учителей много, ученица одна

Пост-тренировка построена на MOPD. Несколько моделей-специалистов — математика, код, терминал, поиск, безопасность — дают токенные подсказки одной ученице на её собственных траекториях, а не на чужих ответах. Параллельно работает R3: маршрутизация экспертов, записанная на инференсе, воспроизводится при обучении. Без этого обучение MoE расходится.

Тысяча токенов в секунду на одном узле

Конфигурация UltraSpeed ужимает веса экспертов в MXFP4, добавляет спекулятивное декодирование DFlash и «живучие» ядра TileRT. На одном узле из восьми GPU скорость превышает тысячу токенов в секунду. Триллион весов в четыре бита — это около 510 ГБ, и все эти гигабайты нужно где-то держать.

Открытые веса, но не открытый пайплайн

Xiaomi показала, что открытые веса больше не ограничены семимиллиардными моделями. Но стоит говорить точнее: «open-weight», а не «open source». Веса доступны, данные и полный пайплайн обучения — нет. Отдельный нюанс с длинным контекстом: миллион токенов в карточке не гарантирует одинаковую точность на всей дистанции. В тесте GraphWalks модель показала ненулевой результат на миллионе токенов, тогда как прошлое поколение резко проседало. Хостинг V2 компания отключила 30 июня 2026 года и попросила клиентов перейти на V2.5, но уже скачанные веса это не затрагивает.

Модель и карточка: mimo.xiaomi.com. Код и веса: github.com/XiaomiMiMo.

Полная версия: https://habr.com/ru/articles/1082686/