Модель GLM-5.3-Flash, которая работает на уровне лидеров в разы дешевле
26 августа китайский гигант Z.ai (Zhipu AI) представил GLM-5.3-Flash с открытыми весами под свободной лицензией MIT.
Источник — docs.z.ai.
⚙ 320B параметров, Linear Attention и сжатие KV-кэша
1. Архитектура Mixture-of-Experts (MoE)
Общий вес нейросети составляет 320B. Однако при обработке каждого отдельного токена активируется лишь 18B. Это позволяет модели сохранять глубину знаний огромной системы, выдавая скорость генерации компактных легковесных сетей.
2. Гибридный механизм внимания
Впервые в открытой фронтирной модели инженеры объединили:
- Linear Attention: Быстрое линейное внимание для обработки локальных контекстов;
- Sparse Attention: Разреженное внимание с легковесным индексатором для работы с глобальным окном в 1 000 000 токенов.
Использование технологий IndexPool (пулинг, объединяющий 4 вектора в 1) и архитектурных гиперсвязей mHC снизило общую вычислительную нагрузку блока внимания в 3,01 раза, а потребление видеопамяти под KV-кэш — в рекордные 4,44 раза.
3. Нативная мультимодальность и мышление
Модель оперирует контекстом в ~1M токенов и способна генерировать непрерывный ответ объемом до 131 000 токенов. Архитектура понимает видеопотоки, анализирует сложные PDF-схемы и скриншоты интерфейсов, прорабатывая логику через скрытые цепочки рассуждений.
🥊 $0.075 за 1M токенов и лицензия MIT
В тестах реального написания кода и автономного взаимодействия с окружением GLM-5.3-Flash совершила заметный рывок по сравнению с предшественниками.
- Программирование и решение задач: В тесте DeepSWE v1.1 модель набрала 63,4%, а в бенчмарке автоматизации AutomationBench — 48,8%.
- Работа в связке с Claude Code: В тесте Z.ai Code Bench v1.0 новинка набрала 29 баллов, вплотную приблизившись к флагманской Claude Opus 4.8 (29,5) и обогнав базовую GPT-5.6 Sol.
Экономика и открытый исходный код
Z.ai установила агрессивный ценник на коммерческий API:
- $0.075 за 1 миллион входных токенов;
- $0.25 за 1 миллион выходных токенов.
Это почти в 10 раз дешевле аналогичных решений закрытых западных лабораторий.
Кроме того, базовые веса и Instruct-версии опубликованы на Hugging Face под свободной лицензией MIT, позволяя бесплатно разворачивать модель локально, создавать квантованные версии и использовать архитектуру в коммерческих продуктах без роялти.