Погонял все современные маленькие модели (до 12B) на тему кодинга, чтобы вам не пришлось
Что могут такие малыши?
На самом деле, при наличии скиллов и документации они работают гораздо лучше, чем облачный чатгпт и клод год назад, когда я над ними ржал. Они могут...
Дописать по несколько строчек в полтора десятка функций:
Добавь во все сеттеры settingsstore проверки, как в setBaseUrl, чтобы исключить лишние сигналы. В другие файлы не лезь, билд не проверяй.
Генерировать стену бойлерплейт-кода:
Добавь в appcontoller недостающие компоненты для работы с QML: Q_PROPERTY, сигналы, геттеры, сеттеры. Все параметры берутся из и сохраняются в m_settings - посмотри на реализацию аналогичных функций. Константы с названиями уже заданы. Думай и отвечай на английском.
Ревьювить код. Архитектурных проблем они не найдут, но явные ошибки ловят:
Пробегись по всем QML-файлам проекта, поищи моменты, критически влияющие на производительность. Составь список с проблемами и предложениями по их решению. Думай и отвечай на английском.
Основная проблема таких моделей - существование deepseek v4 flash, работа которого обходится в копейки по сравнению со всеми остальными, и при этом для большинства задач его достаточно. Сейчас день работы с агентом с дипсиком обходится в 100-200 рублей - это 20-40 миллионов входящих плюс 400-800 тысяч исходящих токенов. Пока есть провайдеры с такими ценами и интернет, смысла в локальных моделях нет никакого.
Сами модели
Qwen3.5-9b - эталон. Ориентируется в проекте, корректно использует инструменты, скиллы, доки, подключённые по mcp. Идеален для проектов на Qt, т.к. из локальных только модели от qwen нормально ориентируются в современном qml и библиотеках qt.
Qwen3.5-4b - насколько быстрее, настолько же глупее. Смысла нет, если заводится модель на 9b. Возможно, он норм для умного автокомплита, но я им не пользуюсь.
Gemma4-e4b, Gemma4-12b - этих нужно как котят носом тыкать в инструменты. Постоянно заваливают уточняющими вопросами даже на простых задачах. Реально, как джун, за которым проще самому сделать, чем объяснять всё. На ревью qt-проекта не видят половину проблем, т.е. годятся только для широко распространённых языков. Не совсем понял, за что их хвалят в кодовых задачах.
На этом мэйнстрим закончился - более старые модели слишком сильно отстают от современных. Дальше экзотика - хайповые модели, которые периодически влетают в топ hugging face.
Mellum2-12B-A2.5B-Thinking - модель, дообученная самими JetBrains. Работает также хреново, как и все остальные в категории экзотики (зато быстро!). Через раз сваливается в бесконечный цикл, код не понимает. На самом деле, хочется что-нибудь похожее, только от qwen. Специализированная нормально обученная модель на 12-15B с активными 2-5B параметров, была бы идеальным локальным джуном на побегушках.
Ternary Bonsai 27B - это Qwen3.6-27B, ужатая до 7 гигабайт тернарным битом. Модель для того, чтобы сказать "я запустил 27B на своих 8 Гб". Медленная, жрёт море памяти на kv-кэш, по уму на уровне Qwen3.5-4b.
Gemma4-12B v2 — Coding + Agentic Edition - затюнингованная под агентские кодовые задачи gemma-4-12b. Поставляется без mtp, поэтому заметно медленнее оригинала. В отличие от базовой модели активно использует инструменты. Но есть нюансы. В первый прогон зависла в цикле чтение-думание. В следующие начинала редактировать код, когда я просил просто посмотреть. Причём, не помогают даже уточнения и включение конкретной роли ревьювера. Только полный read-only режим, на котором часто зависает в циклах.
Ornith-1.0 - дообученные модели qwen 3.5. Первое отличие в поведении от простого qwen 3.5 - любит редактировать код, когда его об этом не просят. Но в отличие от Gemma-4-12B-Coder, если уточнять запрос, делает всё правильно. Плюс, при temp = 0.6 иногда сваливается в бесконечный цикл во время кодинга, надо ставить 1.0. Плюс, он слишком много думает. Там, где обычный qwen уже вовсю пишет код, ornith ещё только разогревается. Из-за этого он часто не заканчивает задачи по редактированию кода - не хватает ни 32, ни 64 тысячи токенов контекста.
Qwen3.6-14B-A3B-FableVibes - вот это самый интересный экзмепляр со сложной судьбой. Изначально это была Qwen3.6-35B-A3B. Её прогнали через расцензуратор, чтобы снять все ограничения на контент. А потом вырезали "ненужных для кодинга" экспертов. Получившегося монстра франкенштейна подают как гения уровня клода. Но модель представляет чисто научный интерес - код генерирует странный, постоянно сваливается в цикл, русского не знает. В целом впечатление, как от городского сумасшедшего. Про драники - это от него. А так он пишет код (генерировал такое, пока не закончился контекст):