Погонял все современные маленькие модели (до 12B) на тему кодинга, чтобы вам не пришлось

Что могут такие малыши?

Приготовить драники из кожи (об этом дальше)
Приготовить драники из кожи (об этом дальше)

На самом деле, при наличии скиллов и документации они работают гораздо лучше, чем облачный чатгпт и клод год назад, когда я над ними ржал. Они могут...

Дописать по несколько строчек в полтора десятка функций:

Добавь во все сеттеры settingsstore проверки, как в setBaseUrl, чтобы исключить лишние сигналы. В другие файлы не лезь, билд не проверяй.

я

Генерировать стену бойлерплейт-кода:

Добавь в appcontoller недостающие компоненты для работы с QML: Q_PROPERTY, сигналы, геттеры, сеттеры. Все параметры берутся из и сохраняются в m_settings - посмотри на реализацию аналогичных функций. Константы с названиями уже заданы. Думай и отвечай на английском.

опять я

Ревьювить код. Архитектурных проблем они не найдут, но явные ошибки ловят:

Пробегись по всем QML-файлам проекта, поищи моменты, критически влияющие на производительность. Составь список с проблемами и предложениями по их решению. Думай и отвечай на английском.

снова я

Основная проблема таких моделей - существование deepseek v4 flash, работа которого обходится в копейки по сравнению со всеми остальными, и при этом для большинства задач его достаточно. Сейчас день работы с агентом с дипсиком обходится в 100-200 рублей - это 20-40 миллионов входящих плюс 400-800 тысяч исходящих токенов. Пока есть провайдеры с такими ценами и интернет, смысла в локальных моделях нет никакого.

Сами модели

Qwen3.5-9b - эталон. Ориентируется в проекте, корректно использует инструменты, скиллы, доки, подключённые по mcp. Идеален для проектов на Qt, т.к. из локальных только модели от qwen нормально ориентируются в современном qml и библиотеках qt.

Qwen3.5-4b - насколько быстрее, настолько же глупее. Смысла нет, если заводится модель на 9b. Возможно, он норм для умного автокомплита, но я им не пользуюсь.

Gemma4-e4b, Gemma4-12b - этих нужно как котят носом тыкать в инструменты. Постоянно заваливают уточняющими вопросами даже на простых задачах. Реально, как джун, за которым проще самому сделать, чем объяснять всё. На ревью qt-проекта не видят половину проблем, т.е. годятся только для широко распространённых языков. Не совсем понял, за что их хвалят в кодовых задачах.

На этом мэйнстрим закончился - более старые модели слишком сильно отстают от современных. Дальше экзотика - хайповые модели, которые периодически влетают в топ hugging face.

Mellum2-12B-A2.5B-Thinking - модель, дообученная самими JetBrains. Работает также хреново, как и все остальные в категории экзотики (зато быстро!). Через раз сваливается в бесконечный цикл, код не понимает. На самом деле, хочется что-нибудь похожее, только от qwen. Специализированная нормально обученная модель на 12-15B с активными 2-5B параметров, была бы идеальным локальным джуном на побегушках.

Ternary Bonsai 27B - это Qwen3.6-27B, ужатая до 7 гигабайт тернарным битом. Модель для того, чтобы сказать "я запустил 27B на своих 8 Гб". Медленная, жрёт море памяти на kv-кэш, по уму на уровне Qwen3.5-4b.

Gemma4-12B v2 — Coding + Agentic Edition - затюнингованная под агентские кодовые задачи gemma-4-12b. Поставляется без mtp, поэтому заметно медленнее оригинала. В отличие от базовой модели активно использует инструменты. Но есть нюансы. В первый прогон зависла в цикле чтение-думание. В следующие начинала редактировать код, когда я просил просто посмотреть. Причём, не помогают даже уточнения и включение конкретной роли ревьювера. Только полный read-only режим, на котором часто зависает в циклах.

Ему вообще похер, что там мясной мешок от него хочет.
Ему вообще похер, что там мясной мешок от него хочет.

Ornith-1.0 - дообученные модели qwen 3.5. Первое отличие в поведении от простого qwen 3.5 - любит редактировать код, когда его об этом не просят. Но в отличие от Gemma-4-12B-Coder, если уточнять запрос, делает всё правильно. Плюс, при temp = 0.6 иногда сваливается в бесконечный цикл во время кодинга, надо ставить 1.0. Плюс, он слишком много думает. Там, где обычный qwen уже вовсю пишет код, ornith ещё только разогревается. Из-за этого он часто не заканчивает задачи по редактированию кода - не хватает ни 32, ни 64 тысячи токенов контекста.

Qwen3.6-14B-A3B-FableVibes - вот это самый интересный экзмепляр со сложной судьбой. Изначально это была Qwen3.6-35B-A3B. Её прогнали через расцензуратор, чтобы снять все ограничения на контент. А потом вырезали "ненужных для кодинга" экспертов. Получившегося монстра франкенштейна подают как гения уровня клода. Но модель представляет чисто научный интерес - код генерирует странный, постоянно сваливается в цикл, русского не знает. В целом впечатление, как от городского сумасшедшего. Про драники - это от него. А так он пишет код (генерировал такое, пока не закончился контекст):

Погонял все современные маленькие модели (до 12B) на тему кодинга, чтобы вам не пришлось
6
3
1