Deckard

+76 300
с 2019

Любитель steam deck, хейтер десктопного линукса вообще, и steam machine в частности. Бинарная персона. Вайтишнег примерно с 2011 года. Щитпостер.

108 подписчиков
27 подписок

Далее, месяцев через 5-6 буду дособирать, меняя видюхуА ты самонадеянный.)))

сперва пяткой в грудь бил что не запустишьГде? Я тебе прямую цитату привёл из первого же сообщения, где говорю что запустить можно, но будет медленно.

Погоди изначально твой тейк был - не запустить эту модель на 16gbЯ смотрю чукча не читатель, чукча писатель?
Ну давай я тебе прямую цитату из первого моего ответа в этой ветке дам:
не, ты то сможешь с cpu оффлоадом и на небольшом контексте запустить, но скорость будет прям не очень.То есть я НЕ говорил, что её нельзя запустить. Я говорил, что "скорость будет прям не очень", что чистая правда, и что подтверждается твоими видосиками. Запустить то можно хоть вообще взяв распберри пай, флешку, подрубившись к интернету, и скачивая и обсчитывая по одному коэффиценту из интернета, и получить один токен в месяц. Технического запрета нет, практического смысла-тоже, разве что для фана.
Но когда я вижу, что кто то советует 27b модель раскатить на 16гиговую карту, и использовать с гермесом, я сразу понимаю: человек нихренашеньки полезного не делает с ней. Потому что вот этот тейк:
скорость работы вообще здесь побоку агент может круглые сутки работать.И в целом подход "лишь бы запустилось а потом пусть себе ворочается"-он бредовый.
Такого рода модели не настолько умные чтобы даже с гермесом достаточную степень, гм, "самостоятельности" иметь, чтобы им просто вывалить список задач, и ждать пока оно само там что то накашеварит. Тебе всё равно надо будет её корректировать по ходу выполнения чего угодно сложнее условного сбора десяти прогнозов погоды с разных сайтов, и вываливания тебе всего этого одной табличкой.
Плюс если задача мало мальски комплексная-30 тысяч токенов контекста которые мы в обоих видосах что ты скинул можем видеть это тупо ничто. А чтобы его увеличить придётся ещё больше слоёв выгрузить на cpu, а значит даже 7 токенов на старте и 4 токена к 30той тысяче-уже завышенные цифры, и в реальности всё будет ещё медленнее. А этот квен ещё и расчитан на долгие цепочки рассуждений(у меня он на простом запросе все 15 тысяч токенов сожрал на одни рассуждения). И в конце концов мы придём к ситуации, что даже с нашими низкими ценами на электричество тупо за него больше заплатишь, чем за те же токены где нибудь на стороне, где оно и генериться могло бы просто несопоставимо быстрее.

А это я ещё промпт процессинг не трогал, а он при агрессивной выгрузке слоёв на cpu тоже, знаете ли, не самый быстрый, а для агентов это тоже вполне себе бутылочное горлышко.

Короче: бред не неси, нет никакого смысла 27b dense модель в q4 кванте на одной 16гиговой видеокарте гонять. Скорее всего более менее скоро выйдет новая версия 35b a3b moe-там ещё хоть как то получится, хотя бы токенов 20-30(а с mtp может быть даже 40) в секунду получишь на пустом контексте, и хотя бы тысяч 70-100 токенов контекста выставить получится более-менее комфортно, это ещё хоть в какие то рамки с горем пополам лезет(хотя и тоже безумно медленно).

19 лет назад за 500 брал комп с gt8600, core 2 duo, 4 гигами оперативки, винтом на 300.
Это вполне "средний игровой комп" тех лет. Сейчас за +/- 500 ты видеокарту 60той серии купишь, и если повезёт взять выгодно пачку сухариков на сдачу.)

9

И это если что я играю на +- средних настройках, без трассировок и прочего.С трассировкой пути вообще отвал жопы. Но да, и без трассировок вообще игра выглядит охрененно. Поляки прям выдали, да.

1

И у этого тоже стата миленькая. Полтора часа ушло на генерацию 27 тысяч токенов. 27 тысяч токенов это какая нибудь очень небольшая задача вроде "добавь мне к моему сервису апи эндпоинт который выводит данные из бд-таблицы X, не забудь про авторизацию, и проведи смоук-тест", или если не программиссткое что нибудь-"возьми топ 5 статей пользователя Вадим Алешин с сайта dtf по рейтингу, сделай выжимку из них, и из реакции аудитории".

В чём смысл агента, если он такого рода задачи не за 15-20 минут делает, а за полтора часа?

7.5 токена в секунду со старта, и падает до четырёх к 32 тысячам контекста(а дальше и того хуже будет). Толку с такого запуска? Я с таким же успехом могу все свои компы в кластер объеденить через llama.cpp rpc и на получившихся примерно двухстах гигах памяти какую нибудь 70b модель в fp16 запустить с выдачей в полтора токена в секунду. Работать оно будет, но толку с такого запуска? Даже для чата с rag меньше 20 токенов в секунду безсмысленно, а для агентских задач лучше иметь ну хотя бы токенов 60-80, иначе простейшие задачи будут выполняться просто вечность.

Собсна как оно ворочается в q4 кванте на 5060ti+2070 с mtp(то есть подавляющее болшинство работы делает 5060ti в которой mtp бошка разместилась). Скорость, мягко скажем, не фонтан. Но я ещё поработаю над тонкой настройкой и может быть получу порядка 40 токенов в секунду, а может и нет.

1