Artemonim

@artemonim
+2142
с 2019

AI-assisted Dev/SDET

29 подписчиков
6 подписок

Teknium как раз главный, если я правильно понимаю.

Даже при полной автоматизации через агентов, поражает масштаб работ в репозитории.

1

Просто выбери бенчмарки, которым доверяешь и которые сходятся с твоим опытом.

Да и есть специфические типа MRCR v2, который буквально измеряет насколько модель тупеет в зависимости от длины контекста — это не подделать. Только сейчас модели начали набирать более 90% на 200к токенах в этом бенче.

А есть и явно дурацкие типа SWE-bench и ARC-AGI-3.

Artemonim
в посте

Ну... С Fable 5 же были приколы. И мы не знаем, не будет ли их снова.

Artemonim
в посте

Ну нам ещё везёт, что Америка не закручивает экспортный контроль, а Китай принципиально выкладывает модели в общий доступ. А вот если оба два прекратят...

1
Artemonim
в посте

Видел недавно статистику, что мы по мощности GPU отстаём от Китая в 120 раз и от Америки в 560 раз ☠️

Artemonim
в посте

На переклейку шильдиков можно проверить, но мне лень. Скорее общая грусть по поводу.

И это при том что на мой вкус GigaChat умнее чем Alice AI.

Artemonim
в посте

Не я как бы за развитие отечественных нейронок. Но чот не думал, что всё настолько плохо.

Qwen3 ещё и по размеру вдвое меньше, чем GigaChat...

Artemonim
в посте

Google Gemini Ultra не могут выпустить, а Сбер может. Сбер стронг

Artemonim
в посте

Я видел три разных исследования, где русский был более эффективным языком, чем английский.

Но конкретно тут у меня гипотеза, что модели просто пофиг на чём она думает. У меня Opus 5 болтает и думает на английском ровно до момента, пока не обращается ко мне или не пишет финальный отчёт.

Artemonim
в посте

Пиндосы воруют наше национальное нейродостояние

1
1