AI-assisted Dev/SDET
Просто выбери бенчмарки, которым доверяешь и которые сходятся с твоим опытом.
Да и есть специфические типа MRCR v2, который буквально измеряет насколько модель тупеет в зависимости от длины контекста — это не подделать. Только сейчас модели начали набирать более 90% на 200к токенах в этом бенче.
А есть и явно дурацкие типа SWE-bench и ARC-AGI-3.
Ну... С Fable 5 же были приколы. И мы не знаем, не будет ли их снова.
Ну нам ещё везёт, что Америка не закручивает экспортный контроль, а Китай принципиально выкладывает модели в общий доступ. А вот если оба два прекратят...
Видел недавно статистику, что мы по мощности GPU отстаём от Китая в 120 раз и от Америки в 560 раз ☠️
На переклейку шильдиков можно проверить, но мне лень. Скорее общая грусть по поводу.
И это при том что на мой вкус GigaChat умнее чем Alice AI.
Не я как бы за развитие отечественных нейронок. Но чот не думал, что всё настолько плохо.
Qwen3 ещё и по размеру вдвое меньше, чем GigaChat...
Google Gemini Ultra не могут выпустить, а Сбер может. Сбер стронг
Я видел три разных исследования, где русский был более эффективным языком, чем английский.
Но конкретно тут у меня гипотеза, что модели просто пофиг на чём она думает. У меня Opus 5 болтает и думает на английском ровно до момента, пока не обращается ко мне или не пишет финальный отчёт.
Пиндосы воруют наше национальное нейродостояние
Teknium как раз главный, если я правильно понимаю.
Даже при полной автоматизации через агентов, поражает масштаб работ в репозитории.