Чем меньше у вендора графиков, тем больше надо считать самому или что нам впаривает Хуанг на этот раз

Дисклеймер: примерно с годик назад я высрался постом по поводу того что NVIDIA собирается родить чип для десктопного масс маркета.
И так уж совпало что сванговал практически идеально, но не совсем. Ссылочка на пост если вдруг интересно вот она, но сейчас мы займемся спекуляциями на тему цены, производительности и всякого разного. Много букв. Статья писалась по старинке ручками, за исключением табличек - могут быть очепятки.

Что мы собственно имеем и что я лично ждал

Сошлось:

  • Потребительский чип на базе того же кремния, что и DGX Spark — да, топовый N1X это буквально перемаркированный GB10. Хуанг это подтвердил прямым текстом.
  • 20 ядер 10+10 (Cortex-X925 + Cortex-A725), Blackwell GPU, NVLink-C2C — всё на месте.
  • Ставка на графику, а не на замес с Apple - очевидно так и вышло.

Почти сошлось:

  • Думал будет честный DDR5, т.к. чип то поддерживает. По факту - LPDDR5X. Дешевле, холоднее, энергоэффективней, но медленней. Для ноута логично, но это же один из основных недостатков.
  • Я думал про один чип. По факту это четыре SKU: два N1X (20-ядерный/6144 CUDA и 18-ядерный/5120 CUDA) и два N1 (12 ядер/2560 CUDA и 10 ядер/2048 CUDA). В целом тоже логично - ребята хотят окучить как можно больше рынка за раз.

Если честно я ожидал что они даже чутка раскочегарят исходную платформу - больше памяти, больше частоты, больше тензорных ядер, больше жира в целом. И в итоге получится некий тюнинговый DGX Spark с обвязкой в виде user friendly экосистемы, но видимо арифметика не сошлась и в итоге мы получили целый зоопарк чипов, зато доступней.

Архитектура этого поделия и что там вообще по сути реализовано

В целом про этот пункт я уже писал в исходном посте, но еще раз продублируем:

N1X это не «ARM-процессор со встройкой» в привычном понимании. Это сборка из двух чиплетов на TSMC 3nm:

  • CPU блок от MediaTek: 20 ядер ARM v9.2 (10× Cortex-X925 + 10× Cortex-A725), 32 МБ L3.
  • GPU на Blackwell: 6144 CUDA-ядра на 48 SM, тензорники 5-го поколения с NVFP4, RT-ядра.
Вот они два красивые и голенькие
Вот они два красивые и голенькие

Объединено это все через NVIDIA NVLink-C2С - не шина, но по сути общая память с нехилой пропускной способностью. CPU и GPU делят единое когерентное адресное пространство до 128 ГБ. Никакого H2C/C2H копирования между RAM и VRAM, как на дискретке через PCIe. Латентность ниже, эффективность выше. По сути это уменьшенный родственник GH200, обкатанный на серверах.

Тут есть несколько очень любопытных моментов. В слайдах от NVIDIA везде висят очень красивые 600GB/S пропускной способности. И это правда - но как обычно есть нюанс. Это пропускная способность NVLink, а реальная пропускная способность системы благополучно втыкается в пропускную способность 273 - 301 GB/s самой LPDDR5X. Что, честно сказать, уже не так впечатляет.

Примерно так будет выглядеть вся линейка по некоторой информации, но показали только самый топ.
Примерно так будет выглядеть вся линейка по некоторой информации, но показали только самый топ.

Важный момент TDP 45–80 Вт - это на весь чиплет, CPU+GPU вместе. Это принципиально другая история, чем 55 Вт на CPU + отдельная дискретка на 100 Вт. Тут весь бюджет общий, и его надо делить.

И ещё момент, который почти наверняка повторит историю мобильных видях - чип сам по себе это одно, но поверх OEM накрутят собственные power-профили в рамках того же 45–80 Вт, ровно как сейчас "RTX 5070 mobile" в тонком корпусе на 65 Вт едет на 30–40% медленнее, чем она же в толстом на 115 Вт — чип один, но работает по разному.
Surface Laptop Ultra на 14 мм будет душить N1X ближе к 45 Вт, а какой-нибудь толстый MSI выдаст полные 80. Так что строка N1X в спеке ноута будет значить примерно столько же, сколько RTX 5070 mobile сейчас, то есть почти ничего без указания TDP конкретной модели. Смотреть надо не на имя чипа, а на ватты и толщину корпуса.

Возвращаемся к основной проблеме - производительность

GB10 (а значит и топовый N1X) имеет 6144 CUDA - "как у десктопной RTX 5070, если прищуриться". Но дальше сходство кончается. Десктопная 5070 имеет 12 ГБ GDDR7 с 672 GB/s эксклюзивной полосы. А 128 ГБ LPDDR5X в GB10 дают 273 GB/s на весь SoC и эту полосу делят CPU и GPU.

А теперь попробуем повторить любимое упражнение "раскрывашек" и прикинуть производительность исходя из имеющихся значений. Эту задачу мы разобьем на два пункта, которыми нынче так любит меряться Хуанг:

  • Производительность инференса (у нас же нейросетевая колыбаха разрушения все же)
  • Производительность в игрульках

Инференс

Тут, честно сказать - все достаточно грустно.

На DGX Spark (тот же чип) инференс упирается в эти 273 GB/s. На 70B FP8 - порядка 2-3 tok/s, на FP4 с TensorRT-LLM - около 5 tok/s. Для сравнения: Mac Studio M3 Ultra с его 819 GB/s генерит токены втрое быстрее на влезающих моделях. Если кратко - это не юзабельно. Если мы говорим про текстовые LLM психологически удобный уровень в один поток - хотя бы ~40tok/s/.

При batch нагрузке и узких сценариях ситуация получше и именно эти графики рисует Хуанг. Добавим сюда MoE модели и в целом можно пользоваться.

Что это значит для ноутбука с N1X? На локальной LLM в одно лицо ты получишь огромную модель, которая больше никуда не влезет в этом форм-факторе, но генерить она будет неспешно. Обучение/файнтюн - норм. Это не недостаток, это особенность платформы.

Пропускная способность это один из немногих параметров, который можно честно сопоставить и с ноутбучными, и с десктопными видяхами, и попробовать прикинуть хуй к носу.
Но сразу важная оговорка: пропускная линейно определяет потолок только для специфичных нагрузок (генерация токенов в LLM - тупо чтение всех весов из памяти на каждый токен). Для гейминга шина уже далеко не решающий фактор - вмешиваются кэш, рендеринг и разная толерантность архитектуры к голоданию по памяти. Так что по шине мы уверенно позиционируем ТОЛЬКО AI-инференс.

А вот тут стало сильно грустнее чем на рекламных слайдах
А вот тут стало сильно грустнее чем на рекламных слайдах

По чистой шине N1X - это сосед Strix Halo, а не 5070. 273 против 256 GB/s - вот его настоящий конкурент в подобных задачах. "6144 CUDA ядер как у 5070" - это у сферического коня в вакууме. А вот про то, как быстро он эти ядра кормит данными из памяти, говорит шина - и она вдвое-втрое уже, чем у настоящей 5070.

Игрульки

Отсюда главное - на игры это влияет сильно меньше, но влияет.
Одно точно - это не 5070, точнее это 5070, которую ЦПУ не сможет полностью утилизировать в играх.
Основной вопрос - насколько будет отставание?
Тут сразу вспоминаем про TDP, потому что на практике мы увидим несколько разных сценариев, которые я бы свел примерно к такой таблице:

Чем меньше у вендора графиков, тем больше надо считать самому или что нам впаривает Хуанг на этот раз

При этом, очевидно, чем выше разрешение и тяжелее текстуры, тем сильнее проседание относительно 5070 - потому что bottleneck по шине усиливается нелинейно с нагрузкой на память. NVIDIA это частично лечит кэшем: на GB10 поверх 24 МБ L2 висит 16 МБ L4, специально размазывающий обращения к памяти. Смягчает голодание, но физику 273 GB/s не отменяет. И вот почему DLSS/FG тут не просто свистоперделка, а архитектурная необходимость.

И последнее по теме - не забываем, что это все еще ARM. А следовательно поверх лежит x86-трансляция (Windows on ARM эмуляция / Proton+FEX). Что также отожрет сколько то кадров.

Немного про CPU

Куртка не покажет нам бенчи
Куртка не покажет нам бенчи
Но их можно было посмотреть еще год назад
Но их можно было посмотреть еще год назад

Про CPU-производительность NVIDIA говорит подозрительно мало, и понятно почему. Прошлогодний прототип N1X в Geekbench показывал в многопотоке отставание от Ryzen AI MAX+ 395и Core Ultra 9 285HX. Это прототип на сырых драйверах, но погоды это не сделает.

Маленькое эссе на тему "А зачем козе баян", а самое главное сколько стоит?

Анонс новых железяк вышел настолько громким, насколько его могла сделать компания с рыночной стоимостью как ВВП евросоюза.

Тут и Microsoft с громкими заявами, и вендоры, обещающие NEW COMPUTING ERA, короче все как мы любим, но если посмотреть на продукт серьезно, то есть вопросы к позиционированию и тому как NVIDIA собирается лутать бабки.

Это вторая попытка NVIDIA в ARM-PC (первая была в 2011-м, потом Windows RT в 2012-м - обе убились об незрелую экосистему). Разница 2026 года в том, что экосистема теперь сама перестроилась вокруг CUDA. Разработчиков не надо уговаривать поддерживать платформу - они уже от неё зависят. Собственно на удобство и замкнутую систему они отчасти и напирали в анонсе.

Сможет ли NVIDIA отхапать кусок рынка - я бы сказал все зависит как обычно от цены. Вангую цену за топовые модели по 3к вечнозеленых. Это много, очень много - за эти человек работающий купит себе Apple, человек играющий - соберет пекарню, а дешевых альтернатив на рынке ноутбуков вроде как еще достаточно.

Для локального инференса тоже есть альтернативы как мы выяснили (да еще и дешевле). Есть вероятность что NVIDIA даст настолько ультимативный пакет софта в комплекте, что все в припрыжку пойдут пересаживаться на винду, но нет - большая часть разработчиков и инженеров на винду не сядет под дулом пистолета.

Для игр - задушит жаба, да и играть на ноутбуке удовольствие, мягко говоря, сомнительное при наличии альтернатив. Вся надежда в данном случае на те самые бюджетные модели на обрезанных чипах (вангую 1000-1500 убитых енотов), которые все еще будут тянуть все что душе угодно в 1440 за счет всех тех софтовых ухищрений, которыми нас кормил Хуанг последние года. И экосистема в этот раз у них гораздо солиднее.

Также внезапно можно вспомнить дедушку Габена, который по тихой грусти сделал LINUX GREAT AGAIN, дав нам SteamOS. У Valve неплохой инструментарий для работы на ARM, который неплохо работает под линухом. Эта связка может неплохо выстрелить, особенно если вспомнить что нативная платформа для донора DGX Spark - Linux.

Поэтому из всей линейки я бы выбрал самым интересным продуктом N1 (12/10 ядер, 2560/2048 CUDA, 18–45 Вт). 2560 CUDA — это уровень десктопной RTX 5050. Это массовый тонкий ноут с приличной встройкой и нативным AI. Буквально ультрабук, который умеет в локальный AI и казуальный гейминг при дневной автономности. Прямой конкурент Snapdragon X и Lunar Lake, но с козырем CUDA. При хорошем софте это будет достаточно популярное устройство.

Маленькая теория заговора

Пока изучал откуда ноги девайсов растут не покидало ощущение, что у NVIDIA остается нихуяевый такой процент брака от производства GB10. Техпроцесс сложный, требования высокие. Архитектура дороговата для масс маркета. И появилась мысль.

Хорошие, годные кристаллы уходят в дорогой DGX или схожие сборки для дата-центров, кристаллы с дефектным GPU-блоком или не берущие частоту - это брак, которому одна дорога в помойку. N1X (18 ядер) и особенно младшие N1 - это утилизация.

Это объясняет четыре SKU лучше любой стратегии - это сортировка брака по корзинам. И заход в ноуты - ответ на "горшочек не вари". Емкий рынок, слово RTX продаёт само, Microsoft как раз искала не-Qualcomm партнёра под Windows-on-ARM - удобно. OEM производителей нагрузили - удобно.

И вот это объясняет все те косячки устройства - перекос в производительности между CPU и GPU, невнятное позиционирование и, скорее всего, приличную стоимость.

Надеюсь я ошибаюсь - будет интересно пощупать какой-нибудь топовый Dell XPS (и накатить на него linux+proton по заветам Гейба).

28
5
1