Чем меньше у вендора графиков, тем больше надо считать самому или что нам впаривает Хуанг на этот раз
Дисклеймер: примерно с годик назад я высрался постом по поводу того что NVIDIA собирается родить чип для десктопного масс маркета.
И так уж совпало что сванговал практически идеально, но не совсем. Ссылочка на пост если вдруг интересно вот она, но сейчас мы займемся спекуляциями на тему цены, производительности и всякого разного. Много букв. Статья писалась по старинке ручками, за исключением табличек - могут быть очепятки.
Что мы собственно имеем и что я лично ждал
Сошлось:
- Потребительский чип на базе того же кремния, что и DGX Spark — да, топовый N1X это буквально перемаркированный GB10. Хуанг это подтвердил прямым текстом.
- 20 ядер 10+10 (Cortex-X925 + Cortex-A725), Blackwell GPU, NVLink-C2C — всё на месте.
- Ставка на графику, а не на замес с Apple - очевидно так и вышло.
Почти сошлось:
- Думал будет честный DDR5, т.к. чип то поддерживает. По факту - LPDDR5X. Дешевле, холоднее, энергоэффективней, но медленней. Для ноута логично, но это же один из основных недостатков.
- Я думал про один чип. По факту это четыре SKU: два N1X (20-ядерный/6144 CUDA и 18-ядерный/5120 CUDA) и два N1 (12 ядер/2560 CUDA и 10 ядер/2048 CUDA). В целом тоже логично - ребята хотят окучить как можно больше рынка за раз.
Если честно я ожидал что они даже чутка раскочегарят исходную платформу - больше памяти, больше частоты, больше тензорных ядер, больше жира в целом. И в итоге получится некий тюнинговый DGX Spark с обвязкой в виде user friendly экосистемы, но видимо арифметика не сошлась и в итоге мы получили целый зоопарк чипов, зато доступней.
Архитектура этого поделия и что там вообще по сути реализовано
В целом про этот пункт я уже писал в исходном посте, но еще раз продублируем:
N1X это не «ARM-процессор со встройкой» в привычном понимании. Это сборка из двух чиплетов на TSMC 3nm:
- CPU блок от MediaTek: 20 ядер ARM v9.2 (10× Cortex-X925 + 10× Cortex-A725), 32 МБ L3.
- GPU на Blackwell: 6144 CUDA-ядра на 48 SM, тензорники 5-го поколения с NVFP4, RT-ядра.
Объединено это все через NVIDIA NVLink-C2С - не шина, но по сути общая память с нехилой пропускной способностью. CPU и GPU делят единое когерентное адресное пространство до 128 ГБ. Никакого H2C/C2H копирования между RAM и VRAM, как на дискретке через PCIe. Латентность ниже, эффективность выше. По сути это уменьшенный родственник GH200, обкатанный на серверах.
Тут есть несколько очень любопытных моментов. В слайдах от NVIDIA везде висят очень красивые 600GB/S пропускной способности. И это правда - но как обычно есть нюанс. Это пропускная способность NVLink, а реальная пропускная способность системы благополучно втыкается в пропускную способность 273 - 301 GB/s самой LPDDR5X. Что, честно сказать, уже не так впечатляет.
Важный момент TDP 45–80 Вт - это на весь чиплет, CPU+GPU вместе. Это принципиально другая история, чем 55 Вт на CPU + отдельная дискретка на 100 Вт. Тут весь бюджет общий, и его надо делить.
И ещё момент, который почти наверняка повторит историю мобильных видях - чип сам по себе это одно, но поверх OEM накрутят собственные power-профили в рамках того же 45–80 Вт, ровно как сейчас "RTX 5070 mobile" в тонком корпусе на 65 Вт едет на 30–40% медленнее, чем она же в толстом на 115 Вт — чип один, но работает по разному.
Surface Laptop Ultra на 14 мм будет душить N1X ближе к 45 Вт, а какой-нибудь толстый MSI выдаст полные 80. Так что строка N1X в спеке ноута будет значить примерно столько же, сколько RTX 5070 mobile сейчас, то есть почти ничего без указания TDP конкретной модели. Смотреть надо не на имя чипа, а на ватты и толщину корпуса.
Возвращаемся к основной проблеме - производительность
GB10 (а значит и топовый N1X) имеет 6144 CUDA - "как у десктопной RTX 5070, если прищуриться". Но дальше сходство кончается. Десктопная 5070 имеет 12 ГБ GDDR7 с 672 GB/s эксклюзивной полосы. А 128 ГБ LPDDR5X в GB10 дают 273 GB/s на весь SoC и эту полосу делят CPU и GPU.
А теперь попробуем повторить любимое упражнение "раскрывашек" и прикинуть производительность исходя из имеющихся значений. Эту задачу мы разобьем на два пункта, которыми нынче так любит меряться Хуанг:
- Производительность инференса (у нас же нейросетевая колыбаха разрушения все же)
- Производительность в игрульках
Инференс
Тут, честно сказать - все достаточно грустно.
На DGX Spark (тот же чип) инференс упирается в эти 273 GB/s. На 70B FP8 - порядка 2-3 tok/s, на FP4 с TensorRT-LLM - около 5 tok/s. Для сравнения: Mac Studio M3 Ultra с его 819 GB/s генерит токены втрое быстрее на влезающих моделях. Если кратко - это не юзабельно. Если мы говорим про текстовые LLM психологически удобный уровень в один поток - хотя бы ~40tok/s/.
При batch нагрузке и узких сценариях ситуация получше и именно эти графики рисует Хуанг. Добавим сюда MoE модели и в целом можно пользоваться.
Что это значит для ноутбука с N1X? На локальной LLM в одно лицо ты получишь огромную модель, которая больше никуда не влезет в этом форм-факторе, но генерить она будет неспешно. Обучение/файнтюн - норм. Это не недостаток, это особенность платформы.
Пропускная способность это один из немногих параметров, который можно честно сопоставить и с ноутбучными, и с десктопными видяхами, и попробовать прикинуть хуй к носу.
Но сразу важная оговорка: пропускная линейно определяет потолок только для специфичных нагрузок (генерация токенов в LLM - тупо чтение всех весов из памяти на каждый токен). Для гейминга шина уже далеко не решающий фактор - вмешиваются кэш, рендеринг и разная толерантность архитектуры к голоданию по памяти. Так что по шине мы уверенно позиционируем ТОЛЬКО AI-инференс.
По чистой шине N1X - это сосед Strix Halo, а не 5070. 273 против 256 GB/s - вот его настоящий конкурент в подобных задачах. "6144 CUDA ядер как у 5070" - это у сферического коня в вакууме. А вот про то, как быстро он эти ядра кормит данными из памяти, говорит шина - и она вдвое-втрое уже, чем у настоящей 5070.
Игрульки
Отсюда главное - на игры это влияет сильно меньше, но влияет.
Одно точно - это не 5070, точнее это 5070, которую ЦПУ не сможет полностью утилизировать в играх.
Основной вопрос - насколько будет отставание?
Тут сразу вспоминаем про TDP, потому что на практике мы увидим несколько разных сценариев, которые я бы свел примерно к такой таблице:
При этом, очевидно, чем выше разрешение и тяжелее текстуры, тем сильнее проседание относительно 5070 - потому что bottleneck по шине усиливается нелинейно с нагрузкой на память. NVIDIA это частично лечит кэшем: на GB10 поверх 24 МБ L2 висит 16 МБ L4, специально размазывающий обращения к памяти. Смягчает голодание, но физику 273 GB/s не отменяет. И вот почему DLSS/FG тут не просто свистоперделка, а архитектурная необходимость.
И последнее по теме - не забываем, что это все еще ARM. А следовательно поверх лежит x86-трансляция (Windows on ARM эмуляция / Proton+FEX). Что также отожрет сколько то кадров.
Немного про CPU
Про CPU-производительность NVIDIA говорит подозрительно мало, и понятно почему. Прошлогодний прототип N1X в Geekbench показывал в многопотоке отставание от Ryzen AI MAX+ 395и Core Ultra 9 285HX. Это прототип на сырых драйверах, но погоды это не сделает.
Маленькое эссе на тему "А зачем козе баян", а самое главное сколько стоит?
Анонс новых железяк вышел настолько громким, насколько его могла сделать компания с рыночной стоимостью как ВВП евросоюза.
Тут и Microsoft с громкими заявами, и вендоры, обещающие NEW COMPUTING ERA, короче все как мы любим, но если посмотреть на продукт серьезно, то есть вопросы к позиционированию и тому как NVIDIA собирается лутать бабки.
Это вторая попытка NVIDIA в ARM-PC (первая была в 2011-м, потом Windows RT в 2012-м - обе убились об незрелую экосистему). Разница 2026 года в том, что экосистема теперь сама перестроилась вокруг CUDA. Разработчиков не надо уговаривать поддерживать платформу - они уже от неё зависят. Собственно на удобство и замкнутую систему они отчасти и напирали в анонсе.
Сможет ли NVIDIA отхапать кусок рынка - я бы сказал все зависит как обычно от цены. Вангую цену за топовые модели по 3к вечнозеленых. Это много, очень много - за эти человек работающий купит себе Apple, человек играющий - соберет пекарню, а дешевых альтернатив на рынке ноутбуков вроде как еще достаточно.
Для локального инференса тоже есть альтернативы как мы выяснили (да еще и дешевле). Есть вероятность что NVIDIA даст настолько ультимативный пакет софта в комплекте, что все в припрыжку пойдут пересаживаться на винду, но нет - большая часть разработчиков и инженеров на винду не сядет под дулом пистолета.
Для игр - задушит жаба, да и играть на ноутбуке удовольствие, мягко говоря, сомнительное при наличии альтернатив. Вся надежда в данном случае на те самые бюджетные модели на обрезанных чипах (вангую 1000-1500 убитых енотов), которые все еще будут тянуть все что душе угодно в 1440 за счет всех тех софтовых ухищрений, которыми нас кормил Хуанг последние года. И экосистема в этот раз у них гораздо солиднее.
Также внезапно можно вспомнить дедушку Габена, который по тихой грусти сделал LINUX GREAT AGAIN, дав нам SteamOS. У Valve неплохой инструментарий для работы на ARM, который неплохо работает под линухом. Эта связка может неплохо выстрелить, особенно если вспомнить что нативная платформа для донора DGX Spark - Linux.
Поэтому из всей линейки я бы выбрал самым интересным продуктом N1 (12/10 ядер, 2560/2048 CUDA, 18–45 Вт). 2560 CUDA — это уровень десктопной RTX 5050. Это массовый тонкий ноут с приличной встройкой и нативным AI. Буквально ультрабук, который умеет в локальный AI и казуальный гейминг при дневной автономности. Прямой конкурент Snapdragon X и Lunar Lake, но с козырем CUDA. При хорошем софте это будет достаточно популярное устройство.
Маленькая теория заговора
Пока изучал откуда ноги девайсов растут не покидало ощущение, что у NVIDIA остается нихуяевый такой процент брака от производства GB10. Техпроцесс сложный, требования высокие. Архитектура дороговата для масс маркета. И появилась мысль.
Хорошие, годные кристаллы уходят в дорогой DGX или схожие сборки для дата-центров, кристаллы с дефектным GPU-блоком или не берущие частоту - это брак, которому одна дорога в помойку. N1X (18 ядер) и особенно младшие N1 - это утилизация.
Это объясняет четыре SKU лучше любой стратегии - это сортировка брака по корзинам. И заход в ноуты - ответ на "горшочек не вари". Емкий рынок, слово RTX продаёт само, Microsoft как раз искала не-Qualcomm партнёра под Windows-on-ARM - удобно. OEM производителей нагрузили - удобно.
И вот это объясняет все те косячки устройства - перекос в производительности между CPU и GPU, невнятное позиционирование и, скорее всего, приличную стоимость.
Надеюсь я ошибаюсь - будет интересно пощупать какой-нибудь топовый Dell XPS (и накатить на него linux+proton по заветам Гейба).