NVIDIA продолжает методично перекраивать ландшафт вычислительной инфраструктуры, и её новейшая графическая архитектура под кодовым именем Rubin представляет собой не просто очередной шаг, а полноценный прыжок в эру масштабируемых вычислений, раскинувшихся на множество стоек, систем и целых дата-центров. Компания нацеливает Rubin на так называемый «агентный искусственный интеллект» — тот самый класс рабочих нагрузок, где модель не просто отвечает на запрос, а постоянно рассуждает, планирует последовательность действий, обращается к внешним инструментам и выполняет множество связанных шагов, и заявляет при этом о десятикратном увеличении пропускной способности на единицу потребляемой энергии по сравнению с архитектурой Blackwell.
В максимальной конфигурации Rubin строится из двух вычислительных кристаллов, ограниченных размерами фотолитографического шаблона и объединённых на одной подложке высокоскоростным интерсоединением, которое NVIDIA называет NV-HBI. Кристалл вмещает колоссальные 336 миллиардов транзисторов, до 224 потоковых мультипроцессоров, 896 тензорных ядер третьего поколения с обновлённым движком Transformer Engine и 288 гигабайт памяти стандарта HBM4, а итоговая вычислительная мощь достигает 50 петафлопс в операциях с разреженной точностью NVFP4. Чтобы превратить этот транзисторный бюджет в устойчивую пропускную способность, вычислительные ресурсы организованы в кластеры графических процессоров с централизованной кеш-памятью второго уровня, а дирижирует всем этим оркестром движок GigaThread Engine, координирующий рабочие нагрузки и оптимизирующий загрузку ресурсов. Возможность нарезать один физический ускоритель на несколько виртуальных с помощью разделов MIG Control, аппаратный декодер видео NVDEC и средства конфиденциальных вычислений с защитой данных на всех этапах дополняют картину, превращая Rubin в универсальный и безопасный инструмент для самых чувствительных корпоративных сред.

На фронте памяти и коммуникаций инженеры NVIDIA совместно с партнёрами сотворили настоящее чудо: 288 гигабайт HBM4 с двенадцатиярусными стеками обеспечивают пиковую пропускную способность до 22 терабайт в секунду, что представляет собой рост в 2,8 раза по сравнению с Blackwell и Blackwell Ultra, чей потолок упирался в 8 терабайт в секунду. Такой рывок отчасти объясняется удвоением ширины интерфейса HBM4 относительно предшествующего поколения HBM3e. Улучшенный ускоритель тензорной памяти теперь эффективнее управляет перемещением данных, а за масштабирование и коммуникации отвечает интерконнект NVLink шестого поколения, обеспечивающий всестороннюю связь между ускорителями на скорости 3600 гигабайт в секунду по фабрике, в то время как линк NVLink-C2C позволяет процессору общаться с графическим чипом на 1800 гигабайтах в секунду. Присутствует и шестнадцатилинейный интерфейс PCIe Gen 6 с пропускной способностью до 256 гигабайт в секунду.
Однако подлинная магия Rubin кроется не только в сырой производительности, а в тонкой настройке под узкие места инференса. Тензорные ядра третьего поколения удваивают пропускную способность за такт, обрабатывая вдвое больше данных вдоль размерности редукции, благодаря чему матричное умножение, требовавшее на Blackwell четырёх итераций, на Rubin укладывается в две, что особенно ценно при распределении модели на множество ускорителей. Для длинноконтекстного механизма внимания промежуточные счёты могут загружаться в структурированно-разреженном сжатом виде, сокращая объём операций при сохранении плотного вывода, а производительность функции Softmax возрастает вдвое для FP32 и вчетверо для BF16 и FP16. Для смесей экспертов обновлённый ускоритель тензорной памяти позволяет разделять один дескриптор между всеми экспертами вместо использования отдельного на каждого, радикально снижая накладные расходы на метаданные и перемещение данных по мере роста числа экспертов.
Коммуникации масштабирования также претерпели революцию. Традиционно взаимодействие между графическими процессорами требовало синхронизации с барьерами памяти и подтверждениями, что вносило задержки и заставляло систему простаивать в ожидании перемещения данных. Rubin внедряет механизм «считаемых записей» для инициируемой устройством коммуникации по NVLink: вместо рукопожатий принимающий ускоритель просто отслеживает обновление счётчика, узнавая о завершении передачи перед загрузкой данных, и такая модель позволяет каждому GPU самостоятельно управлять своими передачами, не прерывая вычислений. Дополнительно улучшено перекрытие ядер: если раньше потребительское ядро могло простаивать в ожидании завершения работы производящего ядра целиком, то Rubin внедряет более тонкое, покадровое переключение, позволяя потребителю начинать работу сразу после готовности нужного фрагмента данных, что в инференсе напрямую конвертируется в дополнительные токены в секунду.
Наконец, энергетическая эффективность и стоечное исполнение довершают облик Rubin как законченного решения для ИИ-фабрик. Одиночная стойка NVL72 вмещает 72 ускорителя, и для такой конфигурации разработана технология интеллектуального сглаживания энергопотребления, интегрирующая все компоненты в единый фиксированный тепловой конверт и снижающая среднее потребление примерно на десять процентов, а пиковое на пятидесятимиллисекундном интервале — на двадцать процентов по сравнению с предыдущим поколением. На уровне целой фабрики решение NVIDIA DSX MaxLPS позволяет, по заявлениям компании, разместить на сорок процентов больше ускорителей в рамках того же энергетического бюджета. Сама стойка построена на модульной архитектуре MGX третьего поколения с бескабельными вычислительными и коммутаторными лотками, жидкостным охлаждением с температурой в сорок пять градусов Цельсия, горячей заменой лотков NVLink и открытой связностью через NVLink и Ethernet Spectrum-X.

