Аналитик TF International Securities Мин-Чи Куо опубликовал свежее исследование отрасли. По его данным, NVIDIA перезапустила разработку чипа Rubin CPX. Серийное производство ожидается уже в первом квартале 2027 года.
Речь идёт о совершенно новом классе графических процессоров. Чип специально проектируют под задачи с длинным контекстом ИИ. Также решение нацелено на этап предварительного заполнения при инференсе. Впервые продукт показали публично на конференции GTC в 2025 году. Тогда релиз планировали на конец 2026 года. Позже проект неожиданно исчез из дорожной карты компании. Теперь NVIDIA вернула разработку обратно в свои планы.
Согласно отчёту Куо, обновлённая версия CPX претерпела серьёзные изменения. Корректировки затронули сразу пять ключевых направлений разработки. Речь идёт о спецификациях, дизайне стоек и архитектуре подключения. Также изменения коснулись режима работы и позиционирования продукта на рынке. Общий вектор развития сместился в сторону гибкости и экономической эффективности.
CPX создавался специально для обработки миллионов токенов контекста. Чип использует технологию точности NVFP4 для вычислений. Один процессор способен обеспечивать от 30 до 50 петафлопс мощности. Прежняя версия чипа опиралась на 128 гигабайт памяти GDDR7. Такое решение снижало себестоимость, но ограничивало вычислительные возможности.
Обновлённая версия CPX перешла на память HBM4 объёмом 168 гигабайт. Это меньше показателя стандартной версии Rubin с её 288 гигабайтами. Однако новый объём заметно превышает прежние 128 гигабайт памяти GDDR7. Максимальное энергопотребление одного чипа осталось прежним — 2300 Вт.
По части конструкции стоек новая версия CPX получила отдельное решение. Чип разместят в независимой стойке MGX ETL. Совместное размещение со стандартным Rubin в одной стойке больше не предусмотрено. Клиенты смогут выбирать конфигурацию из 64, 128, 192 или 256 чипов. Каждые 64 процессора CPX формируют отдельный стоечный модуль. Модуль включает восемь вычислительных лотков по восемь чипов каждый. Дополняет конструкцию отдельный коммутационный лоток.
Архитектура межсоединений тоже подверглась заметному пересмотру инженерами. Технология NVLink теперь используется лишь внутри одного лотка. Речь идёт о связке восьми чипов CPX между собой. Пропускная способность NVLink на один чип составляет 1-1,5 терабайта в секунду. Это заметно ниже показателя стандартного Rubin в 3,6 терабайта в секунду. Связь между лотками внутри одного модуля обеспечивает сеть Spectrum-6 Ethernet. Соединение между разными стоечными модулями идёт через оптические разъёмы OSFP.
Чип CPX предназначен для совместной работы с платформой Vera Rubin NVL72. NVIDIA рекомендует соотношение один к одному между CPX и Rubin. Задача CPX сводится к обработке предзаполнения и построению кэша KV. Затем данные передаются на Rubin через RDMA по сети Ethernet. Именно Rubin выполняет финальный этап декодирования и генерации ответа.
Куо отмечает важную особенность современных нагрузок инференса ИИ. Более половины вычислений приходится именно на обработку входных данных. Речь идёт о создании кэша ключей и значений KV Cache. CPX берёт эту задачу на себя более гибким и дешёвым способом. Каждый вычислительный лоток из восьми чипов получает около 1,34 терабайта памяти HBM4. Этого объёма достаточно для большинства сценариев с длинным контекстом и построением кэша KV.
