Компания AMD использовала свою программную речь на Advancing AI 2026, чтобы представить миру следующее поколение дата-центровых графических ускорителей Instinct MI400 Series, стоечное решение Helios и архитектуру CDNA 5, которая служит фундаментом для всего этого великолепия. Это первая архитектура AMD, добравшаяся до технологического узла в два нанометра с транзисторами на основе gate-all-around, и хотя речь идёт сугубо о вычислительных ускорителях для центров обработки данных, а не об игровых картах Radeon, некоторые конструктивные решения CDNA 5 дают отчётливое представление о том, куда движется будущая унифицированная архитектура компании.
Флагманский Instinct MI455X представляет собой чип, с самого начала спроектированный для развёртывания в стойках, а не в традиционных восьмикартовых нодах. Вычислительные чиплеты XCD производятся по двухнанометровому техпроцессу TSMC, тогда как вспомогательные кристаллы FCD и MID используют более зрелый трёхнанометровый FinFET-процесс N3P, а весь пакет объединяет восемь вычислительных чиплетов, два чиплета ввода-вывода, два функциональных кристалла и двенадцать стеков HBM4, давая в сумме колоссальные 320 миллиардов транзисторов. На борту разместились 432 гигабайта памяти HBM4 с пропускной способностью 23,3 терабайта в секунду, что превышает как более ранние ориентиры для этого ускорителя, так и показатели конкурентного NVIDIA Vera Rubin VR200. Пиковая производительность достигает двадцати петафлопс в формате MXFP8 и сорока петафлопс в MXFP4 с поддержкой форматов FP4, FP6 и FP8, а шестнадцатилинейная шина AMD Infinity Fabric обеспечивает 256 гигабайт в секунду двунаправленной аппаратно-когерентной связи с процессором EPYC Venice. По сравнению с предшественником MI355X компания обещает до четырёхкратного прироста пиковой производительности, увеличение пропускной способности памяти в 2,9 раза и полуторакратный рост ёмкости, что выливается в восемнадцатикратное увеличение токеновой пропускной способности и тридцатичетырёхкратное снижение стоимости токена при обслуживании модели DeepSeek V4 Flash в режиме FP4.
Архитектура CDNA 5 примечательна не только сырыми цифрами, но и набором дизайнерских решений, среди которых увеличенные кэши, мультикастовые операции с памятью, усовершенствованный движок Tensor Data Mover и самое любопытное — модель исполнения Wave32 с тридцатидвухэлементным волновым фронтом, которая до сих пор была визитной карточкой игровой архитектуры RDNA. Именно это сближение, наряду с инвестициями в блочно-масштабированные низкоточные форматы данных и зрелой чиплетной упаковкой, служит явным индикатором того, какие строительные блоки лягут в основу будущей унифицированной архитектуры UDNA, которая однажды объединит дата-центровые и потребительские линейки.
Младшая модель Instinct MI430X нацелена на суверенный ИИ, национальную исследовательскую инфраструктуру и высокопроизводительные вычисления, где критична точность расчётов с плавающей запятой, и может похвастаться 288 терафлопс аппаратной производительности в FP64 при развёртывании в традиционных HPC-топологиях на основе ячеистой сети. Стоечное решение Helios, представляющее собой открытый и валидированный проект стойки с 72 ускорителями MI455X в восемнадцати четырёхкартовых лотках, объединяет пиковую производительность в 2,9 экзафлопс для FP4 и 1,4 экзафлопс для FP8, 31 терабайт ёмкости HBM4 с совокупной пропускной способностью 1,7 петабайта в секунду, а также 260 терабайт в секунду вертикального масштабирования через UALink поверх Ethernet и 43 терабайта в секунду горизонтального масштабирования. Против аналогичной стойки NVIDIA Vera Rubin NVL72 AMD заявляет пятнадцатипроцентное преимущество по пиковой производительности в FP4, на пятьдесят процентов больший объём HBM, шестипроцентный выигрыш по пропускной способности памяти и до тридцати процентов больше токенов на доллар, а среди заказчиков уже значатся OpenAI, Meta, Anthropic, Microsoft и Oracle.
Вместе с аппаратной платформой дебютировал программный стек ROCm.ai, который объединяет унифицированный интерфейс командной строки для всего жизненного цикла ИИ-нагрузок, включая изолированные развёртывания, фирменные экспертные навыки AMD, встроенные прямо в ассистентов вроде Claude, Cursor, Codex и Gemini, открытую агентную систему Hyperloom для автоматической сквозной оптимизации инференса без участия человека, и предметно-ориентированный язык FlyDSL для написания GPU-ядер в питоническом стиле. AMD утверждает, что ROCm.ai обеспечивает в среднем 3,3-кратное ускорение инференса и 2,4-кратное ускорение обучения на том же оборудовании по сравнению с ROCm 7, а доступность намечена на август.
Наконец, для тех, кто следит за потребительским сегментом, AMD показала тизер платформы Gorgon Halo, наследницы Strix Halo и Ryzen AI MAX. Новая система расширяет объём унифицированной памяти со 128 до 192 гигабайт и поднимает планку локального запуска моделей с 200 до 300 миллиардов параметров, позволяя настольным системам запускать облачные модели на месте, а в комплекте с каждым устройством на Halo будет идти год подписки на Hugging Face Pro. Всё это наглядно демонстрирует, как дата-центровые технологии AMD постепенно перетекают в сегмент продвинутых пользовательских и энтузиастских настольных систем.
