Компания Google столкнулась с серьёзным дефицитом оперативной памяти. Об этом на отраслевом саммите заявил старший директор по инфраструктуре Никхил Черян. Информацию приводит издание Wccftech. Причиной проблемы стала постоянная нехватка чипов DRAM на рынке. Для решения проблемы компания начала разбирать выведенные из эксплуатации серверы. Инженеры извлекают из старого оборудования ещё рабочие модули памяти DDR4.
По словам Черяна, главным узким местом ИИ-индустрии стала уже не нехватка вычислительной мощности. Ключевым ограничением превратилась именно оперативная память. В типичном ИИ-сервере доля памяти в общей стоимости комплектующих достигает 75 процентов. Память фактически определяет и производительность системы, и её итоговую стоимость.
Google решает проблему памяти сразу с двух сторон. Компания одновременно работает над программными и аппаратными решениями. На аппаратном уровне подход выглядит максимально прямолинейным. Списанные серверы возвращают обратно в дата-центры для разбора. Специалисты извлекают из них годные модули DDR4. Так формируется внутренняя система повторного использования комплектующих.
В некоторых случаях компании приходится идти на компромиссы. Google вынужденно устанавливает модули DDR4 вместо более новых DDR5. Изначально новые ИИ-серверы проектировались именно под память следующего поколения. Для решения этой задачи инженеры разработали специальные переходные платы. Такие адаптеры позволяют подключать память прошлого поколения к современным ИИ-системам. Это временно снижает давление на рынок дефицитной высокопроизводительной памяти.
Отдельный подход компания применяет для чипов TPUv8i. Эти процессоры оптимизированы под задачи инференса нейросетей. Google использует здесь многоуровневую систему хранения данных. На уровне всей системы задачи предобработки данных решает быстрая память DDR5. Каждый чип TPUv8i дополнительно оснащён памятью HBM3e объёмом 288 гигабайт. Такое сочетание балансирует требования к объёму и пропускной способности памяти.
Параллельно компания продолжает работу над программной оптимизацией. Инженеры Google дорабатывают низкоуровневые библиотеки и архитектуру самих моделей. Отдельное внимание уделяется алгоритмам сжатия кэша KV. Цель этой работы — снизить расход памяти на единицу вычислительной мощности. Такой подход системно уменьшает зависимость от физических объёмов памяти. В результате растёт и общая эффективность использования ресурсов.
