Qualcomm представила новое поколение Hexagon NPU. Компания создала его для будущих AI-агентов. Новый ускоритель дебютирует в Snapdragon 8 Elite шестого поколения.
Главным изменением стал новый блок Element Accelerator. Он оптимизирован для Transformer-моделей генеративного и агентного AI. Блок объединяет векторные и скалярные вычислительные модули. Такой подход ускоряет ключевые операции при работе больших языковых моделей.
Qualcomm рассчитывает повысить скорость отклика AI-агентов. При этом компания сохраняет энергоэффективность мобильных устройств. Ускоритель также получил значительно больший объем общей памяти.
Общая память хранит состояния нескольких моделей и контекстные данные. Там же размещается информация KV-cache для текущих вычислений. Размещение данных ближе к ускорителю снижает влияние узких мест памяти.
Это особенно важно при работе с длинным контекстом. AI-агентам также приходится одновременно обращаться к нескольким инструментам. Новая архитектура должна сохранять стабильную скорость при таких нагрузках.
Qualcomm рассматривает Hexagon NPU как основу агентного AI на устройствах. Компания хочет переносить больше вычислений непосредственно на смартфоны. Такой подход также помогает снизить зависимость от облачных сервисов.
Новая архитектура ориентируется и на будущие модели AI. Qualcomm сотрудничает с производителями памяти и разработчиками моделей. Среди перспективных технологий компания выделяет Mixture-of-Experts, или MoE.
Такая архитектура разделяет модель на специализированные экспертные блоки. Система выбирает нужных экспертов в зависимости от входных данных. Поэтому модели не приходится активировать всю сеть при каждом запросе.
Qualcomm приводит показательный пример с моделью на 30 млрд параметров. При использовании MoE одновременно активируются примерно 3 млрд параметров. Остальные параметры остаются доступными для других вычислительных задач.
Это снижает вычислительную нагрузку во время инференса. Одновременно уменьшается потребность в пропускной способности памяти. Такой подход особенно важен для мобильных платформ с ограниченным энергопотреблением.
Qualcomm также рассчитывает на интеллектуальное управление загрузкой экспертов. Система сможет перемещать нужные модули между флеш-памятью и оперативной памятью. Кэширование дополнительно сократит задержки при обращении к данным.
В результате смартфоны смогут запускать более крупные AI-модели локально. Пользователь получит более быстрый отклик без постоянного обращения к серверу. Локальная обработка также повышает уровень конфиденциальности пользовательских данных.
Новый Hexagon NPU объединяет несколько архитектурных изменений. Element Accelerator работает совместно с векторными и скалярными блоками. Увеличенная общая память дополняет эту вычислительную архитектуру.
Qualcomm делает ставку на агентные сценарии нового поколения. Такие системы должны самостоятельно выполнять последовательности связанных операций. Для этого им требуются вычислительная мощность, память и быстрый доступ к контексту.
Переход к MoE дополнительно меняет требования к мобильному AI. Большие модели смогут работать эффективнее при меньшем числе активных параметров. Это открывает путь к более сложным AI-функциям непосредственно на смартфонах.
