На официальном форуме разработчиков NVIDIA появилась тревожная жалоба пользователя. Речь идёт о профессиональной карте RTX PRO 6000 Blackwell на чипе GB202. Видеокарта с 96 гигабайтами памяти сбоит под длительной ИИ-нагрузкой. На системах Linux устройство регулярно вызывает ошибку сторожевого таймера Xid-8. Графический процессор при этом фактически зависает намертво. Проблема воспроизводится сразу на двух версиях открытого драйвера. Речь идёт о версиях 595.84 и 610.43.02.
Тестовая платформа построена на десктопной системе с процессором Raptor Lake. Операционная система — Ubuntu 24.04 с ядром 7.0.0-30-generic. На машине включена функция Secure Boot. Пользователь применял подписанный Canonical открытый модуль GSP от NVIDIA.
Тестировалась именно карта RTX PRO 6000 Blackwell. Для сравнения в системе также стояла RTX 4090. Проверку проводили при двух ограничениях мощности — стандартных 600 Вт и урезанных 450 Вт. Оба варианта энергопотребления одинаково приводили к сбою устройства.
Характер ошибки в логах остаётся одинаковым при каждом повторении. Сторожевой таймер RC фиксирует предполагаемое зависание видеокарты. Тайм-аут составляет ровно семь секунд перед выдачей ошибки. Система выбрасывает код Xid 8 в момент сбоя. Связанным процессом обычно оказывается llama-server или скрипт на Python для ИИ-вычислений. Приложение верхнего уровня получает характерную ошибку CUDA. Сообщение гласит о превышении времени запуска и принудительном завершении задачи.
К счастью, проблема не требует полной перезагрузки всей системы. Видеокарта самостоятельно восстанавливается примерно за 15 секунд после сбоя. Случаев повреждения аппаратной части или данных зафиксировано не было.
Впервые сбой начал проявляться ещё 18 августа этого года. С тех пор пользователь насчитал уже 13 повторений проблемы. Ошибку провоцируют преимущественно два типа рабочих нагрузок. Первый сценарий — обработка длинного контекста в llama.cpp с активированной технологией CUDA Graph. Второй сценарий — обучение крупных Transformer-моделей на 4 и 9 миллиардов параметров. Речь идёт о точности FP32 в чистом режиме Eager без графов вычислений.
При непрерывной максимальной нагрузке на видеокарту сбой повторяется примерно каждые 20-45 минут. Именно плотное обучение в точности FP32 демонстрирует наивысшую вероятность возникновения проблемы.
Параллельно пользователь провёл масштабную диагностику и исключил целый ряд возможных причин. Отключение CUDA Graph немного смягчает ситуацию только в сценарии инференса llama.cpp. Однако сценарий обучения в PyTorch изначально не использует эту технологию, но сбой всё равно происходит. Это говорит о том, что CUDA Graph лишь усиливает проблему, а не является её причиной.
Обновление или откат версии драйвера тоже не повлияли на ситуацию. Характер ошибки и частота её появления остались абсолютно неизменными. Показатели коррекции ошибок ECC при этом оставались нулевыми без единого случая переназначения строк памяти.
Температурный фактор также был полностью исключён из числа причин. Максимальная зафиксированная температура в момент сбоя составила лишь 87 градусов. Более того, сбой возникал даже при прогреве системы всего до 51 градуса из состояния простоя. Нехватку видеопамяти тоже исключили из числа виновников проблемы. В момент сбоя свободного объёма памяти оставалось свыше 55 гигабайт. Ограничение по мощности также никак не связано с проблемой. Оба режима — на 450 и 600 Вт — одинаково провоцировали зависание.
Отдельно стоит отметить случайный характер возникновения самой ошибки. При абсолютно одинаковых входных данных и чистой перезагрузке точка сбоя не остаётся постоянной.
Сравнительные тесты продемонстрировали крайне показательную разницу между двумя видеокартами. На той же машине с идентичной версией драйвера карта RTX 4090 на чипе AD102 прошла идентичную задачу обучения в FP32. Устройство отработало без единой ошибки на протяжении 26912 шагов подряд. Общее время безотказной работы составило 5,35 часа.
При этом та же система с RTX PRO 6000 Blackwell под похожей нагрузкой зависала пять раз за один вечер. Это позволяет уверенно локализовать источник проблемы именно в графическом процессоре поколения GB202.
Дополнительное тестирование выявило ещё одну важную деталь ситуации. Обучение и инференс модели на 27 миллиардов параметров в формате BF16 прошли без единого сбоя. Проверка длилась целых восемь часов при полной нагрузке на видеокарту. Судя по всему, ошибка связана с плотностью подачи команд ядра и продолжительностью выполнения отдельных вычислительных операций. Именно высокая нагрузка в точности FP32 провоцирует проблему заметно чаще остальных сценариев.
Автор публикации уже направил соответствующий отчёт представителям NVIDIA. По его предположению, дело кроется в известном дефекте платформы GB202. Речь может идти о логике планирования каналов или работе ядра GSP-RM при высокой плотности подачи команд. Пользователь уже собрал полный лог nvidia-bug-report за минуту до возникновения сбоя. По его словам, проблему удаётся стабильно воспроизвести в течение одного часа тестирования.

