Перегрев ASIC: как проверить сигнал и организовать работу в ROC
Как отличить актуальный перегрев от устаревшей телеметрии, определить затронутые ASIC, передать работу ответственному и проверить восстановление оборудования.

При сигнале о перегреве ASIC сначала проверьте свежесть температуры и связь с устройством, затем определите масштаб проблемы и передайте проверку ответственному сотруднику. В ROC показатели, оборудование и история инцидента связаны между собой. Завершение задачи нужно оценивать вместе с текущими данными оборудования.
Проверьте, что сигнал описывает текущее состояние
Откройте затронутый ASIC и сопоставьте температуру со временем последнего обновления. Проверьте статус связи и график показателей. Если обновления прекратились, последнее известное значение не описывает температуру устройства в настоящий момент.
В ROC предусмотрены предупреждение о повышенной температуре и критический сигнал. Используемые пороги зависят от настройки системы. Не переносите один температурный предел на всё оборудование: сверяйте модель, тип показателя и требования производителя.
Определите масштаб проблемы
Сравните затронутый ASIC с соседними устройствами по месту установки и времени начала отклонения. Одиночный сигнал и одновременные сигналы в одном контейнере требуют разной проверки. Общее размещение помогает выбрать направление поиска, но само по себе ещё не доказывает причину.
Что видно в мониторинге | Что передать сотруднику на площадке |
|---|---|
Отклонение у одного ASIC | S/N, место установки, модель, время начала и актуальные показатели. |
Отклонения у нескольких соседних ASIC | Список устройств, общий участок и последовательность появления сигналов. |
Температура пропала вместе со связью | Время последнего обновления и состояние связи; охлаждение ещё не подтверждено. |
Сохраните контекст в задаче или инциденте
В рабочей записи должны быть понятны затронутое оборудование, приоритет, ответственный и срок реакции. Добавьте наблюдения: какие данные актуальны, что уже проверили и какое действие требуется на месте. Это позволяет следующей смене продолжить работу без повторного сбора сведений.
Автоматическое создание задачи связано с условиями работы системы и наличием подходящего оператора на смене. Если инцидент открыт, а задача или ответственный отсутствуют, проверьте назначение работы — не считайте, что её уже приняли в исполнение.
Организуйте проверку на площадке
Ответственный сотрудник проверяет оборудование и условия его работы по регламенту площадки. В истории фиксируют наблюдения, выполненные действия и результат. Удалённую команду применяют, когда она доступна устройству, разрешена роли и соответствует согласованному порядку работы.
Перезапуск не заменяет поиск причины. Если после него показатель снова растёт, сохраните это наблюдение и продолжите проверку. Не запускайте массовые действия только потому, что несколько ASIC попали в один фильтр.
Проверьте восстановление по данным
После выполненных действий проверьте несколько последовательных обновлений температуры, связь и хешрейт. Сравните их с режимом работы оборудования. Отсутствие свежих данных не подтверждает восстановление, даже если прежний сигнал больше не показан.
Что оставить следующей смене
Передайте краткую последовательность: когда возникло отклонение, какие ASIC затронуты, что проверили, какие действия выполнили и какими данными подтверждён результат. Если проверка продолжается, укажите следующий шаг и ответственного.


