Инциденты и задачи

Перегрев ASIC: как проверить сигнал и организовать работу в ROC

Как отличить актуальный перегрев от устаревшей телеметрии, определить затронутые ASIC, передать работу ответственному и проверить восстановление оборудования.

Команда ROC3 мин чтения
Рабочая очередь ROC: задачи, инциденты и действия смены на демонстрационных данных

При сигнале о перегреве ASIC сначала проверьте свежесть температуры и связь с устройством, затем определите масштаб проблемы и передайте проверку ответственному сотруднику. В ROC показатели, оборудование и история инцидента связаны между собой. Завершение задачи нужно оценивать вместе с текущими данными оборудования.

Проверьте, что сигнал описывает текущее состояние

Откройте затронутый ASIC и сопоставьте температуру со временем последнего обновления. Проверьте статус связи и график показателей. Если обновления прекратились, последнее известное значение не описывает температуру устройства в настоящий момент.

В ROC предусмотрены предупреждение о повышенной температуре и критический сигнал. Используемые пороги зависят от настройки системы. Не переносите один температурный предел на всё оборудование: сверяйте модель, тип показателя и требования производителя.

Определите масштаб проблемы

Сравните затронутый ASIC с соседними устройствами по месту установки и времени начала отклонения. Одиночный сигнал и одновременные сигналы в одном контейнере требуют разной проверки. Общее размещение помогает выбрать направление поиска, но само по себе ещё не доказывает причину.

Что видно в мониторинге

Что передать сотруднику на площадке

Отклонение у одного ASIC

S/N, место установки, модель, время начала и актуальные показатели.

Отклонения у нескольких соседних ASIC

Список устройств, общий участок и последовательность появления сигналов.

Температура пропала вместе со связью

Время последнего обновления и состояние связи; охлаждение ещё не подтверждено.

Сохраните контекст в задаче или инциденте

В рабочей записи должны быть понятны затронутое оборудование, приоритет, ответственный и срок реакции. Добавьте наблюдения: какие данные актуальны, что уже проверили и какое действие требуется на месте. Это позволяет следующей смене продолжить работу без повторного сбора сведений.

Автоматическое создание задачи связано с условиями работы системы и наличием подходящего оператора на смене. Если инцидент открыт, а задача или ответственный отсутствуют, проверьте назначение работы — не считайте, что её уже приняли в исполнение.

Организуйте проверку на площадке

Ответственный сотрудник проверяет оборудование и условия его работы по регламенту площадки. В истории фиксируют наблюдения, выполненные действия и результат. Удалённую команду применяют, когда она доступна устройству, разрешена роли и соответствует согласованному порядку работы.

Перезапуск не заменяет поиск причины. Если после него показатель снова растёт, сохраните это наблюдение и продолжите проверку. Не запускайте массовые действия только потому, что несколько ASIC попали в один фильтр.

Проверьте восстановление по данным

После выполненных действий проверьте несколько последовательных обновлений температуры, связь и хешрейт. Сравните их с режимом работы оборудования. Отсутствие свежих данных не подтверждает восстановление, даже если прежний сигнал больше не показан.

Что оставить следующей смене

Передайте краткую последовательность: когда возникло отклонение, какие ASIC затронуты, что проверили, какие действия выполнили и какими данными подтверждён результат. Если проверка продолжается, укажите следующий шаг и ответственного.

Материалы ROC по теме

Задачи, инциденты, смены и сроки в ROC

Показатели и история оборудования в мониторинге ROC

Связанный раздел ROCИнцидентыМатериал обновлён 9 сентября 2026 г.