Почему оповещения от мониторинга начинают игнорировать
Частая история: систему мониторинга внедряют с энтузиазмом, настраивают алерты почти на всё — и через пару месяцев их читают по диагонали, а потом и вовсе отключают уведомления в отдельный канал, который никто не открывает.
Причина обычно одна
Слишком много срабатываний без реального действия на выходе. Если алерт приходит, а с ним ничего не нужно делать — прочитал, вздохнул, закрыл — мозг довольно быстро учится такие сообщения пропускать. И когда придёт действительно важное — оно потеряется в той же массе.
Что помогает
Разделение по приоритету — это не галочка "критично / не критично" для галочки, а реальная разница в действии. Критичный алерт должен означать "нужно вмешаться сейчас", а не "было бы неплохо посмотреть на неделе".
Пороговые значения стоит настраивать не по учебным значениям "по умолчанию", а по факту наблюдения за нормальным поведением конкретной сети — на одной инфраструктуре 80% загрузки канала это норма в моменте, на другой — уже повод для тревоги.
И, пожалуй, главное: у каждого алерта должен быть понятный следующий шаг. Если непонятно, что делать с уведомлением, кроме как посмотреть на него — скорее всего, оно просто не должно существовать в таком виде.
Итог
Мониторинг с сотней алертов, которые никто не читает, работает хуже, чем мониторинг с десятком — но таких, на которые точно отреагируют. Лучше меньше, но по делу.