Многие начинающие разработчики думают, что мониторинг — это про красивые дашборды с графиками.
Загрузка CPU.
Память.
Количество запросов.
Ошибки.
Всё мигает, движется, выглядит очень профессионально. 😄
Вот только есть одна проблема.
Если никто не смотрит на эти графики в тот момент, когда что-то сломалось, то пользы от них почти нет.
Представьте.
В три часа ночи сервер перестал отвечать.
На графике отлично видно, как CPU улетел в 100%, база данных перестала отвечать, а количество ошибок выросло в сотни раз.
Но узнаете вы об этом... только утром.
От пользователей. 😅
Именно поэтому мониторинг всегда работает в паре с алертами.
Если сервис перестал отвечать, свободное место заканчивается, резко выросло количество ошибок или время ответа стало слишком большим — система сама отправляет уведомление в Telegram, Slack, на почту или даже звонит дежурному инженеру.
Получается простое правило:
📊 Мониторинг показывает, что происходит.
🚨 Алерты сообщают, что пора что-то делать.
Поэтому опытные команды сначала настраивают не красивые графики, а действительно полезные уведомления.
Ведь идеальный дашборд бесполезен, если его никто не открыл в нужный момент.
💬 А как думаете, что хуже: когда алертов нет совсем или когда их настолько много, что их уже перестают замечать? 😄