Как узнавать о сбоях раньше, чем позвонит клиент
Внутренний проект

Задача
Между поломкой и моментом, когда о ней узнали, проходило два дня
Решение
Мониторинг сервисов с уведомлениями в любой мессенджер
Услуги в этом кейсе
Технологии
- Socket Proxy
- Matrix
- Traefik
- Docker Swarm
- Docker
- N8N
Знакомая ситуация?
Сайт перестал открываться в субботу вечером. Или зависла программа, через которую принимаются заявки. Или отвалилась оплата.
Никто этого не замечает — вечер, выходной. В понедельник выясняется, что два дня не приходили заявки. Сколько именно клиентов ушло к конкурентам за эти два дня, узнать уже невозможно.
Проблема не в том, что что-то сломалось. Ломается у всех. Проблема в том, что между поломкой и моментом, когда о ней узнали, прошло два дня.
Что мы сделали у себя?
У нас на серверах работает около десяти программ: сайт, база данных, внутренние сервисы. Мы настроили так, что при любом сбое сообщение о нём приходит в рабочий чат за несколько секунд. Не «сервер номер три, ошибка 502», а человеческим языком: что именно перестало работать и когда.
Дальше — три вещи, которые обычно не делают, а зря.
Отсеиваем лишнее. Сервер сообщает о сотнях мелких событий в сутки. Если пересылать всё, через неделю уведомления перестают читать — и настоящую поломку пропускают вместе с остальным шумом. До людей доходит только то, на что надо реагировать.
Не отправляем одно и то же дважды. Если сервис перезапускается десять раз подряд, приходит одно сообщение, а не десять.
Держим всё у себя. Уведомления идут в наш собственный рабочий чат на нашем сервере. Ни один посторонний сервис не видит, что происходит внутри компании.
Что это даёт?
- О поломке узнают через секунды, а не через два дня
- Чинят до того, как это заметят клиенты
- Простой измеряется минутами, а не выходными
- Никто не сидит и не проверяет вручную, всё ли работает
Систему потом легко менять под себя. Захотели — сделали:
- перенесли уведомления из Matrix в Telegram;
- настроили сохранение информации о сбоях в удалённое хранилище файлов;
- настроили моментальное реагирование AI-агента на инцидент.
Дорого ли это?
Настройка делается один раз. Дальше система работает сама и не требует ни абонентской платы за сторонние сервисы, ни отдельного сотрудника.
Для базовой сборки нужны две вещи:
- сервис n8n — он отвечает за гибкость: правила фильтрации и маршрутизации меняются без переписывания кода;
- сервис, собирающий состояния — он следит за остальными сервисами и отдаёт события.
Если гибкость не нужна, вы платите только за настройку сервиса уведомлений. Под n8n может понадобиться немного расширить существующий хостинг или арендовать небольшой новый.
Для технических специалистов
События Docker Swarm читаются через docker-socket-proxy — доступ ограничен эндпоинтами чтения, сокет в контейнер не монтируется. Небольшое приложение пересылает поток на вебхук n8n; вся логика фильтрации, дедупликации и форматирования живёт в воркфлоу, поэтому правила меняются без пересборки и передеплоя сервиса. Доставка — в собственный Matrix (Synapse) в том же кластере. Ingress и TLS — Traefik.
У вас так же?
Если вы не знаете, работает ли ваш сайт прямо сейчас, — это и есть ответ. Посмотрим, что у вас есть, и скажем, что стоит настроить. Бесплатно.