Наблюдаемость
SaaS-платформа
Проблема
Об ошибках в сервисе узнавали от клиентов: разрозненные логи, отсутствие метрик, инциденты разбирались днями.
Решение
Внедрена система метрик, дашбордов и алертов: аномалии видны до жалоб клиентов, причины ошибок находятся по графикам за минуты.
Результат
Что изменилось
- Инциденты видны до жалоб клиентов
- Поиск причины — минуты, а не дни
- Дашборды состояния всех сервисов
GrafanaPrometheusRabbitMQ