Алерти та інциденти
Правила алертів стежать за трафіком одного проєкту й повідомляють когось, коли той перетинає заданий вами поріг. Використовуйте їх, щоб дізнатися про ендпоінт, що падає, раніше за його власника.
Створіть правило
Section titled “Створіть правило”- Відкрийте сторінку Алерти проєкту й створіть правило.
- Оберіть умову та поріг.
- Оберіть вікно. Для
CONSECUTIVE_FAILURESтакож оберіть ендпоінт, за яким стежити. - Оберіть важливість і канал.
- Збережіть. За замовчуванням правила обчислюються щохвилини (
ALERTS_EVALUATION_CRON).
| Умова | Спрацьовує, коли |
|---|---|
FAILURE_RATE |
Частка невдалих серед доставок проєкту, створених у вікні, у відсотках, сягає порогу або перевищує його. Правильний вибір, коли трафік деградує, а не зник. |
CONSECUTIVE_FAILURES |
Останні доставки на ендпоінт, стільки, скільки задає поріг, усі невдалі. Потребує ендпоінта: правило без нього ніколи не спрацює. Ловить ендпоінт, який зник, швидше за частку, бо не потребує обсягу. |
DLQ_THRESHOLD |
Кількість доставок проєкту, що стали невдалими повідомленнями у вікні, сягає порогу або перевищує його. Саме ця умова каже, що доставки полишають, а не просто повторюють. |
LATENCY_THRESHOLD |
p95 часу відповіді по проєкту за вікно, у мілісекундах, сягає порогу або перевищує його. Повільний ендпоінт з’їдає паралелізм і врешті відкриває запобіжник. |
Правило спрацьовує, коли його умова починає виконуватися, а не на кожному обчисленні, поки вона триває. Один збій дає одне сповіщення, а не одне щохвилини.
Налаштування, від яких залежить, чи хтось відреагує
Section titled “Налаштування, від яких залежить, чи хтось відреагує”| Налаштування | За замовчуванням | Порада |
|---|---|---|
| Вікно | 5 хвилин | Наскільки далеко назад дивиться умова. Короткі вікна смикаються на малому трафіку; довгі повільні на великому. Узгоджуйте з тим, скільки доставок проєкт отримує за цей час. |
| Ендпоінт | Немає | Обов’язковий для CONSECUTIVE_FAILURES. Решта умов вимірює весь проєкт. |
| Важливість | WARNING |
INFO, WARNING або CRITICAL. Правило CRITICAL під час спрацювання ще й відкриває інцидент. |
| Заглушення й відкладення | Вимкнено | Заглушіть правило безстроково або відкладіть до певного часу. Під час запланованих робіт відкладайте правило, а не видаляйте. Вимкнене правило взагалі не обчислюється. |
Канали
Section titled “Канали”Один канал на правило. Щоб повідомити в два місця, створіть два правила.
| Канал | Куди надсилає | Що потрібно |
|---|---|---|
IN_APP |
Сповіщення в панелі. За замовчуванням. | Нічого |
EMAIL |
Одному або кільком отримувачам | Налаштована пошта в розгортанні: EMAIL_ENABLED=true і параметри SMTP |
SLACK |
URL вхідного вебхука Slack | URL |
WEBHOOK |
Будь-який ваш URL, як JSON POST. Через нього дістанетесь пейджера, тикет-системи чи власної маршрутизації. |
URL |
Інциденти
Section titled “Інциденти”Інцидент збирає те, що сталося, у запис із хронологією. Правило CRITICAL відкриває його автоматично під час спрацювання; також можна відкрити інцидент самому на сторінці Інциденти проєкту й додавати нотатки до хронології.
| Статус | Означає |
|---|---|
OPEN |
Ще ніхто не взявся |
INVESTIGATING |
Хтось над ним працює |
RESOLVED |
Закрито. Хронологія лишається, тож наступний випадок можна порівняти з цим. |
Чого поки немає
Section titled “Чого поки немає”- Немає каналу PagerDuty чи Opsgenie. Обидва приймають HTTP-запит, тож канал
WEBHOOKдістає їх із невеликим адаптером на вашому боці. - Немає алерту на тишу. Правило спрацьовує на те, що сталося, а не на проєкт, який перестав надсилати трафік, хоча не мав би.
- Немає автоматичного вимкнення ендпоінта, який постійно падає. Алерт повідомить вас; вимикає ендпоінт людина.
Що далі
Section titled “Що далі”Повтори та невдалі повідомленняЩо відбувається з доставкою, перш ніж її визнають невдалою.
СпостережуваністьМетрики й алерти платформи для операторів.