Перейти до вмісту

Алерти та інциденти

Правила алертів стежать за трафіком одного проєкту й повідомляють когось, коли той перетинає заданий вами поріг. Використовуйте їх, щоб дізнатися про ендпоінт, що падає, раніше за його власника.

  1. Відкрийте сторінку Алерти проєкту й створіть правило.
  2. Оберіть умову та поріг.
  3. Оберіть вікно. Для CONSECUTIVE_FAILURES також оберіть ендпоінт, за яким стежити.
  4. Оберіть важливість і канал.
  5. Збережіть. За замовчуванням правила обчислюються щохвилини (ALERTS_EVALUATION_CRON).
Умова Спрацьовує, коли
FAILURE_RATE Частка невдалих серед доставок проєкту, створених у вікні, у відсотках, сягає порогу або перевищує його. Правильний вибір, коли трафік деградує, а не зник.
CONSECUTIVE_FAILURES Останні доставки на ендпоінт, стільки, скільки задає поріг, усі невдалі. Потребує ендпоінта: правило без нього ніколи не спрацює. Ловить ендпоінт, який зник, швидше за частку, бо не потребує обсягу.
DLQ_THRESHOLD Кількість доставок проєкту, що стали невдалими повідомленнями у вікні, сягає порогу або перевищує його. Саме ця умова каже, що доставки полишають, а не просто повторюють.
LATENCY_THRESHOLD p95 часу відповіді по проєкту за вікно, у мілісекундах, сягає порогу або перевищує його. Повільний ендпоінт з’їдає паралелізм і врешті відкриває запобіжник.

Правило спрацьовує, коли його умова починає виконуватися, а не на кожному обчисленні, поки вона триває. Один збій дає одне сповіщення, а не одне щохвилини.

Налаштування, від яких залежить, чи хтось відреагує

Section titled “Налаштування, від яких залежить, чи хтось відреагує”
Налаштування За замовчуванням Порада
Вікно 5 хвилин Наскільки далеко назад дивиться умова. Короткі вікна смикаються на малому трафіку; довгі повільні на великому. Узгоджуйте з тим, скільки доставок проєкт отримує за цей час.
Ендпоінт Немає Обов’язковий для CONSECUTIVE_FAILURES. Решта умов вимірює весь проєкт.
Важливість WARNING INFO, WARNING або CRITICAL. Правило CRITICAL під час спрацювання ще й відкриває інцидент.
Заглушення й відкладення Вимкнено Заглушіть правило безстроково або відкладіть до певного часу. Під час запланованих робіт відкладайте правило, а не видаляйте. Вимкнене правило взагалі не обчислюється.

Один канал на правило. Щоб повідомити в два місця, створіть два правила.

Канал Куди надсилає Що потрібно
IN_APP Сповіщення в панелі. За замовчуванням. Нічого
EMAIL Одному або кільком отримувачам Налаштована пошта в розгортанні: EMAIL_ENABLED=true і параметри SMTP
SLACK URL вхідного вебхука Slack URL
WEBHOOK Будь-який ваш URL, як JSON POST. Через нього дістанетесь пейджера, тикет-системи чи власної маршрутизації. URL

Інцидент збирає те, що сталося, у запис із хронологією. Правило CRITICAL відкриває його автоматично під час спрацювання; також можна відкрити інцидент самому на сторінці Інциденти проєкту й додавати нотатки до хронології.

Статус Означає
OPEN Ще ніхто не взявся
INVESTIGATING Хтось над ним працює
RESOLVED Закрито. Хронологія лишається, тож наступний випадок можна порівняти з цим.
  • Немає каналу PagerDuty чи Opsgenie. Обидва приймають HTTP-запит, тож канал WEBHOOK дістає їх із невеликим адаптером на вашому боці.
  • Немає алерту на тишу. Правило спрацьовує на те, що сталося, а не на проєкт, який перестав надсилати трафік, хоча не мав би.
  • Немає автоматичного вимкнення ендпоінта, який постійно падає. Алерт повідомить вас; вимикає ендпоінт людина.