Come ti informiamo o avvisiamo
Un outage vale la pena rilevarlo solo se la persona giusta ne viene informata. Inviamo dove il tuo team già guarda, e ai tuoi sistemi quando una persona non è la prima a dover reagire.
I canali
Ogni canale riceve lo stesso messaggio: quale monitor, da quando e perché. Ognuno è un indirizzo che aggiungi una volta e poi assegni a una regola.
-
Email Ogni piano
Un messaggio a qualsiasi indirizzo, confermato una volta prima di inviarlo, così un avviso non può essere indirizzato alla casella di qualcun altro.
-
Webhook (POST) Ogni piano
Un corpo JSON con tutti i campi sottostanti, verso un tuo URL. Per la tua automazione: apri un ticket, avvisa un turno, cambia una spia di stato.
-
Webhook (GET) Ogni piano
Gli stessi campi come parametri di query, per un ricevitore che può accettare solo un GET.
-
PagerDuty Starter e superiori
Un incidente tramite l'Events API v2, aperto durante un outage e risolto al recupero, così l'escalation di PagerDuty lo gestisce da lì. Un controllo lento o con perdita arriva come avviso, non come critico.
-
Slack Pro e Business
Un messaggio in un canale, rosso per offline e verde per tornato online, tramite un webhook.
-
Microsoft Teams Pro e Business
Lo stesso messaggio in un canale Teams, tramite un webhook.
-
Discord Pro e Business
Lo stesso messaggio in un canale Discord, tramite un webhook del canale.
-
Telegram Pro e Business
Lo stesso messaggio in una chat, tramite il tuo bot.
Chi sente cosa, e quando
Confermati prima
Nulla viene inviato su segnalazione di un solo probe. Un errore diventa un outage quando i probe di altri due continenti concordano, quindi un avviso significa che il sito è offline e non che c'è un problema di rete intermedio.
Regole ed escalation
Una regola dice chi sente di quali monitor e quanto tempo dopo l'inizio dell'outage. Metti il turno di reperibilità in un gruppo di contatti con un ritardo per membro, e una regola diventa un'escalation che si ferma nel momento in cui il monitor si riprende.
Tornato online, detto una volta
Tutti coloro che sono stati informati dell'outage vengono avvisati quando finisce, con la durata. Non ti sveglieremo per dirti che l'outage è terminato.
Testa prima che ti serva
Ogni indirizzo ha un pulsante che invia un test attraverso lo stesso percorso di un vero avviso, formulato in modo che non possa essere scambiato per un vero outage.
Il webhook, per i tuoi sistemi
Un indirizzo webhook è una tua URL. La chiamiamo quando un outage è confermato, quando si riprende e quando premi test. POST invia i campi come corpo JSON; GET li invia come parametri di query. La URL è memorizzata criptata e non viene mai più mostrata per intero, perché chiunque la possieda può inviarle dati.
| Campo | Cosa contiene |
|---|---|
| reason | down quando un outage è confermato, recovery quando finisce, test quando qualcuno ha premuto il pulsante |
| monitor | Il nome del monitor |
| monitor_id | Il suo id, lo stesso presente nel suo indirizzo nella dashboard |
| target | Cosa controlla: la URL, l'host o il nome |
| type | Il tipo di controllo, come un nome breve tipo https, dns o ssl_cert |
| cause | Perché ha fallito, in poche parole, quando lo sappiamo |
| error_class | La stessa cosa come un nome breve su cui un programma può ramificarsi, tipo timeout, connection o certificate_expired |
| started | Quando l'outage è iniziato, come un orario con il suo fuso |
| confirmed_at | Quando il fallimento è stato confermato |
| confirmed_from | I continenti che lo hanno confermato, come una lista di nomi. Era un singolo nome fino a settembre 2026 |
| degraded | true quando il monitor è lento o perde pacchetti invece di essere down |
| resolved | Quando è finito, come un timestamp ISO 8601, su una recovery |
| duration | Quanto è durato, in parole, su una recovery |
| incident_id | L'id dell'incidente, lo stesso sull'outage e sulla sua recovery |
Un campo senza nulla da dire è null nel JSON e omesso in un GET. Rispondi con qualsiasi stato sotto 400. Qualsiasi altra cosa conta come una consegna fallita e viene riprovata dopo 30 secondi, 2 minuti e 10 minuti, poi abbandonata: un alert che non è arrivato entro un quarto d'ora è storia, non notizia.