Saltar para o conteúdo

Monitorização de sites com alertas PagerDuty

A Uptimia verifica os seus sites, certificados e processos de checkout a partir do exterior da sua rede e regista cada falha confirmada como um incidente no PagerDuty. A partir daí, a sua política de escalonamento assume o controlo — um telemóvel toca, depois o seguinte quando ninguém atende, até alguém assumir o caso.

Os alertas precisam de um responsável, não de uma audiência

Um alerta de chat é uma difusão: todos o veem, por isso ninguém é responsável por ele. O PagerDuty transforma a mesma falha numa atribuição — um nome, uma contagem decrescente, e o nome seguinte quando a contagem chega ao fim.

O alerta como mensagem num canal

Visto por todos, da responsabilidade de ninguém

A Signing API falha
04:52 · publicado em #alerts
ninguém de serviço aqui
O histórico do canal
três reações 👍 até à hora do pequeno-almoço

Todos os que veem a mensagem presumem que um colega mais próximo de um teclado está a tratar do assunto, e num domingo a sala inteira está a dormir em uníssono. Um canal não faz ideia de quem está de folga.

O alerta como incidente no PagerDuty

Um nome, um temporizador, depois um telefonema

A Signing API falha
04:52 · evento de acionamento
política · temporizador de 4 min
O telemóvel que tem de atender
toca, escalona, regista a confirmação

O PagerDuty já sabe de quem é a semana, que número ligar e o que fazer quando ninguém atende. A única coisa que não consegue fornecer é a razão para começar: a prova, a partir do exterior da sua rede, de que um visitante real não conseguiu carregar a página.

Um canal mais ruidoso não ajuda. Um alerta com um responsável e um cronómetro ajuda. Eis uma recuperação de um domingo de manhã, minuto a minuto:

Uma interrupção, um telefonema

Uma falha na sua infraestrutura pode deixar nove verificações vermelhas ao mesmo tempo — checkout, API, início de sessão, tudo no mesmo minuto. A Uptimia agrupa-as num único incidente, e o PagerDuty faz tocar um único telemóvel: o de quem estiver de prevenção nessa semana.

04:52 Nove verificações falham na mesma política de escalonamentoUm único evento de acionamento: "9 monitors down — Signing API +8 more (#482)" gravidade · critical
04:53 A política liga para o responsável principal — sem respostaNada se perde: a política já está em contagem decrescente para o passo dois política · passo 1
04:58 O responsável secundário confirma, inicia a recuperação regionalO resumo indicava o monitor e a gravidade — o suficiente para agir de imediato confirmado no PagerDuty
05:16 ✅ Tudo resolvido: os 9 monitores voltaram a ficar operacionaisO seu próprio evento com gravidade warning — o responsável fecha o incidente evento de recuperação
24 minindisponível → operacional
O engenheiro que resolveu o problema nunca tinha aberto a Uptimiasemana 2 da escala
A pessoa de prevenção não tinha sessão na Uptimia e nunca precisou de uma. O aviso indicava o monitor, a gravidade e o componente — o suficiente para agir — e a confirmação ficou registada no PagerDuty.
9 monitores, 1 acionamentoconfirmado em 6 min24 minutos indisponívelsem necessidade de sessão
A deteção veio de fora do edifício. Tudo o resto ficou no PagerDuty — a escala, o telefonema, o escalonamento, a confirmação. sem necessidade de sessão de monitorização

Ligue o PagerDuty em três passos

Crie um serviço no PagerDuty, copie a chave que este lhe fornece, e cole-a na Uptimia. Não há nenhuma aplicação para autorizar nem nada seu para manter em funcionamento.

Passo 12 min

Copie a chave do PagerDuty

Crie um serviço no PagerDuty — a chave apresentada é tudo o que a Uptimia precisa.

Web platform · Events API v2 Copiar chave
R0VE··············KEY · um único valor, nada mais para configurar
Passo 21 min

Cole-a na Uptimia

Guarde a chave, e um evento de teste comprova o encaminhamento na hora.

Alertar este monitor para
PagerDuty · Web platformE-mailSlack
evento de teste entregue · gravidade info · origem uptimia.com
Passo 3importante

Deixe o PagerDuty gerir o escalonamento

As suas escalas, substituições e telefonemas ficam no PagerDuty — a Uptimia regista o incidente e recua.

Quem escalona
política PagerDuty — de prevenção → +4 min secundário → +10 min responsável
escalonamento Uptimia — um passo · as janelas de manutenção não enviam nada
Guia técnico de configuração

Ligue o PagerDuty à Uptimia

Todos os passos, no Centro de Ajuda: criar o serviço no PagerDuty, copiar a chave, e associá-la aos seus monitores.

Qualquer verificação que execute pode acionar o seu pager

Fazer ping à página inicial só diz respeito à página inicial. A Uptimia também percorre um início de sessão passo a passo, segue uma cadeia de API que falha na terceira chamada e nota quando uma tarefa agendada nunca reporta — e qualquer um destes casos pode acionar o pager.

Verificações de disponibilidadeConfirmado primeiro por até três regiões
Certificados SSLDatas de expiração e handshakes falhados
Expiração do domínioDatas de renovação que se aproximam
Métricas do servidorCPU, memória, disco e carga
1 chave de encaminhamento uma única chave — todas as verificações acionam o pager através dela
Heartbeats e cron jobsA tarefa noturna que nunca reportou
TransaçõesCheckouts repetidos passo a passo
Vírus e malwarePáginas sinalizadas, servidores em lista negra
Velocidade da páginaTempos de carregamento acima do limite definido
A gravidade acompanha o evento — uma interrupção confirmada chega como critical, uma recuperação e um servidor acima do limiar de CPU, memória ou disco chegam como warning, para que as regras do seu serviço os possam encaminhar de forma distinta. todas as verificações · uma única chave

Encaminhe cada sistema para a equipa responsável

Acione uma única escala para tudo, ou dê a cada sistema o seu próprio serviço — o checkout para a equipa da loja, os servidores para a equipa de plataforma, e as descobertas de baixo risco para um canal que espera pela manhã.

Um único serviço
Uma chave, uma escala — onde a maioria das equipas começa.
Todos os tipos de monitor acionam para aqui
Uma política de escalonamento, um evento de acionamento
A sua política decide quem acorda
uma chave, um contacto
Um serviço por sistema
Checkout, plataforma e infraestrutura, cada um com a sua própria chave.
Repetições de transação → a escala de pagamentos
Servidores e heartbeats → infraestrutura
Certificados e domínios → a fila de renovações
as chaves são apenas contactos
Pager de noite, chat de dia
Nem toda a descoberta justifica um telefonema às quatro da manhã.
Interrupções confirmadas → PagerDuty
Avisos de expiração e limiar → um canal de chat
Relatórios mensais de disponibilidade → e-mail
o mesmo incidente, audiências diferentes
O mesmo incidente também pode chegar a SlackMS TeamsDiscordTelegramWhatsAppTwilio SMSE-mail

Os canais são lidos.Os pagers são atendidos.

Toda a plataforma no período de teste — todos os tipos de verificação, uma única chave, e um incidente registado no momento em que uma falha é confirmada.

Comece o seu teste gratuito de 30 dias
30 dias grátis sem cartão de crédito cancele quando quiser

Acionamento no PagerDuty, evidência na Uptimia

O evento diz o que falhou e com que gravidade, que é tudo o que um responsável precisa. O veredicto por sonda, o gráfico do tempo de resposta e a cronologia do incidente estão à espera na Uptimia para quem escrever o acompanhamento.

O que o evento realmente transporta

Todos os acionamentos são o mesmo JSON para a Events API v2: um resumo do que falhou, source uptimia.com, uma gravidade, e um componente que identifica o tipo de verificação — ou Incident group sempre que uma política de escalonamento o gerou. Nada para mapear ou analisar.

summary — Signing API is DOWN (Uptimia incident #479)TEXTO severity — criticalACIONA component — Incident groupENCAMINHA

Confirmado antes de acionar o pager

Uma sonda com azar nunca acorda ninguém sozinha. Nas verificações de disponibilidade, velocidade, certificado e transação, define quantas regiões independentes têm de concordar — até três — antes de um evento ser enviado.

mais de 171 sondas · 6 continentes

Uma tempestade, um incidente

Os monitores que partilham uma política de escalonamento e falham em conjunto são agrupados num único incidente Uptimia, e o PagerDuty recebe um único evento que o identifica.

Incidente Uptimia #482 · 9 monitores

A manutenção mantém-se silenciosa

As janelas planeadas suprimem os alertas, por isso uma implementação às 23:00 nunca se transforma num telefonema.

23:00–01:00 · silenciado

Tempo de reação registado

Numa política de escalonamento, a Uptimia regista a data e hora das suas próprias confirmações, por isso o incidente fica com o registo de quem o assumiu e quantos minutos demorou.

confirmado · 6 min

Apenas factos — por conceção

Os canais de chat recebem uma ligação de confirmação; o PagerDuty e as cargas úteis de webhook nunca a recebem — um fluxo automático de pipelines de registos nunca deve poder silenciar um escalonamento. Confirme no PagerDuty ou na Uptimia, cada um para o seu próprio escalonamento.

Evento PagerDuty — factos, sem ligação de confirmaçãoPOR CONCEÇÃO Canais de chat — ligação de confirmação incluídaSLACK · TEAMS Painel — um toque termina o escalonamentoUPTIMIA

Como funcionam os alertas de monitorização PagerDuty

A Uptimia verifica os seus sites a partir de mais de 171 localizações externas e, quando uma verificação falha, regista um incidente no PagerDuty — a sua política de escalonamento chama quem estiver de prevenção e continua até alguém confirmar. O incidente identifica o monitor, o que correu mal e a sua gravidade, e quando a verificação recupera, um segundo evento leva o sinal de tudo resolvido ao mesmo serviço.

O pager fecha-se sozinho quando o site voltar

A recuperação é um evento, não uma resolução

Operacional novamente às 05:16
evento de tudo resolvido enviado
nenhuma resolução é enviada
O incidente continua aberto
até um responsável o fechar

Todos os eventos enviados pela Uptimia são acionamentos, nunca resoluções — uma verificação que volta a ficar ativa de forma instável não é um incidente que alguém tratou. O sinal de tudo resolvido chega como o seu próprio evento de gravidade warning, identificando os monitores que recuperaram; é o responsável quem fecha o incidente no PagerDuty.

Sondas externas + a sua política de escalonamento

Detetado no exterior, escalonado no interior

171+ localizações
até três regiões têm de concordar
um único evento de acionamento
A sua política de prevenção
chama, escalona, regista

Uma verificação de estado interna partilha a sua região, o seu balanceador de carga e o seu mau dia, e fica em silêncio junto com eles. As sondas em mais de 70 países falham de forma independente de si — que é o único tipo de evidência que justifica acordar um colega às 4 da manhã.

Cada evento

Sete eventos, uma única chave de encaminhamento

Cada linha é um único POST para a Events API v2 — sem modelos para manter, sem campos para mapear, sem nada para manter em funcionamento do seu lado.

Compare os 12 canais de alerta
EventoGravidadeO que o resumo diz
Interrupção confirmadacriticalO nome do monitor, marcado como DOWN
Resumo da tempestadecritical"9 monitors down — Signing API +8 more (Uptimia incident #482)"
Atualização de adesãocriticalQuantos mais monitores aderiram ao mesmo incidente
Lembrete de indisponibilidade contínuacritical"Still down: 3 of 9 monitors" quando um passo de escalonamento posterior dispara
Limiar do servidorwarningCPU, memória, disco ou carga acima do limite definido
RecuperaçãowarningOperacional novamente — um único monitor também indica há quanto tempo
Evento de testeinfoUma saudação da Uptimia, enviada quando prime Enviar teste

Perguntas frequentes sobre a integração PagerDuty

01O que preciso do lado do PagerDuty?+
Um serviço com uma integração Events API v2. No PagerDuty: Services → New Service → escolha Events API v2 como tipo de integração, e depois copie a Integration Key a partir do separador Integrations do serviço. Essa chave é o único valor que a Uptimia armazena — não há nenhuma aplicação para autorizar, nenhuma conta de utilizador para ligar e nada para alojar.
02A Uptimia resolve o incidente quando o site volta a funcionar?+
Não. Todos os eventos enviados pela Uptimia são acionamentos, incluindo o sinal de tudo resolvido: a recuperação chega como o seu próprio evento de gravidade warning, identificando o que voltou a funcionar, e o incidente no PagerDuty continua aberto até alguém o fechar lá. Uma verificação que volta a ficar ativa não é o mesmo que uma interrupção que foi tratada, por isso a última palavra pertence ao responsável.
03Uma única interrupção vai acionar o meu pager nove vezes?+
Não se esses monitores partilharem uma política de escalonamento. O agrupamento está ativado por predefinição e reúne tudo o que falha dentro da mesma janela num único incidente Uptimia, pelo que o PagerDuty recebe um único evento a identificá-lo: "9 monitors down — Signing API +8 more (Uptimia incident #482)". Os monitores que aderem mais tarde geram um único evento de atualização limitado, em vez de um por monitor, e um único sinal de tudo resolvido quando todos recuperam. Os monitores sem política de escalonamento associada são alertados um a um, e o agrupamento pode ser desativado nas definições de Alertas, caso seja essa a sua preferência.
04De quem é o escalonamento que prevalece — o da Uptimia ou o do PagerDuty?+
O que estiver associado ao monitor — e executar os dois em simultâneo duplica o ruído. As equipas que já vivem no PagerDuty deixam-no gerir a escala e associam o monitor a um único contacto PagerDuty. As próprias políticas de escalonamento da Uptimia — passos temporizados para mais pessoas e canais, construídas no plano Professional e superiores — existem para equipas sem uma ferramenta de prevenção.
05Confirmar no PagerDuty também confirma na Uptimia?+
Não — a ligação é unidirecional: a Uptimia publica eventos, o PagerDuty nunca responde de volta. Confirmar no PagerDuty interrompe o escalonamento do PagerDuty; confirmar no painel da Uptimia interrompe o da Uptimia. É também por isso que as cargas úteis do PagerDuty não trazem, deliberadamente, uma ligação de confirmação, ao contrário dos canais de chat — um fluxo automático e os pipelines de registos por detrás dele não devem conseguir silenciar um escalonamento.
06Que monitores podem acionar um incidente?+
Todos eles — disponibilidade, transações, velocidade de página, monitorização de utilizadores reais, SSL, domínios, malware, servidores, heartbeats, listas negras, DNS e verificações de API. Cada um escreve o seu próprio resumo, identificando o monitor e o que lhe aconteceu, e cada um envia o seu próprio sinal de tudo resolvido quando a verificação volta a passar.
07Como são atribuídas as gravidades?+
As interrupções confirmadas chegam como critical, tal como os alertas de expiração e degradação enviados por monitor — se preferir que estes não acionem o pager de ninguém, envie-os antes para um canal de chat. Os limiares de recursos do servidor — CPU, memória, disco, carga — e todas as recuperações chegam como warning; os incidentes agrupados registados a nível de problema também. O evento de teste chega como info. Todos os eventos trazem também source uptimia.com e um componente que identifica o tipo de verificação ("Uptime Monitoring", "SSL Certificate", "API Monitoring"), ou "Incident group" sempre que o alerta foi registado através de uma política de escalonamento.
08Monitores diferentes podem acionar pagers de serviços diferentes?+
Sim. Adicione uma integração por Integration Key — cada uma torna-se o seu próprio contacto — e depois associe os monitores ao contacto que corresponde à escala responsável por eles. Uma repetição de checkout pode acionar o serviço de pagamentos, enquanto um aviso de disco vai para a infraestrutura.
09O que acontece se a chave estiver errada ou o PagerDuty estiver inacessível?+
A chamada tem um limite — dez segundos para ligar, trinta no total — por isso um endpoint lento ou inacessível não consegue atrasar o resto do envio de alertas, e o resultado fica registado junto com o alerta. Todos os outros contactos desse monitor são notificados de forma independente deste. Vale mais detetar uma chave mal escrita com o Enviar teste do que durante uma interrupção real.
10O PagerDuty está disponível em todos os planos?+
Sim — é um canal de alerta integrado, incluído em todos os planos e no período de teste gratuito de 30 dias, sem qualquer cobrança por evento por parte da Uptimia. O que paga ao PagerDuty por lugares e pelas suas próprias funcionalidades de escalonamento é um assunto entre si e o PagerDuty.

Alertas de indisponibilidade, diretos para quem está de prevenção

Ligue o PagerDuty com uma única chave, e cada falha confirmada chama quem estiver de prevenção — com a evidência à espera na Uptimia quando lá chegar.

Quem está de prevenção, não uma difusão Uma chave, sem código Teste gratuito de 30 dias Sem cartão de crédito
O PagerDuty é um canal de alerta integrado — qualquer verificação executada pela Uptimia pode acionar um incidente.