Saltar para o conteúdo

Calculadora de indisponibilidade:
que percentagem de disponibilidade deixou a sua interrupção?

Indique a indisponibilidade registada — devolvemos a percentagem de disponibilidade, as metas de SLA que ela incumpre, o custo com os seus próprios números e a divisão por fase. A direção oposta da nossa calculadora de disponibilidade, que parte do SLA.

nos últimos
A tabela de danos

Um mês de indisponibilidade, avaliado

A mesma matemática da escala de SLA, mas ao contrário: parta dos minutos perdidos e veja que metas eles ainda cumprem.

Indisponibilidade num mês → nota de disponibilidade

mês = 30,42 dias · 43 800 min
Indisponibilidade / mêsEquivale aDisponibilidadeNotaMeta mais exigente cumprida
1 minute um deploy falhado, detetado depressa 99.9977% quatro noves 99.99%
4m 22s todo o orçamento de quatro noves 99.99% quatro noves 99.99%
43m 48s todo o orçamento de três noves 99.9% três noves 99.9%
3h 39m uma tarde difícil 99.5% dois noves 99.5%
7h 18m um problema recorrente 99% dois noves 99%
24 hours um incidente com nome próprio 96.7123% um nove nenhuma delas
O método

Transformar incidentes num número de indisponibilidade

Três regras decidem o número:

  • Some, não faça a média. A indisponibilidade da janela é a soma da duração de cada incidente — três interrupções curtas não significam «disponível na maior parte do tempo».
  • Meça de ponta a ponta. Um incidente começa no primeiro pedido falhado, não no primeiro alerta — e termina quando o serviço é verificado, não quando a correção é publicada.
  • Decida o que significa «em baixo» — por escrito. Interrupção total, checkout avariado, ou apenas lento? Escolha a definição antes do incidente, ou a discussão acontece depois dele.

Depois é uma divisão: indisponibilidade ÷ janela. O registo à direita é o mês de junho de uma pequena loja — a calculadora acima é essa última linha, avaliada.

Um mês, totalmente registado

caldmont.com · junho
4 jun. · 03:12–03:24Reinício do servidor após atualização do kernel — ninguém reparou às 3 da manhã. Ainda conta.12m 0s
18 jun. · 14:41–14:45Rollback do deploy. Curto, mas em hora de ponta — a caixa de entrada de apoio reparou.4m 0s
30 jun. · 11:04–11:47O grande: uma alteração de configuração avariou o checkout em hora de ponta.43m 48s
Total de junho59m 48s de 43 800 minutos — somados, não em média.99,864%
Repare na nota: três incidentes e junho já falha as três noves — o orçamento mensal era de 43m 48s no total.
MTTRMTTR = indisponibilidade total ÷ número de incidentes
MTBFMTBF = tempo total em funcionamento ÷ número de incidentes
Disponibilidade a partir de ambosdisponibilidade = MTBF ÷ (MTBF + MTTR)
Custo de uma interrupçãocusto ≈ horas de indisponibilidade × receita/h + pessoas × horas × taxa horária com encargos
FAQ

Perguntas frequentes sobre indisponibilidade

Existem duas direções para a mesma fórmula. Partindo de uma percentagem de SLA obtém-se a indisponibilidade que ela permite (é o que faz a nossa calculadora de disponibilidade). Partindo da indisponibilidade registada, como esta página faz, obtém-se a percentagem de disponibilidade que ela produziu: (janela − indisponibilidade) ÷ janela × 100. Acrescentamos os dois números que uma folha de cálculo não dá: quanto custou e para onde foram os minutos.

Divida a indisponibilidade pela janela e multiplique por 100. Uma interrupção de 43m 48s num mês de 30,42 dias: 2 628 s ÷ 2 628 000 s × 100 = 0,1% de indisponibilidade — ou seja, 99,9% de disponibilidade. Duas regras: some todos os incidentes da janela — sem fazer a média — e meça desde o primeiro pedido falhado até à recuperação verificada.

Entre duas e três noves é a faixa normal para serviços de produção pequenos a médios — entre 43 minutos e 7 horas por mês. Três noves (43m 48s/mês) é a meta de referência: alcançável com um bom alojamento, rollbacks rápidos e alguém de prevenção. Se o seu mês ultrapassar as 7 horas, a tabela de danos acima mostra a nota que está a entregar — e a secção da cronologia no resultado mostra onde recuperar minutos primeiro.

Ignore os valores por minuto divulgados em estudos empresariais — juntam bancos e padarias na mesma média. O seu teto é a sua própria aritmética: receita por hora × horas de indisponibilidade, mais as pessoas que largaram tudo, mais qualquer penalização contratual. A secção de custo do resultado calcula isto ao vivo com os seus números. Duas ressalvas. Alguns compradores interrompidos voltam mais tarde, por isso a receita perdida é um teto. E alguns custos nunca cabem numa folha de cálculo: confiança, SEO, a acumulação de pedidos de apoio.

Contam da forma que decidiu que contariam — antes do incidente. Prática comum: um caminho crítico avariado (checkout, início de sessão) conta na íntegra mesmo que a página inicial carregue; um estado degradado mas funcional conta à parte, ou não conta de todo. Escreva a definição e aplique-a sempre da mesma forma. As discussões sobre SLA giram em torno deste parágrafo, não da aritmética.

MTTR é o tempo médio de recuperação: indisponibilidade total ÷ número de incidentes. É a sua melhor alavanca, porque reduzi-lo para metade reduz a indisponibilidade para metade sem evitar um único incidente. MTBF é o tempo médio entre falhas, ou seja, com que frequência as coisas avariam. Depende da arquitetura e da disciplina nas alterações, não da velocidade de resposta. Juntos dão a disponibilidade: MTBF ÷ (MTBF + MTTR). O RTO é o MTTR que prometeu — quanto tempo uma interrupção pode durar antes de o plano de recuperação falhar. Teste-o antes que um incidente o faça.

Ataque o MTTR antes do MTBF — recuperar mais depressa é mais barato do que falhar menos. E dentro do MTTR, ataque primeiro a deteção: é a única fase que uma ferramenta consegue encurtar por completo. No nosso exemplo prático, a deteção demorou 11 minutos e a correção demorou 4. Verificações a cada trinta segundos limitam o silêncio antes da primeira verificação falhada a meio minuto — não conseguem encurtar o envio do alerta nem o tempo que alguém demora a atender o telefone, e é por isso que a deteção encolhe quatro minutos aqui, não onze. O diagnóstico encolhe com provas (resultados de várias localizações, marcas temporais exatas); a correção em si encolhe com rollbacks ensaiados — essa parte depende da preparação de cada equipa.

Não é possível calcular o que não foi detetado — o reinício das 3 da manhã no nosso registo de junho só existe porque algo estava a monitorizar. A monitorização independente fornece os dados de que esta calculadora precisa: horas exatas de início e fim, a partir de fora da própria infraestrutura. Isto cobre todos os incidentes, incluindo os que aconteceram enquanto ninguém estava acordado. A Uptimia verifica a partir de mais de 171 localizações em mais de 70 países — a cada 60 segundos no plano Basic, a cada 30 a partir do Professional — e mantém esse registo automaticamente.

99,9% — TRÊS NOVES · POR MÊS

43m 48s de indisponibilidade = 99,9%.

Ao longo de um mês, 43m 48s de indisponibilidade deixam 99,9% de disponibilidade — três noves. Em baixo: os mesmos minutos comparados com quatro metas de SLA comuns, quanto custam com os seus números, e para onde foram.

A sua interrupção — edite qualquer campo e todas as secções abaixo atualizam-se
nos últimos
Obtenha os minutos exatos da próxima vez uptimia.com/downtime-calculator?down=2628s&window=month
1 · A nota

43m 48s, avaliados face a quatro metas comuns

Os orçamentos são por janela e somam-se entre incidentes — este veredito assume que estes foram os únicos minutos perdidos.

Veredito face a quatro metas comuns

uma interrupção face a quatro metas de SLA
99.99% por mêsorçamento 4m 22s — excedido em 39m 25sincumprido
99.95% por mêsorçamento 21m 54s — excedido em 21m 54sincumprido
99.9% por mêsorçamento 43m 48s — sobram 0mscumprido — por pouco
99.5% por mêsorçamento 3h 39m 0s — sobram 2h 55m 12scumprido

A fórmula, com os seus números

percentagem de indisponibilidade
1 · a janelamês = 2,628,000 s
2 · a indisponibilidade2,628 s = 43m 48s → 0.1% da janela
3 · a disponibilidade(2,628,000 − 2,628) ÷ 2,628,000 × 100 = 99.9%

Convenção: ano de 365 dias, mês = ano ÷ 12 (30,42 dias) — o mesmo que a nossa calculadora de disponibilidade e a escala de noves.

2 · Quanto custou

Os seus 43m 48s€14,037 — calculado a partir da receita, das pessoas e do investimento em publicidade introduzidos

Três valores decidem a fatura. Edite-os aqui — o total, as linhas e a navegação acima atualizam-se à medida que escreve.

€/h no momento da interrupção
× 95 €/h com encargos, incidente + limpeza
€ gastos numa página indisponível
€14,037 €320/min de indisponibilidade

A fatura discriminada

43m 48s = 0.73 h
Receita perdida18 400 €/h × 0.73 h. Um limite superior: alguns compradores interrompidos voltam mais tarde, outros compram à concorrência.€13,432
Publicidade a financiar uma página indisponívelAs campanhas não pausam só porque o site pausou. O orçamento continuou a ser gasto durante toda a interrupção.€50
A equipa do incidente4 pessoas × 0.73 h a 95 €/h — duplicado, porque a análise pós-incidente, a limpeza e os pedidos de desculpa demoram, no mínimo, tanto tempo como a interrupção.€555
Crédito de SLA do alojamentoO que quer que o contrato do alojamento devolva pelo incumprimento — normalmente um valor residual. O exemplo prático abaixo mostra porquê.o contrato
Confiança, SEO, acumulação de pedidos de apoioReais, com efeito diferido e impossíveis de avaliar em euros — por isso são apenas listados, não estimados.sem preço
Total, antes dos custos sem preçoIsto é uma interrupção. Some todos os incidentes da janela para obter o total real.€14,037
Exemplo prático — não os seus números

O que paga o crédito de SLA do alojamento numa interrupção de 43m 48s

1 · o incumprimentoO alojamento promete 99,95% mensais (24 × 7). Junho entregou 99,864% — incumprido.
2 · o nívelCompensação contratual para 99,5–99,95%: crédito de serviço de 10% sobre a mensalidade.
3 · a mensalidadeO alojamento custa 49 €/mês. 10% disso é o pagamento total: −4,90 € face a uma perda de ~14 000 €.
4 · a ressalvaOs créditos têm de ser reclamados, não são pagos automaticamente: submeta o pedido no prazo de 30 dias, com provas de uma fonte que não seja o próprio fornecedor contra quem está a reclamar — o registo de incidentes de uma ferramenta de monitorização independente é exatamente isso.

Os créditos de SLA estão limitados a uma parte da mensalidade do alojamento, por isso raramente cobrem a perda. O número que reduz a perda é o tempo de deteção.

3 · Para onde foram os minutos

11m 0s da sua interrupção foi provavelmente atraso puro de deteção

Um incidente típico divide-se em 25% deteção · 39% diagnóstico · 9% correção · 27% recuperação. Aplicado aos seus 43m 48s — a deteção é a fatia que uma ferramenta elimina por completo.

Os seus 43m 48s, divididos por fase

divisão típica, à escala
Deteção11m 0sAinda ninguém sabe. A única fase que uma ferramenta encurta por completo — verificações a cada 30 segundos limitam o silêncio antes da primeira verificação falhada a meio minuto.
Diagnóstico17m 0s«O que mudou?» Encolhe com provas: resultados de várias localizações e marcas temporais exatas aquecem o rasto.
A correção4m 0sNormalmente a fatia mais curta — se o rollback for um único comando ensaiado. Esta parte depende da preparação de cada equipa.
Recuperação11m 48sTermina quando o serviço é verificado a partir do exterior, numa marca temporal registada.

Na fatura acima, só a fatia de deteção ≈ €3,525. A monitorização não corrige o deploy, mas elimina a maior parte da fatia de deteção.

Exemplo prático — uma reconstituição real

Cronologia de uma interrupção de 43m 48s, minuto a minuto

11:04:00o checkout avaria (alteração de configuração às 11:03) 11:08:40primeira verificação falhada — intervalo de 5 min 11:09:40confirmado a partir da 2.ª localização · alerta enviado 11:15:00engenheiro mobilizado — deteção concluída 11:32:00causa raiz: a alteração de configuração das 11:03 11:36:00rollback implementado — correção concluída 11:47:48todas as verificações verdes — incidente encerrado

Com verificações a cada 30 segundos, a linha das 11:08:40 passa a 11:04:30: o silêncio antes da primeira verificação falhada desce de 4m 40s para 30 segundos, e todas as linhas abaixo dela avançam esses quatro minutos.

As ferramentas grátis são só o começo.
O Uptimia cuida dos seus sites.

Uptime, SSL, validade de domínio, velocidade de página, transações — monitorização em 171+ locais em todo o mundo. Grátis por 30 dias.

30 dias grátis sem cartão cancele quando quiser plano gratuito após o teste
Mais de 100.000 sites monitorizados · conforme o RGPD