Designer de SLOs e Alertas de Burn-Rate Acionáveis
Defina SLIs voltados ao usuário, dimensione error budgets e troque alertas ruidosos por pages de burn-rate.
Por Os Melhores Prompts
Categoria: DevOps
O que ele faz
Define SLIs como eventos bons sobre eventos válidos do ponto de vista do usuário, e não a partir de CPU ou contagem de pods, e diz o que o ponto de medição escolhido (cliente, load balancer ou servidor) esconde. Dimensiona o error budget em minutos e escreve regras multi-window multi-burn-rate - fast burn 14.4x em 1h/5m para page, slow burn 6x em 6h/30m para ticket - de modo que uma page sempre signifique orçamento realmente em risco. Também faz a triagem de cada alerta existente em manter, rebaixar para ticket ou apagar, com uma linha de justificativa para cada.
Use quando
- Uma escala acordada toda noite por alertas sem ação
- SLOs pedidos pela liderança sem nenhum SLI por trás
- Alertas de limiar de CPU que nunca previram uma queda
- Um serviço com métricas mas sem jornada de usuário definida
O que você recebe
- 1-3 fórmulas de SLI com a query exata e o ponto de medição
- Metas de SLO e o error budget em minutos ou requisições
- Regras multi-window de burn-rate prontas para colar
- Veredito manter, rebaixar ou apagar para cada alerta atual
- Esboço de runbook por page e plano de rollout em shadow
Como usar
- Descreva o serviço e o que ele faz pelos usuários em `{{service_description}}`, e o caminho de requisição mais importante em `{{user_journey}}`.
- Liste métricas, labels, campos de log, traces, exporters, retenção e scrape interval em `{{telemetry_available}}` - avise se não houver label de sucesso por requisição, pois o desenho do SLI muda.
- Cole as regras atuais em `{{current_alerts}}` com os números honestos: pages por semana e o percentual que gerou ação.
- Informe tamanho do time, rotação, horário comercial ou 24/7 e o MTTR histórico em `{{oncall_reality}}`.
- Rode as novas regras em shadow pelo período indicado, compare pages disparadas com o budget realmente queimado e então faça o corte e apague o que a triagem marcou.
Tags: observability, sre, slo, prometheus, alerting, burn-rate, error-budget, promql
Preço: 10.00 BRL