Designer de SLOs e Alertas de Burn-Rate Acionáveis

Defina SLIs voltados ao usuário, dimensione error budgets e troque alertas ruidosos por pages de burn-rate.

Por Os Melhores Prompts

Categoria: DevOps

O que ele faz

Define SLIs como eventos bons sobre eventos válidos do ponto de vista do usuário, e não a partir de CPU ou contagem de pods, e diz o que o ponto de medição escolhido (cliente, load balancer ou servidor) esconde. Dimensiona o error budget em minutos e escreve regras multi-window multi-burn-rate - fast burn 14.4x em 1h/5m para page, slow burn 6x em 6h/30m para ticket - de modo que uma page sempre signifique orçamento realmente em risco. Também faz a triagem de cada alerta existente em manter, rebaixar para ticket ou apagar, com uma linha de justificativa para cada.

Use quando

O que você recebe

Como usar

  1. Descreva o serviço e o que ele faz pelos usuários em `{{service_description}}`, e o caminho de requisição mais importante em `{{user_journey}}`.
  2. Liste métricas, labels, campos de log, traces, exporters, retenção e scrape interval em `{{telemetry_available}}` - avise se não houver label de sucesso por requisição, pois o desenho do SLI muda.
  3. Cole as regras atuais em `{{current_alerts}}` com os números honestos: pages por semana e o percentual que gerou ação.
  4. Informe tamanho do time, rotação, horário comercial ou 24/7 e o MTTR histórico em `{{oncall_reality}}`.
  5. Rode as novas regras em shadow pelo período indicado, compare pages disparadas com o budget realmente queimado e então faça o corte e apague o que a triagem marcou.

Tags: observability, sre, slo, prometheus, alerting, burn-rate, error-budget, promql

Preço: 10.00 BRL