Right-Sizing de Requests, Limits e HPA no Kubernetes

Defina requests, limits e HPA a partir de percentis reais sem provocar throttling ou OOMKills.

Por Os Melhores Prompts

Categoria: DevOps

O que ele faz

Converte uso por percentil em requests, limits e um HPA que não brigam entre si. Requests seguem o estado estável p50-p90, porque tanto o scheduler quanto a utilização do HPA os leem; o limit de memória segue o p99 mais folga, porque memória é incompressível; limits de CPU são questionados explicitamente, com `container_cpu_cfs_throttled_seconds_total` como evidência decisiva. Cada número vem com o percentil e o fator de folga que o originaram, a classe de QoS resultante e os conflitos HPA/VPA e a latência do cluster autoscaler que poderiam anular o ajuste.

Use quando

O que você recebe

Como usar

  1. Coloque o manifest do workload com requests/limits atuais e PDB em `{{workload_manifest}}`.
  2. Preencha `{{usage_metrics}}` com pelo menos 7 dias cobrindo um pico: CPU/memória p50/p90/p99, taxa de throttling, restart count e tamanho da janela.
  3. Informe seu HPA/VPA/KEDA em `{{hpa_config}}`, o formato de RPS, a razão pico/vale e o SLO de latência em `{{traffic_profile}}`, e tamanhos de nó, quotas e mix de spot em `{{cluster_constraints}}`.
  4. Aplique o patch primeiro em um único workload e acompanhe as queries PromQL indicadas.
  5. Faça rollback com o diff fornecido se throttling, OOMKills ou latência p99 cruzarem os critérios de abort.

Tags: kubernetes, hpa, autoscaling, cost, vpa, resource-limits, cpu-throttling, capacity-planning

Preço: 10.00 BRL