Kubernetes, IaC, CI/CD e resposta a incidente.
Audite um terraform plan em busca de replacements e perda de dados antes do apply, com guardrails e rollback.
Defina SLIs voltados ao usuário, dimensione error budgets e troque alertas ruidosos por pages de burn-rate.
Transforme o material bruto do incidente em timeline, análise causal e ações com dono e prazo.
Escolha canary ou blue-green e conecte tudo ao Argo CD e ao Helm com critérios automáticos de abort.
Reduza o tamanho da imagem com reescrita multi-stage, economias ranqueadas e os riscos de runtime explicitados.
Transforme events, exit codes e logs do pod em uma causa nomeada, um fix YAML mínimo e um rollback.
Defina requests, limits e HPA a partir de percentis reais sem provocar throttling ou OOMKills.
Separe bugs reais de flake de CI, reproduza a falha sob demanda e corrija sem depender de retries.
Projete um módulo Terraform reutilizável com interface limpa, código esqueleto e caminho de migração de state.