Mantenedor de Tabelas Iceberg / Delta

Transforme métricas de arquivos e snapshots em um plano de compaction, expiração e evolução de schema.

Por Os Melhores Prompts

Categoria: Engenharia de dados

O que ele faz

Lê as estatísticas de arquivo — contagem e tamanho médio dos data files, proporção de delete files ou deletion vectors, número de manifests e de snapshots — porque em tabela alimentada por streaming quem domina costuma ser o custo de planejamento da query, não o de scan. Separa os quatro trabalhos de manutenção que costumam ser confundidos: compaction bin-pack, clustering por sort ou z-order, expiração de snapshots e limpeza de orphan files, cada um com seu risco e gatilho de agendamento. Mudanças de schema e partição são classificadas como metadata-only, exigem rewrite ou quebram readers, conferidas contra sua versão de spec Iceberg ou protocolo reader/writer do Delta, com DDL e caminho de migração; a retenção de expire_snapshots/VACUUM é escolhida contra sua query mais longa e a janela de time travel.

Use quando

O que você recebe

Como usar

  1. Informe {{table_format}}: spec Iceberg v1/v2 ou versões reader/writer do Delta, mais todo engine que lê ou escreve (Spark, Flink, Trino, Athena, Databricks).
  2. Cole {{table_metrics}} — linhas, tamanho total, contagem e tamanho médio de data files, delete files, manifests, snapshots, partition spec e cardinalidade.
  3. Descreva {{write_pattern}} (micro-batches de streaming, taxa de MERGE, frequência de commit, writers concorrentes) e {{query_pattern}} (filtros dominantes, chaves de join, p95).
  4. Declare a mudança necessária em {{schema_change_request}}.
  5. Antes de qualquer expiração de snapshot, confira sua query mais longa e a necessidade de time travel contra a retenção escolhida.

Tags: apache-iceberg, delta-lake, lakehouse, compaction, schema-evolution, snapshot-expiration, file-sizing, trino

Preço: 10.00 BRL