Agente autônomo de diagnóstico de falhas do Airflow
Um engenheiro de dados de plantão, em software: quando qualquer DAG falha, o agente investiga sozinho, encontra a causa-raiz, avisa no WhatsApp e — quando o problema é código — abre um Pull Request com a correção, verificando depois se o fix resolveu.
Ao quebrar um pipeline chegava um alerta seco — “deu erro na DAG X”. Alguém precisava abrir o log, entender o traceback, investigar dependências e código. Falhas silenciosas (OOM, tarefa travada) podiam passar dias despercebidas.
O erro vira um diagnóstico acionável em ~1 minuto — causa provável, evidência do log, categoria e o passo a passo (ou o PR) para corrigir. A triagem braçal sai do humano; resta a decisão: avaliar 👍/👎 e mergear.
Do callback de falha ao aprendizado, em um fluxo fechado.
O agente é acionado no momento da falha e assume a investigação.
Extrai a assinatura do erro a partir do traceback real, não de um alerta genérico.
Incidentes passados (episódica) + convenções da arquitetura (semântica) + linhagem do pipeline.
Reúne o contexto e o LLM gera a análise de causa-raiz com evidência do log.
PR draft quando é código; recomendação operacional nos demais casos.
Causa provável, categoria, evidência e o passo a passo — ou o link do PR.
👍 reforça a boa memória; 👎 remove a memória ruim da recuperação.
Um sweeper captura falhas em que o callback sequer roda (processo morto por OOM/SIGKILL), e a verificação pós-merge re-executa a DAG após o fix para confirmar a resolução.
A única escrita no Airflow é re-executar uma DAG após aprovação humana. Nunca faz deploy por conta própria — o merge do PR é o portão.
Episódica (“já vi esse erro?”) e semântica (“como as coisas funcionam nesta arquitetura?”) — camadas e convenções versionadas.
Deduplicação por janela de tempo, circuit breaker diário de custo e kill-switch.
O feedback humano molda a recuperação: reforça o que ajudou e descarta o que atrapalhou.
Não é um “alerta melhorado” — é um primeiro-respondente autônomo que combina RAG, conhecimento da arquitetura, linhagem de dados e raciocínio agêntico, sempre mantendo o humano no comando das decisões irreversíveis.
Fecha o ciclo completo: detectar → diagnosticar → propor → verificar → aprender. Em produção, cobrindo dezenas de DAGs, já diagnosticou incidentes reais em múltiplas categorias — config, dados, código, infraestrutura e upstream — com feedback sendo coletado para medir acurácia e graduar o nível de autonomia.