Rodrigo Xavier← Voltar ao portfólio
Case 02Agente de IA · Produção

Agente autônomo de diagnóstico de falhas do Airflow

Um engenheiro de dados de plantão, em software: quando qualquer DAG falha, o agente investiga sozinho, encontra a causa-raiz, avisa no WhatsApp e — quando o problema é código — abre um Pull Request com a correção, verificando depois se o fix resolveu.

~1 min
do erro ao diagnóstico acionável
168
testes automatizados + golden eval
Dezenas
de DAGs cobertas em produção
Read-only
por design, humano aprova o merge
O problema
Antes

Ao quebrar um pipeline chegava um alerta seco — “deu erro na DAG X”. Alguém precisava abrir o log, entender o traceback, investigar dependências e código. Falhas silenciosas (OOM, tarefa travada) podiam passar dias despercebidas.

Depois

O erro vira um diagnóstico acionável em ~1 minuto — causa provável, evidência do log, categoria e o passo a passo (ou o PR) para corrigir. A triagem braçal sai do humano; resta a decisão: avaliar 👍/👎 e mergear.

Como funciona

Do callback de falha ao aprendizado, em um fluxo fechado.

01
Falha na DAG → callback

O agente é acionado no momento da falha e assume a investigação.

02
Lê o log real

Extrai a assinatura do erro a partir do traceback real, não de um alerta genérico.

03
Consulta a memória

Incidentes passados (episódica) + convenções da arquitetura (semântica) + linhagem do pipeline.

04
Coleta evidência + RCA

Reúne o contexto e o LLM gera a análise de causa-raiz com evidência do log.

05
Roteia a resposta

PR draft quando é código; recomendação operacional nos demais casos.

06
Notifica no WhatsApp

Causa provável, categoria, evidência e o passo a passo — ou o link do PR.

07
Aprende com o feedback

👍 reforça a boa memória; 👎 remove a memória ruim da recuperação.

Duas redes de segurança
O que o torna confiável
Read-only por design

A única escrita no Airflow é re-executar uma DAG após aprovação humana. Nunca faz deploy por conta própria — o merge do PR é o portão.

Duas memórias

Episódica (“já vi esse erro?”) e semântica (“como as coisas funcionam nesta arquitetura?”) — camadas e convenções versionadas.

Anti-spam + teto de custo

Deduplicação por janela de tempo, circuit breaker diário de custo e kill-switch.

Aprende de verdade

O feedback humano molda a recuperação: reforça o que ajudou e descarta o que atrapalhou.

Stack
Linguagem / APIPython 3.11 · FastAPI + Uvicorn
Orquestração do agenteLangGraph — máquina de estados: ingest → signature → dedup → retrieve → evidence → diagnose → route → log
LLMOpenAI — gpt-4.1 (structured output) + text-embedding-3-small
Memória / RAGPostgreSQL + pgvector (similaridade de cosseno)
FerramentasAirflow REST API v2 (JWT) · SQL read-only (pyodbc) · GitHub (PyGithub, só PR draft) · WhatsApp (Evolution API)
ConhecimentoBase de incidentes (episódica) + cheat-sheet de arquitetura (semântica) + tabela de linhagem
DeployDocker + Docker Compose · GitHub Actions (deploy e verificação)
ObservabilidadeLangfuse (opcional) + logging estruturado
Qualidadepytest (168 testes) + golden eval
Diferencial & estado atual
Não é um “alerta melhorado” — é um primeiro-respondente autônomo que combina RAG, conhecimento da arquitetura, linhagem de dados e raciocínio agêntico, sempre mantendo o humano no comando das decisões irreversíveis.

Quer um agente resolvendo um problema real no seu negócio?