Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

11 Commits
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

🚀 GOVBR Data Engine | Pipeline de Auditoria com IA

Motor de processamento de alto desempenho para ingestão, saneamento e enriquecimento semântico de dados governamentais (+12GB).

O SIAV Data Engine é o núcleo de processamento do ecossistema de auditoria. Ele orquestra o fluxo desde a extração de dados brutos no Google Drive até a disponibilização de vetores semânticos no Supabase/pgvector, utilizando a Arquitetura de Medalhão para garantir a linhagem e integridade do dado. 🏗️ Arquitetura do Pipeline (Medallion)

O pipeline é dividido em camadas lógicas para garantir resiliência e reprocessabilidade:

Bronze (Ingestion): Consome arquivos .zip, convertendo CSVs legados em Parquet (Apache Arrow) para eficiência de armazenamento e leitura.

Silver (Refinement): Padronização de colunas, saneamento de tipos e tratamento de valores nulos/inconsistentes.

Gold (Business): Consolidação de entidades (Viagens, Pagamentos, Trechos) em visões de negócio otimizadas para consumo.

Audit Layer (IA & BI): Geração de Embeddings para busca semântica (RAG), detecção de anomalias com Isolation Forest e agregação de cubos analíticos.

📂 Estrutura de Diretórios

A organização do projeto segue princípios de Modularidade e Separação de Preocupações (SoC): Bash

├── src/govbr_etl │ ├── core/ # Core do Pipeline (Fases ETL) │ │ ├── bronze/ # Ingestão e conversão inicial │ │ ├── silver/ # Refinamento e limpeza de esquemas │ │ └── gold/ # Visões consolidadas de negócio │ ├── modules/audit/ # Camada de Inteligência e RAG │ │ ├── bi/ # Geração de Cubos de Análise (OLAP) │ │ ├── rag/ # Feature Engineering e Vetorização (LLM ready) │ │ └── search/ # Otimização de indexação e buscas │ ├── pipeline/ # Utilitários de padronização (Schema Enforcement) │ ├── shared/ # Clientes Cloud (Azure, Drive, Supabase) │ └── tools/ # Scripts de validação de contratos de dados ├── logs/ # Monitoramento granular de cada execução └── scripts/ # Automações de suporte e documentação

🛠️ Diferenciais de Engenharia

Lightning-Fast Processing: Uso intensivo de Polars para manipulação de dados, garantindo performance superior ao Pandas em hardware limitado.

Observabilidade: Geração de logs granulares para cada módulo (ex: vetorizacao_rag.log, gold_viagens.log), facilitando o rastreio de erros em grandes volumes.

Data Contract: Ferramentas integradas para verificação de esquemas (check_gold_schema_contract.py), garantindo que o downstream (App/Frontend) nunca quebre.

IA-Ready: Pipeline de RAG nativo que prepara justificativas textuais para análise crítica por LLMs.

🚀 Como Executar Configuração Inicial

Configure as credenciais no arquivo .env (Azure, Supabase e Google Drive).

Instale as dependências:
Bash

pip install -r requirements.txt
export PYTHONPATH=$PYTHONPATH:$(pwd)/src

Orquestração via CLI

O pipeline é modular e pode ser acionado por fases: Bash

Executa o ciclo completo de ETL (Bronze -> Gold)

python main.py --ano 2025 --fase etl

Processa a camada de Auditoria, ML e Vetorização

python main.py --ano 2025 --fase audit

Faz o upload dos dados processados para o ambiente de Serving

python main.py --ano 2025 --fase upload

🔗 Ecossistema de Auditoria

Este motor alimenta a interface inteligente:

SIAV App / Investigador IA: Dashboard reativo e análise semântica em tempo real.

📸 Demonstração do Pipeline em Operação

O SIAV Data Engine é operado via CLI, permitindo a execução modular de cada etapa do ecossistema de dados.

1. Processamento e Auditoria (ETL & RAG)

Abaixo, o motor realizando a extração, saneamento e a geração de inteligência (vetorização semântica e detecção de anomalias).

Fase de ETL Fase de Auditoria RAG

2. Consolidação e Disponibilização (Cube & Upload)

Após o processamento, o sistema gera cubos analíticos para BI e sincroniza os dados finais com o ambiente de produção (Supabase/Azure).

Geração de Cubos de BI Upload para Nuvem

Nota: O uso de Polars permite que essas operações de larga escala sejam concluídas em segundos, mesmo em hardware limitado, otimizando o consumo de memória e CPU.

Desenvolvido por Rogério Oliveira | Engenharia de Dados & Soluções de Alta Performance.

About

⚙️ Engine de alta performance para processamento de +12GB de dados governamentais. Pipeline em arquitetura de medalhão (Bronze/Silver/Gold) com detecção de anomalias (ML) e vetorização RAG para auditoria inteligente.

Topics

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages