GH analytics

Analytics Engineer · Composable Data Platform · Laboratório Ativo

Engenharia Analítica de ponta a ponta, open source, sob medida, em produção

Portfólio de Guilherme Santos, Analytics Engineer com 9+ anos em plataformas de dados e Engenharia Analítica. Composable Data Platform open source em produção desde nov/2024. Laboratório ativo com pipelines reais funcionando 24/7.

100%

Open source, sem vendor lock-in

3

Modelagens: 3NF, Data Vault e Kimball

24/7

Laboratório ativo desde nov/2024

9+

Anos com plataformas de dados

Minha abordagem

Uma plataforma composable, não uma solução genérica

O motor central é o DuckDB, com DuckLake como camada transacional sobre Parquet, trazendo ACID, time travel e schema evolution, sem servidor de metadados separado e sem overhead de JVM. Ingestão via Python puro e PyAirbyte, para ERPs e APIs públicas.

A modelagem é escolhida por entidade, não por projeto inteiro: 3NF para dados estáveis, Data Vault (Hub/Link/Satellite) para entidades com histórico de mudança e integração multi-fonte. As duas abordagens convergem em Star/Galaxy Schema (Kimball) na camada Gold. Documentação completa: conceitual, lógica, física, dbt docs e SchemaSpy.

Explorar a Stack Timeline →
Ingestão
Python puroPyAirbyte
Lakehouse
DuckDBDuckLakedbt Core
Modelagem
3NFData VaultKimball Star/Galaxy
Orquestração
Apache Airflow 3.xDockerKubernetes
Serving & BI
StreamlitMetabasePostgreSQL DW
Qualidade
Great Expectationsdbt TestsRLS

O que construo

Da modelagem formal ao pipeline em produção, com documentação, qualidade de dados e acesso seguro por padrão.

Composable Data Platform

Arquitetura Lakehouse sobre DuckDB + DuckLake, um formato de tabela transacional (ACID, time travel, schema evolution) com catálogo em PostgreSQL, eliminando o problema clássico de arquivos fragmentados em ingestões incrementais. Medallion (Bronze → Silver → Gold) orquestrado com dbt e Airflow. 100% open source, versionado em Git, sem vendor lock-in.

Modelagem de Dados Formal

Três camadas entregues como artefato do projeto: conceitual (Excalidraw), lógica (dbdiagram/DBML) e física (DDL Python + dbt schema.yml). Na Silver, a abordagem é escolhida por entidade: 3NF para dados estáveis de fonte única, Data Vault (Hub/Link/Satellite) para entidades com histórico de mudança e integração multi-fonte. Ambas convergem em Star/Galaxy Schema (Kimball) na Gold. Documentação via SchemaSpy e dbt Docs.

Engenharia de Pipelines

Ingestão de ERPs (Protheus/TOTVS via PyAirbyte), APIs governamentais (MDIC, IBGE, ANP), bancos relacionais e arquivos flat. Scripts Python puros para ingestão, transformação, exportação e validação. Compressão Parquet zstd, particionamento por tempo, carregamento em chunks via COPY nativo no PostgreSQL.

Qualidade & Observabilidade

Great Expectations para validações estatísticas, dbt tests para integridade referencial e unicidade, scripts Python de validação pós-carga. Row Level Security no PostgreSQL. Todos os serviços expostos com SSL via Nginx + Certbot. PgBouncer para connection pooling.

Dashboards & Visualização

Streamlit + Plotly para portais analíticos sob medida. Metabase self-hosted para BI self-service de negócio, sem licença por usuário. Dois canais deliberadamente separados por público e propósito. Storytelling de Dados e UX Design para alta gestão. Acesso seguro via subdomínio dedicado com autenticação.

Laboratório Técnico

Ambiente próprio com dois pipelines paralelos rodando em produção 24/7 desde nov/2024, com dados de ERP (Protheus) e dados públicos (MDIC/Comex). Cada componente testado, versionado e documentado como base de estudo e evolução contínua da stack.

Laboratório ativo

Dois pipelines rodando em produção agora

Não é arquitetura no papel. Cada componente da stack está funcionando, testado e documentado neste laboratório, rodando 24/7 em um VPS ARM com Docker desde nov/2024.

Pipeline Comex

Dados públicos MDIC: balança comercial brasileira

API Gov → Python → OCI Object Storage → DuckDB → dbt → PostgreSQL DW. Parquet com zstd nível 3, Medallion Bronze→Silver→Gold, atualização automática via Airflow.

Python puroDuckDBdbt CoreAirflowParquet/zstdPostgreSQL

Pipeline ERP

ERP empresarial: dados comerciais e financeiros

SQL Server → PyAirbyte → DuckDB Engine (DuckLake) → dbt → PostgreSQL DW + RLS. Modelagem híbrida na Silver: 3NF para dados estáveis e Data Vault (Hub/Link/Satellite) para entidades com histórico de mudança, convergindo em Star/Galaxy Schema na Gold.

PyAirbyteDuckDBDuckLakeData Vaultdbt CoreRLS

Stack tecnológica completa

DuckDBDuckLakedbt CoreApache AirflowPythonPyAirbyteData VaultSQL AvançadoPostgreSQLDockerKubernetesOCI / GCPGit / CI-CDStreamlitPlotlyMetabaseGreat Expectationsdbt DocsSchemaSpyExcalidrawdbdiagram.ioNginxPgBouncerCertbot / Let's EncryptParquet / zstd

Segmentos de atuação

Experiência em múltiplos setores

AgronegócioIndústriaVarejoAtacadoFranquiasTransportadoraEducaçãoFinanceiroComércio Exterior

Quer conversar sobre essa arquitetura?

Se você quer entender melhor alguma decisão técnica, discutir uma oportunidade ou trocar ideia sobre dados, ficarei feliz em conversar.