Pular para o conteúdo principal
Engenharia de Dados Experimental Componente integrante do projeto BuscaCNPJ

Pipeline reprodutível de ingestão e publicação da base nacional de CNPJ

Aquisição, extração, consolidação, transferência e validação de dezenas de milhões de registros sob restrições reais de memória, disco e rede.

Este artefato constitui a camada inicial de dados do BuscaCNPJ: converte arquivos públicos heterogêneos em um repositório relacional verificável e adequado à exploração analítica. O fluxo emprega transferência por streaming[1], processamento em lotes[2], carga bulk com PostgreSQL COPY[3] e checkpoints por tabela[4].

7Etapas Orquestradas
200 milLinhas por Bloco CSV
20 milLinhas por COPY
71,3 miEstabelecimentos Publicados
Problema computacional

Atualizar uma base nacional não é apenas importar arquivos

A publicação periódica exige controlar falhas parciais, arquivos corrompidos, codificações legadas, pressão de memória, indisponibilidade de rede e divergências entre origem e destino. Uma falha silenciosa pode produzir um banco aparentemente disponível, porém incompleto.

Contribuição tecnológica

O pipeline transforma a atualização mensal em um processo observável e parcialmente retomável, separando aquisição, preparação, publicação e validação. Essa separação permite medir cada etapa, reproduzir falhas e comparar estratégias de implementação.

Integridade e evidência

Uma carga só termina quando pode ser verificada

O pipeline separa término de processamento de aceitação da carga. Após a publicação, são coletadas quantidades por tabela, metadados, amostras e a competência efetivamente carregada.

03

Linhagem e reconciliação

Rastreabilidade entre origem, intermediário e destino

Limitações atuais e evolução metodológica

Responsável técnico