Pipeline ETL multi-sources
Architecture de collecte et transformation de données publiques
Architecture ETL modulaire pour croiser les données publiques françaises (INSEE, DARES, URSSAF, SIRENE) aux formats et nomenclatures hétérogènes. Scripts de collecte automatisés par source, harmonisation géographique via tables MIGCOM, contrôles qualité systématiques (valeurs manquantes, doublons, cohérence temporelle). Stockage optimisé Parquet partitionné — compression 10x vs CSV, requêtes instantanées DuckDB.
Livrables
- Documentation technique — à venir
- Schéma d’architecture — à venir
Stack technique
Python · DuckDB · Parquet · Pandas · Requests · INSEE · DARES · URSSAF · SIRENE
