Dans quelle situation faire appel au cabinet
- Les chiffres ne sont pas les mêmes selon le tableau de bord : plusieurs pipelines recalculent la même chose, personne ne connaît la source de vérité, et chaque réunion commence par un débat sur les données.
- Un pipeline casse et on le découvre par les utilisateurs : pas d'alerte, pas de reprise sur incident, une dépendance à la personne qui l'a écrit.
- BigQuery coûte de plus en plus cher : requêtes non partitionnées, tables rescannées en entier, planifications redondantes. Le coût suit le volume au lieu de suivre l'usage.
- Une plateforme est à construire ou à reprendre : migration d'un ETL vieillissant, nouvel entrepôt, ou industrialisation de scripts qui ont grandi trop vite.
Ce qui est livré
- Une plateforme orchestrée : Dagster ou Airflow selon votre contexte, avec des assets déclarés, des dépendances explicites, des reprises sur incident et une observabilité qui dit ce qui a tourné, quand, et sur quelles données.
- Des pipelines batch et streaming : ingestion des sources, transformations en dbt ou en SQL versionné, tests de qualité exécutés à chaque run, documentation générée.
- Un modèle de données lisible : couches claires de la donnée brute à la donnée exposée, lineage de bout en bout, catalogue. On sait d'où vient chaque chiffre.
- Une facture BigQuery expliquée puis réduite : partitionnement, clustering, matérialisations, planifications, avec un avant/après mesuré sur vos propres requêtes.
- Une gouvernance des accès et de la conformité : accès par rôle, données sensibles chiffrées, RGPD portée en responsabilité, pas en note de bas de page.
- Une passation : CI/CD des pipelines, runbooks, et une équipe capable de faire évoluer la plateforme sans le cabinet.
Comment se déroule la mission
1. Diagnostic, une à deux semaines
cartographie des flux existants, mesure des coûts et des incidents, entretiens avec les consommateurs de la donnée. Restitution écrite avec priorités.
2. Cadrage
choix d'orchestrateur, modèle de données cible, stratégie de migration flux par flux. Des options comparées, chiffrées, à décider ensemble.
3. Construction flux par flux
chaque flux migré est testé, documenté et mis en production avec ses alertes. L'ancien reste en place jusqu'à la bascule vérifiée.
4. Exploitation et transfert
supervision au démarrage, puis passation à votre équipe, avec les runbooks et les pipelines CI/CD qui vont avec.
Ce qui le prouve
Un ETL interne servant plus de six cents projets
exploité en production sur trois environnements, avec lineage, reprise sur incident, gouvernance des accès en Terraform et optimisation continue des coûts.
Plateforme Dagster en production chez un fournisseur d'énergie
depuis janvier 2026 : plateforme de données Dagster avec CI/CD Azure DevOps, responsabilité de la sécurité des données et de la conformité RGPD. Lire l'étude de cas.
Des barèmes réglementaires ingérés par Dagster, avec Claude dans le pipeline
délibérations tarifaires de la CRE (PDF) téléchargées, parsées par Claude Haiku, normalisées puis chargées dans BigQuery et Postgres, pour l'électricité et le gaz. Une veille détecte les nouvelles délibérations pour ne plus jamais calculer sur un barème obsolète. Détail sur la page Projets.
Dagster comme colonne vertébrale d'exploitation
quinze planifications sur un même SaaS : ingestion des données, rafraîchissement d'un cache Redis depuis neuf tables BigQuery, tâches métier quotidiennes (renouvellements, essais, purges), supervision synthétique toutes les cinq minutes, nettoyage des serveurs. Chaque tâche est un asset versionné, relançable à la main depuis l'interface.
Encadrement d'équipes data
ingénieurs managés chez Renault Digital, vingt consultants encadrés sur des comptes stratégiques. La plateforme se construit avec l'équipe, pas à côté d'elle.
Outils pratiqués
Questions fréquentes
Combien de temps dure le diagnostic d'une plateforme data ?
Une à deux semaines : cartographie des flux, mesure des coûts et des incidents, entretiens avec les consommateurs de la donnée, puis une restitution écrite avec des priorités.
Dagster ou Airflow ?
Selon votre contexte. Le cabinet exploite quinze planifications Dagster en production sur un même SaaS et a livré des pipelines Airflow. Le choix est argumenté au cadrage, pas imposé.
Comment réduire une facture BigQuery ?
Partitionnement, clustering, matérialisations et planifications, avec un avant/après mesuré sur vos propres requêtes. Le coût doit suivre l'usage, pas le volume.
Qui exploite la plateforme après la mission ?
Votre équipe. La passation comprend les pipelines CI/CD, les runbooks et le temps passé avec l'équipe pour qu'elle fasse évoluer la plateforme sans le cabinet.
Décrivez votre situation
Un pipeline fragile, une facture BigQuery incompréhensible, une plateforme à reprendre : dites-le tel quel. Le premier échange sert à qualifier, pas à vendre.
Décrire votre situation