Dossier de spécialiste 02-1 · Le Cerveau

Le Cerveau: Data engineer GCP

Des données financières contrôlées chaque jour sur Google Cloud. J’écris les contrôles qualité et les traitements Airflow qui les lancent. Quand un chiffre ne colle pas, je mène l’enquête.

Rôle au Casse
Le Cerveau (data et cloud)
Zone
Basé à Carrières-sous-Poissy, dans les Yvelines. Missions sur site en Île-de-France ou en remote.
Disponibilité
Disponible immédiatement, en mission freelance

Monter le prochain coup

Le terrain | Ce que je fais aujourd’hui

Depuis octobre 2024, je suis data engineer chez Mobilize Financial Services, la filiale de services financiers du Renault Group, dans l’équipe Data Platform RCI. J’y pilote des projets GCP à partir des besoins recueillis avec les business analysts, et je code moi-même une partie des cas d’usage.

Le sujet de fond : des données financières venues de plusieurs systèmes doivent être harmonisées avant de servir le métier. Entre la donnée brute et la donnée raffinée, chaque étape peut introduire un doublon, une rupture de volume ou une valeur hors nomenclature. Mon travail consiste à les repérer avant qu’elles n’atteignent les usages en aval.

Le matériel | Comment je travaille

  • Des contrôles en SQL sur BigQuery : conformité aux nomenclatures, cohérence entre jeux de données liés, unicité, complétude, continuité des volumes. Le résultat se lit simplement, une ligne par écart avec sa proportion.
  • Des pipelines Airflow sur Cloud Composer, générés à partir de configuration. Ajouter un contrôle ou un périmètre ne demande pas de réécrire le traitement. J’ai réorganisé l’ordonnancement en deux chaînes, quotidienne et hebdomadaire, selon la nature des contrôles.
  • Des diagnostics en production : quand un traitement échoue, je reconstitue l’état passé de la donnée avec le time travel de BigQuery, je le compare à l’état courant et je remonte jusqu’à la cause.
  • Du Python autour des données, par exemple un traitement de tri automatique des e-mails par IA que j’ai conçu, puis migré vers Office 365 avec Microsoft Graph API.

Le plan | Ce que je peux reprendre chez vous

Un entrepôt BigQuery qui grossit sans garde-fou, des règles de qualité à écrire avec le métier, des DAG Airflow qui échouent la nuit, des chiffres qui ne collent pas entre deux rapports : c’est le terrain que je pratique tous les jours.

Je travaille autant avec les business analysts qu’avec les équipes techniques. Un contrôle n’a de valeur que si son résultat est compris par ceux qui doivent corriger la donnée. Je formalise donc les règles avec eux avant de les écrire en SQL.

Côté données géographiques, j’ai aussi écrit des recherches de proximité en SQL sur PostgreSQL et PostGIS, avec un index spatial, pour une marketplace mobile.

Les preuves| Études de cas

Chaque affirmation de cette page se vérifie dans un dossier.

  1. Pièce n°1

    Contrôle qualité de données sur GCP, Lire l’étude de cas Contrôle qualité de données sur GCP

    Contrôles qualité automatisés sur des flux de données financiers, pipelines Airflow pilotés par configuration et diagnostics en production avec le time travel de BigQuery.

  2. Pièce n°2

    Batkari, Lire l’étude de cas Batkari

    Positions stockées en coordonnées géographiques avec un index spatial, et recherches de proximité en SQL sur PostGIS pour une carte en temps réel.

Au parcours| Expériences

Votre projet est le prochain coup.

Un entrepôt de données à fiabiliser ou des pipelines à reprendre ? Décrivez le contexte, on regarde ensemble par où commencer.