Incident n°1 : retrouver l’origine de doublons dans un flux quotidien
Imprévu. Un traitement en production a échoué à cause de doublons inattendus. Au moment de l’analyse, la donnée avait déjà changé : impossible de voir ce qui s’était passé en regardant l’état courant.
Parade. J’ai reconstitué l’état exact des données au moment de l’échec grâce au time travel de BigQuery, puis je l’ai comparé à l’état courant et aux référentiels. Une série de requêtes d’investigation, de validation et de contre-vérification a isolé la cause : une incohérence de format sur une clé de jointure. La même méthode a ensuite confirmé que la correction tenait.
Ce que j’en retiens. Sur un flux vivant, un diagnostic fiable exige de figer le contexte. L’historique de l’entrepôt est un outil d’enquête à part entière.