Qualité des données : 6 contrôles à automatiser
Un CA différent selon le rapport qu’on ouvre, des clients en double dans le CRM, des marges calculées sur des coûts vieux de six mois : la mauvaise qualité des données ne fait pas de bruit. Elle coûte en silence. Et elle mine la confiance : le jour où un dirigeant repère une erreur dans son tableau de bord, il retourne à l’intuition, et des mois de travail partent avec.
Pas besoin d’un grand programme qualité pour reprendre la main. Six contrôles automatisés, posés au bon endroit, interceptent la plupart des incidents avant qu’ils n’atteignent le comité de direction. Cet article les décrit un par un, avec leur emplacement idéal et le mode d’alerte qui va avec.
Ce que coûte la mauvaise qualité des données
Les études sérieuses convergent au moins sur un point : la facture est lourde. Gartner évalue le coût de la mauvaise qualité de données à au moins 12,9 millions de dollars par an et par organisation en moyenne (recherche 2020, menée auprès de grandes entreprises). Le chercheur Thomas Redman, dans la MIT Sloan Management Review, estimait la perte entre 15 et 25 % du chiffre d’affaires pour la plupart des entreprises. Ces chiffres viennent du monde des grands comptes ; inutile de les transposer tels quels. Retenez plutôt la mécanique : le coût est élevé et invisible, parce qu’il est éclaté en frictions quotidiennes que personne n’additionne.
À l’échelle d’une PME, ces frictions ont des visages connus : une relance envoyée à un client qui a déjà payé, une commande passée sur une référence morte, deux jours de contrôle de gestion pour réconcilier des chiffres qui auraient dû l’être d’office. Rien de spectaculaire. Juste un frottement permanent, qui use les équipes et retarde les décisions.
Les 6 contrôles à automatiser
Inutile de déployer les centaines de règles d’un programme grand compte. Six familles, qui recoupent les dimensions de qualité du référentiel DAMA-DMBOK, couvrent la grande majorité des incidents :
- La complétude. Les champs qui conditionnent vos analyses doivent être remplis. Un client sans code postal, une facture sans axe analytique : chaque trou devient un « non affecté » dans vos rapports. Le contrôle compte les vides sur les champs qui comptent, et seulement ceux-là.
- L’unicité. Le même client saisi trois fois avec trois orthographes fausse le CA par client, les relances et toute la connaissance commerciale. La détection traque les quasi-doublons : même SIREN, même e-mail, libellés trop proches, adresses semblables.
- La fraîcheur. Un tableau de bord alimenté par un export oublié depuis dix jours est plus dangereux qu’un tableau vide, parce qu’il a l’air à jour. Le test vérifie la date de dernière alimentation de chaque source contre un seuil convenu.
- La cohérence entre sources. Le CA du CRM, celui de la compta et celui de la facturation doivent raconter la même histoire. Un écart peut être légitime (avoirs, décalages de période) ; il doit alors être connu et expliqué. La vérification compare les totaux et alerte au-delà d’une tolérance.
- Les plages de validité. Une remise de 250 %, une livraison datée de 1970, une quantité négative : autant de valeurs techniquement possibles et métier-impossibles. Le garde-fou borne chaque champ sensible avec des règles simples.
- Les référentiels. Familles de produits, centres de coûts, statuts : dès que chacun saisit sa propre version d’un code, les regroupements partent en morceaux. Le contrôle rejette ou signale toute valeur absente de la liste officielle.
À la source ou au chargement : où brancher les contrôles
À la source, on empêche l’erreur d’entrer : champ obligatoire, liste fermée, format imposé, valeur par défaut bannie des champs sensibles. C’est l’option la plus rentable, à une condition : pouvoir paramétrer l’outil de saisie. Et elle ne couvre jamais les données venues de l’extérieur.
Au chargement, on contrôle ce qui entre dans le socle de reporting : des tests exécutés à chaque actualisation, qui valident complétude, plages et référentiels avant d’alimenter le moindre tableau de bord. Notre règle tient en une phrase : verrouiller à la source tout ce que l’outil permet, contrôler au chargement tout le reste, et ne jamais corriger en silence. Une correction invisible est une erreur qui reviendra.
Des alertes, pas des rapports qualité
Le rapport qualité mensuel de quarante pages finit toujours au même endroit : personne ne le lit. Ce qui change les comportements, c’est l’alerte ciblée. Un message à la bonne personne, avec la ligne fautive, au moment où le seuil est franchi. Deux niveaux suffisent : le bloquant, qui arrête le chargement (un fichier de paie incomplet ne doit jamais alimenter un rapport de masse salariale), et le non-bloquant, qui laisse passer mais notifie, avec un délai de correction attendu.
Attention au calibrage. Une alerte qui sonne dix fois par jour est morte en deux semaines. Démarrez avec des seuils larges, resserrez au fil de l’eau, et supprimez sans état d’âme celles que personne ne traite.
Qui est responsable de la qualité des données ?
Ce que nous constatons en mission : tant que la qualité des données « appartient à la DSI », rien ne bouge. La DSI voit passer les flux, pas le sens métier. Une remise anormale, seul le directeur commercial sait la juger ; un code analytique douteux, c’est l’affaire de la finance. Le modèle qui tient en PME est léger : un propriétaire par domaine de données (clients, produits, données financières), qui reçoit les alertes de son périmètre et arbitre les corrections. Ce n’est pas un poste. C’est un rôle : dix minutes par jour, plus une revue mensuelle de vingt minutes autour de deux indicateurs, le nombre d’incidents et le délai de correction.
Dans les coulisses de nos audits data, l’absence de propriétaire identifié revient dans presque tous les diagnostics. Chacun suppose que quelqu’un d’autre surveille. Personne ne surveille.
Par où commencer lundi
Choisissez un seul flux, celui qui fait mal : la facturation, ou l’alimentation du tableau de bord de direction. Posez-y deux contrôles pour démarrer, complétude et cohérence entre sources, généralement les plus rentables. Branchez une alerte vers un propriétaire nommé, laissez tourner un mois, puis comptez les incidents interceptés. Ce chiffre-là décidera de la suite mieux que n’importe quel argumentaire.
Pour objectiver l’état de vos flux avant de choisir, notre diagnostic data ops vous donne une première lecture, gratuitement et en quelques minutes.
Vos équipes passent plus de temps à vérifier les chiffres qu’à les utiliser ? Pour en sortir, réservez un appel de 30 minutes : nous vous dirons quels contrôles poser en premier chez vous, et comment nous cadrons ce type de chantier dans notre pilotage de projets data.
Parlons de vos données.
30 minutes pour évaluer votre situation. Conseils concrets garantis, avec ou sans mission.