Complétude des données : ce que dit le DAMA et comment la mesurer
|
6
minute de lecture

Le conseil le plus populaire concernant la complétude des données est également le plus trompeur : comptez les valeurs NULL et considérez le travail comme terminé. Qu'est-ce que la complétude des données ? C'est le degré auquel toutes les données requises pour un usage particulier sont présentes. Cette définition déplace la question de « Y a-t-il des cellules vides ? » à « Ce jeu de données contient-il ce dont le processus métier, le rapport, le modèle ou le contrôle a besoin ? »
Un champ renseigné peut toujours contenir une valeur erronée, tandis qu'une valeur NULL dans un champ facultatif peut n'avoir aucun impact pratique. La complétude est donc une question d'adéquation à l'usage, et non une exigence de perfection abstraite. Les directives des Nations Unies sur la couverture et la complétude établissent la même distinction conceptuelle dans les statistiques officielles, où la complétude compare les événements enregistrés au total mondial qu'ils sont censés représenter.
Table des matières
En quoi la complétude diffère de l'exactitude et de la validité
Comment digna peut-il accompagner la complétude des données ?
Ce que signifie réellement la complétude des données
La complétude des données est le degré auquel toutes les données requises pour un usage particulier sont présentes. Dans un jeu de données d'entreprise, cela peut signifier des attributs obligatoires renseignés, des enregistrements métier complets, des volumes d'enregistrements attendus, des périodes de reporting requises ou tous les jeux de données sources nécessaires à un processus en aval.
C'est pourquoi la complétude ne se résume pas à l'absence de valeurs NULL. Supposons qu'une table client contienne un identifiant client manquant. Il s'agit d'un défaut de complétude lorsque l'identifiant est requis pour des jointures, des rapprochements ou du reporting. Une préférence marketing secondaire manquante peut être acceptable si l'utilisation prévue n'en dépend pas.
Cette distinction sépare également la complétude des autres dimensions de la qualité des données. Si une adresse est présente mais incorrecte, le problème concerne l'exactitude. Si un numéro de téléphone est présent mais ne respecte pas le format requis, le problème concerne la validité. La complétude demande uniquement si l'information requise existe dans le périmètre défini.
Commencer par l'objectif métier
Avant de choisir une métrique, identifiez ce que les données doivent soutenir :
Le reporting réglementaire peut exiger chaque entité déclarable et chaque attribut obligatoire.
Le traitement opérationnel peut dépendre d'identifiants, de dates et de champs de statut.
L'analyse peut tolérer des attributs d'enrichissement manquants si la population principale reste disponible.
Le développement de l'IA nécessite des champs, des enregistrements et des périodes de temps suffisants pour l'analyse visée, car l'absence de données peut réduire la taille de l'échantillon analysable et produire des estimations biaisées ou imprécises, comme décrit dans cette étude hébergée par le NIH sur les données manquantes.
Règle pratique : Définissez ce que signifie « assez complet » avant de le mesurer. Sinon, un tableau de bord affiche un chiffre sans indiquer si ce chiffre permet de prendre la décision.
Une définition de travail utile est : les enregistrements, champs, relations et périodes de livraison requis sont présents dans le périmètre et la cadence attendus pour un cas d'usage défini. Cette définition donne aux propriétaires de données un élément concret qu'ils peuvent transformer en contrôles.
Les Carbon-cinq types de complétude qui méritent d'être mesurés
Les organisations ont besoin de plusieurs angles de vue sur la complétude car les valeurs manquantes et les populations manquantes sont des anomalies différentes. Les cinq types ci-dessous couvrent les besoins courants de surveillance en entreprise, bien que les équipes doivent sélectionner la combinaison correspondant aux exigences métier.
Complétude des attributs
La complétude des attributs cherche à savoir si les champs requis sont renseignés. Les exemples typiques incluent :
Identifiants clients manquants
Dates de transaction manquantes
Numéros de compte manquants
Attributs métier
NULLrequis par un rapport ou un processus
Un enregistrement client peut exister, mais si son identifiant est absent, l'enregistrement peut être inutilisable pour le dédoublonnage ou les jointures. La mesure pertinente est la part des enregistrements attendus contenant une valeur dans l'attribut spécifié.
Complétude des enregistrements
La complétude des enregistrements évalue si chaque enregistrement disponible contient l'ensemble des champs obligatoires. Une transaction peut avoir un identifiant et un montant mais manquer d'identifiant client, de devise ou de date de transaction. Compter la ligne comme présente masquerait le fait que l'enregistrement n'est pas complet d'un point de vue opérationnel.
Complétude du nombre d'enregistrements
La complétude du nombre d'enregistrements compare la population livrée à la population attendue. Par exemple, une table de transactions quotidiennes qui contient normalement 10 millions d'enregistrements mais n'en contient soudainement que 7 millions présente un problème de complétude de population, même si chaque ligne livrée comporte des champs parfaitement renseignés.
Le document de recherche de DAMA sur la qualité des données soutient cette vision plus large en abordant la complétude à travers les enregistrements, les fichiers, les attributs et les métadonnées.
Complétude temporelle
La complétude temporelle vérifie si toutes les dates ou périodes de reporting attendues sont présentes. Un pipeline financier peut se charger correctement tout en omettant un jour, un mois ou une partition de reporting. La table peut contenir des lignes valides, mais la série temporelle est incomplète.
Complétude du jeu de données
La complétude du jeu de données vérifie si chaque jeu de données requis par un processus en aval est disponible. Un flux de reporting mensuel peut nécessiter des jeux de données sur les clients, les transactions, les produits et les taux de change. Si une source n'arrive pas, les entrées du flux de travail sont incomplètes même si les autres tables sont renseignées.

Ces vérifications ne sont pas interchangeables. Une équipe peut avoir besoin de la complétude des attributs et des enregistrements pour un référentiel client, de la complétude temporelle et du nombre d'enregistrements pour les transactions, et de la complétude du jeu de données pour une dépendance d'orchestration.
Comment DAMA et DMBOK abordent la complétude
DAMA International et l'édition révisée de DAMA-DMBOK® 2.0 traitent la complétude comme une dimension de la qualité des données. Le cadre est particulièrement utile lorsque les équipes appliquent la complétude en relation avec les exigences métier et l'adéquation à l'usage, plutôt que de la traiter comme un score technique universel. L'aperçu des cadres de DAMA et de gestion des données fournit un contexte connexe pour positionner la qualité des données au sein de pratiques de gestion plus larges.
Le cadre de DAMA s'aligne sur une question pratique : que doit-on savoir pour que cette donnée remplisse son rôle prévu ? Le guide de qualité des données du gouvernement britannique stipule que les données sont complètes lorsque toutes les données requises pour un usage particulier sont présentes, et conseille de mesurer la complétude pour les données critiques plutôt que pour chaque champ de chaque jeu de données.
Cela signifie qu'une complétude à 100 % n'est pas automatiquement l'exigence appropriée pour chaque jeu de données. Un taux de complétude de 98 % peut être acceptable pour un cas d'usage analytique mais inacceptable pour un reporting réglementaire. Ces valeurs illustrent une décision de governance, et non des seuils universels.
Définir les exigences par impact
Une politique utile relie la complétude aux conséquences :
Identifiez le rapport, le modèle, le processus ou le contrôle qui consomme les données.
Définissez les enregistrements et attributs sans lesquels il ne peut pas fonctionner.
Établissez un seuil de complétude acceptable avec le propriétaire des données.
Documentez ce qui se passe lorsque le seuil n'est pas atteint.
Réévaluez l'exigence lorsque le cas d'usage évolue.
Une clé primaire, un attribut réglementaire ou un identifiant de transaction méritent généralement un traitement plus strict qu'un enrichissement descriptif facultatif. La contribution de DAMA réside dans le vocabulaire et la discipline nécessaires pour rendre cette distinction explicite. Elle ne remplace pas les décisions de propriété locales.
Métriques et formules pour mesurer la complétude
Les métriques de complétude des données doivent mesurer l'absence de données susceptible d'affecter un cas d'usage défini. Un modèle de mesure robuste associe des indicateurs au niveau des champs, des enregistrements, des populations, du temps et des jeux de données, au lieu de s'appuyer uniquement sur un comptage de valeurs nulles.
La formule de base est :
Taux de complétude = valeurs requises renseignées / valeurs requises attendues × 100
Pour la complétude des attributs, les « valeurs requises renseignées » correspondent au nombre d'enregistrements ayant une valeur dans le champ sélectionné. Pour la complétude des enregistrements, le numérateur compte les enregistrements contenant tous les attributs obligatoires. Pour la complétude de la population, comparez les enregistrements livrés à la population d'enregistrements attendue. Le dénominateur doit refléter la définition métier des données attendues, et non simplement le nombre de lignes qui se trouvent être arrivées.
Mesures clés
Taux de NULL : La part d'enregistrements où un champ sélectionné est manquant. Il aide à localiser les lacunes au niveau des champs mais ne révèle pas les enregistrements ou jeux de données manquants.
Couverture des champs requis : La part des valeurs attendues renseignées pour les attributs obligatoires.
Nombre d'enregistrements : Le nombre d'enregistrements livrés pour un chargement, une partition, une entité ou une période définie.
Écart du nombre d'enregistrements : La différence entre le volume observé et le volume attendu, en utilisant une référence documentée ou un rapprochement à la source.
Disponibilité du jeu de données : Vérifie si chaque source, table, fichier ou partition requis est présent.
Couverture temporelle : Vérifie si toutes les dates et périodes de reporting requises sont représentées.
Tendances de complétude : L'évolution de chaque mesure dans le temps, ce qui permet de distinguer un incident ponctuel d'une détérioration continue.
Métrique | Ce qu'elle mesure | Utilisation typique |
|---|---|---|
Taux de NULL | Valeurs manquantes dans un attribut sélectionné | Identifiant client ou numéro de compte obligatoire |
Couverture des champs requis | Valeurs obligatoires renseignées par rapport aux valeurs attendues | Contrôles opérationnels et réglementaires |
Nombre d'enregistrements | Population de lignes livrées | Surveillance des lots et des flux d'événements |
Écart du nombre d'enregistrements | Différence par rapport au volume attendu | Détection de perte de lignes ou de chargements incomplets |
Couverture temporelle | Présence des périodes requises | Finance, opérations et analyse de séries temporelles |
Disponibilité du jeu de données | Présence des sources de données requises | Vérification des dépendances en aval |
Tendance de complétude | Évolution de la complétude dans le temps | Analyse des problèmes récurrents et des dérives de processus |
Le guide des métriques de qualité des données de digna offre un contexte supplémentaire pour sélectionner les mesures. La décision importante de governance consiste à prioriser les attributs et populations critiques. Mesurer chaque champ de manière égale génère du bruit et peut masquer un écart important.
En quoi la complétude diffère de l'exactitude et de la validité
La complétude demande si la donnée requise est présente. L'exactitude demande si elle est correcte. La validité demande si elle respecte les règles ou le format requis. Ces dimensions peuvent faire défaut indépendamment les unes des autres, c'est pourquoi les équipes doivent éviter d'attribuer une étiquette générique de « problème de qualité » à ces trois notions.
Prenons l'exemple d'un numéro de téléphone client :
Complétude : Un numéro de téléphone est-il présent lorsque l'activité l'exige ?
Validité : La valeur respecte-t-elle le format de numéro de téléphone accepté ?
Exactitude : La valeur correspond-elle au véritable numéro de téléphone du client ?

Complétude et exactitude
Un numéro de téléphone manquant est un problème de complétude. Un numéro de téléphone correctement formaté qui appartient à un autre client est un problème d'exactitude. Le champ est présent dans les deux cas, mais une seule valeur représente correctement l'entité du monde réel.
L'explication de Dataversity sur les dimensions de la qualité des données décrit la complétude comme la mesure des informations manquantes, et non comme le fait de savoir si les informations stockées sont exactes ou valides. Cette distinction est importante car la correction diffère. Les données manquantes peuvent nécessiter une saisie dans le système source ou un retraitement, tandis que les données inexactes peuvent nécessiter une vérification, une correction ou une gérance des données de référence (master data stewardship).
Complétude et validité
Un numéro de téléphone manquant est incomplet. Un numéro de téléphone contenant des lettres alors que le schéma requiert un modèle numérique est invalide. Un numéro de téléphone correctement formaté mais erroné est inexact.
Question | Dimension | Exemple |
|---|---|---|
La valeur requise est-elle présente ? | Complétude | Le numéro de téléphone est manquant |
Est-elle conforme à la règle ? | Validité | Le numéro de téléphone a un format invalide |
Correspond-elle à la réalité ? | Exactitude | Le numéro appartient à quelqu'un d'autre |
La distinction faite par IBM entre complétude, exactitude et validité renforce ce modèle à trois questions. Utilisez-le pour attribuer des responsabilités, concevoir des tests et expliquer les incidents aux parties prenantes métier.
Surveiller la complétude à travers les pipelines modernes
Un pipeline techniquement réussi ne produit pas nécessairement des données complètes. Prenons l'exemple d'un entrepôt de données recevant quotidiennement des données clients et de transactions : le traitement ETL se termine, l'orchestration signale un succès et la table cible est disponible, mais le volume des transactions est nettement inférieur à la normale et les identifiants clients requis affichent une forte augmentation des valeurs NULL.
Le simple statut d'un pipeline ne peut pas détecter ces deux situations. La première est un problème de nombre d'enregistrements ou de population. La seconde relève de la complétude des attributs. Une architecture de surveillance doit examiner les données après leur livraison, et non pas seulement si le code s'est exécuté sans erreur d'exécution.

Utiliser des contrôles multiniveaux
La validation déterministe vérifie les exigences connues, comme le fait qu'un identifiant client obligatoire ne soit pas
NULL.La détection d'anomalies identifie les changements inattendus dans le volume d'enregistrements, les taux de valeurs nulles, les distributions ou le comportement de livraison.
L'analyse historique montre si l'écart est isolé, saisonnier, récurrent ou s'il s'inscrit dans une détérioration à plus long terme.
La surveillance de la ponctualité vérifie si les données attendues sont arrivées à l'heure et à la cadence requises.
Dans ce scénario, les vérifications de la complétude des données pour les pipelines d'entreprise peuvent être organisées autour de la perte de lignes, de la perte de champs, des enregistrements manquants et des champs manquants. Le contrôle doit également identifier la partition source ou la livraison responsable de l'écart, afin que les ingénieurs puissent investiguer plutôt que de simplement constater un statut rouge.
Une exécution ETL réussie prouve que le processus s'est exécuté. Elle ne prouve pas que les données métier requises sont arrivées.
La continuité est essentielle car la complétude évolue dans le temps. Un jeu de données propre aujourd'hui peut devenir incomplet après la mise à jour d'un système source, la modification d'un filtre d'extraction, une partition en retard ou un transfert de flux de travail. Une surveillance continue rend cette situation visible au plus près du moment où elle change.
Comment digna peut-il accompagner la complétude des données ?
digna prend en charge la complétude des données grâce à des fonctionnalités distinctes pour les règles explicites, les comportements inhabituels et le contexte historique. Chaque fonctionnalité s'adresse à un niveau différent, de sorte qu'une équipe ne doit pas traiter un seul module comme un substitut complet à l'ensemble des contrôles de complétude.
digna Data Validation
digna Data Validation prend en charge les exigences connues basées sur des règles, notamment :
Les champs requis ne doivent pas être
NULL.Chaque transaction doit posséder un identifiant requis.
Les attributs métier obligatoires doivent être renseignés.
Les règles de complétude définies doivent être respectées.
Il s'agit de la fonctionnalité principale pour les exigences qui peuvent être formulées directement et évaluées enregistrement par enregistrement.
digna Data Anomalies
digna Data Anomalies peut identifier des changements inattendus dans les comportements liés à la complétude, tels que des augmentations soudaines des taux de NULL, des baisses imprévues du nombre d'enregistrements, des modifications importantes de distribution et des écarts inhabituels par rapport aux volumes de données historiques.
La détection d'anomalies identifie un comportement inhabituel. Elle ne prouve pas automatiquement que les données sont incomplètes. Un changement saisonnier légitime peut sembler inhabituel, tandis qu'une anomalie de complétude subtile peut rester dans les limites d'un modèle historique large. Les équipes ont toujours besoin du contexte métier et, le cas échéant, de règles de validation explicites.
digna Data Analytics
digna Data Analytics fournit un contexte historique pour les métriques de complétude. Les équipes peuvent examiner les tendances du nombre d'enregistrements, les tendances du taux de NULL, la complétude historique, les modèles récurrents de données manquantes et les changements d'une période de reporting à l'autre.
Exigence de complétude | Exemple | Fonctionnalité digna |
|---|---|---|
Valeurs requises | Le champ requis ne doit pas être | digna Data Validation |
Volume d'enregistrements | Nombre attendu d'enregistrements | digna Data Anomalies |
Complétude historique | Détecter une détérioration dans le temps | digna Data Analytics |
Disponibilité du jeu de données | La source de données attendue est présente | digna Data Validation / digna Data Anomalies |
Cette répartition est délibérée. La validation applique des conditions connues, les anomalies révèlent des comportements inattendus et l'analyse permet de déterminer si un problème est isolé ou récurrent.
Points clés à retenir et questions fréquemment posées
La complétude des données est une condition métier mouvante, et non un contrôle statique des valeurs nulles. Définissez les données requises pour chaque cas d'usage, mesurez le niveau pertinent et surveillez si les enregistrements, attributs, périodes et jeux de données continuent d'arriver comme prévu.
Qu'est-ce que la complétude des données ?
C'est le degré auquel toutes les données requises pour un usage particulier sont présentes. Le périmètre dépend de l'adéquation à l'usage.
Quels sont les types de complétude des données ?
Les types courants incluent la complétude des attributs, des enregistrements, du nombre d'enregistrements, temporelle et du jeu de données. Chacun répond à un risque différent de données manquantes.
Comment mesure-t-on la complétude des données ?
Utilisez des mesures telles que le taux de NULL, la couverture des champs requis, le nombre d'enregistrements, l'écart du nombre d'enregistrements, la disponibilité du jeu de données, la couverture temporelle et les tendances de complétude.
Que dit DAMA sur la complétude des données ?
Le DAMA-DMBOK traite la complétude comme une dimension de la qualité des données et relie les exigences aux besoins métier et à l'adéquation à l'usage.
Une complétude des données à 100 % est-elle toujours requise ?
Non. Le taux de 100 % n'est pas universellement approprié. Une exigence doit refléter les conséquences des données manquantes pour l'utilisation prévue.
Quelle est la différence entre complétude et exactitude ?
La complétude demande si la valeur requise est présente. L'exactitude demande si cette valeur est correcte.
Quelle est la différence entre complétude et validité ?
La complétude concerne la présence. La validité concerne la conformité à des formats, règles ou normes définis.
Comment surveiller la complétude des données en continu ?
Associez validation basée sur des règles, surveillance des enregistrements et des livraisons, détection d'anomalies et analyse historique à travers les pipelines de traitement par lots, de streaming et intersystèmes.
Quels modules digna prennent en charge la complétude des données ?
digna Data Validation, digna Data Anomalies et digna Data Analytics répondent à différents besoins de complétude. Ils doivent être associés à un contrôle spécifique plutôt que d'être considérés comme interchangeables.
digna offre des fonctionnalités de validation des données, de détection d'anomalies et d'analyse des données pour vérifier les valeurs requises, identifier les comportements inhabituels de volume d'enregistrements et de taux de valeurs nulles, et analyser la complétude dans le temps. Visitez digna pour découvrir comment ces contrôles peuvent s'intégrer dans votre démarche de surveillance de la qualité des données.



