• nouveau

    Release 2026.06 - Intégrer la Data Observability au cœur de votre code

  • nouveau

    Contribuez à l'avenir de l'innovation en matière d'IA et de données

  • nouveau

    • Release 2026.06 - Intégrer la Data Observability au cœur de votre code

  • nouveau

    • Contribuez à l'avenir de l'innovation en matière d'IA et de données

Validité des données : définition, mesure et importance

|

9

minute de lecture

La validité des données est le degré de conformité des données aux formats définis, aux types de données, aux valeurs autorisées, aux plages et aux règles métier. La validité mesure la conformité à des exigences définies ; elle ne prouve pas en soi que les données reflètent la réalité.

Cette distinction est facile à manquer et coûteuse à ignorer. Une valeur peut passer tous les contrôles structurels et décrire pourtant le mauvais client, la mauvaise transaction ou le mauvais événement. Pour les équipes d'entreprise, la validité est le contrôle pratique basé sur des règles qui intercepte les données malformées avant qu'elles n'atteignent l'analyse, les rapports, les modèles d'IA ou les processus réglementaires.

Table des matières

  • Qu'est-ce que la validité des données et pourquoi est-elle importante ?

    • La validité comme barrière opérationnelle

  • Que signifie la validité dans la qualité des données ?

    • Choisir la bonne règle

  • Quels sont des exemples de données invalides ?

  • Comment la validité des données est-elle mesurée ?

    • Mesurer à plusieurs niveaux

  • Validité vs Exactitude, Complétude et Raisonnabilité

    • Pourquoi la distinction affecte les opérations

  • Pourquoi la validité des données est-elle importante pour les entreprises ?

    • La validité comme point de contrôle

  • Comment la validité des données peut-elle être surveillée en continu ?

  • Comment digna peut-elle soutenir la validité des données ?

  • Foire aux questions sur la validité des données

    • Qu'est-ce que la validité des données ?

    • Qu'est-ce que la validité dans la qualité des données ?

    • Comment mesure-t-on la validité des données ?

    • Quels sont des exemples de données invalides ?

    • Qu'est-ce qu'une règle de Data Validation ?

    • Quelle est la différence entre validité et exactitude ?

    • Quelle est la différence entre validité et complétude ?

    • Comment la validité des données peut-elle être surveillée en continu ?

    • Quel module digna prend en charge la validité des données ?

Qu'est-ce que la validité des données et pourquoi est-elle importante ?

La validité des données est une dimension mesurable de la qualité des données qui vérifie si les valeurs satisfont à des exigences prédéfinies. Ces exigences peuvent décrire la syntaxe, le type, la plage, les domaines autorisés, les relations ou la logique métier. Un e-mail doit suivre un format accepté, un mois doit s'inscrire dans son domaine défini, et un code de référence doit correspondre à une liste approuvée.

La validité diffère de l'exactitude dès sa définition. L'exactitude cherche à savoir si une valeur représente correctement l'objet ou l'événement du monde réel. La validité cherche à savoir si la valeur est conforme aux règles établies par l'organisation. Une date telle que 1800-01-01 peut être structurellement valide si elle utilise le format de date attendu et se situe dans la plage configurée, mais elle peut tout de même être une fausse date de naissance.

An infographic titled What Is Data Validity explaining criteria like formats, ranges, and business rules.

La validité comme barrière opérationnelle

Une règle de validité est déterministe. Pour une même valeur et une même règle, le résultat doit être soit un succès, soit un échec. Cela rend la validité particulièrement adaptée aux contrôles automatisés lors de l'ingestion, de la transformation, du chargement dans l'entrepôt de données et aux limites du reporting.

Une séquence de mise en œuvre utile est la suivante :

  1. Définir l'exigence. Documenter le type attendu, le format, le domaine, la plage, la politique de gestion des valeurs nulles ou la relation.

  2. Appliquer la règle au bon niveau de détail. Vérifier individuellement les champs critiques, puis évaluer les résultats au niveau de l'enregistrement et de l'ensemble de données.

  3. Consigner les preuves. Stocker la règle en échec, l'enregistrement affecté, la source, l'horodatage et le statut de correction.

  4. Définir la responsabilité. L'équipe responsable de la source ou de la transformation doit prendre en charge la correction, et non pas seulement l'équipe qui découvre le défaut.

Règle pratique : Un score de validité n'a de sens que si chaque règle est associée à une définition documentée, un responsable et un objectif métier.

Les organisations qui mettent en place un programme plus large de qualité des données peuvent placer ce contrôle aux côtés d'autres dimensions dans leur data quality framework. Le point central reste simple : la validité empêche les données qui violent des exigences connues de se propager en aval.

Que signifie la validité dans la qualité des données ?

La validité dans la qualité des données signifie la conformité à des contraintes explicites qui peuvent être testées de manière cohérente. La DAMA-DMBOK® 2.0 Revised Edition identifie la Validité comme une dimension standard de la qualité des données, aux côtés de dimensions telles que l'Exactitude, la Complétude, l'Intégrité, l'Unicité ou Déduplication, la Timeliness, la Raisonnabilité et la Cohérence.

Les principaux types de validité sont distincts, mais ils fonctionnent souvent ensemble :

Type de validité

Définition

Exemple en entreprise

Validité de format

La valeur suit un modèle ou une syntaxe attendue.

Un identifiant de facture correspond au format d'identifiant approuvé par l'organisation.

Validité de domaine

La valeur appartient à un ensemble de valeurs approuvées.

Le country_code existe dans la liste de référence des pays gérée.

Validité de plage

La valeur se situe entre des limites définies.

Le solde d'un compte ne descend pas en dessous du seuil d'activité autorisé.

Validité du type de données

La valeur utilise le type requis.

Un champ de revenus contient des valeurs numériques plutôt que du texte.

Nullabilité

Les valeurs manquantes respectent la politique de gestion des valeurs nulles autorisée pour le champ.

Un identifiant de transaction n'est jamais nul après l'autorisation de paiement.

Validité croisée entre champs

Les champs liés respectent une relation logique.

La date de fin d'une police d'assurance est postérieure à sa date de début.

Validité des règles métier

L'enregistrement est conforme à la politique spécifique au domaine.

Le statut de remboursement d'un prêt suit les règles associées à l'état de son cycle de vie.

Validité référentielle

Les clés et les codes correspondent à des enregistrements valides dans les données de référence.

Un identifiant de succursale existe dans le fichier maître des succursales actuelles.

Choisir la bonne règle

Les contrôles de format détectent les erreurs de syntaxe flagrantes, mais ils sont rarement suffisants à eux seuls. Une valeur peut avoir la bonne structure tout en utilisant un code obsolète, en violant une relation ou en contredisant une politique métier.

C'est pourquoi un modèle mature de data quality dimensions model traite la validité comme un contrôle par couches. Les contrôles structurels doivent être exécutés en premier, suivis des contrôles de domaine, de relation et de règles métier lorsque l'utilisation des données l'exige. Plus le champ a des conséquences importantes, plus il est important de le valider au niveau du champ plutôt que de s'en remettre à un score unique pour l'ensemble du jeu de données.

Quels sont des exemples de données invalides ?

Une donnée invalide est une donnée qui ne respecte pas un format, un type, un domaine, une plage, une nullabilité, une relation ou une règle métier définis. Elle s'introduit souvent par le biais de formulaires trop permissifs, de modifications des systèmes sources, d'importations manuelles, de valeurs par défaut fictives ou de transformations qui ne préservent pas les contraintes d'origine.

Sous-type de validité

Exemple de données invalides

Pourquoi cela échoue

Format

Des lettres stockées dans un champ d'identifiant national qui exige un modèle défini.

La valeur ne correspond pas à la syntaxe requise.

Domaine

Un enregistrement de paiement utilise un code devise ou un code pays non approuvé.

La valeur n'est pas présente dans le domaine géré.

Plage

Un flux IoT enregistre -999 comme valeur fictive pour la température.

La valeur viole la plage physique ou opérationnelle du champ.

Type de données

Un montant numérique arrive sous la forme d'une chaîne de texte impossible à analyser.

La valeur ne peut pas être interprétée comme le type requis.

Nullabilité

Un identifiant client obligatoire est vide.

La définition du champ interdit les valeurs nulles.

Croisée entre champs

La date de fin d'un contrat précède sa date de début.

Les valeurs liées contredisent la logique temporelle.

Règle métier

Un enregistrement de prêt dépasse la limite fixée par la politique pour sa catégorie de risque.

L'enregistrement ne respecte pas une règle explicite de l'organisation.

Référentielle

Une transaction pointe vers une clé client absente du fichier maître des clients.

La relation ne peut pas être résolue.

Une valeur telle que 0000-00-00 montre bien pourquoi l'analyse syntaxique seule ne suffit pas. Un système peut la stocker sous forme de texte, ou un analyseur permissif peut l'accepter, mais la valeur peut toujours violer la définition de date de l'organisation.

Les équipes opérationnelles doivent classifier les échecs plutôt que de simplement les compter. Un échec de format peut indiquer un défaut d'interface, tandis qu'une augmentation soudaine de codes de référence inconnus peut signaler une mise à jour en amont ou un problème de synchronisation des données de référence. La data anomaly detection complète la validation déterministe en mettant en évidence des changements inhabituels dans les comportements d'échec sans remplacer les règles sous-jacentes.

Comment la validité des données est-elle mesurée ?

La validité des données est mesurée en comptant les valeurs ou les enregistrements qui respectent les règles de validation définies. Le calcul de base est le suivant :

Taux de validité = enregistrements ou valeurs valides / enregistrements ou valeurs évalués × 100

La perspective inverse, le taux d'enregistrements invalides, montre la part qui a échoué à au moins une règle. Les équipes doivent également conserver le nombre d'échecs aux règles, le taux de réussite aux règles et le pourcentage de valeurs au sein d'un domaine approuvé. Ces indicateurs révèlent des réalités opérationnelles différentes. Un ensemble de données peut présenter un taux de validité global stable tandis qu'une règle essentielle se détériore brutalement.

Mesurer à plusieurs niveaux

Au niveau du champ, mesurez si les valeurs satisfont aux règles du champ. Au niveau de l'enregistrement, déterminez si un enregistrement passe tous les contrôles requis. Au niveau de la table et du pipeline, agrégez les résultats tout en préservant les catégories d'échec sous-jacentes.

Couche de validation

Indicateur

Exemple de règle

Seuil typique

Format et type

Taux de réussite de la règle

Chaque identifiant correspond au modèle et au type approuvés.

Défini selon la criticité du champ.

Domaine et plage

Pourcentage dans le domaine

Chaque country_code appartient à la liste approuvée.

Défini selon le risque opérationnel.

Métier et croisé entre champs

Nombre d'échecs à la règle

La date de fin est postérieure à la date de début.

Analyser toute augmentation significative.

Il n'existe pas de seuil d'acceptabilité universel. Un champ de rapport réglementaire peut exiger une conformité quasi totale, tandis qu'un ensemble de données exploratoires peut tolérer plus d'exceptions si les analystes en comprennent les limites. Le seuil doit refléter la criticité pour l'entreprise, l'exposition réglementaire, l'utilisation en aval et le coût du blocage par rapport à la mise en quarantaine des enregistrements.

L'automatisation est essentielle car un profilage ponctuel produit un instantané, pas un contrôle. Suivez les résultats au fil du temps, conservez des échantillons d'enregistrements rejetés et vérifiez si les règles reflètent toujours les définitions métier actuelles. Les équipes qui mettent en place une pratique de mesure plus large peuvent utiliser ce practical QA guide 2026 parallèlement à leurs contrôles de qualité des données. Pour un cadre de métriques plus large, voir data quality metrics.

Validité vs Exactitude, Complétude et Raisonnabilité

La validité cherche à savoir si les données suivent des règles définies. L'exactitude cherche à savoir si elles représentent la réalité. La complétude cherche à savoir si les données requises sont présentes. La raisonnabilité cherche à savoir si une valeur ou un modèle semble plausible dans son contexte.

Prenons l'exemple d'un enregistrement client. Un numéro de téléphone peut respecter le format international requis, ce qui le rend valide, mais appartenir à une autre personne, ce qui le rend inexact. Une adresse e-mail manquante est principalement un défaut de complétude. Un salaire qui s'inscrit dans la plage numérique autorisée peut tout de même sembler déraisonnable pour le rôle ou le groupe de pairs de l'employé.

Pourquoi la distinction affecte les opérations

La validité est généralement le contrôle le moins coûteux à exécuter car il repose sur des règles explicites. L'exactitude nécessite souvent une source de confiance, telle qu'un dossier client faisant autorité ou une vérification externe. La complétude requiert une définition claire des champs obligatoires, et la raisonnabilité peut nécessiter des distributions historiques, des comparaisons avec des pairs ou des modèles d'anomalies.

Ces dimensions se recoupent, mais elles ne doivent pas être regroupées dans un score unique sans explication. Un enregistrement peut être entièrement complété et structurellement valide tout en étant inexact. Inversement, un enregistrement peut contenir une valeur exacte qui échoue à une exigence de format local parce que les systèmes sources utilisent des représentations incompatibles.

La dimension d'exactitude dans la qualité des données (accuracy dimension in data quality) a donc sa place dans une évaluation par couches plutôt qu'en remplacement de la validité. Utilisez des barrières de validité déterministes dès le départ, puis appliquez des contrôles d'exactitude et de raisonnabilité lorsqu'une vérité externe ou une interprétation contextuelle est disponible.

Un enregistrement valide est exploitable selon les règles. Il n'est pas automatiquement vrai, complet ou logique.

Pourquoi la validité des données est-elle importante pour les entreprises ?

La validité des données est importante car des valeurs invalides peuvent perturber les traitements en aval et compromettre les travaux d'analyse, d'IA et de conformité. Un échec de code de référence peut bloquer un flux de transaction, tandis que des variables de modèle malformées ou hors limites peuvent traverser un lac de données et influencer des décisions sans générer d'erreurs flagrantes.

L'enjeu économique est considérable. Gartner a fait état d'un coût annuel moyen de 12,9 millions de dollars par organisation dû à une mauvaise qualité des données, et 68 % des personnes interrogées ont cité l'inexactitude comme un facteur majeur, comme résumé dans l'article NISS statistical perspective on data quality. Une autre synthèse des coûts d'IBM citée dans des rapports de 2026 indique que l'inexactitude pourrait entraîner 25 % de perte de revenus pour les grandes entreprises en raison de prises de décision erronées.

La validité comme point de contrôle

Un contrôle de validité ne prouvera pas qu'une adresse client est correcte, mais il peut empêcher un code pays impossible, un identifiant corrompu ou une date invalide d'entrer dans un rapport réglementaire. Cela en fait un premier contrôle pratique avant une vérification d'exactitude et une analyse contextuelle plus coûteuses.

L'IA accentue la portée de ces enjeux. Les modèles héritent des défauts structurels de leurs entrées, et des enregistrements invalides peuvent créer des défaillances silencieuses même lorsque les prédictions obtenues semblent plausibles. Des contrôles continus offrent aux équipes d'ingénierie et de gouvernance (governance) un moyen auditable de détecter la détérioration des règles, d'isoler les données affectées et de décider s'il faut bloquer, mettre en quarantaine ou diffuser un jeu de données avec une exception explicite.

Comment la validité des données peut-elle être surveillée en continu ?

La surveillance continue de la validité des données exécute des règles de validation dès que des données arrivent ou changent, au lieu d'attendre un examen périodique. Le bon modèle opérationnel combine des contrôles automatisés, des alertes, la définition des responsabilités et des preuves historiques.

Une structure pratique se présente comme suit :

  • Valider tôt : Exécutez des contrôles de format, de type, de domaine et de nullabilité à proximité de l'ingestion, là où les échecs sont les plus faciles à isoler.

  • Valider les relations : Appliquez des contrôles de champs croisés, de règles métier et référentiels une fois que les champs requis et les données de référence sont disponibles.

  • Orienter les exceptions : Mettez en quarantaine ou étiquetez les enregistrements rejetés au lieu de les supprimer.

  • Alerter en cas de changement : Informez les responsables lorsque le nombre d'échecs ou les taux de validité s'écartent des limites approuvées.

  • Conserver l'historique : Gardez les résultats des règles pour que les équipes puissent identifier le moment où la dégradation a commencé et la relier à des modifications de la source ou du schéma.

La validation en temps réel convient à l'autorisation de paiement, à l'intégration des clients et à d'autres flux où une mauvaise saisie doit être rejetée immédiatement. La validation par lots (batch) reste pratique pour les charges analytiques importantes, les extractions réglementaires planifiées et les jeux de données pour lesquels une évaluation complète est plus utile qu'un blocage enregistrement par enregistrement.

Le CDC distingue la validité de l'exactitude et décrit la validité comme la conformité aux règles de métadonnées et de syntaxe dans son data quality assessment worksheet. Le rapprochement externe peut ensuite ajouter une couche d'exactitude distincte. Une étude sur les soins de traumatologie répertoriée par PubMed a associé la validation externe à une amélioration de l'exactitude, de la fiabilité des données et de la validité des modèles en aval, ce qui encourage à combiner les contrôles internes avec des comparaisons régulières faisant autorité.

Comment digna peut-elle soutenir la validité des données ?

digna Data Validation prend en charge des contrôles de validité déterministes au niveau de l'enregistrement par rapport à des règles définies. Les équipes peuvent l'utiliser pour des contraintes de format, de domaine, de plage, de nullabilité, de règles métier, de relations croisées entre champs et de contraintes référentielles ou opérationnelles, avec des résultats exploitables pour l'évaluation de la qualité et la remédiation.

Prenons un fichier maître client disposant d'un domaine de country_code approuvé. Une règle de validation vérifie chaque valeur entrante par rapport à cette liste de référence. Si une source commence à envoyer un code non approuvé, Data Validation identifie les enregistrements concernés et consigne la règle en échec. Le pipeline peut alors rejeter, mettre en quarantaine ou orienter ces enregistrements conformément à la politique opérationnelle de l'organisation.

A diagram illustrating the three steps of Digna's approach to ensuring data validity for trusted business analytics.

digna Data Anomalies joue un rôle complémentaire. Il peut identifier une augmentation inhabituelle des échecs de codes pays par rapport au comportement établi du jeu de données, mais il ne remplace pas la règle déterministe qui définit quels codes sont approuvés.

digna Data Analytics aide les équipes à examiner les résultats de validation et les tendances au fil du temps. Dans l'exemple du fichier maître client, l'analyse peut montrer quand les échecs ont commencé, s'ils affectent une ou plusieurs sources et si la remédiation a permis de rétablir le comportement antérieur. Comme digna s'exécute au sein de l'environnement du client et prend en charge l'exécution en base de données, les équipes peuvent surveiller les résultats tout en conservant les données sur place.

Foire aux questions sur la validité des données

What is Data Validity?

C'est le degré de conformité des données aux formats, types, domaines, plages et règles métier définis.

What is Validity in Data Quality?

La validité est une dimension mesurable de la qualité des données, axée sur la conformité aux règles.

How do you measure Data Validity?

Utilisez le taux de validité, le taux d'enregistrements invalides, le taux de réussite aux règles, le nombre d'échecs et la conformité au domaine approuvé.

What are examples of invalid data?

Les exemples d'invalidité incluent des identifiants malformés, des codes de référence inconnus, des valeurs nulles interdites, des plages impossibles et des combinaisons de champs contradictoires.

What is a Data Validation rule?

C'est un test explicite qui détermine si une valeur ou un enregistrement satisfait à une exigence définie.

What is the difference between Validity and Accuracy?

La validité vérifie la conformité. L'exactitude vérifie la correspondance avec la réalité du monde physique.

What is the difference between Validity and Completeness?

La complétude concerne les données manquantes. La validité concerne les données présentes qui ne respectent pas leurs règles.

How can Data Validity be monitored continuously?

Exécutez des contrôles automatisés dans les pipelines, alertez en cas de détérioration, conservez les preuves et attribuez la responsabilité des corrections.

Which digna module supports Data Validity?

digna Data Validation est le module principal pour les contrôles de validité déterministes.

Utilisez digna pour définir des règles de validation au niveau de l'enregistrement, surveiller les échecs sur l'ensemble des jeux de données critiques et analyser les changements avant que des données invalides n'atteignent vos rapports ou vos flux de travail d'IA. Visitez digna pour évaluer comment ses fonctionnalités de Data Validation, de digna Data Anomalies et de digna Data Analytics peuvent s'intégrer au processus de qualité des données de votre entreprise.

Partager sur X
Partager sur X
Partager sur Facebook
Partager sur Facebook
Partager sur LinkedIn
Partager sur LinkedIn

Rencontrez l'équipe derrière la plateforme

Une équipe basée à Vienne d'experts en IA, données et logiciels soutenue

par la rigueur académique et l'expérience en entreprise.

Rencontrez l'équipe derrière la plateforme

Une équipe basée à Vienne d'experts en IA, données et logiciels soutenue
par la rigueur académique et l'expérience en entreprise.

Produit

Intégrations

Ressources

Société

INDEXED BYIndexerNow INDEXED BYIndexerNow