Completitud de los datos: Qué dice DAMA y cómo medirla
|
6
minuto de lectura

El consejo más popular sobre la completitud de los datos es también el más engañoso: contar los valores NULL y dar el trabajo por terminado. ¿Qué es la completitud de los datos? Es el grado en que están presentes todos los datos requeridos para un fin determinado. Esa definición cambia la pregunta de «¿Hay celdas vacías?» a «¿Contiene este conjunto de datos lo que el proceso de negocio, informe, modelo o control necesita?»
Un campo cumplimentado puede contener un valor incorrecto, mientras que un NULL en un campo opcional puede no tener ningún impacto práctico. La completitud es, por tanto, una cuestión de adecuación para el uso, no una exigencia de perfección abstracta. Las directrices de las Naciones Unidas sobre cobertura y completitud establecen la misma distinción conceptual en las estadísticas oficiales, donde la completitud compara los hechos registrados con el total mundial que pretenden representar.
Índice de contenidos
En qué se diferencia la completitud de la exactitud y la validez
Monitoreo de la completitud en los flujos de trabajo modernos
Lo que realmente significa la completitud de los datos
La completitud de los datos es el grado en que están presentes todos los datos requeridos para un fin determinado. En un conjunto de datos empresariales, esto puede significar atributos obligatorios cumplimentados, registros comerciales completos, poblaciones de registros esperadas, períodos de informe requeridos o todos los conjuntos de datos de origen necesarios para un proceso posterior.
Por eso la completitud no es solo la ausencia de valores NULL. Supongamos que en una tabla de clientes falta el ID del cliente. Se trata de un fallo de completitud cuando el identificador es necesario para uniones, conciliaciones o informes. La ausencia de una preferencia secundaria de marketing puede ser aceptable si el uso previsto no depende de ella.
La distinción también separa la completitud de otras dimensiones de la calidad de los datos. Si una dirección está presente pero es incorrecta, el problema es de exactitud. Si un número de teléfono está presente pero infringe el formato requerido, el problema es de validez. La completitud solo pregunta si la información requerida existe dentro del alcance definido.
Comenzar con el propósito comercial
Antes de elegir una métrica, identifique qué debe respaldar los datos:
Los informes regulatorios pueden requerir cada entidad reportable y atributo obligatorio.
El procesamiento operativo puede depender de identificadores, fechas y campos de estado.
Las analíticas pueden tolerar la falta de atributos de enriquecimiento si la población principal sigue disponible.
El desarrollo de IA requiere campos, registros y períodos de tiempo suficientes para el análisis previsto, porque la falta de datos puede reducir el tamaño de la muestra analizable y producir estimaciones sesgadas o imprecisas, como se describe en esta revisión de datos faltantes alojada por el NIH.
Regla práctica: Defina qué significa «lo suficientemente completo» antes de medirlo. De lo contrario, un panel de control informará de un número sin que nadie sepa si ese número respalda la decisión.
Una definición de trabajo útil es: los registros, campos, relaciones y períodos de entrega requeridos están presentes en el alcance y la cadencia esperados para un caso de uso definido. Esa definición ofrece a los propietarios de los datos algo que pueden transformar en controles.
Los cinco tipos de completitud que vale la pena medir
Las organizaciones necesitan más de una perspectiva de completitud porque la falta de valores y la falta de poblaciones son fallos diferentes. Los cinco tipos que se indican a continuación cubren las necesidades habituales de monitoreo de las empresas, aunque los equipos deben seleccionar la combinación que mejor se adapte a los requisitos del negocio.
Completitud de atributos
La completitud de atributos pregunta si los campos requeridos están cumplimentados. Los ejemplos típicos incluyen:
IDs de clientes faltantes
Fechas de transacciones faltantes
Números de cuenta faltantes
Atributos de negocio
NULLrequeridos por un informe o proceso
Un registro de cliente puede existir, pero si falta su identificador, el registro puede resultar inservible para desduplicaciones o uniones. La medida pertinente es la proporción de registros esperados que contienen un valor en el atributo especificado.
Completitud de registros
La completitud de registros pregunta si cada registro disponible contiene todos los campos obligatorios conjuntamente. Una transacción puede tener un ID de transacción y un importe, pero carecer de ID de cliente, moneda o fecha de transacción. Contar la fila como presente ocultaría el hecho de que el registro no está operativamente completo.
Completitud del recuento de registros
La completitud del recuento de registros compara la población entregada con la población esperada. Por ejemplo, una tabla de transacciones diarias que normalmente contiene 10 millones de registros pero que de repente contiene 7 millones de registros tiene un problema de completitud de la población, incluso si cada fila entregada tiene campos perfectamente cumplimentados.
El documento de investigación sobre la calidad de los datos de DAMA respalda esta visión más amplia al analizar la completitud de los registros, archivos, atributos y metadatos.
Completitud temporal
La completitud temporal comprueba si todas las fechas o períodos de información previstos están presentes. Un flujo de finanzas puede cargarse con éxito omitiendo un día, mes o partición de informe. La tabla puede contener filas válidas, pero la serie temporal está incompleta.
Completitud del conjunto de datos
La completitud del conjunto de datos pregunta si todos los conjuntos de datos requeridos por un proceso posterior están disponibles. Un flujo de trabajo de informes mensuales puede necesitar conjuntos de datos de clientes, transacciones, productos y tipos de cambio. Si un origen no llega, las entradas del flujo de trabajo están incompletas, incluso cuando las otras tablas están cumplimentadas.

Estas comprobaciones no son intercambiables. Un equipo puede necesitar la completitud de atributos y registros para un maestro de clientes, la completitud de recuento de registros y temporal para las transacciones, y la completitud del conjunto de datos para una dependencia de orquestación.
Cómo abordan la completitud DAMA y DMBOK
DAMA International y la edición revisada de DAMA-DMBOK® 2.0 consideran la completitud como una dimensión de la calidad de los datos. El marco es más útil cuando los equipos aplican la completitud en relación con los requisitos del negocio y la adecuación para el uso, en lugar de tratarla como una puntuación técnica universal. La descripción general de los marcos de DAMA y de gobernanza de datos ofrece un contexto relacionado para posicionar la calidad de los datos dentro de las prácticas de gestión más amplias.
El enfoque de DAMA se alinea con una pregunta práctica: ¿qué se debe saber para que estos datos cumplan la función prevista? Las directrices sobre calidad de los datos del Gobierno del Reino Unido establecen que los datos están completos cuando están presentes todos los datos necesarios para un uso concreto, y aconsejan medir la completitud de los datos críticos en lugar de cada campo de cada conjunto de datos.
Eso significa que un 100 % de completitud no es automáticamente el requisito adecuado para cada conjunto de datos. Una tasa de completitud del 98 % podría ser aceptable para un caso de uso analítico, pero inaceptable para los informes regulatorios. Esos valores ilustran una decisión de governance, no umbrales universales.
Establecer los requisitos por impacto
Una política útil conecta la completitud con las consecuencias:
Identificar el informe, modelo, proceso o control que consume los datos.
Definir los registros y atributos sin los cuales no puede operar.
Establecer un umbral de completitud aceptable con el propietario de los datos.
Documentar qué ocurre cuando no se alcanza el umbral.
Revisar el requisito cuando cambie el caso de uso.
Una clave primaria, un atributo regulatorio o un identificador de transacciones suelen merecer un tratamiento más estricto que un enriquecimiento descriptivo opcional. La contribución de DAMA es el vocabulario y la disciplina para hacer explícita esa distinción. No sustituye a las decisiones de propiedad local.
Métricas y fórmulas para medir la completitud
Las métricas de completitud de los datos deben medir la falta de datos que puede afectar a un caso de uso definido. Un modelo de medición sólido combina indicadores a nivel de campo, registro, población, tiempo y conjunto de datos, en lugar de confiar en un único recuento de nulos.
La fórmula básica es:
Tasa de completitud = valores requeridos cumplimentados / valores requeridos esperados × 100
Para la completitud de atributos, los «valores requeridos cumplimentados» es el número de registros con un valor en el campo seleccionado. Para la completitud de registros, el numerador cuenta los registros que contienen cada atributo obligatorio. Para la completitud de la población, compare los registros entregados con la población de registros esperada. El denominador debe reflejar la definición empresarial de los datos esperados, no simplemente el número de filas que casualmente llegaron.
Medidas principales
Tasa de NULL: La proporción de registros en los que falta un campo seleccionado. Ayuda a localizar lagunas a nivel de campo, pero no revela registros o conjuntos de datos faltantes.
Cobertura de campos requeridos: La proporción de valores esperados cumplimentados para los atributos obligatorios.
Recuento de registros: El número de registros entregados para una carga, partición, entidad o período definidos.
Varianza del recuento de registros: La diferencia entre el volumen observado y el esperado, utilizando una línea de base documentada o una conciliación de origen.
Disponibilidad del conjunto de datos: Si cada origen, tabla, archivo o partición requeridos está presente.
Cobertura temporal: Si están representadas todas las fechas y períodos de informe requeridos.
Tendencias de completitud: El movimiento de cada medida a lo largo del tiempo, lo que ayuda a distinguir un incidente puntual de un deterioro continuo.
Métrica | Qué mide | Uso típico |
|---|---|---|
Tasa de NULL | Valores faltantes en un atributo seleccionado | ID de cliente o número de cuenta requerido |
Cobertura de campos requeridos | Valores obligatorios cumplimentados frente a valores esperados | Controles operativos y regulatorios |
Recuento de registros | Población de filas entregada | Monitoreo de lotes y flujos de eventos |
Varianza del recuento de registros | Diferencia con respecto al volumen esperado | Detección de pérdida de filas o cargas incompletas |
Cobertura temporal | Presencia de períodos requeridos | Finanzas, operaciones y análisis de series temporales |
Disponibilidad del conjunto de datos | Presencia de las fuentes de datos requeridas | Comprobaciones de dependencias posteriores |
Tendencia de completitud | Cambio en la completitud a lo largo del tiempo | Análisis de problemas recurrentes y desviaciones del proceso |
Las directrices sobre métricas de calidad de datos de digna ofrecen un contexto adicional para seleccionar las medidas. La decisión importante de governance es priorizar los atributos y poblaciones críticas. Medir todos los campos por igual genera ruido y puede dificultar la visualización de una brecha grave.
En qué se diferencia la completitud de la exactitud y la validez
La completitud pregunta si los datos requeridos están presentes. La exactitud pregunta si son correctos. La validez pregunta si siguen las reglas o el formato requerido. Estas dimensiones pueden fallar de forma independiente, por lo que los equipos deben evitar asignar una etiqueta genérica de «problema de calidad» a las tres por igual.
Considere el número de teléfono de un cliente:
Completitud: ¿Hay un número de teléfono presente cuando el negocio lo requiere?
Validez: ¿Sigue el valor el formato de número de teléfono aceptado?
Exactitud: ¿Coincide el valor con el número de teléfono real del cliente?

Completitud y exactitud
La falta de un número de teléfono es un problema de completitud. Un número de teléfono con el formato correcto que pertenece a otro cliente es un problema de exactitud. El campo está presente en ambos casos, pero solo un valor representa correctamente a la entidad del mundo real.
La explicación de las dimensiones de la calidad de los datos de Dataversity describe la completitud como la medición de qué información falta, no de si la información almacenada es exacta o válida. Esta separación es importante porque la solución difiere. Los datos faltantes pueden requerir la finalización del sistema de origen o un nuevo procesamiento, mientras que los datos inexactos pueden requerir verificación, corrección o supervisión de los datos maestros.
Completitud y validez
Un número de teléfono faltante está incompleto. Un número de teléfono que contiene letras cuando el esquema requiere un patrón numérico no es válido. Un número de teléfono con formato correcto pero incorrecto es inexacto.
Pregunta | Dimensión | Ejemplo |
|---|---|---|
¿Está presente el valor requerido? | Completitud | Falta el número de teléfono |
¿Se ajusta a la regla? | Validez | El número de teléfono tiene un formato no válido |
¿Coincide con la realidad? | Exactitud | El número pertenece a otra persona |
La distinción de IBM entre completitud, exactitud y validez refuerza este modelo de tres preguntas. Utilícelo al asignar propietarios, diseñar pruebas y explicar incidentes a las partes interesadas del negocio.
Monitoreo de la completitud en los flujos de trabajo modernos
Un flujo de trabajo técnicamente exitoso no produce necesariamente datos completos. Considere un almacén que recibe diariamente datos de clientes y transacciones: el trabajo ETL finaliza, la orquestación informa del éxito y la tabla de destino está disponible, pero el volumen de transacciones es significativamente inferior al normal y los ID de cliente requeridos muestran un fuerte aumento de los valores NULL.
El estado de un único flujo de trabajo no puede detectar ambas condiciones. La primera es un problema de recuento de registros o de población. La segunda es la completitud de atributos. El diseño del monitoreo debe examinar los datos después de la entrega, y no solo si el código se ejecutó sin errores de ejecución.

Utilizar controles en capas
La validación determinista comprueba los requisitos conocidos, como que un ID de cliente obligatorio no sea
NULL.La detección de anomalías identifica cambios inesperados en el volumen de registros, tasas de nulos, distribuciones o comportamiento de entrega.
Las analíticas históricas muestran si la desviación es aislada, estacional, recurrente o forma parte de un deterioro más prolongado.
El monitoreo de puntualidad comprueba si los datos esperados llegaron a la hora y con la cadencia requeridas.
En este escenario, las comprobaciones de completitud de datos para los flujos de trabajo empresariales pueden organizarse en torno a la pérdida de filas, la pérdida de campos, los registros faltantes y los campos faltantes. El control también debe identificar la partición de origen o la entrega responsable de la brecha, para que los ingenieros puedan investigar en lugar de limitarse a observar un estado en rojo.
Una ejecución exitosa de ETL demuestra que el proceso se ha ejecutado. No demuestra que hayan llegado los datos de negocio requeridos.
La continuidad es importante porque la completitud cambia con el tiempo. Un conjunto de datos limpio hoy puede pasar a estar incompleto tras el lanzamiento de un sistema de origen, un filtro de extracción modificado, una partición retrasada o un traspaso de flujo de trabajo. El monitoreo continuo hace visible la condición cerca del momento en que cambia.
¿Cómo puede digna respaldar la completitud de los datos?
digna respalda la completitud de los datos mediante funciones específicas para reglas explícitas, comportamientos inusuales y contexto histórico. Cada función aborda una capa diferente, por lo que un equipo no debe tratar un módulo como un sustituto completo de todos los controles de completitud.
digna Data Validation
digna Data Validation admite requisitos conocidos basados en reglas, entre los que se incluyen:
Los campos obligatorios no deben ser
NULL.Cada transacción debe tener un identificador requerido.
Los atributos de negocio obligatorios deben estar cumplimentados.
Se deben cumplir las reglas de completitud definidas.
Esta es la función principal para los requisitos que pueden establecerse directamente y evaluarse registro por registro.
digna Data Anomalies
digna Data Anomalies puede identificar cambios inesperados en el comportamiento relacionado con la completitud, como aumentos repentinos en las tasas de NULL, caídas inesperadas en los recuentos de registros, cambios significativos en la distribución y desviaciones inusuales de los volúmenes de datos históricos.
La detección de anomalías identifica comportamientos inusuales. No demuestra automáticamente que los datos estén incompletos. Un cambio estacional legítimo puede parecer inusual, mientras que un fallo sutil de completitud puede permanecer dentro de un patrón histórico amplio. Los equipos siguen necesitando el contexto empresarial y, cuando proceda, reglas de validación explícitas.
digna Data Analytics
digna Data Analytics proporciona contexto histórico para las métricas de completitud. Los equipos pueden examinar las tendencias del recuento de registros, las tendencias de la tasa de NULL, la completitud histórica, los patrones recurrentes de datos faltantes y los cambios entre períodos de informe.
Requisito de completitud | Ejemplo | Función de digna |
|---|---|---|
Valores requeridos | El campo requerido no debe ser | digna Data Validation |
Volumen de registros | Número esperado de registros | digna Data Anomalies |
Completitud histórica | Detectar el deterioro a lo largo del tiempo | digna Data Analytics |
Disponibilidad del conjunto de datos | La fuente de datos esperada está presente | digna Data Validation / digna Data Anomalies |
La asignación es deliberada. La validación impone condiciones conocidas, las anomalías revelan comportamientos inesperados y las analíticas ayudan a determinar si un problema es aislado o recurrente.
Puntos clave y preguntas frecuentes
La completitud de los datos es una condición de negocio cambiante, no una comprobación estática de nulos. Defina los datos necesarios para cada caso de uso, mida la capa pertinente y monitoree si los registros, atributos, períodos y conjuntos de datos siguen llegando según lo previsto.
¿Qué es la completitud de los datos?
Es el grado en que están presentes todos los datos requeridos para un fin determinado. El alcance depende de la adecuación para el uso.
¿Cuáles son los tipos de completitud de los datos?
Los tipos habituales incluyen la completitud de atributos, de registros, de recuento de registros, temporal y de conjuntos de datos. Cada una de ellas aborda un riesgo diferente de falta de datos.
¿Cómo se mide la completitud de los datos?
Utilice medidas como la tasa de NULL, la cobertura de campos requeridos, los recuentos de registros, la varianza de los recuentos de registros, la disponibilidad de los conjuntos de datos, la cobertura temporal y las tendencias de completitud.
¿Qué dice DAMA sobre la completitud de los datos?
DAMA-DMBOK trata la completitud como una dimensión de la calidad de los datos y relaciona los requisitos con las necesidades del negocio y la adecuación para el uso.
¿Se requiere siempre el 100 % de completitud de los datos?
No. El 100 % no es adecuado de forma universal. El requisito debe reflejar las consecuencias de la falta de datos para el uso previsto.
¿Cuál es la diferencia entre completitud y exactitud?
La completitud pregunta si el valor requerido está presente. La exactitud pregunta si ese valor es correcto.
¿Cuál es la diferencia entre completitud y validez?
La completitud se refiere a la presencia. La validez se refiere a la conformidad con los formatos, reglas o normas definidos.
¿Cómo se puede monitorear de forma continua la completitud de los datos?
Combine la validación basada en reglas, el monitoreo de registros y entregas, la detección de anomalías y el análisis histórico en flujos de trabajo por lotes, de transmisión y entre sistemas.
¿Qué módulos de digna respaldan la completitud de los datos?
digna Data Validation, digna Data Anomalies y digna Data Analytics respaldan diferentes necesidades de completitud. Deben asignarse al control específico en lugar de tratarse como intercambiables.
digna ofrece funciones de Data Validation, Data Anomalies y Data Analytics para comprobar los valores requeridos, identificar comportamientos inusuales de registros y tasas de nulos, y analizar la completitud a lo largo del tiempo. Visite digna para ver cómo estos controles pueden encajar en su enfoque de monitoreo de la calidad de los datos.



