• nuevo

    Release 2026.06: Incorporando Data Observability en su código

  • nuevo

    Contribuya al futuro de la innovación en IA y datos

  • nuevo

    • Release 2026.06: Incorporando Data Observability en su código

  • nuevo

    • Contribuya al futuro de la innovación en IA y datos

La integridad de los datos explicada: más que solo valores correctos

|

7

minuto de lectura

Se estima que la mala calidad de los datos cuesta a las organizaciones una media de 12,9 millones de dólares al año, y resúmenes más amplios sitúan la horquilla entre 12,9 y 15 millones de dólares anuales. La integridad de los datos consiste en mantener relaciones correctas y fiables entre los elementos de datos y los conjuntos de datos, no solo en si los valores individuales son correctos.

Esa distinción es importante porque un campo puede parecer limpio y, aun así, formar parte de una relación rota. Un pedido puede tener un importe válido, una fecha correcta y un ID de cliente con aspecto real, pero seguir fallando si ese cliente ya no existe en los datos maestros o si la fila infringe una regla de negocio que mantiene la confiabilidad del conjunto de datos.

Tabla de contenidos

  • Qué significa realmente la integridad de los datos

    • Por qué los “valores correctos” son una prueba incompleta

  • Dónde encaja la integridad en la calidad de los datos

    • Por qué la integridad necesita su propio camino

  • Qué abarca la integridad de los datos en la práctica

  • En qué se diferencia la integridad de la precisión, la validez y la consistencia

    • Distinciones comparativas

  • Cómo medir la integridad de los datos

    • Una puntuación de integridad sencilla

    • Métricas prácticas que siguen los equipos

  • ¿Qué es la integridad referencial?

    • Por qué los registros huérfanos son un problema real

  • ¿Cómo se puede monitorear continuamente la integridad de los datos?

    • Cómo es el monitoreo continuo

  • Un ejemplo de pedidos y clientes para el monitoreo de la integridad

    • Tres comprobaciones capturan señales diferentes

    • Cómo se debe gestionar el incidente

  • ¿Cómo puede digna respaldar la integridad de los datos?

    • Qué hace cada módulo por la integridad

Qué significa realmente la integridad de los datos

La integridad de los datos es la preservación de relaciones válidas, condiciones estructurales y restricciones de negocio en todos los elementos de datos y conjuntos de datos. Es más amplio que comprobar si una celda contiene el valor correcto, porque un valor puede estar bien formado y, aun así, encontrarse dentro de una relación rota.

Por qué los “valores correctos” son una prueba incompleta

Un ID de cliente puede parecer válido, el total de una factura puede ser numérico y un campo de estado puede utilizar la etiqueta correcta. Nada de eso garantiza que el registro siga cumpliendo las reglas del sistema. Si una factura apunta a una cuenta inexistente, o un pedido hace referencia a un cliente que se eliminó en origen, los datos han perdido integridad aunque cada campo individual parezca aceptable.

Por eso los fallos de integridad son tan peligrosos en los flujos de análisis y de IA. Los registros llegan, el proceso se completa y el panel de control se genera. El sistema parece sano, pero las relaciones que dan sentido a los datos han desaparecido. En la práctica, esta es la diferencia entre un número que existe y un número en el que se puede confiar.

Regla práctica: trate la integridad como una propiedad de las conexiones y de la estructura, no de una sola celda.

Para los equipos que también realizan el seguimiento de la procedencia y el linaje, la relación es estrecha, pero no idéntica. La integridad plantea si el conjunto de datos sigue manteniéndose unido según lo previsto, mientras que el linaje y la procedencia describen cómo han llegado los datos hasta ahí. Un punto de referencia útil es esta comparación de procedencia y linaje, que ayuda a separar el seguimiento del origen de la confianza estructural.

La razón de peso para preocuparse es sencilla. IBM y Harvard Business Review citan desde hace tiempo un coste anual estimado de 3,1 billones de dólares de datos incorrectos para la economía estadounidense, y MIT Sloan Management Review también ha informado de investigaciones anteriores que estiman que los datos incorrectos pueden consumir entre el 15 % y el 25 % de los ingresos de muchas empresas, lo que explica por qué la integridad de los datos sigue saliendo del ámbito del equipo de bases de datos para pasar a los debates sobre gobernanza y liderazgo. El riesgo financiero no procede únicamente de los valores erróneos, sino de las relaciones rotas que distorsionan las decisiones posteriores.

Dónde encaja la integridad en la calidad de los datos

La integridad es una de las dimensiones de calidad de datos reconocidas en DAMA-DMBOK® 2.0 Edición Revisada, junto con la precisión, la completitud, la Timeliness, la consistencia, la unicidad, la validez y otras dimensiones de calidad relacionadas. Esa ubicación es importante porque confirma que la integridad no es una idea de nicho de las bases de datos, sino una parte fundamental del pensamiento de calidad de datos de DAMA y de la calidad de datos de DMBOK.

A diagram illustrating how Data Integrity is a key component alongside other essential data quality metrics.

Por qué la integridad necesita su propio camino

Un equipo puede disponer de sólidas comprobaciones de precisión y, aun así, pasar por alto fallos de integridad. Esto ocurre porque la precisión analiza si un valor refleja la realidad, mientras que la integridad analiza si la estructura y las relaciones que rodean a ese valor siguen manteniéndose. La dirección de un cliente puede ser precisa, pero si el registro del cliente ya no se vincula a la cuenta correcta, la integridad ya ha fallado.

El mismo problema se presenta en las operaciones. Muchos grupos dependen de comprobaciones manuales o de validaciones basadas en SQL, mientras que son menos los que utilizan herramientas de Observability dedicadas, y la propiedad de la gobernanza suele compartirse entre los equipos. Datos de encuestas recientes muestran que el 44 % afirma que la propiedad de la calidad de los datos se comparte entre varios equipos, el 61 % sigue dependiendo de comprobaciones manuales o validaciones basadas en SQL, el 27 % utiliza una plataforma de Observability dedicada, el 39 % realiza un seguimiento de los SLA de los flujos de datos clave y el 14 % los aplica en toda la organización. Esas cifras apuntan a una brecha operativa común: los equipos vigilan los valores de calidad, pero no siempre monitorean la salud de las relaciones de extremo a extremo. La consistencia interna entre las dimensiones de calidad de los datos es lo que evita que la integridad se confunda con otra dimensión.

Qué abarca la integridad de los datos en la práctica

La integridad de los datos incluye varias comprobaciones relacionadas, cada una de las cuales detecta un tipo diferente de fallo. Los cuatro subtipos principales y su aspecto en la práctica son:

Subtipo

Qué comprueba

Ejemplo de fallo

Función de digna

Integridad referencial

Vínculos válidos entre registros relacionados

Una visita al hospital apunta a un ID de paciente que ya no existe

Data Validation

Integridad relacional

Consistencia lógica entre registros y conjuntos de datos

Un resultado de laboratorio se asocia a un encuentro con el paciente incorrecto

Data Validation

Integridad estructural

Forma del esquema, tipos y campos obligatorios

Un campo obligatorio desaparece de un canal de reclamaciones

Schema Tracker

Integridad de reglas de negocio

Reglas que rigen los valores relacionados

Un pago liquidado se marca de nuevo como activo

Data Validation

La tabla es importante porque cada subtipo rompe la confianza de una manera diferente. Un registro puede parecer perfectamente válido por sí solo y, aun así, fallar la comprobación de integridad general si sus vínculos, su forma o el contexto de su regla ya no se sostienen.

Un sistema de reclamaciones es un buen ejemplo. Una línea de reclamación puede contener un código válido, un importe válido y una fecha válida. Si esa línea se asocia a la cuenta de paciente incorrecta, o si el encuentro del que depende se ha cerrado fuera de secuencia, los datos siguen estando dañados. El valor está bien. La relación no.

Esa distinción es la razón por la que los equipos suelen pasar por alto los problemas de integridad cuando solo inspeccionan campos individuales. Las comprobaciones estructurales detectan columnas que faltan o cambios de tipo. Las comprobaciones referenciales detectan vínculos rotos. Las comprobaciones de reglas de negocio detectan combinaciones que nunca deberían darse juntas. En conjunto, muestran si el conjunto de datos sigue comportándose como un sistema conectado en lugar de como un cúmulo de valores con un aspecto correcto.

Una plataforma puede respaldar estas comprobaciones de diferentes maneras. Las pruebas de integridad de bases de datos son un enfoque práctico, porque obligan a los equipos a clasificar cada regla como un problema de referencia, de estructura o de regla de negocio. Si el fallo se debe a la falta de una fila primaria, la solución es diferente a la de un cambio de esquema o una infracción de regla.

En qué se diferencia la integridad de la precisión, la validez y la consistencia

La integridad no es lo mismo que la precisión, la validez o la consistencia. La forma más sencilla de separarlas es preguntarse qué tipo de fallo detecta cada una.

Distinciones comparativas

Dimensión

Qué comprueba

Modo de fallo que detecta

Ejemplo de detección

Integridad

Relaciones y dependencias

Registros huérfanos, vínculos rotos entre elementos primarios y secundarios, infracción de reglas de negocio

Una clave externa apunta a un cliente inexistente

Precisión

Si un valor coincide con la realidad

Nombres incorrectos, importes incorrectos, fechas incorrectas

La dirección de correo electrónico de un cliente está desactualizada

Validez

Si un valor se ajusta al formato o dominio permitido

Tipos erróneos, rangos no válidos, códigos mal formados

Un estado queda fuera de la lista aprobada

Consistencia

Si los datos coinciden entre sistemas o representaciones

Valores contradictorios en tablas o informes diferentes

Dos sistemas muestran recuentos de clientes diferentes

Un registro puede ser válido, preciso e incluso consistente y, aun así, no tener integridad. El correo electrónico de un cliente puede tener el formato correcto, coincidir con el CRM y reflejar a la persona real. Si ese ID de cliente ya no existe en el sistema de pedidos, la relación se rompe y el conjunto de datos deja de ser confiable.

Regla general: utilice comprobaciones de precisión para la corrección de los valores, comprobaciones de validez para las reglas de formato y de dominio, comprobaciones de consistencia para la concordancia entre sistemas y comprobaciones de integridad para las relaciones que unen los datos.

La precisión en la calidad de los datos es un punto de comparación útil porque muestra por qué la corrección del valor por sí sola no protege el modelo, el informe o el libro de contabilidad. Los equipos de datos necesitan cada comprobación en el lugar adecuado, no una prueba única que pretenda abarcarlo todo.

Cómo medir la integridad de los datos

La integridad de los datos se vuelve medible cuando se definen las relaciones y las reglas de negocio que deben cumplirse para un conjunto de datos determinado. La fórmula es sencilla, pero el conjunto de reglas que la respalda debe ser explícito.

An infographic illustrating four steps to measure data integrity using a specific formula for calculating the score.

Una puntuación de integridad sencilla

Tasa de integridad = registros que cumplen las condiciones de integridad requeridas / registros evaluados × 100

Esa fórmula funciona únicamente si el equipo se pone de acuerdo sobre qué condiciones cuentan. Para un flujo de datos, la condición puede ser una clave externa válida. Para otro, puede ser una regla de esquema más un registro primario más una restricción de negocio. La medición depende de la relación que se evalúe.

Métricas prácticas que siguen los equipos

  • Tasa de infracción de la integridad referencial, con qué frecuencia los vínculos apuntan a elementos primarios inexistentes.

  • Recuento de registros huérfanos, el número de filas secundarias sin ningún elemento primario válido.

  • Comprobaciones de relaciones fallidas, el número total de uniones rotas o reglas de dependencia incumplidas.

  • Porcentaje de registros con referencias válidas, una vista sencilla de la tasa de aprobados.

  • Recuentos de relaciones rotas, útil para el seguimiento de tendencias en los lanzamientos.

  • Tasa de infracción de reglas de negocio, la proporción de filas que no cumplen una regla definida.

Las métricas de calidad de los datos resultan mucho más útiles cuando separan la estructura de la calidad del valor. Un panel de control limpio debería mostrar la salud de las relaciones, no solo las tasas de valores nulos y de completitud. Si la desviación del esquema, las comprobaciones de clave externa y las comprobaciones de reglas fallan en la misma ventana, la puntuación de integridad disminuye aunque los valores parezcan normales a primera vista.

¿Qué es la integridad referencial?

La integridad referencial significa que las relaciones entre entidades relacionadas siguen siendo válidas. Cada pedido debe hacer referencia a un cliente existente, cada factura debe hacer referencia a una cuenta existente y cada ID de producto debe existir en el maestro de productos.

Por qué los registros huérfanos son un problema real

Una referencia rota crea un registro huérfano. La fila sigue existiendo, pero su significado se ha visto dañado porque ya no apunta a un elemento primario válido. La documentación de SQL Server de Microsoft lo describe claramente: una clave externa depende de la clave primaria a la que hace referencia, y no se permiten referencias a valores inexistentes.

Por eso, la integridad referencial se suele aplicar mediante restricciones de clave primaria y clave externa, ayudando también las restricciones CHECK a preservar relaciones válidas entre tablas. Si una clave cambia, todas las referencias dependientes deben cambiar también de forma consistente, o de lo contrario el conjunto de datos perderá su significado.

Cuando una fila secundaria no encuentra a su elemento primario, los datos pueden seguir cargándose, pero la relación deja de ser confiable.

El panorama general es preocupante. El Identity Theft Resource Center informó de 3.322 incidentes de compromiso de datos en EE. UU. en 2025, un 79 % más en cinco años, y 471,2 millones de notificaciones a víctimas solo en el primer semestre de 2026. Esas cifras muestran por qué los equipos no pueden tratar los fallos de relación como tareas menores de limpieza, ya que los problemas de integridad forman parte de un entorno operativo y de riesgo más amplio. La guía sobre integridad referencial ofrece una definición operativa clara: las relaciones válidas entre registros vinculados son el mecanismo central.

¿Cómo se puede monitorear continuamente la integridad de los datos?

El monitoreo de la integridad de los datos funciona mejor como un control continuo, no como una auditoría trimestral. Las comprobaciones programadas detectan los problemas a posteriori, mientras que el monitoreo continuo detecta las relaciones rotas, los cambios de esquema y los fallos en las reglas a medida que ocurren.

Cómo es el monitoreo continuo

Comience con los umbrales. Defina qué se considera normal para las comprobaciones de relaciones, los recuentos de huérfanos, los cambios de esquema y los fallos de reglas de negocio. A continuación, envíe una alerta cuando los datos se desvíen del rango esperado y dirija el incidente al propietario adecuado con el contexto suficiente para solucionar la causa raíz.

Un ritmo de funcionamiento útil es sencillo:

  1. Definir KPI, como las tasas de aprobación de relaciones y los recuentos de restricciones fallidas.

  2. Establecer líneas base, para que el equipo sepa qué aspecto tiene la normalidad.

  3. Alertar sobre desviaciones, en lugar de esperar a que falle un informe.

  4. Revisar mensualmente, para que los problemas recurrentes se hagan visibles y puedan solucionarse.

La desviación del esquema merece especial atención porque los cambios estructurales pueden corromper el significado posterior incluso cuando los valores de las filas siguen pareciendo correctos. Los cambios de tipo, las columnas renombradas, los campos eliminados y las adiciones no coordinadas pueden romper la compatibilidad o invalidar las transformaciones antes de que nadie se dé cuenta.

Un ejemplo de pedidos y clientes para el monitoreo de la integridad

Una fila de pedido con customer_id = 4821 puede parecer perfecta y, aun así, estar rota si el cliente 4821 se eliminó del maestro de clientes el trimestre pasado. El importe del pedido puede ser correcto, el ID del pedido puede ser único y el formato del correo electrónico puede superar la validación, mientras que la integridad ya ha fallado.

A diagram illustrating data integrity monitoring processes including structural, referential, domain, and business rule checks for orders.

Tres comprobaciones capturan señales diferentes

digna Data Validation señala la referencia no válida cuando el pedido apunta a un cliente que ya no existe.
Data Reconciliation compara los conjuntos de datos de origen y destino relacionados y saca a la luz el desajuste entre lo que espera la tabla de pedidos y lo que contiene el maestro de clientes.
digna Schema Tracker detecta el cambio estructural que puede haber contribuido al problema, como un campo eliminado o renombrado en origen.

El propio flujo de datos puede completarse con éxito. Esa es la trampa. Un estado de proceso en verde no significa que la integridad de los datos haya sobrevivido a la ejecución.

Cómo se debe gestionar el incidente

El equipo debe agrupar las tres señales en un solo incidente, no en tres tiques separados. Eso hace que las personas se concentren en la causa raíz, que podría ser la falta de una regla de eliminación, una sincronización rota o un cambio de esquema que no se coordinó con los sistemas posteriores. La solución correcta suele estar en origen, ya que parchear la fila huérfana por sí sola no restaura la relación rota.

¿Cómo puede digna respaldar la integridad de los datos?

digna Data Validation admite comprobaciones explícitas de relaciones y reglas de negocio, lo que constituye el requisito básico para detectar referencias rotas, filas huérfanas e infracciones de reglas. digna Data Reconciliation ayuda a comparar conjuntos de datos de origen y destino relacionados cuando la integridad depende de que los dos sistemas coincidan. digna Schema Tracker identifica cambios estructurales o de esquema que pueden afectar a la integridad con el paso del tiempo.

Qué hace cada módulo por la integridad

Data Validation es la solución directa para las comprobaciones a nivel de registro. Reconciliation es la solución adecuada cuando la integridad depende de la consistencia entre sistemas. Schema Tracker es la capa de alerta temprana para los cambios estructurales que pueden romper las suposiciones posteriores.

El monitoreo del esquema puede identificar cambios estructurales que pueden afectar a la integridad; por sí mismo no demuestra que los datos sean estructural o referencialmente correctos.

Esa distinción es importante porque los equipos a veces confunden la detección con la demostración. Una alerta de esquema le indica que la forma ha cambiado. No confirma que todas las relaciones sigan funcionando o que todas las reglas sigan cumpliéndose.

Si su equipo está intentando separar los datos con un aspecto limpio de los datos confiables, profundice en las reglas de relación, los cambios de esquema y las señales de validación que se encuentran debajo del panel de control. Visite digna para ver cómo sus capacidades de validación, conciliación y seguimiento de esquemas pueden respaldar el monitoreo de la integridad de los datos en los sistemas que ya ejecuta.

Compartir en X
Compartir en X
Compartir en Facebook
Compartir en Facebook
Compartir en LinkedIn
Compartir en LinkedIn

Conoce al equipo detrás de la plataforma

Un equipo con sede en Viena de expertos en IA, datos y software respaldado

por el rigor académico y la experiencia empresarial.

Conoce al equipo detrás de la plataforma

Un equipo con sede en Viena de expertos en IA, datos y software respaldado
por el rigor académico y la experiencia empresarial.

Producto

Integraciones

Recursos

Empresa

INDEXED BYIndexerNow INDEXED BYIndexerNow