¿Cuáles son los objetivos de garantizar la integridad de los datos?
|
6
minuto de lectura

Un equipo financiero puede publicar un informe trimestral con gráficos impecables, totales conciliados y la aprobación de la dirección, y aun así basarlo en una tabla cuyo significado cambió durante una actualización del pipeline. Una columna renombrada, un archivo que falta o una corrección sobrescrita pueden hacer que una métrica de confianza describa el evento de negocio equivocado. Cuando alguien lo detecta, esos mismos datos quizá ya alimenten un panel operativo, una función de IA y una presentación regulatoria.
Por eso la respuesta a cuáles son los objetivos de garantizar la integridad de los datos no puede quedarse en «mantener los datos correctos». Un programa eficaz debe preservar la precisión, la completitud, la coherencia, la trazabilidad, la seguridad y la recuperabilidad. También debe aportar pruebas de que esas propiedades sobrevivieron a transformaciones, correcciones, cambios de esquema y la respuesta a incidentes.
Índice
Por qué la integridad de los datos es un conjunto de objetivos y no una simple casilla
El concepto central detrás de los objetivos de integridad de los datos
Cómo cambian los objetivos en casos regulatorios, operativos y de IA
El equilibrio que la mayoría de las guías de integridad omiten
Preguntas frecuentes y una lista rápida de objetivos de integridad
Por qué la integridad de los datos es un conjunto de objetivos y no una simple casilla
La integridad de los datos suele tratarse como un piloto de estado: verde significa fiable y rojo significa roto. Las plataformas de datos reales no funcionan así. Un conjunto de datos puede contener valores correctos pero carecer de pista de auditoría, llegar tarde pero estar completo, o superar las comprobaciones estructurales mientras usa una definición de negocio incoherente.
Pensemos en una tabla de ingresos trimestrales. Los valores pueden ser correctos para los registros que llegaron, pero un archivo regional nunca se cargó. El informe ya está incompleto. Si un sistema de origen cambió net_revenue para representar los ingresos tras un ajuste distinto, la tabla también es incoherente con los periodos anteriores. Si nadie puede identificar cuándo ocurrió el cambio ni qué transformación lo aplicó, el equipo no puede defender el resultado.
Esta es la diferencia práctica entre calidad e integridad de los datos. La calidad pregunta si la información sirve para un uso concreto. La integridad pregunta si se mantuvo fiable, controlada y explicable a lo largo de todo su ciclo de vida.
Regla práctica: una comprobación de calidad superada te dice cómo son los datos ahora. Las pruebas de integridad te ayudan a explicar cómo llegaron hasta ahí.
Por tanto, los objetivos forman una pila:
Precisión: los valores representan el evento subyacente.
Completitud: no han desaparecido registros, campos ni evidencias necesarios.
Coherencia: la misma definición y las mismas reglas se mantienen entre sistemas y a lo largo del tiempo.
Trazabilidad: se puede reconstruir quién cambió qué, cuándo y por qué.
Seguridad: el acceso o la modificación no autorizados se impiden o se detectan.
Recuperabilidad: la organización puede restaurar y verificar un estado fiable.
Estos objetivos sostienen a la vez la analítica, la IA, la información financiera, las operaciones y el cumplimiento normativo. La pregunta correcta no es si un conjunto de datos tiene una única puntuación de integridad, sino qué objetivo queda expuesto en cada traspaso y qué evidencia demuestra que el control funcionó.
El concepto central detrás de los objetivos de integridad de los datos
El NIST define la integridad como la propiedad de que los datos no han sido alterados, destruidos ni perdidos por medios no autorizados o accidentales, y la vincula además con la autenticidad y el no repudio. Dicho de forma sencilla: el registro debe seguir representando lo que ocurrió y la organización debe poder demostrarlo.
Las dimensiones de la calidad de los datos ayudan a describir si la información es utilizable, pero la integridad añade control sobre el ciclo de vida. Un valor puede parecer plausible en un data warehouse y aun así no ser fiable si falta su origen, su marca de tiempo, su transformación o su historial de correcciones.

Convertir ALCOA en controles cotidianos
Las directrices de la FDA describen la integridad de los datos mediante los cinco atributos ALCOA: atribuible, legible, registrado de forma contemporánea, original o copia fiel, y exacto. Estos términos resultan más útiles cuando se traducen en preguntas que un equipo de datos puede responder.
Atribuible: ¿puedes identificar a la persona, el sistema, el instrumento o el servicio que creó o modificó el registro?
Legible: ¿puede un revisor autorizado leer e interpretar el registro y sus metadatos más adelante?
Contemporáneo: ¿se registró el evento cuando ocurrió, en lugar de reconstruirse de memoria?
Original: ¿conservas el registro de origen o una copia fiel verificada, y no solo un resultado transformado?
Exacto: ¿describe el valor fielmente el evento subyacente?
Un evento de streaming que llega tarde ilustra la diferencia entre el momento de captura y el momento del evento. Registrar ambos ayuda a los revisores a entender si la fuente generó el evento tarde, si la red lo retrasó o si falló el proceso de ingesta.
La integridad va más allá de «los datos parecen correctos». Incluye la evidencia que rodea a los datos, los controles que los protegen y la capacidad de reconstruir la secuencia de hechos tras una corrección o un incidente.
Los objetivos principales que todo programa debe cubrir
Las directrices de la FDA describen la integridad de los datos como la completitud, coherencia y exactitud de los datos, y esperan que los registros sean atribuibles, legibles, registrados de forma contemporánea, originales o copias fieles, y exactos: los cinco atributos ALCOA. Estos atributos son una base sólida, pero los pipelines empresariales también necesitan controles de seguridad, trazabilidad y recuperación.
Seis objetivos en términos prácticos
La precisión significa que un valor representa el evento que dice representar. Si una factura se registra con una conversión de divisa errónea, una comprobación de rango puede detectar un resultado inverosímil, pero solo una validación con reglas de negocio o una conciliación puede establecer cuál debería ser el valor correcto. Algunas señales útiles son las comprobaciones de registros fallidas, las distribuciones inesperadas y las discrepancias con una fuente de confianza.
La completitud significa que están presentes los registros, campos y evidencias de soporte necesarios. Una carga de archivo correcta puede seguir estando incompleta si la fuente solo generó parte del extracto esperado. Las alertas de cargas ausentes, las comparaciones de recuento de filas, las comprobaciones de nulos y las verificaciones de pruebas fallidas o repetidas ayudan a sacar a la luz el hueco.
La coherencia significa que un concepto de negocio conserva el mismo significado entre sistemas y a lo largo del tiempo. Un valor de estado como «activo» no debería significar «pagado» en una aplicación y «no cancelado» en otra. El seguimiento de esquemas, las comprobaciones de datos de referencia y la conciliación entre sistemas aportan evidencia cuando las definiciones divergen.
La trazabilidad significa que los revisores pueden reconstruir el historial del registro. Un analista financiero que corrige un valor debería dejar disponibles para revisión el original, el motivo, la marca de tiempo, la identidad y la versión resultante. Los registros de auditoría, el linaje, el historial de versiones y el contexto del cambio proporcionan ese rastro.
La seguridad protege los datos frente al acceso, la modificación, la pérdida y la destrucción no autorizados. El acceso basado en roles, el principio de mínimo privilegio, los registros protegidos y la supervisión de cambios reducen la probabilidad de que una acción no autorizada se convierta en un cambio de datos invisible.
La recuperabilidad significa que el equipo puede restaurar un estado fiable y demostrar que lo es. Las directrices del NIST exigen la capacidad de restaurar los datos a su último estado bueno conocido, identificar la copia de seguridad correcta y no contaminada, y determinar la identidad y el momento de las alteraciones. Las copias de seguridad por sí solas no bastan si la restauración no se ha probado o si el equipo no sabe qué versión es segura.
Objetivo | Cómo se manifiesta el fallo | Control representativo |
|---|---|---|
Precisión | Una métrica representa un valor de transacción erróneo | Validación a nivel de registro y conciliación |
Completitud | Falta un archivo de origen o un registro obligatorio | Supervisión de actualidad, cargas, recuento de filas y nulos |
Coherencia | Un sistema interpreta un campo de otra manera | Seguimiento de esquemas y reglas de negocio compartidas |
Trazabilidad | Un valor corregido no tiene historial documentado | Pista de auditoría inmutable y linaje |
Seguridad | Un usuario no autorizado modifica una tabla crítica | Controles de acceso y registros de cambios protegidos |
Recuperabilidad | Un backfill erróneo sobrescribe un historial fiable | Copias de seguridad versionadas y pruebas de restauración |
Estos objetivos se solapan, pero no se sustituyen entre sí. Un conjunto de datos seguro puede estar incompleto, y uno recuperable puede seguir conteniendo una lógica de negocio incorrecta.
Los objetivos paso a paso en un pipeline de datos real
Tomemos un flujo diario de ingresos procedente de un sistema de facturación. La fuente envía transacciones a un data warehouse, donde las transformaciones preparan un conjunto de datos para un panel de business intelligence.
En la ingesta, la precisión empieza por validar tipos, divisas, identificadores y reglas de negocio. Un registro con un importe negativo puede ser válido si es un reembolso, así que la regla necesita contexto de negocio en lugar de una comprobación simplista de «solo valores positivos». La completitud entra en juego cuando el archivo llega con menos registros de los esperados o con retraso. El pipeline debería distinguir un día sin actividad de una transferencia fallida.

Después, un cambio de esquema en el origen renombra una columna. La transformación sigue ejecutándose, pero asigna el campo equivocado al panel. La coherencia requiere detectar cambios estructurales y semánticos, no basta con que el job termine correctamente. Los equipos que diseñan estos traspasos también pueden consultar una guía de arquitectura de pipelines de datos para hacer explícitos los responsables y los puntos de control.
A continuación, una analista financiera detecta una corrección legítima y actualiza un valor. La trazabilidad exige el valor original, el nuevo valor, el motivo, la identidad y la marca de tiempo. Sin ese contexto, un revisor posterior no puede saber si el cambio corrigió un problema de facturación o encubrió un proceso fallido.
Luego cambia el rol de un analista. Los controles de seguridad determinan si esa persona puede seguir viendo o modificando campos sensibles. El acceso debe seguir al rol actual, no a un permiso antiguo que permanece activo indefinidamente.
Por último, un backfill erróneo sobrescribe tres días de datos del warehouse. La recuperabilidad requiere una versión buena conocida, evidencias protegidas de las copias de seguridad y una forma de identificar qué cambió. La guía práctica del NIST también subraya la importancia de determinar la identidad y el momento de las alteraciones, de modo que la restauración y la investigación forman parte del mismo proceso operativo.
Para los equipos que recopilan información externa antes de que entre en un pipeline, una API de web scraping puede evaluarse junto con los controles de validación, procedencia y cambios en la fuente. Obtener los datos no elimina la necesidad de verificar lo que llegó.
Cómo cambian los objetivos en casos regulatorios, operativos y de IA
Los controles de integridad deben ajustarse a las consecuencias de un fallo y a la forma en que se consumen los datos. Un informe regulatorio necesita evidencias duraderas y capacidad de revisión. Un KPI operativo en tiempo real puede priorizar la detección rápida y un estado de actualidad claro. Un conjunto de datos de entrenamiento de IA necesita procedencia, comprobaciones de representatividad, versionado y una forma de identificar entradas obsoletas o con cambios semánticos.
El artículo 5 del RGPD de la UE exige que los datos personales sean exactos y, si fuera necesario, estén actualizados, y requiere un tratamiento que garantice una seguridad adecuada, incluida la protección contra el tratamiento no autorizado o ilícito y contra su pérdida, destrucción o daño accidental. Esa obligación hace que los flujos de corrección, los controles de acceso y las evidencias de incidentes sean importantes para los productos de datos personales, no solo para los informes de cumplimiento.
Caso de uso | Objetivos dominantes | Latencia aceptable de comprobación | Revisión humana |
|---|---|---|---|
Informe regulatorio | Precisión, completitud, trazabilidad, seguridad, recuperabilidad | Antes de la presentación y tras cambios relevantes | Obligatoria para excepciones, correcciones y aprobación |
KPI operativo | Puntualidad, precisión, coherencia, disponibilidad | Cerca del momento de la ingesta o la publicación | Centrada en anomalías relevantes e interrupciones |
Conjunto de datos de entrenamiento de IA | Procedencia, completitud, coherencia, precisión, recuperabilidad versionada | Antes de publicar el conjunto de datos y tras cambios en la fuente o el esquema | Obligatoria para etiquetado, exclusiones, deriva y usos sensibles |
Los controles no deberían ser idénticos. Una métrica operativa retrasada puede ser más dañina que un registro retenido temporalmente si los equipos la usan para responder a un evento en curso. Un conjunto de datos regulatorio puede tolerar una ventana de revisión más larga, pero debe conservar los registros originales y la evidencia de las decisiones.
Aquí resulta útil la distinción entre cumplimiento y gobernanza. El cumplimiento define las obligaciones que hay que satisfacer. La gobernanza asigna responsables y reglas de funcionamiento para que los equipos puedan cumplir esas obligaciones de forma constante.
Llevar los objetivos a prácticas operativas
Los objetivos se vuelven útiles cuando cada uno tiene un control observable y un responsable. El linaje y las pistas de auditoría sostienen la trazabilidad al registrar fuentes, transformaciones, versiones, identidades y marcas de tiempo. La validación a nivel de registro sostiene la precisión y la coherencia al comprobar valores exactos, rangos, listas de referencia, el tratamiento de nulos y las relaciones entre columnas.
La completitud necesita algo más que un recuento de filas. La supervisión de la puntualidad puede identificar cargas ausentes, llegadas con retraso y patrones de entrega inesperados. El seguimiento de esquemas puede revelar columnas añadidas o eliminadas y cambios de tipo de datos antes de que un consumidor posterior cambie de significado sin previo aviso.
La detección de anomalías añade otra capa. Las reglas deterministas detectan fallos conocidos, mientras que las líneas base de comportamiento pueden resaltar volúmenes, distribuciones o métricas de negocio inusuales que una regla fija no anticipa.
Un mapa práctico de controles
Precisión: validar los registros frente a reglas de negocio y conciliar los totales críticos.
Completitud: supervisar las llegadas esperadas, los campos obligatorios y los registros fallidos o rechazados.
Coherencia: hacer seguimiento de esquemas, valores de referencia, definiciones y relaciones entre sistemas.
Trazabilidad: conservar el linaje, los eventos de auditoría, las versiones y los motivos de los cambios.
Seguridad: aplicar el mínimo privilegio, registros protegidos y cambios de acceso revisables.
Recuperabilidad: mantener copias de seguridad versionadas y probar la restauración a un estado bueno conocido.
La guía práctica del NIST identifica resultados como restaurar la última configuración buena conocida, identificar la copia de seguridad correcta, determinar qué cambió y cuándo, y correlacionar una alteración con los eventos relacionados. Un equipo pequeño puede empezar por las tablas de mayor riesgo y ampliar la cobertura a medida que maduran la responsabilidad y las evidencias.
Una plataforma como el enfoque de implantación de calidad de datos de digna puede combinar detección de anomalías, validación, supervisión de la puntualidad y seguimiento de esquemas. La decisión de diseño importante no es elegir una sola función, sino conectar señales estadísticas, reglas deterministas, conciencia estructural y evidencias de recuperación con el mismo producto de datos.
El equilibrio que la mayoría de las guías de integridad omiten
Más controles no producen automáticamente más integridad. El exceso de alertas genera fatiga, una validación lenta puede inutilizar la información y un acceso demasiado restrictivo puede empujar a los analistas hacia copias sin gobierno.
Una encuesta global a más de 550 profesionales de datos y analítica señaló la calidad de los datos como el principal reto para su integridad. Solo un 12 % afirmó que sus datos estaban preparados para la IA, y la escasez de competencias y personal fue el mayor obstáculo para mejorar la calidad, según el análisis de la encuesta publicado por Precisely.
El objetivo práctico son datos fiables a una velocidad y un coste adecuados. Prioriza los controles según el impacto en el negocio, los requisitos de actualidad, la exposición regulatoria y el uso previsto. Una lista de comprobación de enriquecimiento de datos de looot puede ayudar a revisar los pasos de enriquecimiento sin olvidar la procedencia, la validación y la responsabilidad.
Preguntas frecuentes y una lista rápida de objetivos de integridad
¿Cómo podemos demostrar que los datos siguieron siendo fiables tras un cambio en el pipeline?
Conserva esquemas versionados, linaje, eventos de auditoría, resultados de validación, marcas de tiempo, responsables y contexto de los cambios. Ante un cambio relevante, compara el comportamiento antes y después, documenta los registros afectados y guarda la evidencia junto con el registro de la versión o del incidente.
¿Cómo debe priorizar los controles un equipo pequeño?
Empieza por los conjuntos de datos que respaldan los informes regulatorios, las operaciones críticas o los modelos de alto impacto. Aplica primero allí controles de actualidad, validación, esquema, acceso y recuperación, y amplíalos después según el riesgo observado, en lugar de intentar supervisar todas las tablas por igual.
¿En qué se diferencian los objetivos de integridad de los KPI de calidad de datos?
Un KPI de calidad mide una propiedad, como la completitud o la validez, en un momento determinado. Un objetivo de integridad pregunta además si el resultado es atribuible, está protegido, es explicable y es recuperable a lo largo de todo el ciclo de vida.

Usa esta lista de comprobación para un producto de datos crítico:
Precisión: validar los valores frente a las reglas de negocio.
Completitud: detectar registros, campos y cargas que faltan.
Coherencia: supervisar definiciones, esquemas y el significado entre sistemas.
Trazabilidad: registrar quién cambió qué, cuándo y por qué.
Seguridad: restringir el acceso y detectar modificaciones no autorizadas.
Recuperabilidad: probar la restauración a un estado bueno verificado.
digna ayuda a los equipos de datos a supervisar el comportamiento de los datos, validar registros, controlar la puntualidad, detectar cambios de esquema e investigar anomalías dentro de su propio entorno. Visita digna para conectar estos controles en los pipelines y conjuntos de datos que sostienen tus informes, tus operaciones y tus casos de uso de IA.
Una vez definidos estos objetivos, el siguiente paso es comprobarlos de forma continua en los pipelines en producción. Nuestra guía práctica de monitorización de la integridad de los datos explica cómo convertir los objetivos de precisión, completitud y coherencia en comprobaciones automatizadas.
Preguntas frecuentes
¿Cuáles son los principales objetivos de garantizar la integridad de los datos?
Los principales objetivos son precisión, completitud, coherencia, trazabilidad, seguridad y recuperabilidad. Cada uno cubre un fallo distinto: un conjunto de datos puede ser seguro pero incompleto, o recuperable pero lógicamente erróneo. Un programa eficaz necesita un control observable y evidencias para los seis, no una única puntuación de integridad.
¿Qué significa ALCOA en integridad de datos?
ALCOA son las siglas en inglés de atribuible, legible, registrado de forma contemporánea, original o copia fiel, y exacto. Estos cinco atributos proceden de las directrices de la FDA. Para un equipo de datos se traducen en preguntas prácticas, como quién modificó un registro y si se conserva el registro de origen.
¿Por qué las copias de seguridad no bastan para que los datos sean recuperables?
Las copias de seguridad solo sirven si sabes qué versión es fiable y la restauración se ha probado de verdad. El NIST pide restaurar el último estado bueno conocido, elegir la copia correcta y no contaminada, y determinar quién cambió los datos y cuándo, así que recuperación e investigación forman un mismo proceso.
¿En qué cambian los objetivos de integridad entre informes regulatorios y datos de entrenamiento de IA?
En los informes regulatorios pesan la trazabilidad, las evidencias duraderas y la aprobación humana antes de presentarlos. Los datos de entrenamiento de IA requieren procedencia, recuperabilidad versionada y nuevas comprobaciones tras cada cambio de fuente o de esquema. Los KPI operativos, en cambio, priorizan la detección rápida y un estado de actualidad claro cerca de la ingesta.
¿Añadir más controles de integridad puede empeorar las cosas?
Sí, acumular controles puede reducir la confianza en lugar de aumentarla. El exceso de alertas provoca fatiga, una validación lenta inutiliza los datos y unas reglas de acceso estrictas empujan a los analistas hacia copias sin gobierno. Es mejor priorizar los controles según impacto en el negocio, necesidad de actualidad, exposición regulatoria y uso previsto.



