Czy dane mogą naprawić się same? Autonomiczna jakość danych
|
6
min. czyt.

Każdy, kto pracuje z danymi, zna ten telefon. Liczba w raporcie się nie zgadza i ktoś musi ustalić dlaczego, zanim zacznie się spotkanie. Dochodzenie, które potem następuje, niemal zawsze wygląda tak samo: który feed, który ładunek, która kolumna, jak daleko to się rozlało i co z tym zrobimy?
Przez dwadzieścia lat narzędzia stawały się coraz lepsze w jednej części tej pracy: w zauważaniu. Reguły wyłapują to, co ktoś przewidział. Obserwowalność wyłapuje to, co się zmieniło. Ale między alertem a naprawą wciąż stoi człowiek, kolejka zgłoszeń i bardzo często poniedziałkowy poranek.
Ten artykuł stawia pytanie, czy tak musi pozostać. Czy dane mogą naprawić się same? Uczciwa odpowiedź brzmi: częściowo, pod warunkami, które da się spisać. A same warunki okazują się ciekawsze niż automatyzacja.
Jakość danych i obserwowalność danych: dwie dyscypliny, żadna nie wystarcza
Jakość danych to stopień, w jakim dane nadają się do celu, w którym są używane, mierzony względem oczekiwania, które ktoś musiał spisać. To cecha samych danych: wartości, kluczy, relacji. Zależy od celu, bo godzina odlotu wystarczająco dobra do miesięcznego raportu nie wystarczy do zgłoszenia slotu na lotnisku. I jest deklaratywna. Reguła znajduje wyłącznie to, o czym ktoś już wcześniej pomyślał.
Obserwowalność danych to zdolność rozumienia kondycji i zachowania danych na podstawie sygnałów, które same emitują, bez wiedzy z góry, co pójdzie nie tak. Aktualność, wolumen, schemat, rozkład i pochodzenie danych są wyuczane z historii, a nie definiowane przez biznes, dlatego obserwowalność skaluje się na każdą tabelę. I to jest zarazem jej granica: obserwowalność powie, że coś się zmieniło, ale nigdy, że coś jest błędne.
Żadna z tych dyscyplin nie zawiera drugiej. Weźmy czas bloku wynoszący 92 minuty na trasie, która zwykle zajmuje 148. Liczba wierszy jest normalna, tabela jest aktualna, schemat się nie zmienił, a wartość mieści się spokojnie w każdym globalnym zakresie. Przechodzi każdą kontrolę i mimo to jest błędna. To właśnie luka opisana w naszym artykule o danych, które wyglądają na błędne, a mimo to przechodzą Twoje reguły, a pełne porównanie obu dyscyplin znajdziesz w tekście Data Observability vs Data Quality.
Czym jest autonomiczna jakość danych?
Autonomiczna jakość danych to ciągła, w dużej mierze oparta na AI zdolność wykrywania, badania, oceniania i usuwania problemów z jakością danych przy minimalnym udziale człowieka. Cztery czasowniki, a to trzy ostatnie odróżniają ją od narzędzi, które większość zespołów już ma:
Wykryj: coś zmieniło się na tyle, że zasługuje na uwagę.
Zbadaj: który feed, który ładunek, która kolumna.
Oceń: jak poważny jest problem i co od tych danych zależy.
Napraw: kwarantanna, wstrzymanie lub ponowne uruchomienie, z dokładnym zapisem tego, co zostało zrobione.
Niemal każdy produkt dostępny dziś na rynku zatrzymuje się na pierwszym czasowniku. Podobnie jak obserwowalność, autonomiczna jakość danych się adaptuje: progi i priorytety podążają za danymi, zamiast zamarznąć w dniu, w którym ktoś je zapisał. W praktyce to próba wykorzystania sygnałów, które generuje obserwowalność, do wykonania pracy nad jakością, która dotąd wymagała reguł.
Dlaczego staje się to możliwe właśnie teraz
Dwie rzeczy zmieniają się jednocześnie. Pierwsza to kształt platformy danych. Centralna hurtownia, należąca do jednego zespołu, który uzgodnił, kim jest klient albo pasażer, ustępuje miejsca produktom danych z własnymi właścicielami, kontraktami i cyklami wydań. Jakość musi się teraz utrzymać na każdej granicy, którą dane przekraczają, a nie tylko tam, gdzie lądują, i nikt nie jest już właścicielem całego łańcucha.
Druga to pojawienie się agentów na tej platformie. Agentowi nie trzeba mówić, jak. Trzeba mu powiedzieć, co, i jak daleko może się posunąć. Weźmy rutynowe ponowne załadowanie danych. Dziś inżynier szuka procedury składowanej i jej parametrów, API źródła wraz z uwierzytelnianiem i stronicowaniem, pisze ponawianie i obsługę błędów, a potem przepisuje to wszystko, gdy partner zmieni format eksportu. Z agentem polecenie sprowadza się do jednego zdania: załaduj ponownie wczorajsze dane boardingowe dla jednego lotu. Agent sam znajduje procedurę i API w katalogu, ustala kolejność wywołań, ponawia je i weryfikuje liczbę wierszy.
To model integracji inny niż wszystko, co budowaliśmy do tej pory. Będziemy poświęcać mniej czasu na opisywanie, jak przebiega ponowne ładowanie, a więcej na określanie, co można załadować ponownie, kto może to zrobić i kiedy bez pytania o zgodę.
Jeden odcinek lotu, pięć różnych odpowiedzi
Żeby to skonkretyzować, weźmy Alpenwing Airways, fikcyjnego europejskiego przewoźnika średniej wielkości, którego problemy są jak najbardziej prawdziwe. Ten sam lot opisuje siedem systemów: rezerwacje, kontrola odlotów, lotniskowa baza operacyjna, obsługa techniczna, planowanie załóg, rozliczanie przychodów i jedenaście feedów od partnerów codeshare. Żaden z nich nie jest błędny. Zbudowano je do różnych zadań w różnym czasie, a to w hurtowni ich rozbieżności wychodzą na jaw. Oto, co agent robi z pięcioma alertami dotyczącymi jednego odcinka lotu: WG 402 z Wiednia do Warszawy.
1. Feed partnera z dnia na dzień przechodzi z kodów lotnisk IATA na ICAO
Średnia długość wartości w kolumnie lotniska wylotu zmienia się w jednym źródle z 3,00 na 4,00, a 1284 wiersze nie przechodzą kontroli dozwolonych wartości. Nic innego w tym feedzie się nie zmieniło. Data Steward zatwierdził mapowanie LOWW na VIE kilka miesięcy temu, opublikowany rejestr ICAO to potwierdza, a poprawka jest odwracalna. To najprostszy możliwy przypadek i jest blisko tego, co da się zrobić już dziś.
2. Na pokład samolotu ze 180 miejscami wchodzi 36 pasażerów
Współczynnik wypełnienia 0,20 na trasie, na której od dwóch lat nie spadł poniżej 0,72, podczas gdy wszystkie pozostałe odcinki tego dnia wyglądają normalnie. Na dokładnie taką sytuację istnieje zatwierdzony wzorzec: załaduj odcinek ponownie, a potem zweryfikuj go względem drugiego, niezależnego licznika z systemu rezerwacji. Pochodzenie danych pokazuje, że zależą od niego trzy marty i dzienny raport operacyjny, więc agent wstrzymuje je do czasu potwierdzenia liczby.
3. Kontrola odlotów liczy 168 pasażerów, lotniskowa baza danych 171
Zaplanowane uzgadnianie danych wykazuje różnicę trzech pasażerów, a obserwowalność nie widzi niczego: 168 to normalna liczba i 171 również. Różnica okazuje się definicyjna. Czy niemowlę podróżujące na kolanach rodzica to pasażer? Żaden wpis w katalogu na to nie odpowiada i żaden zatwierdzony wzorzec tego nie obejmuje. Agent może przeprowadzić całą analizę. Definicja pozostaje decyzją człowieka.
4. Feed z lotniskowej bazy operacyjnej spóźnia się o trzy godziny
Feed zwykle dociera przed 02:30. O 05:40 wciąż go nie ma, a raport operacyjny ma powstać o 06:00. Żadna reguła jakości danych się nie uruchamia, bo dane nie są błędne, po prostu ich nie ma. Odraczanie zależnych ładowań przy opóźnionej dostawie to zatwierdzony wzorzec, więc agent korzysta z pochodzenia danych i logu ładowań, by wstrzymać dokładnie te raporty, które w przeciwnym razie powstałyby na wczorajszych liczbach, i nic poza nimi.
5. Miasto docelowe przychodzi jako dowolny tekst
Wiedeń, Viena i Wien oznaczają to samo miasto. Liczba unikalnych wartości skacze w ciągu jednego dnia z 41 do 63, a 2140 wierszy nie pasuje do żadnej listy referencyjnej. Otwarty internet przydaje się, żeby ustalić, że Wiedeń to polska nazwa stolicy Austrii, ale sam w sobie nigdy nie wystarcza. Mapowanie jest bezpieczne tylko względem zadeklarowanej domeny: 94 lotnisk, które Alpenwing faktycznie obsługuje. To kierunek, w którym zmierza technologia, a nie miejsce, w którym jest dziś.
Cztery kontrole, które decydują, czy agent może działać samodzielnie
Każdy z tych scenariuszy przechodzi przez tę samą bramkę, zbudowaną z czterech sprawdzalnych pytań. Żadnym z nich nie jest pewność samego modelu, która nie jest skalibrowana i nigdy nie powinna być powodem zmiany w hurtowni.
Czy dokładnie ten wzorzec był już wcześniej zatwierdzony? Jeśli Steward raz go zatwierdził, dziesiąte wystąpienie to kwestia sprawdzenia, a nie oceny. To najsilniejszy pojedynczy sygnał, ale nie jest ani konieczny, ani wystarczający.
Czy działanie jest odwracalne? Kwarantannę, wstrzymanie, ponowne zamówienie danych i ponowne ładowanie można cofnąć. Nadpisania wartości w miejscu cofnąć się nie da. Działania odwracalne zasługują na znacznie większą swobodę.
Czy źródło jest autorytatywne i datowane? Opublikowany rejestr z datą publikacji uzasadnia działanie. Wiarygodnie brzmiąca odpowiedź bez źródła już nie, niezależnie od tego, jak pewnie brzmi.
Jak duży jest zasięg skutków? Jeden wiersz w kwarantannie to nie to samo co wymiar, z którym łączy się każdy mart, a ten z kolei to nie to samo co liczba już przekazana regulatorowi.
Równie ważna jest kolejność, w jakiej agent sięga po źródła. Najpierw Twoja własna baza wiedzy: katalog, pochodzenie danych, kontrakty i biblioteka zatwierdzonych wzorców. Na drugim miejscu opublikowane rejestry. Otwarty internet służy wyłącznie do orientacji, a pamięć samego modelu jest najsłabszym źródłem ze wszystkich, bo odpowiedzi, której nikt nie sprawdził, nie da się odróżnić od takiej, która została zweryfikowana. Agent, który nie potrafi wskazać swojego źródła, nie może działać.
To, ile swobody dostaje agent, ustala się dla każdej domeny i każdego produktu danych osobno, nigdy raz dla całej firmy. Regulowany bank może dopuszczać wyłącznie propozycje, z których każda czeka na wskazanego z nazwiska zatwierdzającego. W danych operacyjnych linii lotniczej działania odwracalne mogą wykonywać się samodzielnie, a wszystko, co nieodwracalne, jest tylko proponowane. Produkt danych marketingowych może większość poprawek wykonywać bez nadzoru i być przeglądany raz w tygodniu zbiorczo. Niezależnie od ustawień każde działanie niesie ze sobą dowody, każde można wycofać osobno, a zatwierdzone wzorce są monitorowane i wygasają, bo świat może się zmienić pod wzorcem, który kiedyś był słuszny.
Czego autonomiczna jakość danych wciąż nie potrafi
Granice się przesunęły. Nie zniknęły, a trzy z nich są trwałe.
Nie wymyśli źródła prawdy. To, czy pasażer faktycznie wszedł na pokład, rejestruje skan karty pokładowej i nic poza nim. Jeśli obie kopie danej liczby są błędne w ten sam sposób, uzgadnianie chętnie je potwierdzi, bo porównuje, a nie weryfikuje.
Nie zdefiniuje celu. To, czy niemowlę liczy się jako pasażer, który system jest autorytatywny i czy wolno korygować historię po przekazaniu liczby regulatorowi, to decyzje biznesowe. Ktoś musi za nie odpowiadać, na piśmie.
Nie naprawi źródła. Feed, który w nieskończoność jest po cichu poprawiany, to feed, którego nikt nigdy nie naprawi u źródła, bo dostawca nigdy nie odczuwa problemu. Dlatego każda automatyczna poprawka musi być nadal raportowana.
Co dzieje się z rolą Data Stewarda
Każdy zespół danych zna ten poniedziałkowy poranek: czterdzieści jeden alertów z weekendu w kolejce, z czego trzy to prawdziwe problemy. Autonomiczna jakość danych nie sprawi, że ta sterta zniknie. Usunie z niej to, co powtarzalne.
Odchodzi czytanie tego samego alertu po raz czterdziesty, ściganie partnera w sprawie feedu, który znowu się zepsuł, i ręczne uruchamianie ładowań o siódmej rano. Zastępuje je kuratorowanie biblioteki zatwierdzonych wzorców rozwiązań, decydowanie, co tak naprawdę oznacza niejednoznaczna wartość, zbiorczy audyt decyzji agenta i ustalanie, ile swobody dostaje każdy produkt danych. Data Steward przestaje naprawiać pojedyncze problemy i zaczyna decydować, w jaki sposób problemy są naprawiane. To bardziej seniorska rola niż ta, którą pełni dziś większość stewardów, bliższa tworzeniu polityk niż operacjom. Nikt nie zostaje usunięty. Znika praca, która źle się skalowała.
Na koniec: precedens, odwracalność i dowody, a nie pewność siebie
Agent ogólnego przeznaczenia z danymi dostępowymi do bazy to nie jest autonomiczna jakość danych. Bez katalogu nie wie, czy kolumna zawiera kod, czy etykietę, i zgaduje z pełnym przekonaniem. Bez pochodzenia danych nie potrafi określić zakresu ponownego uruchomienia ani ocenić zasięgu skutków. Bez biblioteki wzorców każde wystąpienie jest pierwszym, nic się nie kumuluje, a Steward nigdy nie odzyskuje czasu. Bez tych trzech elementów model językowy nie powinien zbliżać się do Twojej hurtowni.
Dlatego autonomiczna jakość danych należy do wnętrza platformy jakości danych, a nie obok niej. Fundament musi już istnieć: digna Data Anomalies uczy się, jak wygląda normalność, bez ręcznie ustawianych progów, digna Data Validation egzekwuje audytowalne reguły na poziomie rekordów, digna Timeliness uczy się wzorców dostaw obok harmonogramów, które deklarujesz, digna Schema Tracker wychwytuje zmiany strukturalne, a digna Data Analytics śledzi, jak w czasie zmieniają się same metryki. Wszystko to działa wewnątrz bazy danych, bez opuszczania przez dane Twojego środowiska. Gradient zaufania, bramka autonomii, ścieżka dowodowa i biblioteka wzorców opisane w tym tekście to kierunek, w którym rozwija się digna.
Czy dane mogą naprawić się same? Nie same z siebie. Ale gdy na miejscu są precedens, odwracalność i dowody, coraz większą ich część da się naprawić bez czekania na poniedziałek.
Zobacz fundament, na którym opiera się autonomiczna jakość danych.
digna uczy się, jak wygląda normalność w każdej tabeli, wewnątrz bazy danych, w chmurze lub on-premise, bez ręcznych progów do utrzymywania. To warstwa dowodów, której agent potrzebuje, zanim będzie można mu zaufać i pozwolić działać.
Zarezerwuj spersonalizowaną prezentację demo → Poznaj platformę digna
Najczęściej zadawane pytania
Czym jest autonomiczna jakość danych?
Autonomiczna jakość danych to ciągła, w dużej mierze oparta na AI zdolność wykrywania, badania, oceniania i usuwania problemów z jakością danych przy minimalnym udziale człowieka. Większość narzędzi zatrzymuje się dziś na wykrywaniu; autonomia to dochodzenie, ocena skutków oraz udokumentowana, odwracalna poprawka.
Czym autonomiczna jakość danych różni się od obserwowalności danych?
Obserwowalność danych uczy się wartości bazowych dla aktualności, wolumenu, schematu i rozkładu i informuje, że coś się zmieniło. Autonomiczna jakość danych traktuje te sygnały jako wyzwalacze, bada przyczynę, ocenia, co zależy od danych, i podejmuje ograniczone działanie, takie jak kwarantanna, wstrzymanie lub ponowne ładowanie.
Kiedy agent AI może samodzielnie naprawiać dane?
Decydują o tym cztery kontrole: czy dokładnie ten wzorzec był wcześniej zatwierdzony, czy działanie jest odwracalne, czy źródło jest autorytatywne i datowane oraz jak duży jest zasięg skutków. Pewność samego modelu nigdy nie jest jedną z tych kontroli, bo nie jest skalibrowana.
Którym źródłom powinien ufać agent jakości danych?
Najpierw własnej bazie wiedzy: katalogowi, pochodzeniu danych, kontraktom i zatwierdzonym wzorcom. Na drugim miejscu są opublikowane rejestry, takie jak listy kodów IATA czy ICAO. Otwarty internet służy tylko do orientacji, a niepotwierdzona pamięć modelu jest najsłabszym źródłem. Agent, który nie potrafi wskazać źródła, nie powinien działać.
Czy autonomiczna jakość danych zastąpi Data Stewarda?
Nie. Usuwa powtarzalną część pracy, taką jak ponowne czytanie tego samego alertu czy ręczne uruchamianie ładowań. Steward zajmuje się kuratorowaniem zatwierdzonych wzorców rozwiązań, decydowaniem, co oznaczają niejednoznaczne wartości, i ustalaniem, ile swobody dostaje każdy produkt danych, co jest bliższe tworzeniu polityk niż operacjom.



