Dostępność platformy nie dowodzi, że monitoring działa. Dashboard może otwierać się przez całą dobę i pokazywać ostatni poprawny punkt sprzed trzech dni. Dobre SLA danych osobno mierzy rzeczywistą kadencję, kompletność, świeżość, luki, ciągłość, opóźnienie dostarczenia i poprawność ramki danych. Dopiero te metryki mówią, czy można zaufać wykresowi, alarmowi i analizie AI.
W skrócie
- SLA aplikacji odpowiada „czy strona działa”; SLA danych odpowiada „czy dostaliśmy pomiary potrzebne do decyzji”.
- Każda metryka wymaga zakresu czasu, mianownika, tolerancji i sposobu obsługi planowanych przerw.
- Nawet wysoka kompletność może ukrywać jedną krytyczną czterogodzinną lukę. Dlatego liczy się też maksymalną lukę i ciągłość.
- Świeżość i opóźnienie to różne rzeczy: pierwsza patrzy na ostatni dostępny pomiar, druga na czas drogi pojedynczej próbki.
- Ocena jakości strumienia nie potwierdza kalibracji ani poprawności fizycznej sensora. Mówi, czy dane są obecne i technicznie użyteczne.
Dlaczego zielona aplikacja może oznaczać ślepy obiekt
SLA danych pomiarowych to uzgodniony zestaw policzalnych warunków określających, czy strumień pomiarowy jest wystarczająco kompletny, świeży i poprawny do zamierzonej decyzji. Nie jest tym samym co SLA hostingu, łącza ani serwera.
Wyobraź sobie platformę działającą bez przerwy. Użytkownik się loguje, wykres się rysuje, wcześniejsze dane są dostępne. Rejestrator w terenie stracił jednak zasilanie w piątek wieczorem. W poniedziałek dashboard nadal może mieć pełną dostępność jako aplikacja, a system monitoringu ma trzydniową dziurę. Jeżeli ostatni punkt nie jest wyraźnie oznaczony, płaska końcówka wykresu może wyglądać jak stabilna konstrukcja.
W monitoringu trzeba rozdzielić co najmniej cztery warstwy:
- sensor wykonał odczyt;
- rejestrator przypisał mu poprawny czas i zapisał go lokalnie;
- transmisja dostarczyła ramkę;
- platforma przyjęła, zwalidowała, przeliczyła i udostępniła wynik.
SLA jednej warstwy nie zastępuje pozostałych. Operator sieci może spełnić dostępność łącza, a urządzenie może wysyłać błędną ramkę danych. Platforma może być dostępna, a źródło milczeć. Sensor może wznowić transmisję i dosłać historię, przez co kompletność okresu poprawi się po czasie, choć alarm w chwili zdarzenia nie miał danych.
Dlatego umowa powinna wskazywać moment pomiaru, moment przyjęcia, sposób korekty wyniku po dosłaniu danych oraz metrykę wykorzystywaną do reakcji bieżącej.
Siedem metryk SLA danych
Nie ma uniwersalnych wartości granicznych. Kanał temperatury pomocniczej, piezometr decydujący o stateczności i rejestracja dynamiczna pracują w innych rytmach. Poniższe definicje są wspólne, lecz cele ustala projektant i właściciel procesu.
| Metryka | Pytanie biznesowe | Prosta definicja | Co może ukryć wynik zbiorczy |
|---|---|---|---|
| Rzeczywista kadencja | Jak często faktycznie dostajemy punkty? | mediana odstępów między kolejnymi czasami pomiaru | krótkie, lecz krytyczne luki |
| Kompletność | Jaki odsetek oczekiwanych próbek istnieje? | otrzymane / oczekiwane × 100% | rozmieszczenie braków w czasie |
| Świeżość | Jak stary jest najnowszy pomiar? | czas oceny − czas najnowszej próbki | opóźnienie wcześniejszych próbek |
| Luki | Jak długie i jak liczne są przerwy? | liczba oraz długość odstępów powyżej tolerancji | wiele małych braków poza maksimum |
| Ciągłość | Jaką część okresu pokrywają nieprzerwane serie? | udział interwałów mieszczących się w tolerancji | pojedynczą długą przerwę bez maksimum |
| Opóźnienie | Jak długo próbka idzie od pomiaru do przyjęcia? | czas przyjęcia − czas pomiaru | próbki, które nigdy nie dotarły |
| Poprawność ramki danych | Ile ramek dało się jednoznacznie przetworzyć? | poprawnie przyjęte / wszystkie odebrane × 100% | błędną kalibrację mimo poprawnej składni |
1. Rzeczywista kadencja
Kadencja deklarowana to ustawienie. Kadencja rzeczywista wynika z danych. Najodporniejszą prostą miarą jest mediana odstępów między kolejnymi czasami pomiaru w reprezentatywnym okresie. Mediana nie zostanie łatwo przesunięta przez pojedynczą wielogodzinną lukę.
Jeżeli urządzenie miało mierzyć domyślnie co 15 minut lub częściej, a mediana wynosi 30 minut, system działa inaczej niż specyfikacja. Jeżeli mediana wynosi 15 minut, nadal mogą istnieć długie braki. Dlatego kadencja jest początkiem diagnozy, nie oceną końcową.
2. Kompletność
Dla stałego kroku liczba oczekiwanych próbek w okresie może być liczona jako długość okresu podzielona przez kadencję, z jasno określoną obsługą końców przedziału. Kompletność wynosi:
kompletność = liczba poprawnych unikalnych próbek / liczba próbek oczekiwanych × 100%.
Słowa „poprawnych” i „unikalnych” są ważne. Dziesięć kopii tego samego znacznika czasu nie może podnosić kompletności. Ramka odrzucona z powodu błędnej struktury także nie jest użytecznym pomiarem.
3. Świeżość
Świeżość mierzy wiek najnowszego dostępnego pomiaru w chwili oceny. Dla kanału 15-minutowego wartość 18 minut może być normalna, a 70 minut – wymagać wyjaśnienia. Granica zależy od cyklu transmisji, bufora, ryzyka i tego, czy pomiar jest krytyczny.
Nie używaj czasu ostatniego logowania urządzenia zamiast czasu ostatniej próbki. Urządzenie może odpowiadać sygnałem żywotności, a nie przesyłać właściwych danych. Może też dosłać stary pomiar, który poprawi kompletność historyczną, lecz nie świeżość bieżącą.
4. Liczba i długość luk
Luka powstaje, gdy odstęp między sąsiednimi próbkami przekracza ustaloną tolerancję. Dla kadencji 15 minut tolerancja nie musi wynosić dokładnie 15:00. Zegar, czas transmisji i sposób próbkowania mogą dawać niewielkie odchylenia. Tolerancję należy zapisać w sekundach lub jako mnożnik kadencji.
Raportuj co najmniej liczbę luk, ich łączny czas, maksimum i rozkład względem ważnych faz robót. Jedna dwugodzinna przerwa podczas głębienia wykopu może być ważniejsza niż kilkadziesiąt pojedynczych braków podczas postoju.
Metryki 5–7: ciągłość, opóźnienie i poprawność
5. Ciągłość
Ciągłość opisuje, ile danych tworzy nieprzerwane serie. Można ją liczyć jako udział oczekiwanych interwałów, których odstęp nie przekracza tolerancji, albo jako długość najdłuższego ciągłego odcinka. W umowie trzeba wybrać jedną definicję.
Ta metryka ma znaczenie dla trendów, korelacji i analizy bazowej. Dwie serie o tej samej kompletności mogą mieć inną wartość analityczną: w jednej brakuje co setnego punktu, w drugiej cały dzień zniknął w jednym bloku.
6. Opóźnienie dostarczenia
Opóźnienie wymaga dwóch wiarygodnych czasów: kiedy wykonano pomiar i kiedy platforma go przyjęła. Raportuj medianę, percentyl 95 lub 99 oraz maksimum w zdefiniowanym oknie. Średnia bywa myląca, bo kilka bardzo późnych ramek może mieć znaczenie operacyjne mimo dobrego przeciętnego wyniku. Odbiór czasu warto połączyć z testami UTC, zmiany strefy i dryfu zegara.
Spóźniona próbka może zostać poprawnie zapisana w historii, lecz nie mogła uruchomić reakcji w chwili zdarzenia. Dlatego SLA powinno osobno oceniać kompletność końcową i terminowość operacyjną.
7. Poprawność ramki danych
Platforma powinna policzyć ramki przyjęte, odrzucone i częściowo przetworzone według jawnych kodów przyczyny. Błędny identyfikator, niejednoznaczny czas, inna liczba wartości niż znaczników czasu albo niepoprawna liczba nie mogą cicho zniknąć.
Poprawna ramka nadal może zawierać błędny fizycznie pomiar. Walidacja struktury nie sprawdza kalibracji, montażu ani tego, czy kanał został przypisany do właściwego sensora. To odrębna warstwa kontroli.
Przykład ilustracyjny: kanał domyślnie co 15 minut lub częściej przez tydzień
Załóżmy kanał, który powinien tworzyć jedną próbkę w domyślnym interwale 15 minut przez siedem pełnych dób. Oczekujemy 672 próbek. Przyszło 665 unikalnych i poprawnych punktów. Siedmiu brakuje, więc kompletność wynosi:
665 / 672 × 100% = 98,96%.
Sam wynik wygląda dobrze. Rozkład braków zmienia ocenę:
- wariant A: siedem pojedynczych braków w różnych dniach;
- wariant B: jedna przerwa 120 minut podczas kluczowej fazy robót;
- wariant C: wszystkie próbki istnieją po dosłaniu historii, lecz dotarły sześć godzin później.
Wariant A może być dopuszczalny dla trendu wolnozmiennego. Wariant B może uniemożliwić ocenę momentu krytycznego. Wariant C da 100% kompletności końcowej, ale zawiedzie jako system wczesnego ostrzegania.
Ilustracyjna karta oceny powinna więc zawierać: kompletność 98,96%, rzeczywistą medianę kadencji 15 minut, maksymalną lukę 120 minut, świeżość w chwili oceny, percentyl opóźnienia i liczbę odrzuconych ramek. Dopiero komplet mówi, czy dane nadają się do bieżącego alarmowania, raportu miesięcznego lub analizy statystycznej.
Jak zapisać SLA w umowie, żeby dało się je odebrać
Nie wpisuj wyłącznie „system zapewnia wysoką kompletność”. Taki zapis nie definiuje mianownika ani wyjątków. Użyj tabeli i powiąż ją z checklistą wyboru platformy monitoringu.
| Pole kontraktowe | Co trzeba ustalić |
|---|---|
| Zakres | projekt, urządzenie, kanał, typ danych |
| Okno | doba, tydzień, miesiąc; strefa i granice przedziału |
| Kadencja | deklarowana albo wyznaczana z danych; tolerancja |
| Próbka oczekiwana | sposób liczenia początku i końca okna |
| Duplikat | klucz jednoznaczności i zasada deduplikacji |
| Planowana przerwa | kto zatwierdza, jak jest oznaczona, czy wchodzi do mianownika |
| Spóźnione dane | termin zamknięcia okresu i korekta raportu |
| Cel | bieżący alarm, raport, analiza trendu lub archiwum |
| Poziom | wartość docelowa, ostrzegawcza i naruszenie |
| Reakcja | właściciel, czas odpowiedzi, dowód zamknięcia |
Każdy kanał nie musi mieć osobnego dokumentu. Można utworzyć klasy krytyczności. Klasa A może wymagać krótszej świeżości i większej ciągłości, klasa C tolerować dosłanie danych po czasie. Klasa wynika z decyzji, którą kanał wspiera, nie z ceny sensora.
Ograniczenia SLA danych i najczęstsze pułapki
Liczenie próbek według czasu przyjęcia. Do geometrii szeregu używaj czasu pomiaru. Czas przyjęcia służy do opóźnienia. Mieszanie obu tworzy sztuczne luki i przesuwa zdarzenia.
Dzielenie przez złą liczbę oczekiwaną. Zmiana kadencji w połowie miesiąca wymaga podziału okresu. Nie wolno użyć jednego mianownika po cichej rekonfiguracji.
Traktowanie duplikatu jako dodatkowej kompletności. Klucz pomiaru powinien jednoznacznie łączyć źródło, kanał i czas. Powtórna transmisja ma być idempotentna.
Maskowanie luk linią na wykresie. Interpolacja może być przydatna analitycznie, ale nie może udawać obserwacji. Na wykresie operacyjnym luka powinna być widoczna.
Jedno SLA dla wszystkich danych. Sygnał dynamiczny jest kompletnym rekordem albo niekompletnym oknem; nie ocenia się go tak samo jak powolnej serii temperatury.
Brak wersji metryki. Zmiana tolerancji lub sposobu wyznaczania kadencji zmienia wynik. Raport powinien zachować metodę i okres obowiązywania.
Jak to wygląda w Inclify
Inclify wyznacza realną kadencję z mediany odstępów między próbkami i liczy raport jakości obejmujący kompletność, świeżość, luki i ciągłość. Rejestratory w systemach Inclify domyślnie wysyłają odczyty co 15 min lub częściej; platforma przyjmuje dowolny interwał.
Alarm braku danych może działać dla urządzenia lub wybranego kanału z konfigurowanym oknem. To osobny stan operacyjny, nie interpretacja bezpieczeństwa konstrukcji. W pilocie trzeba sprawdzić, czy wykres operacyjny przerywa serię w luce, zamiast łączyć odległe punkty i udawać ciągłość. Administrator może przejść z metadanych błędu do zachowanej wymiany urządzenia, o ile mieści się ona w skonfigurowanej retencji surowych logów, domyślnie siedem dni.
Raport jakości nie mierzy kontraktowego opóźnienia dla każdej możliwej integracji ani nie potwierdza dokładności czujnika. Daje techniczny obraz gotowości danych. Jeżeli w umowie potrzebujesz percentyla opóźnienia od pomiaru do przyjęcia, określ punkt pomiarowy i sposób raportowania w integracji. Jeżeli chcesz potwierdzić kalibrację, potrzebujesz osobnej procedury oraz raportu długu kalibracyjnego.
Wynik raportu zawsze trzeba odnieść do decyzji oraz krytyczności konkretnego kanału.
Checklista tygodniowego przeglądu jakości
- Czy rzeczywista kadencja zmieniła się względem poprzedniego tygodnia?
- Które kanały mają najniższą kompletność i czy brak dotyczy ważnej fazy?
- Jaka jest maksymalna luka, nie tylko średnia?
- Czy najnowszy pomiar jest wystarczająco świeży dla decyzji?
- Czy dane przyszły na czas, czy zostały dosłane po zdarzeniu?
- Ile ramek odrzucono i z jakiego powodu?
- Czy planowane prace serwisowe zostały poprawnie oznaczone?
- Czy reguła NO_DATA odpowiada aktualnej kadencji?
- Czy analiza AI lub raport trendu powinny dostać zastrzeżenie jakości?
- Kto jest właścicielem naprawy i kiedy sprawdzimy wynik ponownie?
Najlepszy raport kończy się zadaniem, nie kolorem. „Kompletność 92%” jest obserwacją. „Sprawdź zasilanie i transmisję, właściciel: serwis, termin: dziś 14:00” jest procesem.
FAQ
Czym SLA danych różni się od dostępności systemu?
Dostępność systemu mierzy, czy można korzystać z aplikacji lub usługi. SLA danych mierzy, czy w aplikacji znajdują się oczekiwane, świeże i poprawne pomiary. Platforma może mieć pełną dostępność, gdy urządzenie terenowe od kilku dni nie wysyła danych. W monitoringu potrzebne są oba poziomy, ale odpowiadają na inne pytania i mają innych właścicieli.
Jak policzyć kompletność pomiarów?
Podziel liczbę poprawnych, unikalnych próbek przez liczbę oczekiwaną w tym samym okresie i pomnóż przez 100%. Najtrudniejsza jest definicja mianownika: trzeba uwzględnić kadencję, granice okna, zatwierdzone przerwy i zmianę konfiguracji. Duplikaty nie zwiększają licznika. Spóźnione dane mogą poprawić kompletność końcową, ale nie terminowość bieżącą.
Jaka kompletność jest wystarczająca?
Nie ma uniwersalnej wartości. Zależy od mechanizmu ryzyka, kadencji, długości luk i celu danych. Ten sam procent może wystarczyć do miesięcznego trendu temperatury i nie wystarczyć do decyzji podczas fazy wykopu. Projektant powinien określić wymaganie per klasa krytyczności, a umowa musi mierzyć również maksymalną lukę oraz świeżość.
Czy brak danych oznacza awarię czujnika?
Nie. Przyczyną może być zasilanie, rejestrator, transmisja, błędny czas, odrzucona ramka danych, konfiguracja albo sam sensor. Alarm NO_DATA mówi, że platforma nie ma oczekiwanej nowej informacji. Uruchamia diagnostykę, ale nie rozstrzyga przyczyny. Dlatego procedura powinna zaczynać się od sprawdzenia ostatniej komunikacji i zakresu braków.
Czy dosłane dane naprawiają naruszenie SLA?
Mogą naprawić kompletność historyczną, lecz nie cofają utraconej terminowości. Jeżeli próbka dotarła sześć godzin po pomiarze, może wejść do raportu i analizy trendu, ale nie mogła wywołać reakcji w chwili zdarzenia. Umowa powinna osobno liczyć kompletność po zamknięciu okresu i opóźnienie operacyjne.
Czy wysoki wynik jakości oznacza, że czujnik mierzy poprawnie?
Nie. Kompletna i świeża seria może pochodzić z rozkalibrowanego, źle zamontowanego lub źle przypisanego sensora. SLA danych ocenia przepływ i techniczną użyteczność. Poprawność fizyczna wymaga kalibracji, kontroli referencji, porównania z kontekstem i oceny inżyniera. Te warstwy powinny być raportowane osobno.
Czy wszystkie kanały powinny mieć ten sam alarm braku danych?
Nie. Okno powinno wynikać z rzeczywistej kadencji, ryzyka i roli kanału. Krytyczny piezometr podczas robót może wymagać krótszej tolerancji niż pomocnicza temperatura. Ustawienie jednego timeoutu dla całego projektu prowadzi albo do spóźnionej reakcji, albo do szumu. Warto grupować kanały według klas krytyczności.
Źródła i dalsza lektura
- USACE EM 1110-2-1908: Instrumentation of Embankment Dams and Levees – planowanie danych, częstotliwość, obsługa i ocena instrumentacji.
- ISO 18674-1:2015 – zasady ogólne monitoringu geotechnicznego.
- NIST IoT Device Cybersecurity Guidance: Data Protection – ochrona integralności i dostępności danych urządzeń.
- Google SRE Workbook: Implementing SLOs – definiowanie mierzalnych wskaźników i celów usługi.
- RFC 3339 – jednoznaczny format czasu używany przy wymianie danych.
- Alarm braku danych: jak zaprojektować NO_DATA – procedura dla źródła, które przestało wysyłać.
Co dalej
Chcesz zobaczyć jakość własnego strumienia zamiast przykładowego dashboardu? Umów przegląd 7–30 dni danych. Zespół Inclify pokaże rzeczywistą kadencję, kompletność, luki i świeżość oraz wskaże, których wniosków jeszcze nie da się obronić.