Jak działają skanowania
Gdy uruchamiasz skanowanie, DQS przetwarza Twoje rekordy Salesforce względem skonfigurowanych funkcji. Skanowanie działa w tle za pomocą Salesforce Batch Apex, więc możesz dalej pracować podczas przetwarzania.
DQS automatycznie respektuje limity governor Salesforce. Twój org pozostaje responsywny podczas skanowań.
Uruchamianie ręcznego skanowania
Rozpoczynanie skanowania
- Otwórz DQS z App Launcher
- Znajdź swoją Definition na liście
- Kliknij Run Scan (lub ikonę odtwarzania)
- Potwierdź, aby rozpocząć
Skanowanie natychmiast rozpoczyna przetwarzanie.
Wskaźniki statusu skanowania
| Status | Ikona | Znaczenie |
|---|---|---|
| Queued | Zegar | Oczekuje na rozpoczęcie |
| Processing | Spinner | Aktualnie w toku |
| Completed | Znacznik wyboru | Zakończone pomyślnie |
| Failed | X | Wystąpił błąd |
Podgląd aktywnych skanowań
Ekran główny DQS pokazuje wszystkie trwające skanowania:
- Nazwę Definition
- Procent postępu
- Przetworzone rekordy / łącznie
- Czas, który upłynął
- Szacowany pozostały czas
Zrozumieć postęp
Śledzenie postępu
DQS przetwarza rekordy wsadowo (w batchach). Pasek postępu pokazuje:
- Ukończone batche spośród łącznej liczby batchy
- Przetworzone rekordy spośród łącznej liczby rekordów
- Aktualnie ocenianą funkcję
Przykład: „Processing batch 5 of 12 (2,500 of 6,000 records) - Completeness“
Kolejność przetwarzania
DQS ocenia funkcje w następującej kolejności:
- Kompletność (szybkie kontrole pól)
- Poprawność (dopasowanie wzorca formatu)
- Terminowość (porównania dat)
- Spójność (zgodność wartości)
- Unikalność (wykrywanie duplikatów)
- Funkcje AI Readiness
Funkcje o niższym koszcie uruchamiane są jako pierwsze, aby zapewnić szybką informację zwrotną.
Szacowany czas
Czas trwania skanowania zależy od:
| Czynnik | Wpływ |
|---|---|
| Liczba rekordów | Więcej rekordów = dłuższy czas |
| Liczba pól | Więcej pól = dłuższy czas |
| Koszt funkcji | Funkcje o koszcie HIGH trwają dłużej |
| Obciążenie org | Zajęte org przetwarzają wolniej |
Typowe tempo przetwarzania:
| Liczba rekordów | Szacowany czas |
|---|---|
| 1 000 | Poniżej 1 minuty |
| 10 000 | 2–5 minut |
| 100 000 | 15–30 minut |
| 1 000 000+ | 1–2 godziny |
To wartości szacunkowe. Rzeczywisty czas zależy od wyboru funkcji i aktywności org.
Koszty przetwarzania
Każda funkcja ma koszt przetwarzania, który wpływa na czas trwania skanowania.
Poziomy kosztu
| Koszt | Funkcje | Uwagi dotyczące przetwarzania |
|---|---|---|
| LOW | Kompletność, Poprawność | Proste kontrole pól per rekord |
| MEDIUM | Terminowość, Spójność, Wykrywanie PII | Analiza wzorców i działania na datach |
| HIGH | Unikalność | Porównania między rekordami |
Obliczanie kosztu
Podsumowanie Definition pokazuje szacowany koszt łączny:
- Low — wszystkie wybrane funkcje mają koszt LOW
- Medium — co najmniej jedna funkcja o koszcie MEDIUM
- High — co najmniej jedna funkcja o koszcie HIGH
Wskazówka: Przy pierwszym skanowaniu dużego zbioru danych zacznij wyłącznie od funkcji o koszcie LOW. Funkcje o koszcie HIGH dodaj, gdy poznasz już punkt wyjścia.
Szczegóły przetwarzania wsadowego
Jak działa Batch Apex
DQS używa Salesforce Batch Apex do przetwarzania rekordów. Oto, co to oznacza:
- Rekordy dzielone są na batche (domyślnie: 200 rekordów na batch)
- Każdy batch przetwarzany jest niezależnie
- Jeśli jeden batch zawiedzie, pozostałe są kontynuowane
- Limity governor resetują się między batchami
Takie podejście pozwala DQS:
- Przetwarzać miliony rekordów
- Respektować limity Salesforce
- Działać bez blokowania użytkowników
- Wznawiać pracę po przerwaniu
Limity governor Salesforce
Batch Apex ma następujące kluczowe limity:
| Limit | Wartość | Uwagi |
|---|---|---|
| Maks. zakolejkowanych batch jobs | 5 | DQS używa 1 joba na skanowanie |
| Rekordy poprzez QueryLocator | 50 milionów | Z naddatkiem dla większości org |
| Dzienne wykonania batchy | 250 000 | Łącznie dla wszystkich batch jobs w org |
DQS zaprojektowano tak, aby pozostawać znacznie poniżej tych limitów.
Optymalizacja rozmiaru batcha
DQS dostosowuje rozmiar batcha do złożoności funkcji:
| Typ funkcji | Rozmiar batcha |
|---|---|
| Tylko koszt LOW | 200 rekordów |
| Uwzględniony koszt MEDIUM | 200 rekordów |
| Uwzględniony koszt HIGH | 100 rekordów |
Mniejsze batche dla złożonych funkcji zapobiegają błędom timeoutu.
Obsługa dużych zbiorów danych
Zbiory danych powyżej 100 000 rekordów
Przy dużych zbiorach danych stosuj się do następujących praktyk:
- Używaj filtrów, aby ograniczyć zakres
- Zacznij od funkcji o koszcie LOW
- Uruchamiaj poza godzinami szczytu, gdy to możliwe
- Monitoruj postęp pod kątem ewentualnych problemów
Zbiory danych powyżej 1 miliona rekordów
Przy bardzo dużych zbiorach danych:
- Segmentuj dane za pomocą wielu Definitions z filtrami
- Planuj skanowania w oknach serwisowych
- Uruchamiaj funkcje osobno, jeśli to konieczne
- Wykorzystaj segmentację do równoległego przetwarzania danych
Przykładowa segmentacja:
- Definition A: Contacts, gdzie Region = ‘Americas’
- Definition B: Contacts, gdzie Region = ‘EMEA’
- Definition C: Contacts, gdzie Region = ‘APAC’
Wskazówki dotyczące wydajności
| Wskazówka | Korzyść |
|---|---|
| Mniej pól na Definition | Szybsze przetwarzanie |
| Stosuj filtry rekordów | Mniejszy zbiór danych do skanowania |
| Uruchamiaj funkcje o koszcie HIGH osobno | Lepsza widoczność postępu |
| Planuj poza godzinami szczytu | Mniejsza konkurencja o zasoby |
Zakończenie skanowania
Powiadomienia o zakończeniu
Po zakończeniu skanowania otrzymujesz:
- Powiadomienie w aplikacji — ikona dzwonka pokazuje nowe wyniki
- Powiadomienie e-mail — podsumowanie wysłane na Twój adres
- Aktualizację ekranu głównego — status zmienia się na Completed
Przeglądanie wyników
Kliknij zakończone skanowanie, aby zobaczyć:
- Ogólny wynik jakości
- Wyniki na poziomie wymiarów
- Szczegóły metryk
- Wejście w rekordy, których to dotyczy
Wskazówki dotyczące interpretacji znajdziesz w artykule Jak rozumieć wyniki.
Historia skanowań
DQS przechowuje historię wszystkich skanowań dla każdej Definition:
- Datę i godzinę
- Czas trwania
- Liczbę rekordów
- Ogólny wynik
- Porównanie z poprzednim skanowaniem
Wykorzystuj historię, aby śledzić poprawę w czasie.
Planowanie skanowań
Możesz planować cykliczne skanowania, aby zautomatyzować monitoring jakości danych.
Konfigurowanie harmonogramu
- Otwórz swoją Definition
- Kliknij Schedule (ikona zegara)
- Wybierz częstotliwość:
- Codziennie
- Co tydzień (wybierz dzień)
- Co miesiąc (wybierz datę)
- Ustaw godzinę rozpoczęcia
- Kliknij Save Schedule
Dobre praktyki dotyczące harmonogramu
| Częstotliwość | Przypadek użycia |
|---|---|
| Codziennie | Duży wolumen wprowadzanych danych, monitoring krytycznej jakości |
| Co tydzień | Standardowe śledzenie jakości, analiza trendów |
| Co miesiąc | Raportowanie zarządcze, audyty zgodności |
Wskazówka: Planuj skanowania poza godzinami szczytu (wczesnym rankiem lub w weekendy), aby zminimalizować wpływ na użytkowników.
Zarządzanie harmonogramami
Ze strony szczegółów Definition:
- Edit — zmień częstotliwość lub godzinę
- Pause — tymczasowo zatrzymaj bez usuwania
- Resume — wznów wstrzymany harmonogram
- Delete — całkowicie usuń harmonogram
Limity harmonogramów
Zaplanowane skanowania są dostępne dla wszystkich użytkowników, bez ograniczenia liczby harmonogramów, które możesz skonfigurować.
Anulowanie skanowania
Jak anulować
- Znajdź trwające skanowanie na ekranie głównym
- Kliknij ikonę zatrzymania (lub Cancel)
- Potwierdź anulowanie
Co się dzieje po anulowaniu
- Przetwarzanie zatrzymuje się po bieżącym batchu
- Częściowe wyniki zostają zapisane
- Status zmienia się na „Canceled“
- Możesz przejrzeć zebrane częściowe dane
Anulowane skanowania nie są wliczane do limitów.
Rozwiązywanie problemów
„Scan queued but not starting“
Przyczyna: W Twoim org działają inne batch jobs.
Rozwiązanie: Poczekaj na zakończenie pozostałych jobów. Salesforce dopuszcza maksymalnie 5 równoczesnych batch jobs.
Sprawdź: Setup > Apex Jobs, aby zobaczyć, co jest w toku.
„Scan failed“
Przyczyna: Zwykle problem z danymi lub uprawnieniami.
Rozwiązanie:
- Sprawdź komunikat o błędzie w szczegółach skanowania
- Zweryfikuj, czy masz dostęp do obiektu i pól
- Przejrzyj warunki filtra pod kątem błędów
- Spróbuj uruchomić skanowanie na mniejszej liczbie rekordów
„Scan taking too long“
Przyczyna: Duży zbiór danych lub funkcje o koszcie HIGH.
Rozwiązanie:
- Poczekaj na zakończenie (ostatecznie się skończy)
- Dodaj filtry, aby zmniejszyć liczbę rekordów
- Usuń funkcje o koszcie HIGH
- Zaplanuj skanowanie poza godzinami szczytu
„Results don’t show all records“
Przyczyna: Warunki filtra wykluczyły część rekordów.
Rozwiązanie: Przejrzyj i dostosuj filtry swojej Definition.
Kolejne kroki
- Jak rozumieć wyniki: interpretacja danych ze skanowania
- Przewodnik po Definition Builder: modyfikacja Twojej Definition
