Skip to main content

Uruchamianie skanowań

Dowiedz się, jak wykonywać skanowania DQS, monitorować ich postęp, obsługiwać duże zbiory danych i planować cykliczne skanowania.

Zaktualizowano

Uruchamianie skanowań

Jak działają skanowania

Gdy uruchamiasz skanowanie, DQS przetwarza Twoje rekordy Salesforce względem skonfigurowanych funkcji. Skanowanie działa w tle za pomocą Salesforce Batch Apex, więc możesz dalej pracować podczas przetwarzania.

DQS automatycznie respektuje limity governor Salesforce. Twój org pozostaje responsywny podczas skanowań.

Uruchamianie ręcznego skanowania

Rozpoczynanie skanowania

  1. Otwórz DQS z App Launcher
  2. Znajdź swoją Definition na liście
  3. Kliknij Run Scan (lub ikonę odtwarzania)
  4. Potwierdź, aby rozpocząć

Skanowanie natychmiast rozpoczyna przetwarzanie.

Wskaźniki statusu skanowania

Status Ikona Znaczenie
Queued Zegar Oczekuje na rozpoczęcie
Processing Spinner Aktualnie w toku
Completed Znacznik wyboru Zakończone pomyślnie
Failed X Wystąpił błąd

Podgląd aktywnych skanowań

Ekran główny DQS pokazuje wszystkie trwające skanowania:

  • Nazwę Definition
  • Procent postępu
  • Przetworzone rekordy / łącznie
  • Czas, który upłynął
  • Szacowany pozostały czas

Zrozumieć postęp

Śledzenie postępu

DQS przetwarza rekordy wsadowo (w batchach). Pasek postępu pokazuje:

  • Ukończone batche spośród łącznej liczby batchy
  • Przetworzone rekordy spośród łącznej liczby rekordów
  • Aktualnie ocenianą funkcję

Przykład: „Processing batch 5 of 12 (2,500 of 6,000 records) - Completeness“

Kolejność przetwarzania

DQS ocenia funkcje w następującej kolejności:

  1. Kompletność (szybkie kontrole pól)
  2. Poprawność (dopasowanie wzorca formatu)
  3. Terminowość (porównania dat)
  4. Spójność (zgodność wartości)
  5. Unikalność (wykrywanie duplikatów)
  6. Funkcje AI Readiness

Funkcje o niższym koszcie uruchamiane są jako pierwsze, aby zapewnić szybką informację zwrotną.

Szacowany czas

Czas trwania skanowania zależy od:

Czynnik Wpływ
Liczba rekordów Więcej rekordów = dłuższy czas
Liczba pól Więcej pól = dłuższy czas
Koszt funkcji Funkcje o koszcie HIGH trwają dłużej
Obciążenie org Zajęte org przetwarzają wolniej

Typowe tempo przetwarzania:

Liczba rekordów Szacowany czas
1 000 Poniżej 1 minuty
10 000 2–5 minut
100 000 15–30 minut
1 000 000+ 1–2 godziny

To wartości szacunkowe. Rzeczywisty czas zależy od wyboru funkcji i aktywności org.

Koszty przetwarzania

Każda funkcja ma koszt przetwarzania, który wpływa na czas trwania skanowania.

Poziomy kosztu

Koszt Funkcje Uwagi dotyczące przetwarzania
LOW Kompletność, Poprawność Proste kontrole pól per rekord
MEDIUM Terminowość, Spójność, Wykrywanie PII Analiza wzorców i działania na datach
HIGH Unikalność Porównania między rekordami

Obliczanie kosztu

Podsumowanie Definition pokazuje szacowany koszt łączny:

  • Low — wszystkie wybrane funkcje mają koszt LOW
  • Medium — co najmniej jedna funkcja o koszcie MEDIUM
  • High — co najmniej jedna funkcja o koszcie HIGH

Wskazówka: Przy pierwszym skanowaniu dużego zbioru danych zacznij wyłącznie od funkcji o koszcie LOW. Funkcje o koszcie HIGH dodaj, gdy poznasz już punkt wyjścia.

Szczegóły przetwarzania wsadowego

Jak działa Batch Apex

DQS używa Salesforce Batch Apex do przetwarzania rekordów. Oto, co to oznacza:

  1. Rekordy dzielone są na batche (domyślnie: 200 rekordów na batch)
  2. Każdy batch przetwarzany jest niezależnie
  3. Jeśli jeden batch zawiedzie, pozostałe są kontynuowane
  4. Limity governor resetują się między batchami

Takie podejście pozwala DQS:

  • Przetwarzać miliony rekordów
  • Respektować limity Salesforce
  • Działać bez blokowania użytkowników
  • Wznawiać pracę po przerwaniu

Limity governor Salesforce

Batch Apex ma następujące kluczowe limity:

Limit Wartość Uwagi
Maks. zakolejkowanych batch jobs 5 DQS używa 1 joba na skanowanie
Rekordy poprzez QueryLocator 50 milionów Z naddatkiem dla większości org
Dzienne wykonania batchy 250 000 Łącznie dla wszystkich batch jobs w org

DQS zaprojektowano tak, aby pozostawać znacznie poniżej tych limitów.

Optymalizacja rozmiaru batcha

DQS dostosowuje rozmiar batcha do złożoności funkcji:

Typ funkcji Rozmiar batcha
Tylko koszt LOW 200 rekordów
Uwzględniony koszt MEDIUM 200 rekordów
Uwzględniony koszt HIGH 100 rekordów

Mniejsze batche dla złożonych funkcji zapobiegają błędom timeoutu.

Obsługa dużych zbiorów danych

Zbiory danych powyżej 100 000 rekordów

Przy dużych zbiorach danych stosuj się do następujących praktyk:

  1. Używaj filtrów, aby ograniczyć zakres
  2. Zacznij od funkcji o koszcie LOW
  3. Uruchamiaj poza godzinami szczytu, gdy to możliwe
  4. Monitoruj postęp pod kątem ewentualnych problemów

Zbiory danych powyżej 1 miliona rekordów

Przy bardzo dużych zbiorach danych:

  1. Segmentuj dane za pomocą wielu Definitions z filtrami
  2. Planuj skanowania w oknach serwisowych
  3. Uruchamiaj funkcje osobno, jeśli to konieczne
  4. Wykorzystaj segmentację do równoległego przetwarzania danych

Przykładowa segmentacja:

  • Definition A: Contacts, gdzie Region = ‘Americas’
  • Definition B: Contacts, gdzie Region = ‘EMEA’
  • Definition C: Contacts, gdzie Region = ‘APAC’

Wskazówki dotyczące wydajności

Wskazówka Korzyść
Mniej pól na Definition Szybsze przetwarzanie
Stosuj filtry rekordów Mniejszy zbiór danych do skanowania
Uruchamiaj funkcje o koszcie HIGH osobno Lepsza widoczność postępu
Planuj poza godzinami szczytu Mniejsza konkurencja o zasoby

Zakończenie skanowania

Powiadomienia o zakończeniu

Po zakończeniu skanowania otrzymujesz:

  1. Powiadomienie w aplikacji — ikona dzwonka pokazuje nowe wyniki
  2. Powiadomienie e-mail — podsumowanie wysłane na Twój adres
  3. Aktualizację ekranu głównego — status zmienia się na Completed

Przeglądanie wyników

Kliknij zakończone skanowanie, aby zobaczyć:

  • Ogólny wynik jakości
  • Wyniki na poziomie wymiarów
  • Szczegóły metryk
  • Wejście w rekordy, których to dotyczy

Wskazówki dotyczące interpretacji znajdziesz w artykule Jak rozumieć wyniki.

Historia skanowań

DQS przechowuje historię wszystkich skanowań dla każdej Definition:

  • Datę i godzinę
  • Czas trwania
  • Liczbę rekordów
  • Ogólny wynik
  • Porównanie z poprzednim skanowaniem

Wykorzystuj historię, aby śledzić poprawę w czasie.

Planowanie skanowań

Możesz planować cykliczne skanowania, aby zautomatyzować monitoring jakości danych.

Konfigurowanie harmonogramu

  1. Otwórz swoją Definition
  2. Kliknij Schedule (ikona zegara)
  3. Wybierz częstotliwość:
    • Codziennie
    • Co tydzień (wybierz dzień)
    • Co miesiąc (wybierz datę)
  4. Ustaw godzinę rozpoczęcia
  5. Kliknij Save Schedule

Dobre praktyki dotyczące harmonogramu

Częstotliwość Przypadek użycia
Codziennie Duży wolumen wprowadzanych danych, monitoring krytycznej jakości
Co tydzień Standardowe śledzenie jakości, analiza trendów
Co miesiąc Raportowanie zarządcze, audyty zgodności

Wskazówka: Planuj skanowania poza godzinami szczytu (wczesnym rankiem lub w weekendy), aby zminimalizować wpływ na użytkowników.

Zarządzanie harmonogramami

Ze strony szczegółów Definition:

  • Edit — zmień częstotliwość lub godzinę
  • Pause — tymczasowo zatrzymaj bez usuwania
  • Resume — wznów wstrzymany harmonogram
  • Delete — całkowicie usuń harmonogram

Limity harmonogramów

Zaplanowane skanowania są dostępne dla wszystkich użytkowników, bez ograniczenia liczby harmonogramów, które możesz skonfigurować.

Anulowanie skanowania

Jak anulować

  1. Znajdź trwające skanowanie na ekranie głównym
  2. Kliknij ikonę zatrzymania (lub Cancel)
  3. Potwierdź anulowanie

Co się dzieje po anulowaniu

  • Przetwarzanie zatrzymuje się po bieżącym batchu
  • Częściowe wyniki zostają zapisane
  • Status zmienia się na „Canceled“
  • Możesz przejrzeć zebrane częściowe dane

Anulowane skanowania nie są wliczane do limitów.

Rozwiązywanie problemów

„Scan queued but not starting“

Przyczyna: W Twoim org działają inne batch jobs.

Rozwiązanie: Poczekaj na zakończenie pozostałych jobów. Salesforce dopuszcza maksymalnie 5 równoczesnych batch jobs.

Sprawdź: Setup > Apex Jobs, aby zobaczyć, co jest w toku.

„Scan failed“

Przyczyna: Zwykle problem z danymi lub uprawnieniami.

Rozwiązanie:

  1. Sprawdź komunikat o błędzie w szczegółach skanowania
  2. Zweryfikuj, czy masz dostęp do obiektu i pól
  3. Przejrzyj warunki filtra pod kątem błędów
  4. Spróbuj uruchomić skanowanie na mniejszej liczbie rekordów

„Scan taking too long“

Przyczyna: Duży zbiór danych lub funkcje o koszcie HIGH.

Rozwiązanie:

  1. Poczekaj na zakończenie (ostatecznie się skończy)
  2. Dodaj filtry, aby zmniejszyć liczbę rekordów
  3. Usuń funkcje o koszcie HIGH
  4. Zaplanuj skanowanie poza godzinami szczytu

„Results don’t show all records“

Przyczyna: Warunki filtra wykluczyły część rekordów.

Rozwiązanie: Przejrzyj i dostosuj filtry swojej Definition.

Kolejne kroki