Salesforce में data quality यह बताती है कि आपके org के records उस काम के लिए कितने उपयोगी हैं जिसके लिए आप उन्हें इस्तेमाल करते हैं: reporting, automation, forecasting, और अब तेज़ी से बढ़ते हुए, AI। एक Salesforce org में लाखों Accounts, Contacts, Leads और Opportunities हो सकते हैं, लेकिन सिर्फ़ मात्रा का मतलब value नहीं है। अगर डेटा अधूरा, पुराना, असंगत या डुप्लिकेट है, तो उसके ऊपर बनी हर process उन्हीं खामियों को अपने अंदर ले लेती है।
यह गाइड समझाती है कि Salesforce के अंदर data quality का खास तौर पर क्या मतलब है, CRM डेटा क्यों खराब होता है, वे छह dimensions कौन-सी हैं जो तय करती हैं कि आपका डेटा इस्तेमाल के लायक है या नहीं, और अपने org से एक भी record export किए बिना quality को कैसे मापें और बेहतर बनाएं।
Salesforce डेटा क्यों खराब होता जाता है
Salesforce डेटा अपने आप साफ़ नहीं रहता। यह लगातार बिगड़ता रहता है, और इसकी वजहें संयोगवश नहीं बल्कि संरचनात्मक हैं:
- Manual entry. Reps थोड़े अलग नामों से accounts बनाते हैं, गैर-ज़रूरी fields छोड़ देते हैं, और notes को गलत जगह paste कर देते हैं। हर keystroke के साथ गलती होने की गुंजाइश रहती है।
- Integrations. Marketing automation, ERP, billing और data-enrichment tools — सब अपने-अपने schedule और अपनी-अपनी मान्यताओं के साथ Salesforce में लिखते हैं। एक ही field में लिखने वाले दो systems हमेशा के लिए शायद ही कभी सहमत रहते हैं।
- समय। जो phone number दो साल पहले सही था, अब गलत है। जो close date बीत चुकी है, अब भ्रामक है। कोई record को छुए या न छुए, freshness घटती रहती है।
- Duplication. एक ही customer एक web form, एक list import और एक sales rep के ज़रिए आता है — तीन records, एक ही entity। बिना सक्रिय monitoring के, duplicates बढ़ते ही जाते हैं।
- AI agents. जैसे-जैसे Agentforce और दूसरे agents records पढ़ते और लिखते हैं, अनदेखे quality issues मानवीय entry की तुलना में कहीं तेज़ी और कहीं बड़े पैमाने पर फैलते हैं।
चूँकि वजहें संरचनात्मक हैं, इसलिए इसका जवाब एक बार की सफ़ाई नहीं है। इसका जवाब है लगातार मापना। Decay measurable है: B2B contact data लगभग 2.1% per month stale हो जाता है — लगभग 22.5% per year — ZoomInfo द्वारा compiled data decay research के अनुसार, और यह integration drift और duplicates को count करने से पहले है।
खराब Data Quality की क्या कीमत चुकानी पड़ती है
Salesforce के संदर्भ में, कम data quality कोई काल्पनिक चिंता नहीं है। Gartner average cost को $12.9 million per organization per year पर रखता है, और Salesforce की अपनी State of Sales research यह पाती है कि sellers non-selling tasks पर 60% समय लगाते हैं — इसमें बहुत कुछ manual CRM data entry और उस जानकारी को खोजना है जो clean records surface किया होता। आपके org के अंदर, यह cost तीन ऐसी जगहों पर दिख आती है जो business के लिए मायने रखती हैं:
Reporting और forecasting. Dashboards उतने ही भरोसेमंद होते हैं जितने वे fields जिन्हें वे जोड़ते हैं। गायब amounts, पुरानी stages और duplicate opportunities चुपचाप pipeline और revenue के आँकड़ों को बिगाड़ देते हैं। Leaders reports पर भरोसा करना बंद कर देते हैं, और फ़ैसले फिर से spreadsheets पर लौट आते हैं।
Automation. Flows, validation rules, assignment logic और approval processes — सब यह मानकर चलते हैं कि जो डेटा वे पढ़ते हैं वह सही है। एक खाली region field एक lead को गलत रास्ते पर भेज देता है; एक अमान्य email चुपचाप किसी nurture sequence को तोड़ देता है। खराब डेटा automation को एक multiplier से एक देनदारी में बदल देता है।
AI readiness. यह सबसे नई और सबसे तेज़ी से बढ़ने वाली कीमत है। Agentforce या किसी भी AI system को अपने Salesforce डेटा पर लगाने से पहले, आपको यह जानना ज़रूरी है कि कौन-से fields पूरे हैं, किनमें personally identifiable information (PII) है, और कौन-से इतने ताज़ा हैं कि किसी जवाब को आधार दे सकें। किसी retrieval index या training set में अनदेखी PII ऐसा जोखिम पैदा करती है जिसे कोई downstream filter पूरी तरह दूर नहीं कर सकता, और अधूरा या पुराना डेटा ऐसे AI जवाब पैदा करता है जो आत्मविश्वास से भरे होकर भी गलत होते हैं।
Salesforce में Data Quality की छह Dimensions
Data quality कोई एकमात्र संख्या नहीं है जो या तो आपके पास है या नहीं। इसे अलग-अलग dimensions में मापा जाता है, और हर एक आपके records के बारे में एक अलग सवाल का जवाब देती है। इन्हें Salesforce से जोड़ने पर अमूर्त बात ठोस बन जाती है:
| Dimension | जिस सवाल का यह जवाब देती है | Salesforce में |
|---|---|---|
| Completeness | जो fields भरे होने चाहिए, क्या वे वाकई भरे हुए हैं? | business के लिहाज़ से ज़रूरी fields जो खाली छूट गए: Account Industry, Contact Email, Opportunity Amount |
| Validity | क्या value अपेक्षित format या set के अनुरूप है? | बिना @ वाली emails, अक्षरों वाले phone numbers, अनुमत set से बाहर के picklist values |
| Uniqueness | क्या हर वास्तविक entity एक ही बार दर्शाई गई है? | forms, imports और manual entry के बीच बने duplicate Accounts और Contacts |
| Consistency | क्या values नियमों से और आपस में मेल खाती हैं? | Country तीन तरह से लिखा हुआ, Billing State जो Billing Country से उलट हो |
| Timeliness | क्या डेटा मौजूदा है और क्या dates विश्वसनीय हैं? | महीनों पुरानी Last Activity, बीत चुकी Close Dates, भविष्य की dates वाले records जो होने ही नहीं चाहिए |
| PII Detection | संवेदनशील व्यक्तिगत डेटा कहाँ रहता है? | free-text Description और Comment fields में पड़े SSNs, credit-card numbers और emails |
ये छह dimensions दो समूहों में बँटती हैं। पहली पाँच — completeness, validity, uniqueness, consistency और timeliness — operational hygiene का वर्णन करती हैं: यानी आपका डेटा रोज़मर्रा के CRM इस्तेमाल के लिए काम करता है या नहीं। PII detection एक दूसरे समूह का हिस्सा है जो AI readiness पर केंद्रित है: यानी आपका डेटा Agentforce और दूसरी AI पहलों के लिए सुरक्षित और तैयार है या नहीं।
Salesforce में Data Quality कैसे मापें
जिसे आप मापते नहीं, उसे आप बेहतर नहीं बना सकते, और जिसे आप सिर्फ़ हाथ से जाँचते हैं, उसे आप माप नहीं सकते। Salesforce में data quality मापने का मतलब है इन छह dimensions को दोहराए जा सकने वाले, गिनती में आने वाले scans में बदलना।
मुख्य नतीजा होता है एक Data Quality Score (जिसे कभी-कभी data reliability score भी कहते हैं): एक अकेला weighted आँकड़ा जो आपकी मनचाही dimensions को एक ऐसी संख्या में समेट देता है जिसे आप समय के साथ track कर सकते हैं। 100 का score इसका मतलब है कि scope के हर record ने हर check पास किया; इससे कम score आपको बताता है कि कितना काम बाकी है और वह कहाँ केंद्रित है।
Salesforce में एक उपयोगी measurement approach में तीन गुण होते हैं:
- Field-level, सिर्फ़ record-level नहीं। यह जानना कि 18% Accounts में कोई समस्या है, एक शुरुआत है। यह जानना कि समस्या किसी एक integration से बने Accounts पर एक खाली Industry field है — यह actionable है।
- आपकी प्राथमिकताओं के हिसाब से weighted। एक गायब Opportunity Amount किसी गायब secondary phone number से ज़्यादा मायने रखता है। Weighting score को सिर्फ़ गिनती नहीं, बल्कि business impact दर्शाने देता है।
- schedule पर दोहराने योग्य। Quality एक हिलता-डुलता लक्ष्य है। एक बार का audit चलाने के अगले ही दिन पुराना पड़ जाता है। Scheduled scans एक snapshot को एक trend line में बदल देते हैं।
यही approach Data Quality Sense (DQS) अपनाता है। आप हर object और field के लिए तय करते हैं कि “अच्छा” क्या है, scan चलाते हैं, और dimension और field के हिसाब से टूटा हुआ एक weighted Data Quality Score पाते हैं — फिर इसे दोहराने के लिए schedule कर देते हैं ताकि आप trend देख सकें।
Native होना क्यों मायने रखता है
Salesforce data quality मापने में सबसे अहम architectural फ़ैसला यह है कि measurement कहाँ होती है। कई tools यह माँग करते हैं कि आप records को किसी external service में export करें, उन्हें off-platform profile करें, और नतीजे वापस भेजें। इससे तीन समस्याएँ पैदा होती हैं: आपके डेटा की एक copy (जिसमें कोई भी PII शामिल हो) अब Salesforce के बाहर रहती है, नतीजे हकीकत से पीछे रह जाते हैं, और आप एक ऐसी integration पर निर्भर हो जाते हैं जो टूट सकती है।
एक 100% Salesforce-native approach इन सबसे बचा लेता है। Scan आपके org के अंदर platform की अपनी batch processing का इस्तेमाल करके चलता है। कोई record Salesforce से बाहर नहीं जाता, नतीजे live डेटा दर्शाते हैं, और बनाए रखने के लिए कोई external pipeline नहीं होती। ऐसे डेटा के लिए जिसमें PII है — ठीक वही डेटा जिसे किसी AI project से पहले आपको सबसे ज़्यादा profile करना होता है — इसे platform पर ही रखना कोई सुविधा नहीं, बल्कि एक compliance requirement है।
DQS इसी वजह से पूरी तरह Salesforce के अंदर चलता है। Detection deterministic और पारदर्शी है: आप लागू किया गया हर नियम देखते हैं, और कोई डेटा कभी export नहीं किया जाता।
शुरुआत कैसे करें
Salesforce में data quality बेहतर बनाना एक सरल loop का पालन करता है, और यह वही loop है चाहे आप इसे हाथ से करें या किसी tool के साथ:
- अपने सबसे ज़रूरी objects और fields के लिए Define करें कि quality का क्या मतलब है।
- एक baseline Data Quality Score और field-level breakdown पाने के लिए Scan करें।
- सबसे ज़्यादा business impact और सबसे कम fix करने के effort वाले issues को Prioritize करें।
- cleanup, validation rules और बेहतर intake processes के ज़रिए Fix करें।
- scheduled scans के साथ Monitor करें ताकि नए issues फैलने से पहले सामने आ जाएँ।
DQS में, आप इसे Definition Builder से बनाते हैं — एक guided wizard जहाँ आप capabilities (छह dimensions) चुनते हैं, scope में आने वाले objects और fields तय करते हैं, thresholds configure करते हैं, और समीक्षा करते हैं। वहाँ से आप scan को on demand चलाते हैं या schedule करते हैं, और Insight Studio में trends, field health और dimension breakdowns के साथ नतीजे देखते हैं। सब कुछ आपके Salesforce org के अंदर होता है।
अगले कदम
- Salesforce में Data Quality कैसे मापें: Data Quality Score विस्तार से
- Salesforce में Data Quality कैसे बेहतर बनाएं: detect-fix-prevent loop
- Salesforce Data Quality Dashboard: track करने लायक metrics
- Data Quality की पाँच Dimensions: dimensions के पीछे का framework
- PII Detection: किसी AI project से पहले संवेदनशील डेटा ढूँढना
- Agentforce Preparation: Salesforce डेटा को AI के लिए तैयार करना
- Agentforce Data Readiness Checklist: deployment से पहले पक्का करें कि आपका डेटा AI-ready है
- Agentforce Data Quality FAQ: deploy करने से पहले teams जो सवाल पूछती हैं, उनके त्वरित जवाब
- Data Quality क्या है?: बुनियादी बातें, बिल्कुल शुरुआत से
