Salesforce におけるデータ品質とは、組織(org)内のレコードが、それを用いて行う業務 — レポーティング、自動化、予測、そして近年ますます重要性を増す AI — をどれだけ的確に支えられるかを示すものです。Salesforce 組織には数百万件の Account、Contact、Lead、Opportunity を保持できますが、量があるからといって価値があるとは限りません。データが不完全であったり、古かったり、一貫性を欠いていたり、重複していたりすれば、その上に構築されたあらゆるプロセスが、その欠陥をそのまま引き継いでしまいます。
本ガイドでは、Salesforce 内におけるデータ品質が具体的に何を意味するのか、なぜ CRM データが劣化するのか、データが利用に耐えるかどうかを決める 6 つのディメンション、そして 1 件のレコードも組織の外へ書き出すことなく品質を測定・改善する方法について解説します。
なぜ Salesforce データは劣化するのか
Salesforce のデータは、放っておいてもきれいなまま保たれるわけではありません。データは継続的に劣化していきます。しかもその原因は偶発的なものではなく、構造的なものです。
- 手入力。 担当者は微妙に異なる名称で取引先を登録し、必須でない項目を飛ばし、メモを誤った場所に貼り付けます。キー入力のひとつひとつが、データのずれを生む可能性をはらんでいます。
- 連携(インテグレーション)。 マーケティングオートメーション、ERP、請求、データエンリッチメントの各ツールは、それぞれ独自のスケジュールと前提で Salesforce に書き込みを行います。同じ項目に書き込む 2 つのシステムが、いつまでも一致し続けることはまずありません。
- 時間。 2 年前には正しかった電話番号も、今では誤りになっています。過ぎ去った完了予定日(Close Date)は、もはや誤解を招くだけです。誰かがレコードに触れるかどうかに関わらず、鮮度は失われていきます。その劣化は測定可能です。B2B コンタクトデータは月ごとに約 2.1% の割合で古くなります。つまり年間では約 22.5% です。これは、ZoomInfo がコンパイルした業界衰退研究によるものですが、これはインテグレーションドリフトや重複をカウントする前のものです。
- 重複。 同じ顧客が Web フォーム、リストインポート、営業担当者の 3 つの経路から入力される — 1 つの実体に対して 3 件のレコードが生まれます。能動的な監視がなければ、重複はどんどん増えていきます。
- AI エージェント。 Agentforce をはじめとするエージェントがレコードを読み書きするようになると、検出されない品質問題は、人手による入力では到底ありえなかった速さと規模で拡散していきます。
原因が構造的なものである以上、答えは一度きりのクリーンアップではありません。継続的な測定こそが必要なのです。
低いデータ品質が招くコスト
Salesforce の文脈において、データ品質の低さは抽象的な懸念事項ではありません。Gartner は質の低いデータの平均コストを組織あたり年間 1290 万ドルとしており、Salesforce の State of Sales 調査では、セラーが非販売タスク(その多くは手動 CRM 入力と、クリーンなレコードが提供するであろう情報探しです)に時間の 60% を費やしていることが分かりました。あなたの組織内では、そのコストはビジネスにとって重要な 3 つの場面に、はっきりと現れます。
レポーティングと予測。 ダッシュボードの信頼性は、それが集計する項目の信頼性を超えることはありません。金額の欠落、古いステージ、重複した Opportunity は、気づかぬうちにパイプラインや売上の数字をゆがめます。経営層はレポートを信頼しなくなり、意思決定は再び表計算ソフトへと戻っていきます。
自動化。 フロー、入力規則(Validation Rule)、割り当てロジック、承認プロセスは、いずれも読み込むデータが正しいことを前提にしています。地域(Region)項目が空欄であれば Lead は誤って振り分けられ、無効なメールアドレスはナーチャリングのシーケンスを静かに破綻させます。不良データは、自動化を増幅装置から負債へと変えてしまいます。
AI への準備(AI readiness)。 これは最も新しく、最も急速に拡大しているコストです。Agentforce やその他の AI システムを Salesforce データに向ける前に、どの項目が完全で、どれに個人を特定できる情報(PII)が含まれ、どれが回答の根拠とするのに十分新しいのかを把握しておく必要があります。検索インデックスや学習データセットに紛れ込んだ未検出の PII は、後段のどんなフィルタでも完全には取り除けないリスクを生み、不完全あるいは古いデータは、自信たっぷりに誤った AI 回答を生み出します。
Salesforce におけるデータ品質の 6 つのディメンション
データ品質は、あるかないかで決まる単一の数値ではありません。それぞれがレコードに関する異なる問いに答える、明確に区別されたディメンションをまたいで測定されるものです。これらを Salesforce に当てはめると、抽象的な概念が具体的になります。
| ディメンション | 答える問い | Salesforce では |
|---|---|---|
| 完全性(Completeness) | 入力されているべき項目は、実際に入力されているか? | ビジネス上必要な項目が空欄:Account Industry、Contact Email、Opportunity Amount |
| 妥当性(Validity) | 値は期待される形式や選択肢に従っているか? | @ を含まないメールアドレス、文字が混ざった電話番号、許可された範囲外の選択リスト(Picklist)値 |
| 一意性(Uniqueness) | 現実世界の各実体は 1 度だけ表現されているか? | フォーム、インポート、手入力にまたがって作成された重複した Account や Contact |
| 一貫性(Consistency) | 値はルールおよび相互に整合しているか? | 3 通りに表記された国名、Billing Country と矛盾する Billing State |
| 適時性(Timeliness) | データは最新で、日付は妥当か? | 数か月前の Last Activity、過去の Close Date、存在すべきでない未来日付のレコード |
| PII 検出(PII Detection) | 機微な個人データはどこに存在するのか? | Description や Comment などの自由記述項目に置かれた社会保障番号、クレジットカード番号、メールアドレス |
これら 6 つのディメンションは、2 つのグループに分かれます。最初の 5 つ — 完全性、妥当性、一意性、一貫性、適時性 — は運用上の衛生状態を表すものであり、日々の CRM 利用にデータが耐えるかどうかを示します。PII 検出は、AI への準備 に焦点を当てた 2 つ目のグループに属し、Agentforce やその他の AI 施策に対してデータが安全かつ準備できているかどうかを示します。
Salesforce でデータ品質を測定する方法
測定できないものは改善できませんし、手作業でしか確認しないものは測定できません。Salesforce でデータ品質を測定するとは、これら 6 つのディメンションを、繰り返し実行できる定量的なスキャンへと変えることを意味します。
その中心的な成果物が データ品質スコア(Data Quality Score)(データ信頼性スコアと呼ばれることもあります)です。これは、あなたが重視するディメンションを 1 つにまとめ、時系列で追跡できる単一の加重数値です。スコア 100 は、対象範囲のすべてのレコードがすべてのチェックを通過したことを意味し、それより低いスコアは、残っている作業量とその偏りの両方を示します。
Salesforce における有効な測定アプローチには、3 つの特性があります。
- レコード単位だけでなく、項目単位であること。 「Account の 18% に問題がある」と分かるのは出発点にすぎません。「その問題が、ある特定の連携によって作成された Account の Industry 項目が空欄であること」だと分かって初めて、行動に移せます。
- 優先度に応じて加重されていること。 欠落した Opportunity Amount は、欠落した副電話番号よりも重大です。加重によって、スコアは単なる件数ではなくビジネスインパクトを反映できます。
- スケジュールに沿って繰り返せること。 品質は動く標的です。一度きりの監査は、実施した翌日にはもう古くなっています。スケジュール化されたスキャンは、スナップショットをトレンドの線へと変えてくれます。
これこそが Data Quality Sense(DQS)が取るアプローチです。各オブジェクトと項目について「良い」とは何かを定義し、スキャンを実行すると、ディメンション別・項目別に分解された加重データ品質スコアが得られます。さらにそれを繰り返し実行するようスケジュール化すれば、トレンドを見守ることができます。
なぜネイティブであることが重要なのか
Salesforce データ品質の測定における最も重要なアーキテクチャ上の判断は、測定がどこで行われるかです。多くのツールは、レコードを外部サービスへ書き出し、プラットフォーム外でプロファイリングし、結果を送り返すことを求めます。これは 3 つの問題を生みます。あなたのデータのコピー(PII を含む)が Salesforce の外に存在することになり、結果は現実から遅れ、そして壊れる可能性のある連携に依存することになります。
100% Salesforce ネイティブ なアプローチは、これらすべてを回避します。スキャンは、プラットフォーム自身のバッチ処理を用いて組織内で実行されます。レコードは Salesforce を一切離れず、結果はライブデータを反映し、保守すべき外部パイプラインも存在しません。PII を含むデータ — まさに AI プロジェクトの前に最もプロファイリングしておく必要があるデータ — については、すべてをプラットフォーム上に留めることは利便性の問題ではなく、コンプライアンス上の要件です。
DQS がすべてを Salesforce 内で実行するのは、まさにこの理由からです。検出は決定論的かつ透明であり、適用されるすべてのルールを確認できるうえ、データが書き出されることは一切ありません。
はじめに
Salesforce におけるデータ品質の改善は、シンプルなループに沿って進みます。それは手作業で行う場合でも、ツールを使う場合でも同じループです。
- 最も重要なオブジェクトと項目について、品質が何を意味するかを 定義する。
- スキャンする ことで、基準となるデータ品質スコアと項目単位の内訳を得る。
- ビジネスインパクトが最も大きく、修正の労力が最も小さい問題を 優先順位付けする。
- クリーンアップ、入力規則、よりよい取り込みプロセスを通じて 修正する。
- 新たな問題が広がる前に表面化するよう、スケジュール化されたスキャンで 監視する。
DQS では、これを Definition Builder で組み立てます。これはガイド付きのウィザードで、機能(6 つのディメンション)を選択し、対象となるオブジェクトと項目を選び、しきい値を設定し、内容を確認します。そこからオンデマンドまたはスケジュールでスキャンを実行し、トレンド、項目の健全性、ディメンション別の内訳とともに、Insight Studio で結果を探索します。すべては Salesforce 組織内で行われます。
次のステップ
- Salesforce でデータ品質を測定する方法:データ品質スコアを掘り下げて解説
- Salesforce でデータ品質を改善する方法:検出・修正・予防のループ
- Salesforce データ品質ダッシュボード:追跡する価値のある指標
- データ品質の 5 つのディメンション:ディメンションを支えるフレームワーク
- PII 検出:AI プロジェクトの前に機微なデータを見つける
- Agentforce の準備:Salesforce データを AI 向けに整える
- Agentforce データ準備チェックリスト:デプロイ前にデータが AI 対応であることを確認する
- Agentforce データ品質 FAQ:デプロイ前にチームが抱く疑問への手早い回答
- データ品質とは何か?:基礎から積み上げる根本理解
