入札金額の先頭桁が均等なら疑え——ベンフォードの法則によるデータ異常検知

統計学の5%ルールとベンフォードの法則を用いて、外れすぎ・当たりすぎ・均等すぎをデータ異常のサインとして示した図 GISでよく使う数学
自然なデータには自然なばらつきがある。外れすぎ、当たりすぎ、均等すぎは、データ異常を疑うサインになる。

入札書類の金額に不正がないか。台帳データにダミーが混入していないか。こうしたチェックに、統計学の古典的な手法が使える。高度な分析ソフトは不要だ。ExcelかPostGISがあれば5分で判定できる。

本稿では、統計的異常検知の基本的な考え方と、データの先頭桁に着目した不正検出手法「ベンフォードの法則」を、GIS実務への応用を含めて整理する。

「当たりすぎ」も異常になる

統計学には「当たりすぎも異常」という考え方がある。結果が悪すぎるときだけでなく、良すぎるときにも疑いの目を向ける。

本来50%程度の的中率しか期待できない予測が、98%で当たり続けたらどうか。能力が高い可能性もあるが、統計学者はまず「答えを事前に参照していないか」「評価データに漏洩がないか」を疑う。

コインを100回投げて表が50回なら自然だ。30回なら偏りがある。100回すべて表なら、そのコイン自体を疑う。統計学が見ているのは「結果の良し悪し」ではなく、自然なばらつきの範囲内にいるかどうかだ。

有意水準5%の正体

統計検定でよく使われる有意水準5%は、自然法則から必然的に導かれた数字ではない。1920年代に統計学者フィッシャーが、実務上の目安として広めたものだ。当時はコンピュータがなく、統計表を手引きしていたため、10%・5%・1%のような切りのいい値が便利だったという事情もある。

p値が0.049なら「有意」、0.051なら「有意でない」。しかしこの2つに科学的な大差はない。健康診断の基準値と同じで、血圧が140/90を1だけ超えたら突然「病気」になるわけではない。5%は「このあたりから偶然では説明しにくくなる」という実務上のガイドラインだ。

ベンフォードの法則——先頭桁は均等にならない

自然に発生する数値データを大量に集め、先頭の数字(第一桁)だけを見ると、面白い規則性が現れる。1で始まる数字が圧倒的に多い。

先頭桁出現確率
1約30.1%
2約17.6%
3約12.5%
4約9.7%
5約7.9%
6約6.7%
7約5.8%
8約5.1%
9約4.6%

これがベンフォードの法則(第一桁の法則)だ。河川の長さ、市区町村の人口、企業の売上高、土地面積、路線価——値の範囲が広く自然に発生したデータであれば、この分布が驚くほど正確に現れる。

なぜ先頭が「1」に偏るのか

直感的に説明する。

人口100人の村が200人になるには2倍の成長が必要だ。しかし100人から199人まで、先頭桁はずっと「1」のままである。一方、先頭が「9」であるためには900~999という狭い範囲にとどまる必要があり、1000に達した瞬間に先頭は「1」に戻る。

数値が成長・変動する過程で、「1」のゾーンに滞在する時間が最も長い。これが偏りの本質だ。

不正検出への応用

人間が架空の数字を作るとき、「1~9を均等に使ったほうが自然だろう」と無意識に考えやすい。しかし本物のデータには先頭桁の偏りがある。提出された入札書類や経費精算書の先頭桁分布が均等すぎれば、逆に不自然だということになる。

米国では会計監査やFBIの不正調査にベンフォードの法則が実際に使われている。選挙結果の検証に適用された事例もある。日本でも、会計監査の実務書でベンフォード分析に言及されるようになってきた。

入札の文脈で考えると、複数業者が提出した見積金額の先頭桁を集計し、ベンフォード分布と大きく乖離している業者があれば、談合や価格操作を疑う端緒になる。もちろん、法則から外れたことだけで不正が証明されるわけではない。あくまでスクリーニングの第一段階だ。

ただし適用できるデータには条件がある。

適用可能適用不可
河川の長さ宝くじの番号
市区町村の人口電話番号
企業の売上高郵便番号
土地面積・地価身長・体重(範囲が狭い)
入札金額・経費精算書人工的に割り振ったID

値の範囲が広く、自然に発生したデータであること。人間が均等に割り振った番号や、値の幅が狭いデータには適用できない。

GISデータの品質チェックへの転用

GISで日常的に扱う筆ポリゴンの面積、路線価、建物の延床面積は、いずれもベンフォードの法則がきれいに当てはまるデータだ。

台帳データの品質チェックに使える。ある列の先頭桁分布がベンフォードから大きく外れていれば、入力ミスや変換エラー、ダミーデータの混入を疑う手がかりになる。自然な土地面積データなら、先頭が「1」のレコードが3割近くあるはずだ。均等分布していたら、まずデータの中身を確認すべきだ。

Excelなら=LEFT(A1,1)で先頭桁を取り出し、ピボットテーブルで集計するだけで5分で確認できる。PostGISなら以下のSQLで一発だ。

SELECT
  LEFT(CAST(area_m2 AS TEXT), 1) AS leading_digit,
  COUNT(*) AS cnt,
  ROUND(COUNT(*)::numeric / SUM(COUNT(*)) OVER() * 100, 1) AS pct
FROM parcels
WHERE area_m2 > 0
GROUP BY leading_digit
ORDER BY leading_digit;

このクエリの結果で「1」が30%前後、「9」が5%前後に分布していれば、そのデータは自然な状態にある。大きく外れていれば調査対象だ。

筆者の経験では、自治体から受領した土地台帳で先頭桁がほぼ均等分布していたケースがあった。確認したところ、テスト用のダミーレコードが本番データに混入していた。面積のような広範囲にばらつく数値が均等になること自体が、データの異常を示すシグナルだ。

同様の手法は建物延床面積、固定資産評価額、公示地価など、GISの属性テーブルに格納される多くの数値カラムに適用できる。新規データの受入検査として、先頭桁分布のチェックをルーティンに組み込んでおくと、目視では気づきにくい異常の早期発見につながる。

共通する原則

有意水準5%もベンフォードの法則も、理論としては別物だ。しかし根底にある考え方は共通している。

自然な現象には、自然なばらつき方がある。外れすぎても、当たりすぎても、均等すぎても、それは「不自然」のサインだ。

データの品質管理において重要なのは、異常値を1件ずつ目視で探すことではない。データ全体の「分布の形」を把握し、自然なパターンからの逸脱を統計的に検出することだ。ベンフォードの法則は、その最もシンプルで強力な手法の一つである。


まとめ

  • 統計学では「悪すぎる」だけでなく「良すぎる」も異常として扱う
  • 有意水準5%は絶対的基準ではなく、歴史的に定着した実務上の慣例
  • 自然発生データの先頭桁は均等にならない。「1」が約30%で最多
  • 人間が作った架空データは先頭桁が均等になりやすく、不正検出に使える
  • GISの台帳データ品質チェックにも応用可能。Excel・PostGISで即実行できる

コメント

タイトルとURLをコピーしました