入札書類の金額に不正がないか。台帳データにダミーが混入していないか。こうしたチェックに、統計学の古典的な手法が使える。高度な分析ソフトは不要だ。ExcelかPostGISがあれば5分で判定できる。
本稿では、統計的異常検知の基本的な考え方と、データの先頭桁に着目した不正検出手法「ベンフォードの法則」を、GIS実務への応用を含めて整理する。
「当たりすぎ」も異常になる
統計学には「当たりすぎも異常」という考え方がある。結果が悪すぎるときだけでなく、良すぎるときにも疑いの目を向ける。
本来50%程度の的中率しか期待できない予測が、98%で当たり続けたらどうか。能力が高い可能性もあるが、統計学者はまず「答えを事前に参照していないか」「評価データに漏洩がないか」を疑う。
コインを100回投げて表が50回なら自然だ。30回なら偏りがある。100回すべて表なら、そのコイン自体を疑う。統計学が見ているのは「結果の良し悪し」ではなく、自然なばらつきの範囲内にいるかどうかだ。
有意水準5%の正体
統計検定でよく使われる有意水準5%は、自然法則から必然的に導かれた数字ではない。1920年代に統計学者フィッシャーが、実務上の目安として広めたものだ。当時はコンピュータがなく、統計表を手引きしていたため、10%・5%・1%のような切りのいい値が便利だったという事情もある。
p値が0.049なら「有意」、0.051なら「有意でない」。しかしこの2つに科学的な大差はない。健康診断の基準値と同じで、血圧が140/90を1だけ超えたら突然「病気」になるわけではない。5%は「このあたりから偶然では説明しにくくなる」という実務上のガイドラインだ。
ベンフォードの法則——先頭桁は均等にならない
自然に発生する数値データを大量に集め、先頭の数字(第一桁)だけを見ると、面白い規則性が現れる。1で始まる数字が圧倒的に多い。
| 先頭桁 | 出現確率 |
|---|---|
| 1 | 約30.1% |
| 2 | 約17.6% |
| 3 | 約12.5% |
| 4 | 約9.7% |
| 5 | 約7.9% |
| 6 | 約6.7% |
| 7 | 約5.8% |
| 8 | 約5.1% |
| 9 | 約4.6% |
これがベンフォードの法則(第一桁の法則)だ。河川の長さ、市区町村の人口、企業の売上高、土地面積、路線価——値の範囲が広く自然に発生したデータであれば、この分布が驚くほど正確に現れる。
なぜ先頭が「1」に偏るのか
直感的に説明する。
人口100人の村が200人になるには2倍の成長が必要だ。しかし100人から199人まで、先頭桁はずっと「1」のままである。一方、先頭が「9」であるためには900~999という狭い範囲にとどまる必要があり、1000に達した瞬間に先頭は「1」に戻る。
数値が成長・変動する過程で、「1」のゾーンに滞在する時間が最も長い。これが偏りの本質だ。
不正検出への応用
人間が架空の数字を作るとき、「1~9を均等に使ったほうが自然だろう」と無意識に考えやすい。しかし本物のデータには先頭桁の偏りがある。提出された入札書類や経費精算書の先頭桁分布が均等すぎれば、逆に不自然だということになる。
米国では会計監査やFBIの不正調査にベンフォードの法則が実際に使われている。選挙結果の検証に適用された事例もある。日本でも、会計監査の実務書でベンフォード分析に言及されるようになってきた。
入札の文脈で考えると、複数業者が提出した見積金額の先頭桁を集計し、ベンフォード分布と大きく乖離している業者があれば、談合や価格操作を疑う端緒になる。もちろん、法則から外れたことだけで不正が証明されるわけではない。あくまでスクリーニングの第一段階だ。
ただし適用できるデータには条件がある。
| 適用可能 | 適用不可 |
|---|---|
| 河川の長さ | 宝くじの番号 |
| 市区町村の人口 | 電話番号 |
| 企業の売上高 | 郵便番号 |
| 土地面積・地価 | 身長・体重(範囲が狭い) |
| 入札金額・経費精算書 | 人工的に割り振ったID |
値の範囲が広く、自然に発生したデータであること。人間が均等に割り振った番号や、値の幅が狭いデータには適用できない。
GISデータの品質チェックへの転用
GISで日常的に扱う筆ポリゴンの面積、路線価、建物の延床面積は、いずれもベンフォードの法則がきれいに当てはまるデータだ。
台帳データの品質チェックに使える。ある列の先頭桁分布がベンフォードから大きく外れていれば、入力ミスや変換エラー、ダミーデータの混入を疑う手がかりになる。自然な土地面積データなら、先頭が「1」のレコードが3割近くあるはずだ。均等分布していたら、まずデータの中身を確認すべきだ。
Excelなら=LEFT(A1,1)で先頭桁を取り出し、ピボットテーブルで集計するだけで5分で確認できる。PostGISなら以下のSQLで一発だ。
SELECT
LEFT(CAST(area_m2 AS TEXT), 1) AS leading_digit,
COUNT(*) AS cnt,
ROUND(COUNT(*)::numeric / SUM(COUNT(*)) OVER() * 100, 1) AS pct
FROM parcels
WHERE area_m2 > 0
GROUP BY leading_digit
ORDER BY leading_digit;
このクエリの結果で「1」が30%前後、「9」が5%前後に分布していれば、そのデータは自然な状態にある。大きく外れていれば調査対象だ。
筆者の経験では、自治体から受領した土地台帳で先頭桁がほぼ均等分布していたケースがあった。確認したところ、テスト用のダミーレコードが本番データに混入していた。面積のような広範囲にばらつく数値が均等になること自体が、データの異常を示すシグナルだ。
同様の手法は建物延床面積、固定資産評価額、公示地価など、GISの属性テーブルに格納される多くの数値カラムに適用できる。新規データの受入検査として、先頭桁分布のチェックをルーティンに組み込んでおくと、目視では気づきにくい異常の早期発見につながる。
共通する原則
有意水準5%もベンフォードの法則も、理論としては別物だ。しかし根底にある考え方は共通している。
自然な現象には、自然なばらつき方がある。外れすぎても、当たりすぎても、均等すぎても、それは「不自然」のサインだ。
データの品質管理において重要なのは、異常値を1件ずつ目視で探すことではない。データ全体の「分布の形」を把握し、自然なパターンからの逸脱を統計的に検出することだ。ベンフォードの法則は、その最もシンプルで強力な手法の一つである。
まとめ
- 統計学では「悪すぎる」だけでなく「良すぎる」も異常として扱う
- 有意水準5%は絶対的基準ではなく、歴史的に定着した実務上の慣例
- 自然発生データの先頭桁は均等にならない。「1」が約30%で最多
- 人間が作った架空データは先頭桁が均等になりやすく、不正検出に使える
- GISの台帳データ品質チェックにも応用可能。Excel・PostGISで即実行できる


コメント