日本語版
最新ニュース
世界

いくつかの実際のデータにおける驚くほど有用な数学パターン

「株式市場の価格を検索すると、パターンが表示される場合があります…」Muhla1/Getty Images 新聞のフロントページを見ると、おそらく多くの数字が含まれていることがわかります。金額、人口サイズ、長さまたは面積の測定値です。これらのすべての数値を引き出してリストに入れた場合、乱数のコレクションがあります。 しかし、これらの数字はあなたが思うほどランダムではありません。現実世界のデータでは、現金の合計や建物の高さなど、特定の数の最初の数字は驚くほど1になる可能性があります。数字が本当にランダムであれば、1/9の約1/9は1から始まりますが、実際には3分の1に似ています。数字9は道をリードする可能性が最も高く、約1/20の時間で発生し、他の数字はそれらの間の曲線に従います。 ベンフォードの法則として知られるこのパターンは、特定のタイプのデータセット、特に不特定の範囲から描かれている値が描かれているデータセットで最初の数字の一般的に観察される分布です。人間の高さ(数字がすべて小さな範囲内にある)や日付(数字がとる値に制限がある場合)のようなことで起こっているのはわかりません。 しかし、銀行口座の金額を確認したり、家の番号を付けたり、株式市場の価格を調べたりするように人々に依頼した場合(写真)、パターンが表示される場合があります。これらはすべて数桁に及ぶ可能性のある数字です。いくつかの通りにはわずかな家しかありませんが、他の街には数百の家があります。これが現象が発生する理由です。 9つのプロパティのある通りを想像してみてください。各桁から始まる家番号の割合は、9方向のスプリットと同じです。しかし、19軒の家のある通りでは、半分以上が1から始まります。家の数を増やすにつれて、これらの2つの極端が発生し続けます。100個で、各初期桁のほぼ等しい数があります。これを200に増やし、再び、それらの半分は1から始まります。 実際のデータの各項目は未知のサイズのセットに由来するため、1から始まる数の平均確率は、これら2つの値の間のどこかになります。他の数字で同様の計算を行うことができ、これにより、それぞれが表示される全体的な頻度が得られます。効果は、大規模なデータコレクションで最も目立ちます。 これが役立つ理由の1つは、データが偽造されたときに手がかりを与えることです。一連のビジネスアカウントを見ると、販売数にベンフォードのような分配を見つけることが期待されます。しかし、誰かが乱数を選択してデータを製造した場合、最初の数字の頻度をプロットするとき、特徴的な曲線はありません。これは、不審な活動を検出するために法医学的な会計士が使用するトリックの1つです。 次回アカウントをチェックしたり、川の長さを比較したりするときは、1から始まる数字の数に注意してください。 Katie Stecklesは、数学者、講師、YouTuber、および英国のマンチェスターに拠点を置く著者です。彼女はまた、ニューサイエンティストのパズルコラムであるブレントウィスターのアドバイザーでもあります。彼女の@stecksに従ってください 他のプロジェクトについては、newscientist.com/makerをご覧ください トピック: #いくつかの実際のデータにおける驚くほど有用な数学パターン

いくつかの実際のデータにおける驚くほど有用な数学パターン

1757270338
2025-09-03 18:00:00

「株式市場の価格を検索すると、パターンが表示される場合があります…」

Muhla1/Getty Images

新聞のフロントページを見ると、おそらく多くの数字が含まれていることがわかります。金額、人口サイズ、長さまたは面積の測定値です。これらのすべての数値を引き出してリストに入れた場合、乱数のコレクションがあります。

しかし、これらの数字はあなたが思うほどランダムではありません。現実世界のデータでは、現金の合計や建物の高さなど、特定の数の最初の数字は驚くほど1になる可能性があります。数字が本当にランダムであれば、1/9の約1/9は1から始まりますが、実際には3分の1に似ています。数字9は道をリードする可能性が最も高く、約1/20の時間で発生し、他の数字はそれらの間の曲線に従います。

ベンフォードの法則として知られるこのパターンは、特定のタイプのデータセット、特に不特定の範囲から描かれている値が描かれているデータセットで最初の数字の一般的に観察される分布です。人間の高さ(数字がすべて小さな範囲内にある)や日付(数字がとる値に制限がある場合)のようなことで起こっているのはわかりません。

しかし、銀行口座の金額を確認したり、家の番号を付けたり、株式市場の価格を調べたりするように人々に依頼した場合(写真)、パターンが表示される場合があります。これらはすべて数桁に及ぶ可能性のある数字です。いくつかの通りにはわずかな家しかありませんが、他の街には数百の家があります。これが現象が発生する理由です。

9つのプロパティのある通りを想像してみてください。各桁から始まる家番号の割合は、9方向のスプリットと同じです。しかし、19軒の家のある通りでは、半分以上が1から始まります。家の数を増やすにつれて、これらの2つの極端が発生し続けます。100個で、各初期桁のほぼ等しい数があります。これを200に増やし、再び、それらの半分は1から始まります。

実際のデータの各項目は未知のサイズのセットに由来するため、1から始まる数の平均確率は、これら2つの値の間のどこかになります。他の数字で同様の計算を行うことができ、これにより、それぞれが表示される全体的な頻度が得られます。効果は、大規模なデータコレクションで最も目立ちます。

これが役立つ理由の1つは、データが偽造されたときに手がかりを与えることです。一連のビジネスアカウントを見ると、販売数にベンフォードのような分配を見つけることが期待されます。しかし、誰かが乱数を選択してデータを製造した場合、最初の数字の頻度をプロットするとき、特徴的な曲線はありません。これは、不審な活動を検出するために法医学的な会計士が使用するトリックの1つです。

次回アカウントをチェックしたり、川の長さを比較したりするときは、1から始まる数字の数に注意してください。

Katie Stecklesは、数学者、講師、YouTuber、および英国のマンチェスターに拠点を置く著者です。彼女はまた、ニューサイエンティストのパズルコラムであるブレントウィスターのアドバイザーでもあります。彼女の@stecksに従ってください

他のプロジェクトについては、newscientist.com/makerをご覧ください

トピック:

#いくつかの実際のデータにおける驚くほど有用な数学パターン

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。