非ガウス分布を基礎から解説(初心者向け)
私たちがよく知るように、現実世界のデータセットは正規化されていませんが、多くの人がすべてのデータセットが有名なベルカーブに従うと考えていました。
結局のところ、誰もが正規分布について話しています。
しかし、現実世界のデータセットを見てみると:
- 人々の収入
- 株式市場のリターン
- ウェブサイトのトラフィック
- YouTubeの視聴回数
- 都市の人口
どれもベルカーブのように見えませんでした。
そのときに重要なことに気づきました。
現実世界のすべてのデータセットが正規分布しているわけではありません。
この記事では、シンプルな言葉、直感、現実世界の例を使って、非ガウス(非正規)分布を基礎から理解していきます。
まず、「非ガウス」とは何を意味するのか?
正規分布(ガウス分布とも呼ばれる)は、非常に特定の形状を持っています。
それは:
- ベル型
- 対称
- 平均 = 中央値 = 最頻値
- ほとんどの観測値が平均値の近くに存在する
しかし、データがそのような形をしていない場合はどうでしょうか?
その場合、それは非ガウス分布と呼ばれます。
簡単な言葉で言うと、
正規分布に従わない確率分布はすべて非ガウス分布と呼ばれます。
なぜ気にする必要があるのか?
従業員の給与を分析していると想像してみてください。
ほとんどの従業員は₹25,000から₹1,00,000の間で稼いでいます。
しかし、一部のCEOは₹50 lakhや₹2 croreを稼いでいます。
このデータは完璧なベルカーブを形成するでしょうか?
いいえ。
極端に高い給与が分布を片側に引き寄せます。
データが正規分布であると誤って仮定すると、分析が誤解を招く可能性があります。
だからこそ、データサイエンスにおいて非ガウス分布を理解することは非常に重要です。
他の分布を学ぶ前に...
2つの重要な概念を理解しましょう。
これらは、データが正規分布しているかどうかを判断するのに役立ちます。
尖度 — 裾の重さはどれくらいか?
初心者が尖度という言葉を聞くと、通常、グラフのピークの高さを測定するものだと考えます。
それは実際には一般的な誤解です。
尖度について考えるより良い方法は次のとおりです:
分布が極端な値(外れ値)を生み出す可能性はどれくらいか?
2つのクラスを想像してみてください。
クラスA
ほとんどの学生が60から80の間で得点します。
20以下または95以上を取る学生はほとんどいません。
クラスB
ほとんどの学生は依然として60から80の間で得点します。
しかし、毎年、数人の学生が0または100を取ります。
どちらのクラスにより多くの極端な値があるでしょうか?
明らかにクラスBです。
つまり、クラスBはより高い尖度を持っています。
尖度の3つのタイプ
1. レプトクルティック
これは太い裾を持つ分布として考えてください。
これは以下を意味します:
- より多くの外れ値
- より多くの極端な値
- より高いリスク
例:
株式市場のリターン。
ほとんどの日、市場はほとんど変化しません。
しかし、時折、劇的にクラッシュしたり急上昇したりします。
これらの稀なイベントが太い裾を作り出します。
2. プラティクルティック
今度は極端な値が非常に少ない分布を想像してみてください。
ほとんどすべてが平均値の近くに留まります。
これはプラティクルティック分布と呼ばれます。
それは:
- 細い裾
- より少ない外れ値
- より低いリスク
3. メソクルティック
これは正規分布と同様に振る舞います。
外れ値が多すぎることも少なすぎることもありません。
正規分布はメソクルティック分布の最良の例です。
データが正規分布しているかどうかを確認するには?
誰かが50,000個の観測値を提供したとします。
それらが正規分布に従っているかどうかをどのように知るのでしょうか?
3つの一般的なアプローチがあります。
1. 視覚的検査
最も簡単な方法です。
ヒストグラムまたは密度プロットを作成します。
自問してみてください:
おおよそベルカーブのように見えるか?
はいの場合、
データはほぼ正規分布している可能性があります。
いいえの場合、
おそらく正規分布していません。
2. QQプロット
ヒストグラムがあまり明確でないとします。
より良い方法が必要です。
ここでQQプロット(Quantile-Quantile Plot)が役立ちます。
QQプロットは、データセットを完璧な正規分布と比較します。
点が直線に近い場合、
データはほぼ正規分布しています。
点が線から曲がる場合、
データは非ガウス分布である可能性が高いです。
2つの手書きサンプルを比較するようなものだと考えてください。
両方が一致する場合、
おそらく同じ人からのものです。
一致しない場合、
それらは異なります。
3. 統計的検定
視覚的検査だけでは十分でない場合もあります。
統計的検定は数学的な判断を下すのに役立ちます。
一般的に使用される検定には以下があります:
- シャピロ-ウィルク検定
- アンダーソン-ダーリング検定
- コルモゴロフ-スミルノフ検定
これらの検定が非常に小さなp値(通常0.05未満)を生成する場合、
データは正規分布していないとみなされます。
一様分布
別の実験を想像してみましょう。
乱数生成器が
1から10の間の数値
フルスクリーンモードに入る フルスクリーンモードを終了する
すべての数値が表示される確率は完全に同じです。
どの数値も他の数値よりも可能性が高いわけではありません。
これは一様分布と呼ばれます。
正規分布とは異なり、
ピークはありません。
すべてが等しく可能性があります。
一様分布の現実世界の例
- 乱数生成器
- 公正なサイコロを振る
- 1分間のランダムな秒を選択する
- 機械学習でのランダム初期化
データサイエンティストが一様分布を使用する理由
一様分布は機械学習で驚くほど頻繁に現れます。
一般的なアプリケーションには以下があります:
- ニューラルネットワーク重みのランダム初期化
- ランダムサンプリング
- データ拡張
- ハイパーパラメータチューニング
すべての値が等しい確率を持つべき場合、
一様分布は有用になります。
対数正規分布
今度は別の興味深い分布を見てみましょう。
人々の収入を想像してみてください。
ほとんどの人は中程度の給与を稼いでいます。
少数の人が非常に高い給与を稼いでいます。
ほぼ誰も負の収入を得ていません。
分布は右側に大きく歪んでいます。
これは対数正規分布と呼ばれます。
確率変数は、その対数が正規分布に従う場合に対数正規分布に従います。
この定義を覚える必要はありません。
直感だけを覚えておいてください:
値は0を下回ることはできませんが、非常に大きくなる可能性があります。
現実世界の例
多くの現実世界のデータセットが対数正規分布に従います。
例えば:
- 人々の収入
- インターネット記事の読了時間
- オンラインコメントの長さ
- チェスゲームの所要時間
ほとんどの値は小さく、
一部は非常に大きくなります。
パレート分布 — 有名な80/20ルール
このような声明を聞いたことがありますか?
顧客の20%が収益の80%を生み出す。
または
従業員の20%が仕事の80%を行う。
このアイデアはパレート分布から来ています。
パレート分布は、
少数の観測値が結果の大部分を占める状況をモデル化します。
現実世界の例
パレート分布はどこにでも現れます。
例:
- 富の分布
- 企業の収益
- 都市の人口
- インターネット上のファイルサイズ
- ソーシャルメディアのフォロワー
- 製品の売上
通常、
多くの観測値は小さく、
一部だけが非常に大きくなります。
なぜパレートが重要なのか?
オンラインストアを所有しているとします。
顧客の20%が売上の80%を生み出していることを発見したとします。
全員にお金をかけるのではなく、
重要な顧客に焦点を当てます。
それがまさにビジネスがパレート分析を愛する理由です。
非ガウスデータの変換
機械学習アルゴリズムは、データがほぼ正規分布している場合にうまく機能することがあります。
しかし、データが正規分布していない場合はどうでしょうか?
アルゴリズムを変更するのではなく、
データを変換します。
一般的な変換には以下があります:
- 対数変換
- 平方根変換
- ボックス-コックス変換
これらの変換は歪度を減らし、データを分析しやすくします。
なぜデータサイエンスでこれが重要なのか?
現実世界のデータはめったに完璧ではありません。
一部のデータセットは:
- 大きく歪んでいる
- 外れ値で満ちている
- 重い裾を持つ
- 不均等に分布している
非ガウス分布を理解することは以下に役立ちます:
- 適切な統計的手法を選択する
- より良い機械学習モデルを構築する
- 異常を検出する
- ビジネスデータを正しく理解する
- 誤った仮定を避ける
最終的な考え
統計を初めて学んだとき、
すべてのデータセットがベルカーブのように見えるべきだと考えていました。
しかし、現実世界のデータはそうではないことを教えてくれました。
自然は乱雑です。
ビジネスは乱雑です。
人間の行動は乱雑です。
それがまさに非ガウス分布が存在する理由です。
すべてのデータセットを正規分布に適合させようとするのではなく、
異なるパターンを認識し、各状況に適したモデルを選択することを学びます。
それが本当のデータサイエンスです。
重要なポイント
- すべてのデータセットが正規分布に従うわけではありません。
- 尖度は極端な値の可能性を測定します。
- レプトクルティック分布は太い裾を持ち、より多くの外れ値があります。
- プラティクルティック分布は細い裾を持ち、より少ない外れ値があります。
- メソクルティック分布は正規分布のように振る舞います。
- ヒストグラム、QQプロット、統計的検定は正規性を検出するのに役立ちます。
- 一様分布はすべての値に等しい確率を与えます。
- 対数正規分布は正の成長をし、右に歪んだデータをモデル化します。
- パレート分布は有名な80/20ルールを説明します。
- データ変換は歪んだデータを分析しやすい形に変換するのに役立ちます。
統計、機械学習、またはデータサイエンスを学んでいるなら、1つの重要な教訓を覚えておいてください:
すべてのデータセットが正規分布に従うと仮定しないでください。
本当のスキルは、データがどの分布に従っているかを認識し、それに応じて適切なツールを選択することです。
それが理解できれば、本当のデータサイエンティストのように考えています。
前のパートを読んでいない場合は、こちらから読んでください:パート4
Happy Learning! 🚀
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.