從第一原理解釋非高斯分布(適合初學者)

正如我們都知道,真實世界的資料集並非 常態化,但我們大多數人以為 每個資料集都遵循著名的鐘形曲線

畢竟,每個人都談論 常態分布

但當我查看真實世界的資料集時,例如:

  • 人們的收入
  • 股市報酬
  • 網站流量
  • YouTube 觀看次數
  • 城市人口

它們都看起來不像鐘形曲線。

就在那時,我意識到一件重要的事。

並非現實世界中的每個資料集都是常態分布的。

在本文中,我們將使用簡單的語言、直觀理解以及真實世界的例子,從第一原理來理解 非高斯(非常態)分布


首先,「非高斯」是什麼意思?

常態分布(也稱為高斯分布)具有非常特定的形狀。

它:

  • 呈鐘形
  • 對稱
  • 平均數 = 中位數 = 眾數
  • 大多數觀測值都位於平均值附近

但如果我們的資料看起來不像這樣呢?

那麼它就被稱為 非高斯分布

簡單來說,

任何不遵循常態分布的機率分布都稱為非高斯分布。


為什麼我們應該在意?

想像一下,你正在分析員工的薪資。

大多數員工的薪資介於 ₹25,000 到 ₹1,00,000 之間。

但少數執行長的薪資可達 ₹50 萬甚至 ₹2 千萬。

這筆資料會形成完美的鐘形曲線嗎?

不會。

極高的薪資會將分布拉向一側。

如果我們錯誤地假設資料是常態的,我們的分析可能會產生誤導。

這就是為什麼在資料科學中,理解非高斯分布極其重要。


在學習其他分布之前...

讓我們先理解兩個重要的概念。

它們能幫助我們判斷資料是否為常態分布。


峰度 — 尾巴有多重?

當初學者聽到 峰度 這個詞時,通常會以為它是測量圖形峰值的高度。

這其實是一個常見的誤解。

理解峰度的一個更好方法是:

分布產生極端值(離群值)的可能性有多高?

想像有兩個班級。

甲班

大多數學生的成績介於 60 到 80 分之間。

很少有人低於 20 分或高於 95 分。

乙班

大多數學生仍然介於 60 到 80 分之間。

但每年都有少數學生得到 0 分或 100 分。

哪個班級有更多極端值?

顯然是乙班。

這意味著乙班有 較高的峰度


三種峰度類型

1. 尖峰態

可以將其視為具有 較胖尾巴 的分布。

這意味著:

  • 更多離群值
  • 更多極端值
  • 更高的風險

例如:

股市報酬。

大多數日子市場變化很小。

但偶爾會大幅崩跌或飆升。

這些罕見事件創造了胖尾。


2. 低峰態

現在想像一個具有極少極端值的分布。

幾乎所有事物都接近平均值。

這被稱為 低峰態分布

它具有:

  • 瘦尾巴
  • 較少的離群值
  • 較低的風險

3. 中峰態

這的行為就像常態分布一樣。

既不過多也不過少的離群值。

常態分布是中峰態分布的最佳例子。


我們如何檢查資料是否為常態?

假設有人給你 50,000 個觀測值。

你如何知道它們是否遵循常態分布?

有三種常見的方法。


1. 視覺檢查

最簡單的方法。

建立直方圖或密度圖。

問問自己:

它看起來大致像鐘形曲線嗎?

如果是,

資料可能近似常態。

如果不是,

它很可能不是。


2. QQ 圖

現在假設直方圖不是很清楚。

我們需要更好的方法。

這就是 QQ 圖(分位數-分位數圖) 的用武之地。

QQ 圖將你的資料集與完美的常態分布進行比較。

如果點位於接近直線的位置,

你的資料就近似常態。

如果點偏離直線,

資料很可能就是非高斯的。

可以將其想像成比較兩份手寫樣本。

如果兩者相符,

它們很可能來自同一個人。

如果不符,

它們就是不同的。


3. 統計檢定

有時視覺檢查還不夠。

統計檢定能幫助我們做出數學上的決定。

一些常用的檢定包括:

  • Shapiro-Wilk 檢定
  • Anderson-Darling 檢定
  • Kolmogorov-Smirnov 檢定

如果這些檢定產生非常小的 p 值(通常小於 0.05),

則資料被認為 不呈常態分布


均勻分布

讓我們想像一個不同的實驗。

假設一個亂數產生器產生介於

1 到 10 之間的數字

進入全螢幕模式 退出全螢幕模式

每個數字出現的機率完全相同。

沒有任何數字比其他數字更有可能出現。

這被稱為 均勻分布

與常態分布不同,

它沒有峰值。

所有事物都同樣可能。


均勻分布的真實生活例子

  • 亂數產生器
  • 擲公正的骰子
  • 在一分鐘內選擇一個隨機的秒數
  • 機器學習中的隨機初始化

為什麼資料科學家會使用均勻分布?

均勻分布出人意料地經常出現在機器學習中。

一些常見的應用包括:

  • 神經網路權重的隨機初始化
  • 隨機取樣
  • 資料擴增
  • 超參數調整

每當每個值都應該有相等的機會時,

均勻分布就會變得有用。


對數常態分布

現在讓我們來看另一個有趣的分布。

想像人們的收入。

大多數人賺取中等的薪資。

較少的人賺取非常高的薪資。

幾乎沒有人有負收入。

分布會嚴重向右偏斜。

這被稱為 對數常態分布

當一個隨機變數的對數遵循常態分布時,它就遵循對數常態分布。

不用擔心要記住這個定義。

只要記住這個直觀概念:

數值不能低於零,但可以變得極大。


真實生活例子

許多真實世界的資料集都遵循對數常態分布。

例如:

  • 人們的收入
  • 網路文章閱讀時間
  • 線上評論的長度
  • 西洋棋對局的持續時間

大多數數值都很小,

但有少數會變得極大。


帕雷托分布 — 著名的 80/20 法則

你是否聽過這樣的說法?

20% 的客戶創造了 80% 的營收。

或者

20% 的員工完成了 80% 的工作。

這個想法來自於 帕雷托分布

帕雷托分布模擬了

少數觀測值佔據了大部分結果的情況。


真實生活例子

帕雷托分布無處不在。

例子包括:

  • 財富分配
  • 公司營收
  • 城市人口
  • 網際網路上的檔案大小
  • 社群媒體追蹤者
  • 產品銷售

通常,

許多觀測值都很小,

而只有少數是極大的。


為什麼帕雷托很重要?

假設你擁有一家線上商店。

你發現

20% 的客戶創造了你 80% 的銷售額。

與其把錢花在每個人身上,

不如專注在那些重要的客戶身上。

這正是企業熱愛帕雷托分析的原因。


轉換非高斯資料

有時當資料近似常態時,機器學習演算法的表現會更好。

但如果你的資料不是常態呢?

我們可以轉換資料,而不是更改演算法。

常見的轉換包括:

  • 對數轉換
  • 平方根轉換
  • Box-Cox 轉換

這些轉換可以減少偏斜度,並使資料更容易分析。


為什麼這在資料科學中很重要?

真實世界的資料很少是完美的。

有些資料集是:

  • 高度偏斜的
  • 充滿離群值的
  • 重尾的
  • 分布不均的

理解非高斯分布能幫助我們:

  • 選擇正確的統計方法
  • 建立更好的機器學習模型
  • 偵測異常值
  • 正確理解商業資料
  • 避免做出不正確的假設

結論

當我第一次學習統計學時,

我以為每個資料集都應該看起來像鐘形曲線。

但真實世界的資料告訴我事實並非如此。

大自然是混亂的。

商業是混亂的。

人類行為是混亂的。

這正是非高斯分布存在的原因。

我們不應該強迫每個資料集都符合常態分布,

而是學習辨識不同的模式,並為每種情況選擇正確的模型。

這才是真正的資料科學。


重點摘要

  • 並非每個資料集都遵循常態分布。
  • 峰度衡量極端值出現的可能性。
  • 尖峰態分布具有胖尾巴和更多離群值。
  • 低峰態分布具有瘦尾巴和較少的離群值。
  • 中峰態分布的行為類似常態分布。
  • 直方圖、QQ 圖和統計檢定有助於偵測常態性。
  • 均勻分布讓每個值都有相等的機率。
  • 對數常態分布模擬了正向成長且右偏的資料。
  • 帕雷托分布解釋了著名的 80/20 法則。
  • 資料轉換有助於將偏斜的資料轉換成更容易分析的形式。

如果你正在學習統計學、機器學習或資料科學,請記住一個重要的教訓:

不要假設每個資料集都遵循常態分布。

真正的技能是辨識 你的資料遵循哪種分布,並據此選擇正確的工具。

一旦你理解這一點,你就是在像真正的資料科學家一樣思考。

如果你還沒讀過前一部分,請點這裡閱讀:第 4 部分

學習愉快!🚀