從第一原理解釋非高斯分布(適合初學者)
正如我們都知道,真實世界的資料集並非 常態化,但我們大多數人以為 每個資料集都遵循著名的鐘形曲線。
畢竟,每個人都談論 常態分布。
但當我查看真實世界的資料集時,例如:
- 人們的收入
- 股市報酬
- 網站流量
- YouTube 觀看次數
- 城市人口
它們都看起來不像鐘形曲線。
就在那時,我意識到一件重要的事。
並非現實世界中的每個資料集都是常態分布的。
在本文中,我們將使用簡單的語言、直觀理解以及真實世界的例子,從第一原理來理解 非高斯(非常態)分布。
首先,「非高斯」是什麼意思?
常態分布(也稱為高斯分布)具有非常特定的形狀。
它:
- 呈鐘形
- 對稱
- 平均數 = 中位數 = 眾數
- 大多數觀測值都位於平均值附近
但如果我們的資料看起來不像這樣呢?
那麼它就被稱為 非高斯分布。
簡單來說,
任何不遵循常態分布的機率分布都稱為非高斯分布。
為什麼我們應該在意?
想像一下,你正在分析員工的薪資。
大多數員工的薪資介於 ₹25,000 到 ₹1,00,000 之間。
但少數執行長的薪資可達 ₹50 萬甚至 ₹2 千萬。
這筆資料會形成完美的鐘形曲線嗎?
不會。
極高的薪資會將分布拉向一側。
如果我們錯誤地假設資料是常態的,我們的分析可能會產生誤導。
這就是為什麼在資料科學中,理解非高斯分布極其重要。
在學習其他分布之前...
讓我們先理解兩個重要的概念。
它們能幫助我們判斷資料是否為常態分布。
峰度 — 尾巴有多重?
當初學者聽到 峰度 這個詞時,通常會以為它是測量圖形峰值的高度。
這其實是一個常見的誤解。
理解峰度的一個更好方法是:
分布產生極端值(離群值)的可能性有多高?
想像有兩個班級。
甲班
大多數學生的成績介於 60 到 80 分之間。
很少有人低於 20 分或高於 95 分。
乙班
大多數學生仍然介於 60 到 80 分之間。
但每年都有少數學生得到 0 分或 100 分。
哪個班級有更多極端值?
顯然是乙班。
這意味著乙班有 較高的峰度。
三種峰度類型
1. 尖峰態
可以將其視為具有 較胖尾巴 的分布。
這意味著:
- 更多離群值
- 更多極端值
- 更高的風險
例如:
股市報酬。
大多數日子市場變化很小。
但偶爾會大幅崩跌或飆升。
這些罕見事件創造了胖尾。
2. 低峰態
現在想像一個具有極少極端值的分布。
幾乎所有事物都接近平均值。
這被稱為 低峰態分布。
它具有:
- 瘦尾巴
- 較少的離群值
- 較低的風險
3. 中峰態
這的行為就像常態分布一樣。
既不過多也不過少的離群值。
常態分布是中峰態分布的最佳例子。
我們如何檢查資料是否為常態?
假設有人給你 50,000 個觀測值。
你如何知道它們是否遵循常態分布?
有三種常見的方法。
1. 視覺檢查
最簡單的方法。
建立直方圖或密度圖。
問問自己:
它看起來大致像鐘形曲線嗎?
如果是,
資料可能近似常態。
如果不是,
它很可能不是。
2. QQ 圖
現在假設直方圖不是很清楚。
我們需要更好的方法。
這就是 QQ 圖(分位數-分位數圖) 的用武之地。
QQ 圖將你的資料集與完美的常態分布進行比較。
如果點位於接近直線的位置,
你的資料就近似常態。
如果點偏離直線,
資料很可能就是非高斯的。
可以將其想像成比較兩份手寫樣本。
如果兩者相符,
它們很可能來自同一個人。
如果不符,
它們就是不同的。
3. 統計檢定
有時視覺檢查還不夠。
統計檢定能幫助我們做出數學上的決定。
一些常用的檢定包括:
- Shapiro-Wilk 檢定
- Anderson-Darling 檢定
- Kolmogorov-Smirnov 檢定
如果這些檢定產生非常小的 p 值(通常小於 0.05),
則資料被認為 不呈常態分布。
均勻分布
讓我們想像一個不同的實驗。
假設一個亂數產生器產生介於
1 到 10 之間的數字
進入全螢幕模式 退出全螢幕模式
每個數字出現的機率完全相同。
沒有任何數字比其他數字更有可能出現。
這被稱為 均勻分布。
與常態分布不同,
它沒有峰值。
所有事物都同樣可能。
均勻分布的真實生活例子
- 亂數產生器
- 擲公正的骰子
- 在一分鐘內選擇一個隨機的秒數
- 機器學習中的隨機初始化
為什麼資料科學家會使用均勻分布?
均勻分布出人意料地經常出現在機器學習中。
一些常見的應用包括:
- 神經網路權重的隨機初始化
- 隨機取樣
- 資料擴增
- 超參數調整
每當每個值都應該有相等的機會時,
均勻分布就會變得有用。
對數常態分布
現在讓我們來看另一個有趣的分布。
想像人們的收入。
大多數人賺取中等的薪資。
較少的人賺取非常高的薪資。
幾乎沒有人有負收入。
分布會嚴重向右偏斜。
這被稱為 對數常態分布。
當一個隨機變數的對數遵循常態分布時,它就遵循對數常態分布。
不用擔心要記住這個定義。
只要記住這個直觀概念:
數值不能低於零,但可以變得極大。
真實生活例子
許多真實世界的資料集都遵循對數常態分布。
例如:
- 人們的收入
- 網路文章閱讀時間
- 線上評論的長度
- 西洋棋對局的持續時間
大多數數值都很小,
但有少數會變得極大。
帕雷托分布 — 著名的 80/20 法則
你是否聽過這樣的說法?
20% 的客戶創造了 80% 的營收。
或者
20% 的員工完成了 80% 的工作。
這個想法來自於 帕雷托分布。
帕雷托分布模擬了
少數觀測值佔據了大部分結果的情況。
真實生活例子
帕雷托分布無處不在。
例子包括:
- 財富分配
- 公司營收
- 城市人口
- 網際網路上的檔案大小
- 社群媒體追蹤者
- 產品銷售
通常,
許多觀測值都很小,
而只有少數是極大的。
為什麼帕雷托很重要?
假設你擁有一家線上商店。
你發現
20% 的客戶創造了你 80% 的銷售額。
與其把錢花在每個人身上,
不如專注在那些重要的客戶身上。
這正是企業熱愛帕雷托分析的原因。
轉換非高斯資料
有時當資料近似常態時,機器學習演算法的表現會更好。
但如果你的資料不是常態呢?
我們可以轉換資料,而不是更改演算法。
常見的轉換包括:
- 對數轉換
- 平方根轉換
- Box-Cox 轉換
這些轉換可以減少偏斜度,並使資料更容易分析。
為什麼這在資料科學中很重要?
真實世界的資料很少是完美的。
有些資料集是:
- 高度偏斜的
- 充滿離群值的
- 重尾的
- 分布不均的
理解非高斯分布能幫助我們:
- 選擇正確的統計方法
- 建立更好的機器學習模型
- 偵測異常值
- 正確理解商業資料
- 避免做出不正確的假設
結論
當我第一次學習統計學時,
我以為每個資料集都應該看起來像鐘形曲線。
但真實世界的資料告訴我事實並非如此。
大自然是混亂的。
商業是混亂的。
人類行為是混亂的。
這正是非高斯分布存在的原因。
我們不應該強迫每個資料集都符合常態分布,
而是學習辨識不同的模式,並為每種情況選擇正確的模型。
這才是真正的資料科學。
重點摘要
- 並非每個資料集都遵循常態分布。
- 峰度衡量極端值出現的可能性。
- 尖峰態分布具有胖尾巴和更多離群值。
- 低峰態分布具有瘦尾巴和較少的離群值。
- 中峰態分布的行為類似常態分布。
- 直方圖、QQ 圖和統計檢定有助於偵測常態性。
- 均勻分布讓每個值都有相等的機率。
- 對數常態分布模擬了正向成長且右偏的資料。
- 帕雷托分布解釋了著名的 80/20 法則。
- 資料轉換有助於將偏斜的資料轉換成更容易分析的形式。
如果你正在學習統計學、機器學習或資料科學,請記住一個重要的教訓:
不要假設每個資料集都遵循常態分布。
真正的技能是辨識 你的資料遵循哪種分布,並據此選擇正確的工具。
一旦你理解這一點,你就是在像真正的資料科學家一樣思考。
如果你還沒讀過前一部分,請點這裡閱讀:第 4 部分
學習愉快!🚀
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.