从第一性原理解释非高斯分布(适合初学者)
正如我们所知,真实世界的数据集并不是归一化的,但我们大多数人曾认为每个数据集都遵循著名的钟形曲线。
毕竟,每个人都在谈论正态分布。
但当我查看真实世界的数据集时,例如:
- 人们的收入
- 股市回报
- 网站流量
- YouTube 观看次数
- 城市人口
它们看起来都不像钟形曲线。
那时我意识到一件重要的事。
并非现实世界中的每个数据集都呈正态分布。
在本文中,我们将使用简单的语言、直觉和真实世界的例子,从第一性原理理解非高斯(非正态)分布。
首先,“非高斯”是什么意思?
正态分布(也称为高斯分布)具有非常特定的形状。
它具有以下特点:
- 钟形
- 对称
- 均值 = 中位数 = 众数
- 大多数观测值集中在平均值附近
但如果我们的数据看起来不像这样呢?
那么它就被称为非高斯分布。
简单来说,
任何不符合正态分布的概率分布都称为非高斯分布。
为什么我们应该关注它?
想象一下,你正在分析员工的薪资。
大多数员工的收入在 ₹25,000 到 ₹1,00,000 之间。
但少数 CEO 的收入达到 ₹50 lakh 甚至 ₹2 crore。
这些数据会形成完美的钟形曲线吗?
不会。
极高的薪资会将分布拉向一侧。
如果我们错误地假设数据是正态的,我们的分析可能会产生误导。
这就是为什么在数据科学中理解非高斯分布极其重要。
在学习其他分布之前...
让我们理解两个重要的概念。
这些概念帮助我们判断数据是否呈正态分布。
峰度——尾部有多重?
当初学者听到峰度这个词时,通常认为它衡量的是图表峰值的高度。
这实际上是一个常见的误解。
理解峰度的一个更好的方式是:
分布产生极端值(异常值)的可能性有多大?
想象两个班级。
班级 A
大多数学生分数在 60 到 80 之间。
很少有学生低于 20 分或高于 95 分。
班级 B
大多数学生分数仍然在 60 到 80 之间。
但每年都有少数学生考 0 分或 100 分。
哪个班级有更多的极端值?
显然是班级 B。
这意味着班级 B 具有更高的峰度。
三种类型的峰度
1. 尖顶峰度(Leptokurtic)
可以将其视为具有更胖尾部的分布。
这意味着:
- 更多异常值
- 更多极端值
- 更高风险
例如:
股市回报。
大多数日子市场变化很小。
但偶尔会大幅下跌或飙升。
这些罕见事件形成了肥尾。
2. 平顶峰度(Platykurtic)
现在想象一个具有极少极端值的分布。
几乎所有值都接近平均值。
这被称为平顶峰度分布。
它具有:
- 薄尾部
- 更少异常值
- 更低风险
3. 中等峰度(Mesokurtic)
其表现与正态分布完全相同。
既没有太多也没有太少异常值。
正态分布是中等峰度分布的最佳例子。
如何判断数据是否呈正态分布?
假设有人给你 50,000 个观测值。
你如何知道它们是否遵循正态分布?
有三种常见方法。
1. 目视检查
最简单的方法。
创建直方图或密度图。
问自己:
它看起来大致像钟形曲线吗?
如果是,
数据可能近似正态。
如果不是,
它很可能不是。
2. QQ 图
现在假设直方图不够清晰。
我们需要更好的方法。
这时QQ 图(分位数-分位数图)就派上用场了。
QQ 图将你的数据集与完美的正态分布进行比较。
如果点靠近一条直线,
你的数据近似正态。
如果点偏离直线,
数据很可能呈非高斯分布。
可以将其想象成比较两份笔迹样本。
如果两者匹配,
它们可能来自同一个人。
如果不匹配,
它们就不同。
3. 统计检验
有时目视检查不够。
统计检验帮助我们做出数学决策。
一些常用的检验包括:
- Shapiro-Wilk 检验
- Anderson-Darling 检验
- Kolmogorov-Smirnov 检验
如果这些检验产生非常小的 p 值(通常小于 0.05),
则数据被认为不呈正态分布。
均匀分布
让我们想象一个不同的实验。
假设一个随机数生成器生成
1 到 10 之间的数字
进入全屏模式 退出全屏模式
每个数字出现的概率完全相同。
没有数字比其他数字更可能出现。
这被称为均匀分布。
与正态分布不同,
它没有峰值。
一切都同样可能。
均匀分布的现实例子
- 随机数生成器
- 掷公正骰子
- 在一分钟内选择一个随机秒数
- 机器学习中的随机初始化
为什么数据科学家使用均匀分布?
均匀分布在机器学习中经常出现。
一些常见应用包括:
- 神经网络权重的随机初始化
- 随机采样
- 数据增强
- 超参数调优
当每个值都应具有相等机会时,
均匀分布就变得有用。
对数正态分布
现在让我们看另一种有趣的分布。
想象一下人们的收入。
大多数人收入中等。
少数人收入很高。
几乎没有人收入为负。
分布向右严重偏斜。
这被称为对数正态分布。
当一个随机变量的对数服从正态分布时,该随机变量服从对数正态分布。
不用担心记住这个定义。
只要记住直觉:
数值不能低于零,但可以变得极大。
现实例子
许多真实世界的数据集遵循对数正态分布。
例如:
- 人们的收入
- 互联网文章阅读时间
- 在线评论长度
- 国际象棋对局时长
大多数值较小,
但少数值会变得极大。
帕累托分布——著名的 80/20 法则
你是否听过这样的说法?
20% 的客户产生 80% 的收入。
或者
20% 的员工完成 80% 的工作。
这个想法来源于帕累托分布。
帕累托分布对以下情况建模:
少数观测值占大部分结果。
现实例子
帕累托分布无处不在。
例子包括:
- 财富分布
- 公司收入
- 城市人口
- 互联网上的文件大小
- 社交媒体粉丝数
- 产品销量
通常,
许多观测值较小,
而只有少数极大。
为什么帕累托分布很重要?
假设你拥有一家在线商店。
你发现
20% 的客户产生了 80% 的销售额。
与其在所有人身上花钱,
不如专注于那些重要客户。
这就是企业喜欢帕累托分析的原因。
转换非高斯数据
有时,当数据近似正态时,机器学习算法表现更好。
但如果你的数据不是正态的呢?
与其改变算法,
不如转换数据。
常见的转换包括:
- 对数转换
- 平方根转换
- Box-Cox 转换
这些转换可以减少偏度,使数据更容易分析。
为什么这在数据科学中很重要?
真实世界的数据很少是完美的。
一些数据集:
- 高度偏斜
- 充满异常值
- 重尾
- 分布不均
理解非高斯分布有助于我们:
- 选择正确的统计方法
- 构建更好的机器学习模型
- 检测异常
- 正确理解业务数据
- 避免做出错误的假设
结语
当我第一次学习统计学时,
我以为每个数据集都应该看起来像钟形曲线。
但真实世界的数据教会了我相反的道理。
自然是杂乱的。
商业是杂乱的。
人类行为是杂乱的。
这正是非高斯分布存在的原因。
与其强迫每个数据集去拟合正态分布,
不如学会识别不同的模式,并为每种情况选择正确的模型。
这就是真正的数据科学。
要点总结
- 并非每个数据集都遵循正态分布。
- 峰度衡量极端值出现的可能性。
- 尖顶峰度分布具有肥尾和更多异常值。
- 平顶峰度分布具有薄尾和更少异常值。
- 中等峰度分布表现得像正态分布。
- 直方图、QQ 图和统计检验有助于检测正态性。
- 均匀分布使每个值具有相等的概率。
- 对数正态分布对正增长且右偏的数据建模。
- 帕累托分布解释了著名的 80/20 法则。
- 数据转换有助于将偏斜数据转换为更容易分析的形式。
如果你正在学习统计学、机器学习或数据科学,请记住一个重要教训:
不要假设每个数据集都遵循正态分布。
真正的技能是识别你的数据遵循哪种分布,并据此选择正确的工具。
一旦你理解了这一点,你就在像真正的数据科学家一样思考。
如果你没有阅读前一部分,请点击这里阅读:第4部分
学习愉快!🚀
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.