从第一性原理解释非高斯分布(适合初学者)

正如我们所知,真实世界的数据集并不是归一化的,但我们大多数人曾认为每个数据集都遵循著名的钟形曲线

毕竟,每个人都在谈论正态分布

但当我查看真实世界的数据集时,例如:

  • 人们的收入
  • 股市回报
  • 网站流量
  • YouTube 观看次数
  • 城市人口

它们看起来都不像钟形曲线。

那时我意识到一件重要的事。

并非现实世界中的每个数据集都呈正态分布。

在本文中,我们将使用简单的语言、直觉和真实世界的例子,从第一性原理理解非高斯(非正态)分布


首先,“非高斯”是什么意思?

正态分布(也称为高斯分布)具有非常特定的形状。

它具有以下特点:

  • 钟形
  • 对称
  • 均值 = 中位数 = 众数
  • 大多数观测值集中在平均值附近

但如果我们的数据看起来不像这样呢?

那么它就被称为非高斯分布

简单来说,

任何不符合正态分布的概率分布都称为非高斯分布。


为什么我们应该关注它?

想象一下,你正在分析员工的薪资。

大多数员工的收入在 ₹25,000 到 ₹1,00,000 之间。

但少数 CEO 的收入达到 ₹50 lakh 甚至 ₹2 crore。

这些数据会形成完美的钟形曲线吗?

不会。

极高的薪资会将分布拉向一侧。

如果我们错误地假设数据是正态的,我们的分析可能会产生误导。

这就是为什么在数据科学中理解非高斯分布极其重要。


在学习其他分布之前...

让我们理解两个重要的概念。

这些概念帮助我们判断数据是否呈正态分布。


峰度——尾部有多重?

当初学者听到峰度这个词时,通常认为它衡量的是图表峰值的高度。

这实际上是一个常见的误解。

理解峰度的一个更好的方式是:

分布产生极端值(异常值)的可能性有多大?

想象两个班级。

班级 A

大多数学生分数在 60 到 80 之间。

很少有学生低于 20 分或高于 95 分。

班级 B

大多数学生分数仍然在 60 到 80 之间。

但每年都有少数学生考 0 分或 100 分。

哪个班级有更多的极端值?

显然是班级 B。

这意味着班级 B 具有更高的峰度


三种类型的峰度

1. 尖顶峰度(Leptokurtic)

可以将其视为具有更胖尾部的分布。

这意味着:

  • 更多异常值
  • 更多极端值
  • 更高风险

例如:

股市回报。

大多数日子市场变化很小。

但偶尔会大幅下跌或飙升。

这些罕见事件形成了肥尾。


2. 平顶峰度(Platykurtic)

现在想象一个具有极少极端值的分布。

几乎所有值都接近平均值。

这被称为平顶峰度分布

它具有:

  • 薄尾部
  • 更少异常值
  • 更低风险

3. 中等峰度(Mesokurtic)

其表现与正态分布完全相同。

既没有太多也没有太少异常值。

正态分布是中等峰度分布的最佳例子。


如何判断数据是否呈正态分布?

假设有人给你 50,000 个观测值。

你如何知道它们是否遵循正态分布?

有三种常见方法。


1. 目视检查

最简单的方法。

创建直方图或密度图。

问自己:

它看起来大致像钟形曲线吗?

如果是,

数据可能近似正态。

如果不是,

它很可能不是。


2. QQ 图

现在假设直方图不够清晰。

我们需要更好的方法。

这时QQ 图(分位数-分位数图)就派上用场了。

QQ 图将你的数据集与完美的正态分布进行比较。

如果点靠近一条直线,

你的数据近似正态。

如果点偏离直线,

数据很可能呈非高斯分布。

可以将其想象成比较两份笔迹样本。

如果两者匹配,

它们可能来自同一个人。

如果不匹配,

它们就不同。


3. 统计检验

有时目视检查不够。

统计检验帮助我们做出数学决策。

一些常用的检验包括:

  • Shapiro-Wilk 检验
  • Anderson-Darling 检验
  • Kolmogorov-Smirnov 检验

如果这些检验产生非常小的 p 值(通常小于 0.05),

则数据被认为不呈正态分布


均匀分布

让我们想象一个不同的实验。

假设一个随机数生成器生成

1 到 10 之间的数字

进入全屏模式 退出全屏模式

每个数字出现的概率完全相同。

没有数字比其他数字更可能出现。

这被称为均匀分布

与正态分布不同,

它没有峰值。

一切都同样可能。


均匀分布的现实例子

  • 随机数生成器
  • 掷公正骰子
  • 在一分钟内选择一个随机秒数
  • 机器学习中的随机初始化

为什么数据科学家使用均匀分布?

均匀分布在机器学习中经常出现。

一些常见应用包括:

  • 神经网络权重的随机初始化
  • 随机采样
  • 数据增强
  • 超参数调优

当每个值都应具有相等机会时,

均匀分布就变得有用。


对数正态分布

现在让我们看另一种有趣的分布。

想象一下人们的收入。

大多数人收入中等。

少数人收入很高。

几乎没有人收入为负。

分布向右严重偏斜。

这被称为对数正态分布

当一个随机变量的对数服从正态分布时,该随机变量服从对数正态分布。

不用担心记住这个定义。

只要记住直觉:

数值不能低于零,但可以变得极大。


现实例子

许多真实世界的数据集遵循对数正态分布。

例如:

  • 人们的收入
  • 互联网文章阅读时间
  • 在线评论长度
  • 国际象棋对局时长

大多数值较小,

但少数值会变得极大。


帕累托分布——著名的 80/20 法则

你是否听过这样的说法?

20% 的客户产生 80% 的收入。

或者

20% 的员工完成 80% 的工作。

这个想法来源于帕累托分布

帕累托分布对以下情况建模:

少数观测值占大部分结果。


现实例子

帕累托分布无处不在。

例子包括:

  • 财富分布
  • 公司收入
  • 城市人口
  • 互联网上的文件大小
  • 社交媒体粉丝数
  • 产品销量

通常,

许多观测值较小,

而只有少数极大。


为什么帕累托分布很重要?

假设你拥有一家在线商店。

你发现

20% 的客户产生了 80% 的销售额。

与其在所有人身上花钱,

不如专注于那些重要客户。

这就是企业喜欢帕累托分析的原因。


转换非高斯数据

有时,当数据近似正态时,机器学习算法表现更好。

但如果你的数据不是正态的呢?

与其改变算法,

不如转换数据。

常见的转换包括:

  • 对数转换
  • 平方根转换
  • Box-Cox 转换

这些转换可以减少偏度,使数据更容易分析。


为什么这在数据科学中很重要?

真实世界的数据很少是完美的。

一些数据集:

  • 高度偏斜
  • 充满异常值
  • 重尾
  • 分布不均

理解非高斯分布有助于我们:

  • 选择正确的统计方法
  • 构建更好的机器学习模型
  • 检测异常
  • 正确理解业务数据
  • 避免做出错误的假设

结语

当我第一次学习统计学时,

我以为每个数据集都应该看起来像钟形曲线。

但真实世界的数据教会了我相反的道理。

自然是杂乱的。

商业是杂乱的。

人类行为是杂乱的。

这正是非高斯分布存在的原因。

与其强迫每个数据集去拟合正态分布,

不如学会识别不同的模式,并为每种情况选择正确的模型。

这就是真正的数据科学。


要点总结

  • 并非每个数据集都遵循正态分布。
  • 峰度衡量极端值出现的可能性。
  • 尖顶峰度分布具有肥尾和更多异常值。
  • 平顶峰度分布具有薄尾和更少异常值。
  • 中等峰度分布表现得像正态分布。
  • 直方图、QQ 图和统计检验有助于检测正态性。
  • 均匀分布使每个值具有相等的概率。
  • 对数正态分布对正增长且右偏的数据建模。
  • 帕累托分布解释了著名的 80/20 法则。
  • 数据转换有助于将偏斜数据转换为更容易分析的形式。

如果你正在学习统计学、机器学习或数据科学,请记住一个重要教训:

不要假设每个数据集都遵循正态分布。

真正的技能是识别你的数据遵循哪种分布,并据此选择正确的工具。

一旦你理解了这一点,你就在像真正的数据科学家一样思考。

如果你没有阅读前一部分,请点击这里阅读:第4部分

学习愉快!🚀