
目录前言1. 引言2. PDF 的挑战自我报告的身高数据3. 结语结语参考前言学习 Steven Brunton 讲授的概率与统计入门概述视频本篇文章记录第三十九讲概率中的 Lebesgue 测度记录下个人学习笔记和大家一起分享交流videohttps://www.youtube.com/playlist?listPLMrJAkhIeNNR3sNYvfgiKgcStwuPSts9V1. 引言现在我想稍微岔开一下话题因为我之前在课程中曾提到过矩生成函数需要在此稍作澄清我曾提到矩生成函数是对概率密度函数的一种非常有用的变换实际上它就是随机变量X XX的概率密度函数的拉普拉斯变换。我提到过这个矩生成函数能唯一确定累积概率分布也就是变量小于等于某个特定值x xx的概率这确实有些特别。为什么我没说这唯一确定了概率密度函数 PDF 呢为什么我要提到 CDF也就是累积分布函数呢这一点非常微妙却至关重要 — 对于函数而言如此对概率分布更是如此事实上累积分布函数比概率密度函数更具普适性且更便于使用因此作为概率密度函数积分形式的累积分布函数往往比概率密度函数更具普适性且更便于使用。请记住这个累积分布函数 — 即随机变量X XX小于某个特定值的概率 — 等于概率密度函数f ( x ) f(x)f(x)从负无穷到该值的积分P ( X ≤ x ) ∫ − ∞ x f ( t ) d t P(X \le x) \int_{-\infty}^{x} f(t)dtP(X≤x)∫−∞xf(t)dt因此对于正态分布变量其累积分布函数会呈现优美的 S 型误差函数曲线即Φ \PhiΦ函数。这里需要说明的是这只是个简短的补充说明并非重点内容后续我们会详细讨论。2. PDF 的挑战自我报告的身高数据实际上概率密度函数本身可能相当复杂它可能包含δ \deltaδ函数和间断点下面我通过一个例子来说明。概率分布可能出现异常尖峰的情况上面这个概率密度函数可能会出现异常的尖峰所以这就像是一个δ \deltaδ函数对吧那我为什么要虚构一个奇怪的 PDF 呢比如上面这个函数f ( x ) f(x)f(x)它看起来像正态分布却又带着个δ \deltaδ函数。事实上如果你查看美国男性身高的统计数据无论是来自驾照、交友软件还是其他来源都会发现其分布非常接近正态分布人们的身高分布大致符合高斯分布也就是正态分布。但数据显示六英尺约 183 厘米这个身高值会出现明显的聚集现象数据显示恰好达到六英尺身高的人群数量存在异常突出的情况从统计学角度看这种现象源于社会对特定身高的偏好压力身高接近六英尺比如 5 英尺 11.5 英寸人们往往会将自己向上取整即便是 5 英尺 10.5 英寸的身高人们也可能直接报成六英尺因此在特定数值处会出现显著的峰值或不连续现象。因此尽管身高是服从高斯分布的连续随机变量但在自我报告时会出现显著的峰值聚集现象在美国男性中六英尺这个身高值确实存在这种现象。因此观察概率密度函数时会发现这是个相当棘手的函数这个函数包含一个δ \deltaδ函数这属于一类广义函数处理起来相当棘手但累积分布函数F ( x ) F(x)F(x)处理起来会稍微容易些因此累积分布函数的作用就是从左侧到右侧进行积分因此它会计算某个x xx值左侧的积分值并直接给出该结果。对于常规高斯分布我们会得到一条 S 型的误差函数曲线这里我们得到的本质上是相同的 S 型误差函数但在间断点处我们实际上会观测到一个微小跃变因此累积分布函数可以具有不连续性虽然这种间断性存在缺陷但仍具有可操作性我可以明确写出这个函数对其进行各种操作还能完成计算。而处理这类抽象的广义δ \deltaδ函数要困难得多多数情况下我们实际面对的就是这类问题这种连续分布于离散点谱的δ \deltaδ函数往往同时存在现在整个泛函分析数学领域都能处理这类函数这些函数是可积的其核心理念正是 Lebesgue 测度理论。同样地测度理论之所以重要是因为我们通常用它来度量概率因此对于这类复杂函数Lebesgue 测度理论与 Lebesgue 积分可作为 Riemann 积分的替代方案但核心思路在于我们往往更倾向于使用累积分布函数而非概率密度函数。因此当我们需要证明中心极限定理时实际上是要证明若干独立同分布随机变量之和会趋近于正态分布我们将通过证明该随机变量和的各阶矩收敛于高斯分布的对应矩来完成论证。但本质上我们将通过证明累积分布函数的收敛性来实现这一目标而非概率分布本身。当这些分布具有特殊性质时直接证明其收敛性会更为困难通过累积分布函数来证明收敛更为简便因为它的数学性质更加规整。要知道原分布的每个间断点都会在概率密度函数中造成更严重的问题因此积分运算能起到平滑作用使函数性质更规整正如对含噪数据求导会放大噪声而积分运算则能起到平滑作用对杂乱的概率分布进行积分处理能有效提升其可分析性因此我们常使用累积分布函数进行分析。3. 结语以上至少简要说明了为什么 CDF 比 PDF 更常被使用后续我们将深入探讨这一点我们将探讨 Lebesgue 理论我们将讨论测度论、测度空间以及更抽象的理论体系但我想先简要说明为何会出现这种情况。结语本讲以 “为什么 MGF 唯一确定的是 CDF 而非 PDF” 这一看似技术性的问题为引揭示了概率论数学基础中一个深刻的实践智慧CDF 几乎在所有方面都比 PDF 更适合作为概率的 “原生对象”。Brunton 以自我报告的身高数据为例给出了精彩的直观说明美国男性的身高近似正态分布但在 6 英尺183 cm处因社会取整效应产生了一个δ \deltaδ函数式的概率质量堆积—身高 5’11.5 的人自称 6’0。这种 “连续分布 离散点谱” 的混合结构在 PDF 中表现为一个难以处理的广义函数δ \deltaδ尖峰而在 CDF 中仅表现为一个温和的跳跃间断。这一对比背后隐藏着积分运算的核心品质积分平滑求导放大。CDF 是 PDF 的积分—如同对含噪信号做移动平均PDF 中的δ \deltaδ奇点、间断、振荡等所有 “脏” 特征在积分后都被驯化为连续的、单调的、有界变差的规整函数。测度论Lebesgue 测度与 Lebesgue 积分正是为了处理这类 Riemann 积分框架下难以直接操作的广义函数和混合分布而发展的数学基础设施—它将概率直接定义为集合上的测度P ( A ) P(A)P(A)无需经过 PDF 这一中间层。这对 CLT 证明策略的影响是决定性的当我们需要证明样本均值的分布收敛于正态分布时选择证明 CDF 的逐点收敛而非 PDF 的逐点收敛是数学上更为稳健的路径—CDF 的单调性和有界性使得极限交换更为合理而 PDF 可能因δ \deltaδ峰、振荡等病态行为使得逐点收敛无法成立。本讲虽然在课程中是 “岔开话题” 的补充说明却道出了高等概率论从 Riemann 积分走向 Lebesgue 积分的核心动机 。参考https://www.youtube.com/playlist?listPLMrJAkhIeNNR3sNYvfgiKgcStwuPSts9V