无处不在的正态分布
问题提出
呼噜星球的统计学家收集了大量数据:人的身高、考试成绩、测量误差、农作物产量……他们发现了一个惊人的规律:
这些看似毫不相关的数据,它们的分布形状都像一口”钟”——中间高、两边低、左右对称。
这种分布就是正态分布(也叫高斯分布)。
一个学生问:
老师,正态分布的公式里为什么有 e?这个 e 和我们一直在探索的自然常数 e 是同一个吗?
我在黑板上写下正态分布的概率密度函数:
f(x)=σ2π1e−2σ2(x−μ)2
“没错,“我说,“这里的 e 就是我们一直在探索的自然常数。今天我们就来看看,e 为什么会出现在这个’无处不在’的分布里。“
观察与猜想
让我们从最简单的情况开始:抛硬币。
抛 n 次硬币,正面朝上的次数 X 服从二项分布 B(n,21):
P(X=k)=(kn)(21)n
当 n 很大时,二项分布的形状会怎样?
学生们计算了一些值:
- n=10:已经有点像钟形了
- n=100:钟形更明显
- n=1000:非常光滑的钟形曲线
他们猜想:当 n→∞ 时,二项分布会趋向一个连续的分布,而且这个分布里可能有 e。
为什么会有 e?因为二项分布里有阶乘,而阶乘的渐近近似(斯特林公式)里就有 e:
n!≈2πn(en)n
严格证明
从二项分布到正态分布(中心极限定理的特例)
设 Xn∼B(n,21),标准化后:
Zn=n/2Xn−n/2
我们要证明 Zn 的分布趋向标准正态分布 N(0,1)。
利用斯特林公式 n!≈2πn(n/e)n,对二项分布概率做渐近展开:
P(Xn=k)=k!(n−k)!n!⋅2n1
令 k=2n+xn,代入并化简(过程较繁琐,这里给出结果),当 n→∞ 时:
P(Xn=k)≈nπ/21⋅e−2x2⋅n1
转换为密度函数,得到:
f(x)=2π1e−2x2
这就是标准正态分布的概率密度函数!
一般正态分布
对标准正态分布做平移和缩放,得到一般正态分布 N(μ,σ2):
f(x)=σ2π1e−2σ2(x−μ)2
其中:
- μ 是均值(决定中心位置)
- σ 是标准差(决定分布的”胖瘦”)
归一化验证:高斯积分
概率密度函数必须满足 ∫−∞∞f(x)dx=1。
对标准正态分布:
I=∫−∞∞e−2x2dx
这个积分就是著名的高斯积分。我们来计算它:
I2=(∫−∞∞e−2x2dx)(∫−∞∞e−2y2dy)=∫−∞∞∫−∞∞e−2x2+y2dxdy
转换为极坐标(x=rcosθ,y=rsinθ,dxdy=rdrdθ):
I2=∫02π∫0∞e−2r2rdrdθ=2π∫0∞e−2r2rdr
令 u=2r2,du=rdr:
I2=2π∫0∞e−udu=2π⋅1=2π
所以 I=2π,即:
∫−∞∞e−2x2dx=2π
因此 2π1e−2x2 的积分确实等于 1,归一化成立。
注意:这里 e 再次发挥了关键作用——正是因为 e−u 的积分等于 1,高斯积分才能得到简洁的结果。
为什么正态分布无处不在?——中心极限定理
中心极限定理:大量独立同分布的随机变量之和,经过标准化后,趋向正态分布。
这就是为什么正态分布无处不在:
- 人的身高 = 基因 + 营养 + 环境 + ……(大量因素叠加)
- 测量误差 = 仪器误差 + 环境误差 + 人为误差 + ……
- 考试成绩 = 各种知识点掌握程度的叠加
只要一个现象是大量独立随机因素的叠加结果,它的分布就会趋向正态分布。而正态分布的密度函数中,e 是核心成分。
正态分布的数字特征
- 均值:E[X]=μ
- 方差:Var(X)=σ2
- 约 68% 的数据在 μ±σ 范围内
- 约 95% 的数据在 μ±2σ 范围内
- 约 99.7% 的数据在 μ±3σ 范围内(“3σ 原则”)
结论与应用
- 正态分布密度:f(x)=σ2π1e−2σ2(x−μ)2
- e 的来源:二项分布的斯特林近似中包含 e,极限过渡后保留在密度函数中
- 高斯积分:∫−∞∞e−x2/2dx=2π,保证了归一化
- 中心极限定理:大量独立因素的叠加趋向正态分布,解释了其”无处不在”
呼噜星球的学生们感叹道:
原来 e 不仅在微积分和复数里,还藏在我们每天遇到的各种数据分布里!从身高到考试成绩,背后都有 e 的身影。
我总结道:
从复利到微积分,从复数到概率,e 一次又一次地出现在看似无关的领域中。这正是数学常数的魅力——它们是不同领域之间的隐秘纽带。
接下来,我们将回到纯数学,追问一个关于 e 身份的终极问题:e 是超越数吗?