2.1 随机变量与分布
离散概率空间上的随机变量
在做随机试验的时候,我们经常会关注样本点的某些性质。比如,假设我们在班上随机选一个同学,我们会想知道该同学的身高。或者,我们随机投掷两个骰子,我们想知道两个骰子的点数和。这儿,同学的身高和骰子的点数和均是定义在样本空间 Ω \Omega Ω 上的函数,这也是我们所谓随机变量的定义。
我们固定一个概率空间 ( Ω , F , P ) (\Omega,\mathcal F,\mathbb P) ( Ω , F , P ) 。我们今天所有的讨论均假设 Ω \Omega Ω 是离散的,即它是有限的或者可数的,并且 F = 2 Ω \mathcal F=2^\Omega F = 2 Ω 。这么做的目的是让大家尽快地接触到概率论里面的一些核心概念并建立相应的直观。事实上,本课程的主要目的之一便是在一般的样本空间上定义相关的概念,这也是我们之后会讨论的话题。
定义 2.1 实值随机变量
一个(实值)随机变量 X X X 指的是从 Ω \Omega Ω 到 R \mathbb R R 的函数,即
X : ω ∈ Ω ⟼ X ( ω ) ∈ R .
X\colon \omega\in\Omega\longmapsto X(\omega)\in\mathbb R.
X : ω ∈ Ω ⟼ X ( ω ) ∈ R .
所以实际上,随机变量它既不随机,也不是变量,它仅仅是一个从样本集到实数集的函数而已。对于一般的样本空间,我们会要求 X X X 是可测(measurable)的。但我们这儿取的 F = 2 Ω \mathcal F=2^\Omega F = 2 Ω ,因此,任意一个函数均是随机变量。
例 2.1 (随机选一个同学的身高) 比如说,在从班上随机选人的例子里,概率空间 Ω \Omega Ω 是班上所有同学的集合,F = 2 Ω \mathcal F=2^\Omega F = 2 Ω ,而 P \mathbb P P 是均匀测度。我们定义 X X X ,满足对于每一个 ω ∈ Ω \omega\in\Omega ω ∈ Ω ,X ( ω ) X(\omega) X ( ω ) 等于同学 ω \omega ω 的身高,这便是一个随机变量。
我们经常会关心一类特殊的随机变量,即所谓的指示变量。对于事件 A ∈ F A\in\mathcal F A ∈ F ,我们定义
定义 2.2 指示变量
1 A : ω ∈ Ω ⟼ { 1 , if ω ∈ A , 0 , if ω ∉ A .
\mathbf 1_A\colon \omega\in\Omega\longmapsto
\begin{cases}
1,&\text{if }\omega\in A,\\
0,&\text{if }\omega\notin A.
\end{cases}
1 A : ω ∈ Ω ⟼ { 1 , 0 , if ω ∈ A , if ω ∈ / A .
换句话说,1 A \mathbf 1_A 1 A 用来指示样本点 ω ∈ Ω \omega\in\Omega ω ∈ Ω 是否在集合 A A A 中。
一些新的记号
我们通常会关心关于随机变量的一些问题,比如“随机选一个同学,身高不超过170的概率是多大”。我们因此需要引入一些新的记号,比如对于 a ∈ R a\in\mathbb R a ∈ R ,定义记号形如 P ( X ≤ a ) \mathbb P(X\le a) P ( X ≤ a ) 。事实上,我们有
P ( X ≤ a ) ≔ P ( { X ≤ a } ) ,
\mathbb P(X\le a)\coloneqq\mathbb P(\{X\le a\}),
P ( X ≤ a ) : = P ({ X ≤ a }) ,
其中 { X ≤ a } ≔ { ω ∈ Ω : X ( ω ) ≤ a } \{X\le a\}\coloneqq\{\omega\in\Omega:X(\omega)\le a\} { X ≤ a } : = { ω ∈ Ω : X ( ω ) ≤ a } 。有了这个定义,我们便可以用 P ( X ≤ 170 ) \mathbb P(X\le170) P ( X ≤ 170 ) 来表示随机选一个同学,身高不超过170的概率了。注意到,这儿的 P \mathbb P P 就是概率空间里面的 P \mathbb P P ,它的输入是 { X ≤ a } \{X\le a\} { X ≤ a } ,这是一个 F \mathcal F F 中的集合。因此,这是良定义的。
类似地,对于任何一个集合 A ∈ B A\in\mathcal B A ∈ B ,我们用 { X ∈ A } \{X\in A\} { X ∈ A } 表示 { ω ∈ Ω : X ( ω ) ∈ A } \{\omega\in\Omega:X(\omega)\in A\} { ω ∈ Ω : X ( ω ) ∈ A } 。因此,可以定义
P ( X ∈ A ) ≔ P ( { X ∈ A } ) .
\mathbb P(X\in A)\coloneqq\mathbb P(\{X\in A\}).
P ( X ∈ A ) : = P ({ X ∈ A }) .
我们同样可以类似地定义 P ( X ≥ a ) \mathbb P(X\ge a) P ( X ≥ a ) 、P ( X = a ) \mathbb P(X=a) P ( X = a ) 等直观的记号,这里就不再赘述了。
此外,我们有时候也用 X − 1 ( A ) X^{-1}(A) X − 1 ( A ) 来表示 { X ∈ A } \{X\in A\} { X ∈ A } ,即集合 A A A 在函数 X X X 下 Ω \Omega Ω 中的原像。
随机变量的分布
我个人认为,关于随机变量的各种术语以及黑话里面,“分布”这个词经常被误用或者滥用,我们在这里严格地把它定义清楚。考虑一个定义在离散概率空间 ( Ω , F = 2 Ω , P ) (\Omega,\mathcal F=2^\Omega,\mathbb P) ( Ω , F = 2 Ω , P ) 上的随机变量 X : Ω → R X\colon\Omega\to\mathbb R X : Ω → R 。设 ( R , B ) (\mathbb R,\mathcal B) ( R , B ) 是实数及其上面的 Borel 集的集合。我们可以定义出一个集合函数 μ X : B → R \mu_X\colon\mathcal B\to\mathbb R μ X : B → R ,满足
∀ A ∈ B , μ X ( A ) = P ( X ∈ A ) .
\forall A\in\mathcal B,\qquad \mu_X(A)=\mathbb P(X\in A).
∀ A ∈ B , μ X ( A ) = P ( X ∈ A ) .
那么,μ X \mu_X μ X 被称为 X X X 的分布(distribution),或者是 X X X 的律(law)。我们接着验证,μ X \mu_X μ X 是 ( R , B ) (\mathbb R,\mathcal B) ( R , B ) 上的一个概率测度。
命题 2.3 随机变量的分布是概率测度
( R , B , μ X ) (\mathbb R,\mathcal B,\mu_X) ( R , B , μ X ) 是一个概率空间。
证明
我们只需要使用概率空间的定义进行验证即可。
首先 μ X ( ∅ ) = P ( X − 1 ( ∅ ) ) = P ( ∅ ) = 0 \mu_X(\varnothing)=\mathbb P(X^{-1}(\varnothing))=\mathbb P(\varnothing)=0 μ X ( ∅ ) = P ( X − 1 ( ∅ )) = P ( ∅ ) = 0 。
其次,对于任何 A ∈ B A\in\mathcal B A ∈ B ,μ X ( A c ) = P ( X − 1 ( A c ) ) = P ( Ω ∖ X − 1 ( A ) ) = 1 − P ( X − 1 ( A ) ) = 1 − μ X ( A ) \mu_X(A^c)=\mathbb P(X^{-1}(A^c))=\mathbb P(\Omega\setminus X^{-1}(A))=1-\mathbb P(X^{-1}(A))=1-\mu_X(A) μ X ( A c ) = P ( X − 1 ( A c )) = P ( Ω ∖ X − 1 ( A )) = 1 − P ( X − 1 ( A )) = 1 − μ X ( A ) 。
设不相交的集合 A 1 , A 2 , … ∈ B A_1,A_2,\ldots\in\mathcal B A 1 , A 2 , … ∈ B ,它们的原像 X − 1 ( A 1 ) , X − 1 ( A 2 ) , … X^{-1}(A_1),X^{-1}(A_2),\ldots X − 1 ( A 1 ) , X − 1 ( A 2 ) , … 也是不相交的。因此
μ X ( ⋃ n ≥ 1 A n ) = P ( X − 1 ( ⋃ n ≥ 1 A n ) ) = P ( ⋃ n ≥ 1 X − 1 ( A n ) ) = ∑ n ≥ 1 P ( X − 1 ( A n ) ) = ∑ n ≥ 1 μ X ( A n ) .
\begin{aligned}
\mu_X\left(\bigcup_{n\ge1}A_n\right)
&=\mathbb P\left(X^{-1}\left(\bigcup_{n\ge1}A_n\right)\right)
=\mathbb P\left(\bigcup_{n\ge1}X^{-1}(A_n)\right)\\
&=\sum_{n\ge1}\mathbb P(X^{-1}(A_n))
=\sum_{n\ge1}\mu_X(A_n).
\end{aligned}
μ X ( n ≥ 1 ⋃ A n ) = P ( X − 1 ( n ≥ 1 ⋃ A n ) ) = P ( n ≥ 1 ⋃ X − 1 ( A n ) ) = n ≥ 1 ∑ P ( X − 1 ( A n )) = n ≥ 1 ∑ μ X ( A n ) .
在我们讨论的场合里,由于 X X X 是定义在可数集上的函数,它的值域最多包含可数个点。我们用 Im ( X ) = { x 1 , x 2 , … } \operatorname{Im}(X)=\{x_1,x_2,\ldots\} Im ( X ) = { x 1 , x 2 , … } 来表示。我们也因此称 X X X 为离散随机变量 。显然,X X X 的分布由 X X X 取 Im ( X ) \operatorname{Im}(X) Im ( X ) 中值的概率唯一确定,即
∀ A ∈ B , μ X ( A ) = ∑ a ∈ Im ( X ) ∩ A P ( X = a ) .
\forall A\in\mathcal B,\qquad
\mu_X(A)=\sum_{a\in\operatorname{Im}(X)\cap A}\mathbb P(X=a).
∀ A ∈ B , μ X ( A ) = a ∈ Im ( X ) ∩ A ∑ P ( X = a ) .
因此,我们可以定义一个函数 p X : R → [ 0 , 1 ] p_X\colon\mathbb R\to[0,1] p X : R → [ 0 , 1 ] ,满足对于任何 x ∈ Im ( X ) x\in\operatorname{Im}(X) x ∈ Im ( X ) ,p X ( x ) = P ( X = x ) p_X(x)=\mathbb P(X=x) p X ( x ) = P ( X = x ) ,且在 R ∖ Im ( X ) \mathbb R\setminus\operatorname{Im}(X) R ∖ Im ( X ) 上的定义都是零。这个被称之为概率质量函数(probability mass function, pmf)。概率质量函数唯一确定了随机变量的分布 μ X \mu_X μ X 。
分布的例子
我们来看几个分布的例子。
我们考察扔一个(不一定均匀)硬币的例子。对于给定的 p ∈ [ 0 , 1 ] p\in[0,1] p ∈ [ 0 , 1 ] ,定义样本空间 Ω = { H , T } \Omega=\{H,T\} Ω = { H , T } ,F = 2 Ω \mathcal F=2^\Omega F = 2 Ω ,P \mathbb P P 满足 P ( { H } ) = p \mathbb P(\{H\})=p P ({ H }) = p ,P ( { T } ) = 1 − p \mathbb P(\{T\})=1-p P ({ T }) = 1 − p 。我们考虑随机变量 X : Ω → R X\colon\Omega\to\mathbb R X : Ω → R 满足 X ( H ) = 1 X(H)=1 X ( H ) = 1 、X ( T ) = 0 X(T)=0 X ( T ) = 0 。换句话说,随机变量把 H H H (表示正面)映射到了1,把 T T T (表示反面)映射到了0。
我们来看 X X X 定义出来的分布 μ X \mu_X μ X 。它的概率质量函数显然满足 p X ( 1 ) = p p_X(1)=p p X ( 1 ) = p ,p X ( 0 ) = 1 − p p_X(0)=1-p p X ( 0 ) = 1 − p 。我们把这样一个分布称之为参数为 p p p 的伯努利分布(Bernoulli distribution),记作 Ber ( p ) \operatorname{Ber}(p) Ber ( p ) 。
我们考虑另外一个随机试验,即扔 n ≥ 1 n\ge1 n ≥ 1 个硬币,每个硬币都是以 p p p 的概率出现正面。这个随机试验对应的概率空间如下:Ω = { H , T } n \Omega=\{H,T\}^n Ω = { H , T } n 为所有长度为 n n n 的 H T HT H T 串的集合;F = 2 Ω \mathcal F=2^\Omega F = 2 Ω 。对于每一个 s ∈ Ω s\in\Omega s ∈ Ω ,记 h ( s ) h(s) h ( s ) 和 t ( s ) t(s) t ( s ) 分别为 s s s 中 H H H 和 T T T 的个数,并且
P ( { s } ) = p h ( s ) ( 1 − p ) t ( s ) .
\mathbb P(\{s\})=p^{h(s)}(1-p)^{t(s)}.
P ({ s }) = p h ( s ) ( 1 − p ) t ( s ) .
我们现在定义一个随机变量 Y Y Y ,用来表示做了一次这样的随机试验后,得到了多少个正面朝上的硬币。即
Y ( s ) = h ( s ) .
Y(s)=h(s).
Y ( s ) = h ( s ) .
我们来考虑 Y Y Y 的分布 μ Y \mu_Y μ Y 。显然 Im ( Y ) = { 0 , 1 , … , n } \operatorname{Im}(Y)=\{0,1,\ldots,n\} Im ( Y ) = { 0 , 1 , … , n } 。由于 Y Y Y 也是离散随机变量,μ Y \mu_Y μ Y 由 pmf p Y p_Y p Y 决定。容易计算得知
∀ k = 0 , 1 , … , n , p Y ( k ) = P ( Y = k ) = ( n k ) p k ( 1 − p ) n − k .
\forall k=0,1,\ldots,n,\qquad
p_Y(k)=\mathbb P(Y=k)=\binom nkp^k(1-p)^{n-k}.
∀ k = 0 , 1 , … , n , p Y ( k ) = P ( Y = k ) = ( k n ) p k ( 1 − p ) n − k .
我们把这样一个分布称为参数为 n n n 和 p p p 的二项式分布(Binomial distribution),记作 Bin ( n , p ) \operatorname{Bin}(n,p) Bin ( n , p ) 。
我们再考虑一个随机试验:不停地扔一枚正面概率为 p p p 的硬币,每次投掷相互独立,其中 0 < p ≤ 1 0<p\le1 0 < p ≤ 1 。令 G G G 表示第一次出现正面时已经投掷的次数。要使 G = k G=k G = k ,前 k − 1 k-1 k − 1 次都得是反面,而第 k k k 次必须是正面。因此,它的概率质量函数满足
∀ k = 1 , 2 , … , p G ( k ) = P ( G = k ) = ( 1 − p ) k − 1 p ,
\forall k=1,2,\ldots,\qquad
p_G(k)=\mathbb P(G=k)=(1-p)^{k-1}p,
∀ k = 1 , 2 , … , p G ( k ) = P ( G = k ) = ( 1 − p ) k − 1 p ,
在其他实数处取值为零。我们把这样一个分布称为参数为 p p p 的几何分布(Geometric distribution),记作 Geom ( p ) \operatorname{Geom}(p) Geom ( p ) 。这里的 G G G 包括成功的那一次 投掷,因而从1开始取值。
当 0 < p < 1 0<p<1 0 < p < 1 时,等比级数给出
∑ k = 1 ∞ p G ( k ) = p ∑ k = 1 ∞ ( 1 − p ) k − 1 = 1.
\sum_{k=1}^{\infty}p_G(k)
=p\sum_{k=1}^{\infty}(1-p)^{k-1}=1.
k = 1 ∑ ∞ p G ( k ) = p k = 1 ∑ ∞ ( 1 − p ) k − 1 = 1.
当 p = 1 p=1 p = 1 时,G = 1 G=1 G = 1 的概率为1。因此,这确实定义了一个概率分布。我们可以在可数样本空间 Ω ′ = { 1 , 2 , … } \Omega'=\{1,2,\ldots\} Ω ′ = { 1 , 2 , … } 上取 F ′ = 2 Ω ′ \mathcal F'=2^{\Omega'} F ′ = 2 Ω ′ 、P ′ ( { k } ) = p G ( k ) \mathbb P'(\{k\})=p_G(k) P ′ ({ k }) = p G ( k ) ,并令 G ′ ( k ) = k G'(k)=k G ′ ( k ) = k ,严格地实现这个分布;无穷长硬币序列对应的概率空间则留待后面构造。我们在2.5节还会回到这个例子,计算它的期望和方差。
“分布”一词容易混淆的地方
我们前文出现“分布”这个词的时候,实际上指了两件事:
给定一个具体的概率空间,一个定义在这个概率空间上的随机变量 X X X ,该随机变量诱导出的分布 μ X \mu_X μ X ;
一个具体的概率质量函数定义出来的分布,比如 Ber ( p ) \operatorname{Ber}(p) Ber ( p ) 或者 Bin ( n , p ) \operatorname{Bin}(n,p) Bin ( n , p ) 。
在教科书或者文献中,我们经常会看到形如“设 X ∼ Ber ( p ) X\sim\operatorname{Ber}(p) X ∼ Ber ( p ) ”,或者等价地,“设 X X X 为满足参数为 p p p 的伯努利分布的随机变量”。这句话往往让人费解。按照定义,X X X 应该是一个从概率空间到实数的一个函数,当我们这样“设”出来的时候,究竟这个函数,或者说概率空间究竟是什么?
例 2.2 (分布不同的实现) 同一个分布,可能对应了不同的随机变量。比如说,我们设 Y ∼ Bin ( n , p ) Y\sim\operatorname{Bin}(n,p) Y ∼ Bin ( n , p ) ,实际上,我们理解成构造一个随机变量 Y Y Y ,使得其诱导出来的分布 μ Y \mu_Y μ Y 为 Bin ( n , p ) \operatorname{Bin}(n,p) Bin ( n , p ) 。对于定义 Y Y Y 的方式,包括函数的形式以及对应的概率空间,它的选择并不是唯一的。比如说,我们可以选择上述引入二项式分布时候介绍的扔 n n n 个硬币所定义出来的概率空间和 Y Y Y ,也可以选择下面这个看起来有点“平凡”的概率空间:
Ω ′ = { 0 , 1 , … , n } , F ′ = 2 Ω ′ ,
\Omega'=\{0,1,\ldots,n\},\qquad
\mathcal F'=2^{\Omega'},
Ω ′ = { 0 , 1 , … , n } , F ′ = 2 Ω ′ ,
以及
∀ k ∈ Ω ′ , P ′ ( { k } ) = ( n k ) p k ( 1 − p ) n − k .
\forall k\in\Omega',\qquad
\mathbb P'(\{k\})=\binom nkp^k(1-p)^{n-k}.
∀ k ∈ Ω ′ , P ′ ({ k }) = ( k n ) p k ( 1 − p ) n − k .
然后,我们定义随机变量 Y ′ : k ↦ k Y'\colon k\mapsto k Y ′ : k ↦ k 。显然,Y ′ Y' Y ′ 的分布也是 Bin ( n , p ) \operatorname{Bin}(n,p) Bin ( n , p ) 。
那么问题来了,我们究竟用哪个?这取决于应用。在很多应用中,我们可能只关心 pmf 的性质,那选择哪样定义的 Y Y Y 其实无所谓。并且,容易想到,我们定义 Y ′ Y' Y ′ 的方式,可以推广到任何分布上,但这个定义丧失了分布本身的“结构”,或者说“组合含义”。在有一些应用中,比如我们今天最后会讲到的使用期望的线性性来计算二项式分布的期望的时候,选择 Ω = { H , T } n \Omega=\{H,T\}^n Ω = { H , T } n 这样有着更加丰富组合结构的概率空间,会更加方便。
2.2 离散期望
随机变量的期望
随机变量的一个重要的“数字特征”,便是它的期望。它可以想象成当我们做随机试验的时候,X ( ω ) X(\omega) X ( ω ) 的平均值。它的定义,并不是特别平凡的。我们今天先从定义在离散概率空间上的随机变量开始。
假设 X X X 是定义在离散概率空间 ( Ω , F , P ) (\Omega,\mathcal F,\mathbb P) ( Ω , F , P ) 上的一个随机变量,它的值域 Im ( X ) = { x 1 , … , x n , … } \operatorname{Im}(X)=\{x_1,\ldots,x_n,\ldots\} Im ( X ) = { x 1 , … , x n , … } 。我们尝试把它的期望定义为 ∑ x ∈ Im ( X ) x ⋅ P ( X = x ) \sum_{x\in\operatorname{Im}(X)}x\cdot\mathbb P(X=x) ∑ x ∈ Im ( X ) x ⋅ P ( X = x ) 。但这个求和可能是个无穷级数,因此,我们要对其行为进行控制。因此,要进行更加细致的讨论。
我们首先设 { Λ i } i ≥ 1 \{\Lambda_i\}_{i\ge1} { Λ i } i ≥ 1 是对样本空间的一个划分,并且对于任何 i ≥ 1 i\ge1 i ≥ 1 ,X X X 在 Λ i \Lambda_i Λ i 上是常数,即对于任何 ω , ω ′ ∈ Λ i \omega,\omega'\in\Lambda_i ω , ω ′ ∈ Λ i ,X ( ω ) = X ( ω ′ ) X(\omega)=X(\omega') X ( ω ) = X ( ω ′ ) 。这样的一个划分肯定是存在的,比如我们可以设 Λ i = X − 1 ( x i ) \Lambda_i=X^{-1}(x_i) Λ i = X − 1 ( x i ) 。但是,我们这儿给出的划分定义更加一般,因为我们允许对于 i ≠ j i\ne j i = j 、ω ∈ Λ i \omega\in\Lambda_i ω ∈ Λ i 、ω ′ ∈ Λ j \omega'\in\Lambda_j ω ′ ∈ Λ j ,有 X ( ω ) = X ( ω ′ ) X(\omega)=X(\omega') X ( ω ) = X ( ω ′ ) 。我们设对于 ω ∈ Λ i \omega\in\Lambda_i ω ∈ Λ i ,X ( ω ) = z i X(\omega)=z_i X ( ω ) = z i (刚才说了,我们允许 i ≠ j i\ne j i = j 、z i = z j z_i=z_j z i = z j )。
我们称随机变量 X X X 是可积 (integrable)的,当且仅当级数 ∑ i = 1 ∞ z i P ( Λ i ) \sum_{i=1}^{\infty}z_i\mathbb P(\Lambda_i) ∑ i = 1 ∞ z i P ( Λ i ) 是绝对收敛的,或者等价地,
∑ i = 1 ∞ ∣ z i ∣ P ( Λ i ) < ∞ .
\sum_{i=1}^{\infty}|z_i|\mathbb P(\Lambda_i)<\infty.
i = 1 ∑ ∞ ∣ z i ∣ P ( Λ i ) < ∞.
如果一个随机变量 X X X 是可积的,我们就把它的期望 E [ X ] \mathbb E[X] E [ X ] 定义为
E [ X ] = ∑ i = 1 ∞ z i P ( Λ i ) .
\mathbb E[X]=\sum_{i=1}^{\infty}z_i\mathbb P(\Lambda_i).
E [ X ] = i = 1 ∑ ∞ z i P ( Λ i ) .
关于这个定义,小朋友一定有很多问号,包括但可能不限于:
这个定义依赖于一个不唯一的分划,它是良定义的吗?
为什么要求级数收敛?
为什么要求级数绝对收敛?
我们先回答后两个问题。首先,根据我们的定义,一定有 ∣ E [ X ] ∣ < ∞ |\mathbb E[X]|<\infty ∣ E [ X ] ∣ < ∞ 。实际上,这个要求是为了我们目前理论开展的方便。我们在不久的未来就会把期望拓展到无穷的情况。所以,我们暂时只允许期望取有限值。其次,为什么要绝对收敛。原因很简单,如果一个级数只是条件收敛,那么变换求和的顺序就可能得到不同的极限值,我们不希望一个随机变量的“平均值”会随着求和的顺序不同而不一样。
回到第一个问题,这个定义是良定义的吗?事实上,我们可以把所有的 { Λ i } i ≥ 1 \{\Lambda_i\}_{i\ge1} { Λ i } i ≥ 1 进行分类,如果 z i = z j z_i=z_j z i = z j ,我们就认为其为一类。我们在计算级数 ∑ i = 1 ∞ z i P ( Λ i ) \sum_{i=1}^{\infty}z_i\mathbb P(\Lambda_i) ∑ i = 1 ∞ z i P ( Λ i ) 的时候,可以先按照 z i z_i z i 所有可能的取值进行求和,这对应于对 x i x_i x i 进行求和,再对于同一类里面的 Λ j \Lambda_j Λ j 进行求和,它们一起构成了 X − 1 ( x i ) X^{-1}(x_i) X − 1 ( x i ) :
∑ i = 1 ∞ z i P ( Λ i ) = ∑ i = 1 ∞ x i ∑ j ≥ 1 : z j = x i P ( Λ j ) = ∑ i = 1 ∞ x i P ( X = x i ) .
\begin{aligned}
\sum_{i=1}^{\infty}z_i\mathbb P(\Lambda_i)
&=\sum_{i=1}^{\infty}x_i
\sum_{j\ge1:z_j=x_i}\mathbb P(\Lambda_j)\\
&=\sum_{i=1}^{\infty}x_i\mathbb P(X=x_i).
\end{aligned}
i = 1 ∑ ∞ z i P ( Λ i ) = i = 1 ∑ ∞ x i j ≥ 1 : z j = x i ∑ P ( Λ j ) = i = 1 ∑ ∞ x i P ( X = x i ) .
这就说明了,这个求和与我们选择的分划无关(只需要满足在每一个 Λ i \Lambda_i Λ i 内 X X X 是常数)。注意到,所有这些求和可以随意交换的性质,是该级数绝对收敛所保证的。
我们使用这个分划的语言,而不是直接用 ∑ i = 1 ∞ x i P ( X = x i ) \sum_{i=1}^{\infty}x_i\mathbb P(X=x_i) ∑ i = 1 ∞ x i P ( X = x i ) 来定义期望,是为了一些证明的方便。比如说,我们假设 Ω = { ω 1 , ω 2 , … } \Omega=\{\omega_1,\omega_2,\ldots\} Ω = { ω 1 , ω 2 , … } ,我们可以令 Λ i = { ω i } \Lambda_i=\{\omega_i\} Λ i = { ω i } ,则我们得到期望的另一个表达式
E [ X ] = ∑ ω ∈ Ω X ( ω ) P ( { ω } ) .
\mathbb E[X]
=\sum_{\omega\in\Omega}X(\omega)\mathbb P(\{\omega\}).
E [ X ] = ω ∈ Ω ∑ X ( ω ) P ({ ω }) .
这个和 ∑ i = 1 ∞ x i P ( X = x i ) \sum_{i=1}^{\infty}x_i\mathbb P(X=x_i) ∑ i = 1 ∞ x i P ( X = x i ) 相比,我们分别对函数 X X X 的“左边”和“右边”加权求和,并得到了一样的值。这种 double counting 的技巧,在处理某些问题的时候会非常有用。
无穷的期望
我们有的时候也会涉及到无穷的期望。我们这里仅对非负的随机变量定义它。对于一般的场合,我们在未来再讨论。
定义 2.4 非负随机变量的期望
如果 X ≥ 0 X\ge0 X ≥ 0 ,我们定义
E [ X ] = ∑ x ∈ Im ( X ) x P ( X = x ) ∈ [ 0 , + ∞ ] .
\mathbb E[X]
=\sum_{x\in\operatorname{Im}(X)}x\mathbb P(X=x)
\in[0,+\infty].
E [ X ] = x ∈ Im ( X ) ∑ x P ( X = x ) ∈ [ 0 , + ∞ ] .
这里允许 E [ X ] = + ∞ \mathbb E[X]=+\infty E [ X ] = + ∞ 。对于一般的实值随机变量,我们仍然在 E [ ∣ X ∣ ] < ∞ \mathbb E[|X|]<\infty E [ ∣ X ∣ ] < ∞ 时称它可积,并定义有限的 E [ X ] \mathbb E[X] E [ X ] 。
例 2.3 (随机变量处处有限,期望仍可能无穷) 令 X X X 取值 2 , 4 , 8 , … 2,4,8,\ldots 2 , 4 , 8 , … ,并规定
P ( X = 2 k ) = 2 − k , k = 1 , 2 , …
\mathbb P(X=2^k)=2^{-k},
\qquad k=1,2,\ldots
P ( X = 2 k ) = 2 − k , k = 1 , 2 , …
因为 ∑ k ≥ 1 2 − k = 1 \sum_{k\ge1}2^{-k}=1 ∑ k ≥ 1 2 − k = 1 ,这确实给出了一个概率分布。每一次试验得到的 X X X 都是有限数,但
E [ X ] = ∑ k ≥ 1 2 k 2 − k = ∑ k ≥ 1 1 = + ∞ .
\mathbb E[X]
=\sum_{k\ge1}2^k2^{-k}
=\sum_{k\ge1}1
=+\infty.
E [ X ] = k ≥ 1 ∑ 2 k 2 − k = k ≥ 1 ∑ 1 = + ∞.
“每次都有限”和“平均值有限”是两件不同的事情。
我们来计算一下二项式分布 Y ∼ Bin ( n , p ) Y\sim\operatorname{Bin}(n,p) Y ∼ Bin ( n , p ) 的期望。根据定义,我们有
E [ Y ] = ∑ k = 0 n k ( n k ) p k ( 1 − p ) n − k = n p ∑ k = 0 n − 1 ( n − 1 k ) p k ( 1 − p ) n − 1 − k = n p .
\begin{aligned}
\mathbb E[Y]
&=\sum_{k=0}^n k\binom nkp^k(1-p)^{n-k}\\
&=np\sum_{k=0}^{n-1}\binom{n-1}{k}p^k(1-p)^{n-1-k}\\
&=np.
\end{aligned}
E [ Y ] = k = 0 ∑ n k ( k n ) p k ( 1 − p ) n − k = n p k = 0 ∑ n − 1 ( k n − 1 ) p k ( 1 − p ) n − 1 − k = n p .
LOTUS
我们今天来讨论离散随机变量的期望的一些基本性质,这些性质在解决具体问题中起着非常重要的作用。
下面这个结论,被称之为 LOTUS(law of the unconscious statistician),原因是它是如此显然,以至于在很多书上被直接当成期望的定义。实际上,它是我们刚才定义的期望的一个推论,是需要证明的。我们说一个函数 f : R → R f\colon\mathbb R\to\mathbb R f : R → R 是可测的,当且仅当对于任何 A ∈ B A\in\mathcal B A ∈ B ,f − 1 ( A ) ∈ B f^{-1}(A)\in\mathcal B f − 1 ( A ) ∈ B 。我们未来会仔细讨论“可测性”的问题,现在大家不用太在意这个条件。对于可测的 f f f ,f ( X ) : ω ↦ f ( X ( ω ) ) f(X)\colon\omega\mapsto f(X(\omega)) f ( X ) : ω ↦ f ( X ( ω )) 也是一个随机变量。
命题 2.5 Law of the Unconscious Statistician (LOTUS)
对于可测函数 f f f ,如果满足
∑ i = 1 ∞ ∣ f ( x i ) ∣ P ( X = x i ) < ∞ ,
\sum_{i=1}^{\infty}|f(x_i)|\mathbb P(X=x_i)<\infty,
i = 1 ∑ ∞ ∣ f ( x i ) ∣ P ( X = x i ) < ∞ ,
则随机变量 f ( X ) f(X) f ( X ) 是可积的,并且
E [ f ( X ) ] = ∑ i = 1 ∞ f ( x i ) P ( X = x i ) .
\mathbb E[f(X)]
=\sum_{i=1}^{\infty}f(x_i)\mathbb P(X=x_i).
E [ f ( X )] = i = 1 ∑ ∞ f ( x i ) P ( X = x i ) .
如果 f ( X ) ≥ 0 f(X)\ge0 f ( X ) ≥ 0 ,上式同样成立,并允许两边为 + ∞ +\infty + ∞ 。
证明
我们考虑一个分划 { Λ i } i ≥ 1 \{\Lambda_i\}_{i\ge1} { Λ i } i ≥ 1 ,Λ i = X − 1 ( x i ) \Lambda_i=X^{-1}(x_i) Λ i = X − 1 ( x i ) 。那么 f ( X ) f(X) f ( X ) 在每个 Λ i \Lambda_i Λ i 上均为常数 f ( x i ) f(x_i) f ( x i ) 。条件保证了可积性,因此,
E [ f ( X ) ] = ∑ i ≥ 1 f ( x i ) P ( Λ i ) = ∑ i ≥ 1 f ( x i ) P ( X = x i ) .
\mathbb E[f(X)]
=\sum_{i\ge1}f(x_i)\mathbb P(\Lambda_i)
=\sum_{i\ge1}f(x_i)\mathbb P(X=x_i).
E [ f ( X )] = i ≥ 1 ∑ f ( x i ) P ( Λ i ) = i ≥ 1 ∑ f ( x i ) P ( X = x i ) .
非负情形使用同一个分划;因为所有项非负,重新分组仍然合法。
期望的线性性
下面一个结论,被称为期望的线性性(linearity of expectation),是非常有用的性质。我们在未来真的用概率论解决一些问题的时候,会发现其妙用无穷。我们现在,先证明它。
命题 2.6 期望的线性性
如果定义在同一个概率空间上的随机变量 X X X 和 Y Y Y 都是可积的,那么对于 a , b ∈ R a,b\in\mathbb R a , b ∈ R ,a X + b Y aX+bY a X + bY 也是可积的,并且有
E [ a X + b Y ] = a E [ X ] + b E [ Y ] .
\mathbb E[aX+bY]=a\mathbb E[X]+b\mathbb E[Y].
E [ a X + bY ] = a E [ X ] + b E [ Y ] .
证明 . 我们先证明 a X + b Y aX+bY a X + bY 是可积的。我们可以给概率空间找到一个划分 { Λ i } i ≥ 1 \{\Lambda_i\}_{i\ge1} { Λ i } i ≥ 1 ,满足 X X X 和 Y Y Y 在每个 Λ i \Lambda_i Λ i 上都是常数。对于每一个 i ≥ 1 i\ge1 i ≥ 1 ,我们记这个常数为 x i x_i x i 和 y i y_i y i 。于是,
∑ i ≥ 1 ∣ a x i + b y i ∣ P ( Λ i ) ≤ ∑ i ≥ 1 ( ∣ a ∣ ∣ x i ∣ + ∣ b ∣ ∣ y i ∣ ) P ( Λ i ) = ∑ i ≥ 1 ∣ a ∣ ∣ x i ∣ P ( Λ i ) + ∑ i ≥ 1 ∣ b ∣ ∣ y i ∣ P ( Λ i ) = ∣ a ∣ E [ ∣ X ∣ ] + ∣ b ∣ E [ ∣ Y ∣ ] < ∞ .
\begin{aligned}
\sum_{i\ge1}|ax_i+by_i|\mathbb P(\Lambda_i)
&\le\sum_{i\ge1}\bigl(|a||x_i|+|b||y_i|\bigr)\mathbb P(\Lambda_i)\\
&=\sum_{i\ge1}|a||x_i|\mathbb P(\Lambda_i)
+\sum_{i\ge1}|b||y_i|\mathbb P(\Lambda_i)\\
&=|a|\mathbb E[|X|]+|b|\mathbb E[|Y|]\\
&<\infty.
\end{aligned}
i ≥ 1 ∑ ∣ a x i + b y i ∣ P ( Λ i ) ≤ i ≥ 1 ∑ ( ∣ a ∣∣ x i ∣ + ∣ b ∣∣ y i ∣ ) P ( Λ i ) = i ≥ 1 ∑ ∣ a ∣∣ x i ∣ P ( Λ i ) + i ≥ 1 ∑ ∣ b ∣∣ y i ∣ P ( Λ i ) = ∣ a ∣ E [ ∣ X ∣ ] + ∣ b ∣ E [ ∣ Y ∣ ] < ∞.
对于期望的表达式,我们可以重复上述计算,把所有的绝对值去掉,并且把不等号换成等号即可。
我们可以使用数学归纳法,把上述结论推广到任意 n n n 个随机变量。即如果定义在同一个概率空间上的随机变量 X 1 , … , X n X_1,\ldots,X_n X 1 , … , X n 均是可积的,那么 ∑ i = 1 n a i X i \sum_{i=1}^na_iX_i ∑ i = 1 n a i X i 也是可积的,并且
E [ ∑ i = 1 n a i X i ] = ∑ i = 1 n a i E [ X i ] .
\mathbb E\left[\sum_{i=1}^na_iX_i\right]
=\sum_{i=1}^na_i\mathbb E[X_i].
E [ i = 1 ∑ n a i X i ] = i = 1 ∑ n a i E [ X i ] .
回到二项式分布
我们前面已经通过期望的定义,计算了对于 Y ∼ Bin ( n , p ) Y\sim\operatorname{Bin}(n,p) Y ∼ Bin ( n , p ) ,其期望 E [ Y ] = n p \mathbb E[Y]=np E [ Y ] = n p 。前面的定义实际上只用到了此分布概率质量函数的性质。事实上,如果回到一开始引入二项式分布的随机试验,即统计“扔 n n n 个硬币,正面向上的个数”,我们可以使用期望的线性性更加方便地计算 Y Y Y 的期望。回顾我们的样本空间是 Ω = { H , T } n \Omega=\{H,T\}^n Ω = { H , T } n 。对于每一个 s ∈ Ω s\in\Omega s ∈ Ω ,记 h ( s ) h(s) h ( s ) 为 s s s 中 H H H 的个数,我们有
Y ( s ) = h ( s ) .
Y(s)=h(s).
Y ( s ) = h ( s ) .
我们现在定义 n n n 个事件 A 1 , … , A n A_1,\ldots,A_n A 1 , … , A n ,其中 A i A_i A i 表示“s s s 的第 i i i 位是 H H H ”,并令
∀ i ∈ [ n ] , Y i = 1 A i .
\forall i\in[n],\qquad Y_i=\mathbf 1_{A_i}.
∀ i ∈ [ n ] , Y i = 1 A i .
换句话说,Y i ( s ) = 1 Y_i(s)=1 Y i ( s ) = 1 当且仅当 s s s 的第 i i i 位是正面。那么显然 Y = ∑ i = 1 n Y i Y=\sum_{i=1}^nY_i Y = ∑ i = 1 n Y i (我再强调一下,我们写这个等式的意思是,对于任何 s ∈ Ω s\in\Omega s ∈ Ω ,Y ( s ) = ∑ i = 1 n Y i ( s ) Y(s)=\sum_{i=1}^nY_i(s) Y ( s ) = ∑ i = 1 n Y i ( s ) 成立)。由于 Y i Y_i Y i 表示的就是第 i i i 个硬币的结果,满足 Y i ∼ Ber ( p ) Y_i\sim\operatorname{Ber}(p) Y i ∼ Ber ( p ) 。容易计算 E [ Y i ] = p \mathbb E[Y_i]=p E [ Y i ] = p 。
因此,由期望的线性性,
E [ Y ] = E [ ∑ i = 1 n Y i ] = ∑ i = 1 n E [ Y i ] = n p .
\mathbb E[Y]
=\mathbb E\left[\sum_{i=1}^nY_i\right]
=\sum_{i=1}^n\mathbb E[Y_i]
=np.
E [ Y ] = E [ i = 1 ∑ n Y i ] = i = 1 ∑ n E [ Y i ] = n p .
那么,期望的线性性不能不加条件地推广到无穷多个随机变量,即 E [ ∑ i = 1 ∞ X i ] = ∑ i = 1 ∞ E [ X i ] \mathbb E[\sum_{i=1}^{\infty}X_i]=\sum_{i=1}^{\infty}\mathbb E[X_i] E [ ∑ i = 1 ∞ X i ] = ∑ i = 1 ∞ E [ X i ] 不一定成立(你能想到反例吗?)。对于无穷多个随机变量,求和和期望什么时候能交换,是我们未来会重点研究的一个问题。
2.3 给定事件的条件期望
在第一章,我们定义过给定事件 A A A 后的条件概率。现在,若我们关心的不是另一个事件发生与否,而是一个随机变量的平均值,应该怎样根据已经知道的事件更新平均?
定义 2.7 给定事件的条件期望
设 X X X 是可积随机变量,A ∈ F A\in\mathcal F A ∈ F 且 P ( A ) > 0 \mathbb P(A)>0 P ( A ) > 0 。定义
E [ X ∣ A ] ≔ E [ X 1 A ] P ( A ) .
\mathbb E[X\mid A]
\coloneqq\frac{\mathbb E[X\mathbf1_A]}{\mathbb P(A)}.
E [ X ∣ A ] : = P ( A ) E [ X 1 A ] .
这里 E [ X ∣ A ] \mathbb E[X\mid A] E [ X ∣ A ] 是一个数 。
如果样本空间有限,我们也可以直接用条件概率求加权平均:
E [ X ∣ A ] = ∑ ω ∈ A X ( ω ) P ( { ω } ∣ A ) .
\mathbb E[X\mid A]
=\sum_{\omega\in A}X(\omega)\mathbb P(\{\omega\}\mid A).
E [ X ∣ A ] = ω ∈ A ∑ X ( ω ) P ({ ω } ∣ A ) .
特别地,E [ X ∣ Ω ] = E [ X ] \mathbb E[X\mid\Omega]=\mathbb E[X] E [ X ∣ Ω ] = E [ X ] 。如果 X = 1 B X=\mathbf1_B X = 1 B 是事件 B B B 的指示变量,那么 E [ 1 B ∣ A ] = P ( B ∣ A ) \mathbb E[\mathbf1_B\mid A]=\mathbb P(B\mid A) E [ 1 B ∣ A ] = P ( B ∣ A ) 。因此,这个定义也把我们熟悉的条件概率包含了进去。
全期望公式
我们以前使用过全概率公式:把同一个事件按照若干互不相交的情况分类,然后把各类的概率加起来。期望也可以用完全相同的集合拆分来计算。
命题 2.8 不交并上的全期望公式
假设 A = ⨆ j ≥ 1 A j A=\bigsqcup_{j\ge1}A_j A = ⨆ j ≥ 1 A j 是有限或可数个事件的不交并,且 P ( A ) > 0 \mathbb P(A)>0 P ( A ) > 0 。对可积随机变量 X X X ,
E [ X ∣ A ] = ∑ j : P ( A j ) > 0 P ( A j ∣ A ) E [ X ∣ A j ] .
\mathbb E[X\mid A]
=\sum_{j:\,\mathbb P(A_j)>0}
\mathbb P(A_j\mid A)\,\mathbb E[X\mid A_j].
E [ X ∣ A ] = j : P ( A j ) > 0 ∑ P ( A j ∣ A ) E [ X ∣ A j ] .
这个级数绝对收敛。取 A = Ω A=\Omega A = Ω ,便得到全空间上的全期望公式;概率为零的事件从求和中删去,不需要定义它们的条件期望。
证明 . 可数情形要先检查求和是否合法。由 X X X 可积与 A j A_j A j 两两不交,
∑ j ∣ E [ X 1 A j ] ∣ ≤ ∑ j E [ ∣ X ∣ 1 A j ] = E [ ∣ X ∣ 1 A ] < ∞ .
\begin{aligned}
\sum_j\bigl|\mathbb E[X\mathbf1_{A_j}]\bigr|
&\le\sum_j\mathbb E[|X|\mathbf1_{A_j}]\\
&=\mathbb E[|X|\mathbf1_A]
<\infty.
\end{aligned}
j ∑ E [ X 1 A j ] ≤ j ∑ E [ ∣ X ∣ 1 A j ] = E [ ∣ X ∣ 1 A ] < ∞.
所以可以把样本点按照它们所在的 A j A_j A j 重新分组,得到 X 1 A = ∑ j X 1 A j X\mathbf1_A=\sum_j X\mathbf1_{A_j} X 1 A = ∑ j X 1 A j ,两边取期望,使用期望的线性性,再除以 P ( A ) \mathbb P(A) P ( A ) ,然后使用事件条件期望的定义,便得到结论。
最大割的随机近似算法与去随机化
我们之前研究过图的最小割。现在看它的姊妹问题:给定无向图 G = ( V , E ) G=(V,E) G = ( V , E ) ,把顶点分成两侧 S S S 与 V ∖ S V\setminus S V ∖ S ,希望横跨两侧的边尽量多。记最优割的大小为 O P T \mathrm{OPT} OPT 。
例 2.4 (最大割的 2 近似算法) 对每个顶点 v v v 独立地扔一枚公平硬币:正面将 v v v 放到左侧,反面放到右侧。用0、1表示两侧,样本空间为 Ω = { 0 , 1 } V \Omega=\{0,1\}^{V} Ω = { 0 , 1 } V ,每个完整结果都等可能。令 C C C 表示这样得到的割的大小。
固定一条边 e = { u , v } e=\{u,v\} e = { u , v } ,记 B e B_e B e 为“端点在两侧”的事件。由于 P ( B e ) = 1 / 2 \mathbb P(B_e)=1/2 P ( B e ) = 1/2 ,对边的指示变量求和,有
E [ C ] = ∑ e ∈ E P ( B e ) = ∣ E ∣ 2 .
\mathbb E[C]
=\sum_{e\in E}\mathbb P(B_e)
=\frac{|E|}{2}.
E [ C ] = e ∈ E ∑ P ( B e ) = 2 ∣ E ∣ .
因为 O P T ≤ ∣ E ∣ \mathrm{OPT}\le|E| OPT ≤ ∣ E ∣ ,这个随机算法输出的割在期望意义下 至少有 O P T / 2 \mathrm{OPT}/2 OPT /2 条边。对于最大化问题,这叫 1 / 2 1/2 1/2 近似。我们接下来要找到一个确定的割,保证至少切开 ∣ E ∣ / 2 |E|/2 ∣ E ∣/2 条边。
把顶点排成 v 1 , … , v n v_1,\ldots,v_n v 1 , … , v n 。假设前 i − 1 i-1 i − 1 枚硬币的结果已经固定,令 A i − 1 A_{i-1} A i − 1 表示“这些已固定结果都发生”的事件;开始时 A 0 = Ω A_0=\Omega A 0 = Ω 。下一枚硬币的两种结果给出不交并
A i − 1 = A i ( 0 ) ⊔ A i ( 1 ) , A i ( b ) = A i − 1 ∩ { ω ∈ Ω : ω ( v i ) = b } .
A_{i-1}=A_i^{(0)}\sqcup A_i^{(1)},
\qquad
A_i^{(b)}=A_{i-1}\cap\{\omega\in\Omega:\omega(v_i)=b\}.
A i − 1 = A i ( 0 ) ⊔ A i ( 1 ) , A i ( b ) = A i − 1 ∩ { ω ∈ Ω : ω ( v i ) = b } .
未投的硬币仍公平,所以 P ( A i ( b ) ∣ A i − 1 ) = 1 / 2 \mathbb P(A_i^{(b)}\mid A_{i-1})=1/2 P ( A i ( b ) ∣ A i − 1 ) = 1/2 。刚才的全期望公式给出
E [ C ∣ A i − 1 ] = 1 2 E [ C ∣ A i ( 0 ) ] + 1 2 E [ C ∣ A i ( 1 ) ] .
\mathbb E[C\mid A_{i-1}]
=\frac12\mathbb E[C\mid A_i^{(0)}]
+\frac12\mathbb E[C\mid A_i^{(1)}].
E [ C ∣ A i − 1 ] = 2 1 E [ C ∣ A i ( 0 ) ] + 2 1 E [ C ∣ A i ( 1 ) ] .
两个数的平均不可能比两个数都大。于是我们计算这两个条件期望,选择较大的那一侧,令相应事件成为 A i A_i A i 。这样每固定一个顶点,E [ C ∣ A i ] \mathbb E[C\mid A_i] E [ C ∣ A i ] 都不会下降。等所有顶点都固定,A n = { ω ∗ } A_n=\{\omega^*\} A n = { ω ∗ } 只剩下一个具体结果,它决定一个割 S S S ,于是
C ( ω ∗ ) = E [ C ∣ A n ] ≥ E [ C ∣ A 0 ] = ∣ E ∣ 2 ≥ O P T 2 .
C(\omega^*)=\mathbb E[C\mid A_n]
\ge\mathbb E[C\mid A_0]
=\frac{|E|}{2}
\ge\frac{\mathrm{OPT}}2.
C ( ω ∗ ) = E [ C ∣ A n ] ≥ E [ C ∣ A 0 ] = 2 ∣ E ∣ ≥ 2 OPT .
这便把随机 2 近似算法变成了确定性 1/2 近似算法。我们不需要去猜一串“幸运硬币”,而只是在每一步选择更好的那个硬币。
一个自然的问题就是,我们每一步去选更好的硬币的操作真的是高效可计算的吗?大家可以想想,这本质上是另一个计算在某个实例上的条件期望问题。利用期望的线性性,我们可以在 O ( ∣ V ∣ + ∣ E ∣ ) O(|V|+|E|) O ( ∣ V ∣ + ∣ E ∣ ) 的时间内内完成。
这种“每次固定一个随机选择,同时保持条件期望不下降”的办法,叫做条件期望方法 (method of conditional expectation)。
2.4 方差与基本尾界
方差:平均值之外的波动
期望是随机变量的“数字特征”之一,用来描述它的平均值。但有的时候在应用中,期望所反映出来的关于随机变量的信息是不够的。比如说,假设 X X X 是我们班上随机取样一位同学的身高。我们知道 E [ X ] \mathbb E[X] E [ X ] ,即平均身高是170,这有可能是大家身高都在170附近,也有可能有一部分同学身高极高,有一部分极低,导致平均是170。方差便是一个用来描述随机变量偏离其平均值的数字特征。
定义 2.9 方差
若 E [ X 2 ] < ∞ \mathbb E[X^2]<\infty E [ X 2 ] < ∞ ,定义
Var ( X ) = E [ ( X − E [ X ] ) 2 ] .
\operatorname{Var}(X)
=\mathbb E\bigl[(X-\mathbb E[X])^2\bigr].
Var ( X ) = E [ ( X − E [ X ] ) 2 ] .
这个时候,敏感的严格性警察可能要出警了:只知道 X X X 可积,为什么就能计算上式?确实不能。因此,我们在定义里明确要求 E [ X 2 ] < ∞ \mathbb E[X^2]<\infty E [ X 2 ] < ∞ 。对于有有限均值但 E [ X 2 ] = + ∞ \mathbb E[X^2]=+\infty E [ X 2 ] = + ∞ 的变量,也可以说它的方差为 + ∞ +\infty + ∞ ;后面要用 Chebyshev 得到非平凡的界,则需要有限方差。
从定义便可以看出,方差是 ( X − E [ X ] ) 2 (X-\mathbb E[X])^2 ( X − E [ X ] ) 2 的平均值。将平方展开,使用期望的线性性,得到
Var ( X ) = E [ X 2 ] − ( E [ X ] ) 2 .
\operatorname{Var}(X)
=\mathbb E[X^2]-\bigl(\mathbb E[X]\bigr)^2.
Var ( X ) = E [ X 2 ] − ( E [ X ] ) 2 .
即“平方的期望减去期望的平方”。这里的 E [ X 2 ] \mathbb E[X^2] E [ X 2 ] 叫做 X X X 的二阶矩;对于自然数 k ≥ 1 k\ge1 k ≥ 1 ,E [ X k ] \mathbb E[X^k] E [ X k ] (若存在)称为 k k k 阶矩。直接代入定义也可验证,对常数 a , b a,b a , b ,
Var ( a X + b ) = a 2 Var ( X ) .
\operatorname{Var}(aX+b)=a^2\operatorname{Var}(X).
Var ( a X + b ) = a 2 Var ( X ) .
不过,方差对和一般没有这样的线性公式。比如令 X X X 是公平硬币出现正面的指示量,并令 Y = X Y=X Y = X 。那么
Var ( X + Y ) = Var ( 2 X ) = 4 Var ( X ) = 1 , Var ( X ) + Var ( Y ) = 1 2 .
\operatorname{Var}(X+Y)
=\operatorname{Var}(2X)
=4\operatorname{Var}(X)
=1,
\qquad
\operatorname{Var}(X)+\operatorname{Var}(Y)=\frac12.
Var ( X + Y ) = Var ( 2 X ) = 4 Var ( X ) = 1 , Var ( X ) + Var ( Y ) = 2 1 .
这里 X X X 和 Y Y Y 完全相同,当然不独立。若随机变量两两独立,方差对有限和就可以拆开。
方差的可加性(两两独立情形)
设 X 1 , … , X n X_1,\ldots,X_n X 1 , … , X n 都有有限二阶矩,并且两两独立。在本章的离散情形,这表示对每一对 i ≠ j i\ne j i = j 及其取值 x , y x,y x , y ,都有
P ( X i = x , X j = y ) = P ( X i = x ) P ( X j = y ) .
\mathbb P(X_i=x,X_j=y)
=\mathbb P(X_i=x)\mathbb P(X_j=y).
P ( X i = x , X j = y ) = P ( X i = x ) P ( X j = y ) .
则
Var ( ∑ i = 1 n X i ) = ∑ i = 1 n Var ( X i ) .
\operatorname{Var}\!\left(\sum_{i=1}^n X_i\right)
=\sum_{i=1}^n\operatorname{Var}(X_i).
Var ( i = 1 ∑ n X i ) = i = 1 ∑ n Var ( X i ) .
证明. 记 μ i = E [ X i ] \mu_i=\mathbb E[X_i] μ i = E [ X i ] 。把和减去它的期望后平方展开,得到
Var ( ∑ i = 1 n X i ) = ∑ i = 1 n E [ ( X i − μ i ) 2 ] + 2 ∑ 1 ≤ i < j ≤ n E [ ( X i − μ i ) ( X j − μ j ) ] .
\operatorname{Var}\!\left(\sum_{i=1}^n X_i\right)
=\sum_{i=1}^n\mathbb E[(X_i-\mu_i)^2]
+2\sum_{1\le i<j\le n}\mathbb E[(X_i-\mu_i)(X_j-\mu_j)].
Var ( i = 1 ∑ n X i ) = i = 1 ∑ n E [( X i − μ i ) 2 ] + 2 1 ≤ i < j ≤ n ∑ E [( X i − μ i ) ( X j − μ j )] .
由 2 ∣ u v ∣ ≤ u 2 + v 2 2|uv|\le u^2+v^2 2∣ uv ∣ ≤ u 2 + v 2 ,每个交叉项都可积。对 i ≠ j i\ne j i = j ,两两独立意味着 X i , X j X_i,X_j X i , X j 的联合 pmf 是各自 pmf 的乘积。因此
E [ ( X i − μ i ) ( X j − μ j ) ] = ∑ x , y ( x − μ i ) ( y − μ j ) P ( X i = x , X j = y ) = ( ∑ x ( x − μ i ) P ( X i = x ) ) ( ∑ y ( y − μ j ) P ( X j = y ) ) = 0.
\begin{aligned}
\mathbb E[(X_i-\mu_i)(X_j-\mu_j)]
&=\sum_{x,y}(x-\mu_i)(y-\mu_j)\mathbb P(X_i=x,X_j=y)\\
&=\left(\sum_x(x-\mu_i)\mathbb P(X_i=x)\right)
\left(\sum_y(y-\mu_j)\mathbb P(X_j=y)\right)\\
&=0.
\end{aligned}
E [( X i − μ i ) ( X j − μ j )] = x , y ∑ ( x − μ i ) ( y − μ j ) P ( X i = x , X j = y ) = ( x ∑ ( x − μ i ) P ( X i = x ) ) ( y ∑ ( y − μ j ) P ( X j = y ) ) = 0.
每个交叉项都等于零,剩下的正是各项方差之和。□ \square □
例 2.5 (用方差的可加性计算 Binomial 方差) 令 Y ∼ Bin ( n , p ) Y\sim\operatorname{Bin}(n,p) Y ∼ Bin ( n , p ) ,回到上一节构造它的硬币试验。对第 i i i 次投掷,令 X i X_i X i 表示是否出现正面:出现正面时 X i = 1 X_i=1 X i = 1 ,否则 X i = 0 X_i=0 X i = 0 。那么
Y = ∑ i = 1 n X i .
Y=\sum_{i=1}^n X_i.
Y = i = 1 ∑ n X i .
这些 X i X_i X i 两两独立,且各自服从 Ber ( p ) \operatorname{Ber}(p) Ber ( p ) 。因为 X i 2 = X i X_i^2=X_i X i 2 = X i ,
Var ( X i ) = E [ X i 2 ] − ( E [ X i ] ) 2 = p − p 2 = p ( 1 − p ) .
\operatorname{Var}(X_i)
=\mathbb E[X_i^2]-\bigl(\mathbb E[X_i]\bigr)^2
=p-p^2
=p(1-p).
Var ( X i ) = E [ X i 2 ] − ( E [ X i ] ) 2 = p − p 2 = p ( 1 − p ) .
现在直接应用刚才证明的方差可加性:
Var ( Y ) = ∑ i = 1 n Var ( X i ) = n p ( 1 − p ) .
\operatorname{Var}(Y)
=\sum_{i=1}^n\operatorname{Var}(X_i)
=np(1-p).
Var ( Y ) = i = 1 ∑ n Var ( X i ) = n p ( 1 − p ) .
Markov 不等式
我们这儿提一个关于期望的不等式,它想描述如下一件显然的事情:如果一个非负的随机变量期望一定,那么它的取值特别大的概率就不能很大(否则期望就炸了)。用数学的语言说就是:
命题 2.10 Markov 不等式
对于非负随机变量 X ≥ 0 X\ge0 X ≥ 0 和任意 a > 0 a>0 a > 0 ,
P ( X ≥ a ) ≤ E [ X ] a .
\mathbb P(X\ge a)
\le\frac{\mathbb E[X]}{a}.
P ( X ≥ a ) ≤ a E [ X ] .
不等式的证明很简单,仅仅就是把我们觉得它对的原因严格地说一下。我这儿写一下,对于初学者来说,值得好好看一下我们这儿使用的所谓“截断”的技巧,它在未来很多证明里要用到。对于一个固定的 a a a ,我们用事件 { X ≥ a } \{X\ge a\} { X ≥ a } 来截断随机变量 X X X ,得到
X = X 1 { X < a } + X 1 { X ≥ a } .
X
=X\mathbf1_{\{X<a\}}
+X\mathbf1_{\{X\ge a\}}.
X = X 1 { X < a } + X 1 { X ≥ a } .
对于初学者,我认为值得好好读一下这个等式。首先,这个等式左右两边均是随机变量,也就是说它们均是函数。因此,它的实际意思是,对于每一个样本点 ω ∈ Ω \omega\in\Omega ω ∈ Ω ,左右两边在 ω \omega ω 上的取值均相同。其次,两个指示变量对应互补事件,恰好有一个取值为1。
我们对左右两边取期望并做放缩:第一项非负,而 X 1 { X ≥ a } ≥ a 1 { X ≥ a } X\mathbf1_{\{X\ge a\}}\ge a\mathbf1_{\{X\ge a\}} X 1 { X ≥ a } ≥ a 1 { X ≥ a } 逐点成立,所以
E [ X ] ≥ E [ X 1 { X ≥ a } ] ≥ a P ( X ≥ a ) .
\mathbb E[X]
\ge\mathbb E[X\mathbf1_{\{X\ge a\}}]
\ge a\mathbb P(X\ge a).
E [ X ] ≥ E [ X 1 { X ≥ a } ] ≥ a P ( X ≥ a ) .
从证明可以看出 Markov 不等式能够取到等号。这个不等式在概率论和计算机科学中很有用:它把一个平均值转成随机变量取值特别大的概率上界,也就是一个尾界。
Chebyshev 不等式
Chebyshev 不等式定量描述了引入方差的动机。我们想知道 X X X 偏离 E [ X ] \mathbb E[X] E [ X ] 很远的概率,而方差正是平方偏差的平均值。
命题 2.11 Chebyshev 不等式
若 Var ( X ) < ∞ \operatorname{Var}(X)<\infty Var ( X ) < ∞ ,则对任意 a > 0 a>0 a > 0 ,
P ( ∣ X − E [ X ] ∣ ≥ a ) ≤ Var ( X ) a 2 .
\mathbb P\bigl(|X-\mathbb E[X]|\ge a\bigr)
\le\frac{\operatorname{Var}(X)}{a^2}.
P ( ∣ X − E [ X ] ∣ ≥ a ) ≤ a 2 Var ( X ) .
证明就是对非负随机变量 ( X − E [ X ] ) 2 (X-\mathbb E[X])^2 ( X − E [ X ] ) 2 使用 Markov:
P ( ∣ X − E [ X ] ∣ ≥ a ) = P ( ( X − E [ X ] ) 2 ≥ a 2 ) ≤ E [ ( X − E [ X ] ) 2 ] a 2 = Var ( X ) a 2 .
\begin{aligned}
\mathbb P\bigl(|X-\mathbb E[X]|\ge a\bigr)
&=\mathbb P\bigl((X-\mathbb E[X])^2\ge a^2\bigr)\\
&\le\frac{\mathbb E[(X-\mathbb E[X])^2]}{a^2}
=\frac{\operatorname{Var}(X)}{a^2}.
\end{aligned}
P ( ∣ X − E [ X ] ∣ ≥ a ) = P ( ( X − E [ X ] ) 2 ≥ a 2 ) ≤ a 2 E [( X − E [ X ] ) 2 ] = a 2 Var ( X ) .
例 2.6 (用硬币频率估计正面概率) 投掷 n n n 次正面概率为 p p p 的独立硬币,令 Y Y Y 为正面数,并用 p ^ n = Y / n \widehat p_n=Y/n p n = Y / n 估计 p p p 。由 Binomial 均值、方差以及 Var ( a X ) = a 2 Var ( X ) \operatorname{Var}(aX)=a^2\operatorname{Var}(X) Var ( a X ) = a 2 Var ( X ) ,
E [ p ^ n ] = p , Var ( p ^ n ) = p ( 1 − p ) n ≤ 1 4 n .
\mathbb E[\widehat p_n]=p,
\qquad
\operatorname{Var}(\widehat p_n)
=\frac{p(1-p)}{n}
\le\frac{1}{4n}.
E [ p n ] = p , Var ( p n ) = n p ( 1 − p ) ≤ 4 n 1 .
所以 Chebyshev 不等式给出
P ( ∣ p ^ n − p ∣ ≥ ε ) ≤ 1 4 n ε 2 .
\mathbb P(|\widehat p_n-p|\ge\varepsilon)
\le\frac{1}{4n\varepsilon^2}.
P ( ∣ p n − p ∣ ≥ ε ) ≤ 4 n ε 2 1 .
如果希望误差超过 ε \varepsilon ε 的概率不超过 δ \delta δ ,取 n ≥ 1 / ( 4 δ ε 2 ) n\ge1/(4\delta\varepsilon^2) n ≥ 1/ ( 4 δ ε 2 ) 便足够。这个结论只使用了方差;课程最后我们会用更强的尾界,把对 1 / δ 1/\delta 1/ δ 的依赖改进成对 log ( 1 / δ ) \log(1/\delta) log ( 1/ δ ) 的依赖。
2.5 奖券收集问题的计算
我们上节课介绍了期望和方差的定义。我们今天使用它们来研究奖券收集(Coupon Collector)问题。我们首先从几何分布的一些基本性质开始。
几何分布的期望与方差
2.1节已经定义了几何分布,并约定 G ∼ Geom ( p ) G\sim\operatorname{Geom}(p) G ∼ Geom ( p ) 为第一次成功时已经投掷的次数。
记 q = 1 − p q=1-p q = 1 − p 。直接从 pmf 计算。由等比级数及其导数,
E [ G ] = ∑ k = 1 ∞ k q k − 1 p = p ( 1 − q ) 2 = 1 p , E [ G 2 ] = ∑ k = 1 ∞ k 2 q k − 1 p = p ( 1 + q ) ( 1 − q ) 3 = 2 − p p 2 .
\begin{aligned}
\mathbb E[G]
&=\sum_{k=1}^{\infty}kq^{k-1}p
=\frac{p}{(1-q)^2}
=\frac1p,\\
\mathbb E[G^2]
&=\sum_{k=1}^{\infty}k^2q^{k-1}p
=\frac{p(1+q)}{(1-q)^3}
=\frac{2-p}{p^2}.
\end{aligned}
E [ G ] E [ G 2 ] = k = 1 ∑ ∞ k q k − 1 p = ( 1 − q ) 2 p = p 1 , = k = 1 ∑ ∞ k 2 q k − 1 p = ( 1 − q ) 3 p ( 1 + q ) = p 2 2 − p .
因此
Var ( G ) = E [ G 2 ] − ( E [ G ] ) 2 = 1 − p p 2 .
\operatorname{Var}(G)
=\mathbb E[G^2]-\bigl(\mathbb E[G]\bigr)^2
=\frac{1-p}{p^2}.
Var ( G ) = E [ G 2 ] − ( E [ G ] ) 2 = p 2 1 − p .
奖券收集问题
奖券收集问题是概率分析里面的一个重要概率模型。我们使用今天介绍的技巧和不等式来研究这个模型。
考虑玩一个抽卡手游。现在总共有 N N N 种不同类型的卡,每一抽可以均匀地得到其中一种。现在想问平均要抽多少次,可以集齐一套,即 N N N 种卡每种至少一张。
我们考虑这个问题的概率空间建模。一个方便的样本空间是 Ω = [ N ] N \Omega=[N]^{\mathbb N} Ω = [ N ] N ,也就是所有无限长的抽卡序列。对应的可数乘积概率空间将在第三章严格构造;现在先接受每次独立、均匀抽取的模型。定义随机变量 T T T 为第一次集齐一套的抽卡次数。我们关心的是 E [ T ] \mathbb E[T] E [ T ] 。由于 T T T 取离散值,它的期望按定义是
E [ T ] = ∑ k = 1 ∞ k P ( T = k ) .
\mathbb E[T]=\sum_{k=1}^{\infty}k\,\mathbb P(T=k).
E [ T ] = k = 1 ∑ ∞ k P ( T = k ) .
直接通过 E [ T ] \mathbb E[T] E [ T ] 的定义进行计算显然很困难。我们又一次使用期望的线性性技巧。下面这个构造第一次见会觉得很巧妙,但它也是一种非常常用的构造,请大家务必理解。对于 i = 1 , 2 , … , N i=1,2,\ldots,N i = 1 , 2 , … , N ,定义 W i W_i W i 表示“已经有了 i − 1 i-1 i − 1 种不同类型的卡之后,要再获得一种新类型的卡还需要抽多少次”。那么,
T = ∑ i = 1 N W i T=\sum_{i=1}^{N}W_i T = ∑ i = 1 N W i ;
W 1 , W 2 , … , W N W_1,W_2,\ldots,W_N W 1 , W 2 , … , W N 相互独立;
W i ∼ Geom ( N − i + 1 N ) W_i\sim\operatorname{Geom}\!\left(\frac{N-i+1}{N}\right) W i ∼ Geom ( N N − i + 1 ) 。
于是,我们便可以使用期望的线性性和几何分布的性质得到
E [ T ] = ∑ i = 1 N E [ W i ] = ∑ i = 1 N N N − i + 1 = N ∑ j = 1 N 1 j = N H N ,
\begin{aligned}
\mathbb E[T]
&=\sum_{i=1}^{N}\mathbb E[W_i]
=\sum_{i=1}^{N}\frac{N}{N-i+1}\\
&=N\sum_{j=1}^{N}\frac1j
=NH_N,
\end{aligned}
E [ T ] = i = 1 ∑ N E [ W i ] = i = 1 ∑ N N − i + 1 N = N j = 1 ∑ N j 1 = N H N ,
其中 H N = ∑ j = 1 N 1 / j H_N=\sum_{j=1}^{N}1/j H N = ∑ j = 1 N 1/ j 是调和数。由于 H N = log N + γ + o ( 1 ) H_N=\log N+\gamma+o(1) H N = log N + γ + o ( 1 ) ,平均完成时间约为 N log N N\log N N log N 。当 N = 1000 N=1000 N = 1000 时,N H N ≈ 7485.47 NH_N\approx7485.47 N H N ≈ 7485.47 次。
以上的计算告诉我们平均多久能集齐一套。但实际上,因为存在欧皇和非酋,我们往往还想知道:抽多少次,才能以至少 99 % 99\% 99% 的概率 收集齐?下面我们用三种方法估计一个足够的抽取次数。注意,它们给出的都是充分预算 ,也就是实际情况的上界。设 m m m 是已经抽取的次数,失败事件为 { T > m } \{T>m\} { T > m } ,也就是第 m m m 次之后至少缺一种卡。我们要让这个事件的概率不超过 δ \delta δ 。
Markov 不等式
首先尝试用 Markov 不等式来估算。回忆 Markov 不等式表达的是:一个随机变量以很大的概率取到特别大的值是不可能的。这正好满足我们的要求。使用 Markov 不等式,
P ( T > m ) = P ( T ≥ m + 1 ) ≤ E [ T ] m + 1 = N H N m + 1 .
\mathbb P(T>m)
=\mathbb P(T\ge m+1)
\le\frac{\mathbb E[T]}{m+1}
=\frac{NH_N}{m+1}.
P ( T > m ) = P ( T ≥ m + 1 ) ≤ m + 1 E [ T ] = m + 1 N H N .
如果希望上面的概率不超过 δ \delta δ ,取 m ≥ ⌈ N H N / δ ⌉ m\ge\lceil NH_N/\delta\rceil m ≥ ⌈ N H N / δ ⌉ 即可。对于 N = 1000 N=1000 N = 1000 、δ = 0.01 \delta=0.01 δ = 0.01 ,这个充分预算为 748548 次。
Chebyshev 不等式
当然抽卡过程没有这么糟。上面的估计看起来很差,原因在于 Markov 不等式太松,没有用到随机变量的其他信息。我们这儿用上方差试试。由 Chebyshev 不等式,
P ( ∣ T − E [ T ] ∣ ≥ a ) ≤ Var ( T ) a 2 .
\mathbb P\bigl(|T-\mathbb E[T]|\ge a\bigr)
\le\frac{\operatorname{Var}(T)}{a^2}.
P ( ∣ T − E [ T ] ∣ ≥ a ) ≤ a 2 Var ( T ) .
如果希望上式不超过 δ \delta δ ,取 a = Var ( T ) / δ a=\sqrt{\operatorname{Var}(T)/\delta} a = Var ( T ) / δ 即可;当 δ = 0.01 \delta=0.01 δ = 0.01 时,这就是 a = 10 Var ( T ) a=10\sqrt{\operatorname{Var}(T)} a = 10 Var ( T ) 。因此,我们来计算 Var ( T ) \operatorname{Var}(T) Var ( T ) 。因为 T = ∑ i = 1 N W i T=\sum_{i=1}^{N}W_i T = ∑ i = 1 N W i ,且这些 W i W_i W i 相互独立,我们可以用方差的可加性得到
这里用了
∑ j = 1 N 1 j 2 ≤ 1 + ∫ 1 ∞ d x x 2 = 2.
\sum_{j=1}^{N}\frac1{j^2}
\le1+\int_1^\infty\frac{dx}{x^2}
=2.
j = 1 ∑ N j 2 1 ≤ 1 + ∫ 1 ∞ x 2 d x = 2.
Var ( T ) = ∑ i = 1 N Var ( W i ) = ∑ i = 1 N 1 − N − i + 1 N ( N − i + 1 N ) 2 = N 2 ∑ j = 1 N 1 j 2 − N H N ≤ 2 N 2 .
\begin{aligned}
\operatorname{Var}(T)
&=\sum_{i=1}^{N}\operatorname{Var}(W_i)\\
&=\sum_{i=1}^{N}
\frac{1-\frac{N-i+1}{N}}{\left(\frac{N-i+1}{N}\right)^2}\\
&=N^2\sum_{j=1}^{N}\frac1{j^2}-NH_N
\le2N^2.
\end{aligned}
Var ( T ) = i = 1 ∑ N Var ( W i ) = i = 1 ∑ N ( N N − i + 1 ) 2 1 − N N − i + 1 = N 2 j = 1 ∑ N j 2 1 − N H N ≤ 2 N 2 .
根据 Chebyshev 不等式,若 m > E [ T ] m>\mathbb E[T] m > E [ T ] ,则
P ( T > m ) ≤ Var ( T ) ( m − E [ T ] ) 2 .
\mathbb P(T>m)
\le\frac{\operatorname{Var}(T)}{(m-\mathbb E[T])^2}.
P ( T > m ) ≤ ( m − E [ T ] ) 2 Var ( T ) .
由 Var ( T ) ≤ 2 N 2 \operatorname{Var}(T)\le2N^2 Var ( T ) ≤ 2 N 2 ,取
m ≥ ⌈ N H N + N 2 δ ⌉
m\ge\left\lceil NH_N+N\sqrt{\frac2\delta}\right\rceil
m ≥ ⌈ N H N + N δ 2 ⌉
便足够。对 N = 1000 N=1000 N = 1000 和 δ = 0.01 \delta=0.01 δ = 0.01 ,得到21628 次。
另一种 Markov 不等式估计
事实上,这个概率可以对“抽了 m m m 轮之后缺少的卡的种类数”进行估计。设 J i J_i J i 为指示变量,表示第 i i i 种卡在前 m m m 轮中没有出现。则
U m = ∑ i = 1 N J i
U_m=\sum_{i=1}^{N}J_i
U m = i = 1 ∑ N J i 为抽了 m m m 轮之后缺少的卡的种类数。于是 { T > m } = { U m ≥ 1 } \{T>m\}=\{U_m\ge1\} { T > m } = { U m ≥ 1 } 。容易计算到
E [ U m ] = ∑ i = 1 N E [ J i ] = N ( 1 − 1 N ) m .
\mathbb E[U_m] = \sum_{i=1}^{N}\mathbb E[J_i]
=N\left(1-\frac1N\right)^m.
E [ U m ] = i = 1 ∑ N E [ J i ] = N ( 1 − N 1 ) m .
现在对 U m U_m U m 使用 Markov 不等式,得到
P ( T > m ) = P ( U m ≥ 1 ) ≤ E [ U m ] = N ( 1 − 1 N ) m ≤ N e − m / N .
\begin{aligned}
\mathbb P(T>m)
&=\mathbb P(U_m\ge1)\\
&\le\mathbb E[U_m]
=N\left(1-\frac1N\right)^m
\le N e^{-m/N}.
\end{aligned}
P ( T > m ) = P ( U m ≥ 1 ) ≤ E [ U m ] = N ( 1 − N 1 ) m ≤ N e − m / N .
因此,取
m ≥ ⌈ N log N δ ⌉
m\ge\left\lceil N\log\frac{N}{\delta}\right\rceil
m ≥ ⌈ N log δ N ⌉
便足够。对于 N = 1000 N=1000 N = 1000 、δ = 0.01 \delta=0.01 δ = 0.01 ,只需 11513 次。
随机图上的三角形个数
使用 Markov 不等式与 Chebyshev 不等式做界估计是离散概率中的基本手段。在概率方法(Probabilistic Method)中,它们分别被称为一阶矩方法(First Moment Method) 与二阶矩方法(Second Moment Method) 。我们以 Erdős–Rényi 随机图中的三角形出现概率为例展示这两种方法。
Erdős–Rényi 随机图模型
考虑 Erdős–Rényi 随机图 G ( n , p ) G(n,p) G ( n , p ) :图的顶点集为 [ n ] = { 1 , 2 , … , n } [n]=\{1,2,\dots,n\} [ n ] = { 1 , 2 , … , n } 。对于任意无序顶点对 { u , v } \{u,v\} { u , v } ,边出现的概率均为 p = p ( n ) p=p(n) p = p ( n ) ,且所有 ( n 2 ) \binom{n}{2} ( 2 n ) 条边的出现相互独立。
边概率 p p p 通常是顶点数 n n n 的函数。我们关心边概率达到什么尺度时,图中开始以高概率出现三角形(三点完全图 K 3 K_3 K 3 )。
三角形个数的矩估计
令 X X X 表示随机图 G ( n , p ) G(n,p) G ( n , p ) 中三角形的总数。对于任意三元顶点集合 S ∈ ( [ n ] 3 ) S \in \binom{[n]}{3} S ∈ ( 3 [ n ] ) ,定义指示变量:
I S = 1 { S 构成一个三角形 } .
I_S = \mathbf{1}_{\{S \text{ 构成一个三角形}\}}.
I S = 1 { S 构成一个三角形 } .
三条边全部出现的概率为 p 3 p^3 p 3 。由各边独立的性质,
P ( I S = 1 ) = E [ I S ] = p 3 .
\mathbb P(I_S = 1) = \mathbb E[I_S] = p^3.
P ( I S = 1 ) = E [ I S ] = p 3 .
三角形总数 X X X 可表示为这些指示变量之和:
X = ∑ S ∈ ( [ n ] 3 ) I S .
X = \sum_{S \in \binom{[n]}{3}} I_S.
X = S ∈ ( 3 [ n ] ) ∑ I S .
一阶矩方法:期望趋于 0 蕴含几乎必然不出现
由期望的线性性,
E [ X ] = ∑ S ∈ ( [ n ] 3 ) E [ I S ] = ( n 3 ) p 3 ≈ n 3 p 3 6 = ( n p ) 3 6 .
\mathbb E[X] = \sum_{S \in \binom{[n]}{3}} \mathbb E[I_S] = \binom{n}{3} p^3 \approx \frac{n^3 p^3}{6} = \frac{(np)^3}{6}.
E [ X ] = S ∈ ( 3 [ n ] ) ∑ E [ I S ] = ( 3 n ) p 3 ≈ 6 n 3 p 3 = 6 ( n p ) 3 .
若 p ( n ) ≪ 1 n p(n) \ll \frac{1}{n} p ( n ) ≪ n 1 (即 n p → 0 np \to 0 n p → 0 ),则当 n → ∞ n \to \infty n → ∞ 时,E [ X ] → 0 \mathbb E[X] \to 0 E [ X ] → 0 。
由于 X X X 为非负整数值随机变量,事件 { X > 0 } \{X > 0\} { X > 0 } 等价于 { X ≥ 1 } \{X \ge 1\} { X ≥ 1 } 。由 Markov 不等式,
P ( X > 0 ) = P ( X ≥ 1 ) ≤ E [ X ] 1 = E [ X ] ⟶ 0.
\mathbb P(X > 0) = \mathbb P(X \ge 1) \le \frac{\mathbb E[X]}{1} = \mathbb E[X] \longrightarrow 0.
P ( X > 0 ) = P ( X ≥ 1 ) ≤ 1 E [ X ] = E [ X ] ⟶ 0.
这说明当 p ≪ 1 n p \ll \frac{1}{n} p ≪ n 1 时,图中出现三角形的概率趋于 0。这种通过说明结构计数期望趋于 0 来证明该结构渐近几乎必然不存在的技术,称为一阶矩方法。
期望趋于无穷是否意味着几乎必然出现?
若 p ( n ) ≫ 1 n p(n) \gg \frac{1}{n} p ( n ) ≫ n 1 (即 n p → ∞ np \to \infty n p → ∞ ),显然 E [ X ] → ∞ \mathbb E[X] \to \infty E [ X ] → ∞ 。然而,仅凭均值趋于无穷并不能保证事件 { X > 0 } \{X > 0\} { X > 0 } 以高概率发生。
期望仅反映取值的加权平均,并不能排除“以极大概率取 0、以极小概率取极大值”的情形。例如,若随机变量 Y Y Y 满足 P ( Y = n 2 ) = 1 n \mathbb P(Y = n^2) = \frac{1}{n} P ( Y = n 2 ) = n 1 且 P ( Y = 0 ) = 1 − 1 n \mathbb P(Y = 0) = 1 - \frac{1}{n} P ( Y = 0 ) = 1 − n 1 ,则其均值 E [ Y ] = n → ∞ \mathbb E[Y] = n \to \infty E [ Y ] = n → ∞ ,但取 0 的概率却趋于 1。
为了证明 X > 0 X > 0 X > 0 以高概率成立,我们需要进一步控制 X X X 的波动,说明它不会集中在 0 处。
二阶矩方法
考虑 X = 0 X=0 X = 0 的情形。当 X = 0 X=0 X = 0 时,它与均值 E [ X ] \mathbb E[X] E [ X ] 的偏差至少为 E [ X ] \mathbb E[X] E [ X ] 。直接应用 Chebyshev 不等式:
P ( X = 0 ) ≤ P ( ∣ X − E [ X ] ∣ ≥ E [ X ] ) ≤ Var ( X ) ( E [ X ] ) 2 .
\mathbb P(X = 0) \le \mathbb P\bigl(|X - \mathbb E[X]| \ge \mathbb E[X]\bigr) \le \frac{\operatorname{Var}(X)}{(\mathbb E[X])^2}.
P ( X = 0 ) ≤ P ( ∣ X − E [ X ] ∣ ≥ E [ X ] ) ≤ ( E [ X ] ) 2 Var ( X ) .
若能证明相对方差 Var ( X ) ( E [ X ] ) 2 → 0 \frac{\operatorname{Var}(X)}{(\mathbb E[X])^2} \to 0 ( E [ X ] ) 2 Var ( X ) → 0 ,则可推出 P ( X = 0 ) → 0 \mathbb P(X = 0) \to 0 P ( X = 0 ) → 0 ,即 P ( X > 0 ) → 1 \mathbb P(X > 0) \to 1 P ( X > 0 ) → 1 。这种利用二阶矩与方差控制变量不为 0 的方法,称为二阶矩方法。
方差计算:展开二阶矩 E [ X 2 ] \mathbb E[X^2] E [ X 2 ]
由方差的定义, Var ( X ) = E [ X 2 ] − ( E [ X ] ) 2 .
\operatorname{Var}(X) = \mathbb E[X^2] - (\mathbb E[X])^2.
Var ( X ) = E [ X 2 ] − ( E [ X ] ) 2 .
由期望的线性性,二阶矩 E [ X 2 ] \mathbb E[X^2] E [ X 2 ] 可以写为指示变量乘积之和:
X 2 = ( ∑ S ∈ ( [ n ] 3 ) I S ) 2 = ∑ S , T ∈ ( [ n ] 3 ) I S I T , E [ X 2 ] = ∑ S , T ∈ ( [ n ] 3 ) E [ I S I T ] .
X^2 = \left(\sum_{S \in \binom{[n]}{3}} I_S\right)^2 = \sum_{S, T \in \binom{[n]}{3}} I_S I_T,
\qquad
\mathbb E[X^2] = \sum_{S, T \in \binom{[n]}{3}} \mathbb E[I_S I_T].
X 2 = S ∈ ( 3 [ n ] ) ∑ I S 2 = S , T ∈ ( 3 [ n ] ) ∑ I S I T , E [ X 2 ] = S , T ∈ ( 3 [ n ] ) ∑ E [ I S I T ] .
乘积 I S I T I_S I_T I S I T 也是一个指示变量,指示 S S S 与 T T T 两个三元点集同时构成三角形。其期望 E [ I S I T ] = P ( I S = 1 , I T = 1 ) \mathbb E[I_S I_T] = \mathbb P(I_S = 1, I_T = 1) E [ I S I T ] = P ( I S = 1 , I T = 1 ) 由 S S S 与 T T T 的相交情况决定,分三种情形:
不共用边(∣ S ∩ T ∣ ≤ 1 |S \cap T| \le 1 ∣ S ∩ T ∣ ≤ 1 ) :两三角形涉及的边集互不相交。由于各边的出现相互独立,两三角形同时出现的概率即为各自概率的乘积:
E [ I S I T ] = P ( I S = 1 ) P ( I T = 1 ) = p 3 ⋅ p 3 = p 6 .
\mathbb E[I_S I_T] = \mathbb P(I_S = 1)\mathbb P(I_T = 1) = p^3 \cdot p^3 = p^6.
E [ I S I T ] = P ( I S = 1 ) P ( I T = 1 ) = p 3 ⋅ p 3 = p 6 .
共用一条边(∣ S ∩ T ∣ = 2 |S \cap T| = 2 ∣ S ∩ T ∣ = 2 ) :两三角形共用 1 条边,各自包含另外 2 条不同的边,两三角形全部出现共要求这 1 + 2 + 2 = 5 1 + 2 + 2 = 5 1 + 2 + 2 = 5 条边全部出现。因此,
E [ I S I T ] = p 5 .
\mathbb E[I_S I_T] = p^5.
E [ I S I T ] = p 5 .
此类无序三角形对的数量为:先选定公共边的两个端点(有 ( n 2 ) \binom{n}{2} ( 2 n ) 种取法),再在剩余的 n − 2 n-2 n − 2 个点中为两三角形分别选取第三个顶点(无序对有 ( n − 2 2 ) \binom{n-2}{2} ( 2 n − 2 ) 种取法)。记该无序对数为 A = ( n 2 ) ( n − 2 2 ) A = \binom{n}{2}\binom{n-2}{2} A = ( 2 n ) ( 2 n − 2 ) ,在遍历有序对 ( S , T ) (S,T) ( S , T ) 时对应 2 A 2A 2 A 项。
完全相同(S = T S = T S = T ) :共有 M = ( n 3 ) M = \binom{n}{3} M = ( 3 n ) 项。此时 I S 2 = I S I_S^2 = I_S I S 2 = I S ,其期望为:
E [ I S 2 ] = E [ I S ] = p 3 .
\mathbb E[I_S^2] = \mathbb E[I_S] = p^3.
E [ I S 2 ] = E [ I S ] = p 3 .
将所有有序对合并,二阶矩为:
E [ X 2 ] = M p 3 + 2 A p 5 + ( M 2 − M − 2 A ) p 6 .
\mathbb E[X^2] = M p^3 + 2A p^5 + \bigl(M^2 - M - 2A\bigr) p^6.
E [ X 2 ] = M p 3 + 2 A p 5 + ( M 2 − M − 2 A ) p 6 .
减去 ( E [ X ] ) 2 = ( M p 3 ) 2 = M 2 p 6 (\mathbb E[X])^2 = (M p^3)^2 = M^2 p^6 ( E [ X ] ) 2 = ( M p 3 ) 2 = M 2 p 6 ,得到方差:
Var ( X ) = E [ X 2 ] − ( E [ X ] ) 2 = M ( p 3 − p 6 ) + 2 A ( p 5 − p 6 ) ≤ M p 3 + 2 A p 5 = ( n 3 ) p 3 + 2 ( n 2 ) ( n − 2 2 ) p 5 .
\begin{aligned}
\operatorname{Var}(X)
&= \mathbb E[X^2] - (\mathbb E[X])^2 \\
&= M(p^3 - p^6) + 2A(p^5 - p^6) \\
&\le M p^3 + 2A p^5 \\
&= \binom{n}{3} p^3 + 2 \binom{n}{2}\binom{n-2}{2} p^5.
\end{aligned}
Var ( X ) = E [ X 2 ] − ( E [ X ] ) 2 = M ( p 3 − p 6 ) + 2 A ( p 5 − p 6 ) ≤ M p 3 + 2 A p 5 = ( 3 n ) p 3 + 2 ( 2 n ) ( 2 n − 2 ) p 5 .
相对方差的渐近估计
将方差上界除以 ( E [ X ] ) 2 = ( ( n 3 ) p 3 ) 2 = Θ ( n 6 p 6 ) (\mathbb E[X])^2 = \left(\binom{n}{3} p^3\right)^2 = \Theta(n^6 p^6) ( E [ X ] ) 2 = ( ( 3 n ) p 3 ) 2 = Θ ( n 6 p 6 ) :
Var ( X ) ( E [ X ] ) 2 ≤ O ( n 3 p 3 ) + O ( n 4 p 5 ) Θ ( n 6 p 6 ) = O ( 1 n 3 p 3 ) + O ( 1 n 2 p ) .
\frac{\operatorname{Var}(X)}{(\mathbb E[X])^2}
\le \frac{O(n^3 p^3) + O(n^4 p^5)}{\Theta(n^6 p^6)}
= O\!\left(\frac{1}{n^3 p^3}\right) + O\!\left(\frac{1}{n^2 p}\right).
( E [ X ] ) 2 Var ( X ) ≤ Θ ( n 6 p 6 ) O ( n 3 p 3 ) + O ( n 4 p 5 ) = O ( n 3 p 3 1 ) + O ( n 2 p 1 ) .
当 p ( n ) ≫ 1 n p(n) \gg \frac{1}{n} p ( n ) ≫ n 1 时,有 n p → ∞ np \to \infty n p → ∞ 。此时:
n 3 p 3 = ( n p ) 3 → ∞ n^3 p^3 = (np)^3 \to \infty n 3 p 3 = ( n p ) 3 → ∞ ,故第一项趋于 0;
n 2 p = n ( n p ) → ∞ n^2 p = n(np) \to \infty n 2 p = n ( n p ) → ∞ ,故第二项趋于 0。
因此,只要 p ( n ) ≫ 1 n p(n) \gg \frac{1}{n} p ( n ) ≫ n 1 ,便有
Var ( X ) ( E [ X ] ) 2 ⟶ 0 ( n → ∞ ) .
\frac{\operatorname{Var}(X)}{(\mathbb E[X])^2} \longrightarrow 0 \qquad (n \to \infty).
( E [ X ] ) 2 Var ( X ) ⟶ 0 ( n → ∞ ) .
结合 Chebyshev 不等式,得到
P ( X = 0 ) ≤ Var ( X ) ( E [ X ] ) 2 ⟶ 0 ,
\mathbb P(X = 0) \le \frac{\operatorname{Var}(X)}{(\mathbb E[X])^2} \longrightarrow 0,
P ( X = 0 ) ≤ ( E [ X ] ) 2 Var ( X ) ⟶ 0 ,
即 P ( X > 0 ) ⟶ 1 \mathbb P(X > 0) \longrightarrow 1 P ( X > 0 ) ⟶ 1 。
阈值函数与相变
综合上述分析,有:
lim n → ∞ P ( G ( n , p ) 包含三角形 ) = { 0 , 若 p ( n ) ≪ 1 n , 1 , 若 p ( n ) ≫ 1 n .
\lim_{n\to\infty} \mathbb P\bigl(G(n,p) \text{ 包含三角形}\bigr) =
\begin{cases}
0, & \text{若 } p(n) \ll \frac{1}{n},\\[6pt]
1, & \text{若 } p(n) \gg \frac{1}{n}.
\end{cases}
n → ∞ lim P ( G ( n , p ) 包含三角形 ) = ⎩ ⎨ ⎧ 0 , 1 , 若 p ( n ) ≪ n 1 , 若 p ( n ) ≫ n 1 .
函数 p ∗ ( n ) = 1 n p^*(n) = \frac{1}{n} p ∗ ( n ) = n 1 称为随机图中“包含三角形”这一性质的阈值函数(threshold function) 。当边概率跨过该临界尺度时,三角形出现的渐近概率从 0 跃迁至 1。这种临界性质在随机图理论中称为相变(phase transition) 。一阶矩方法与二阶矩方法分别对应了刻画阈值上下界的标准分析框架。