扔硬币的试验与问题
下面有一枚可以调节正面出现概率 p 的“硬币”。我们来用它做一些投掷硬币的试验。
先想一组具体结果。 假设十次投掷依次是 H、T、H、H、T、H、T、H、H、H,其中有7次正面。正面比例是70%;若用 p=0.5 作比较,正面个数比10×0.5多了2个。
启用 JavaScript 后,可以按1、10、100或1,000次继续投掷,调整正面概率,并比较同一数据的比例、个数偏差和不同尺度。下面的问题也可以用这组有限记录先想一想。
在这个小游戏中,我们能做不少事情,也可以观察到不少有意思的事情,我这里列举几个:
- 多扔一些。 绿色曲线是不是逐渐靠近了表示 p 的虚线?它会从某一次开始就一直留在虚线的一小段范围里吗?
- 重新来一组。 用同样的 p,再扔一遍。旧曲线会变成灰色。条件明明一样,曲线却不一样,随着投掷次数增多,两个曲线会有什么关系吗?
- 换一种视角。 切到“与 np 的偏差”。正面比例看起来越来越稳时,正面个数与 np 的差也会越来越小吗?再试试把偏差除以 n 看看呢?
- 换一枚硬币。 把 p 改成 0.7,重新试一遍。
规律与问题
虽然每一次硬币投掷的结果是随机的,但是,当投掷的数量变得很多的时候,我们可以发现一些规律。这些规律也能自然的产生一些问题。
第一,正面比例到底会不会稳定? 应该可以观察到,随着投掷次数的增多,正面比例会越来越接近 p。但是,正面比例会一直稳定在 p 附近吗?
第二,稳定以后,还剩下多大的波动? 如果正面的比例越来越接近 p,那么它的波动会越来越小吗?
第三,我们怎样根据结果判断硬币? 我们能否根据投掷的结果来判断硬币的正面概率 p?如果我们只扔了十次,正面比例是 0.7,那么我们能否说硬币的正面概率就是 0.7 呢?如果我们扔了一百次,正面比例是 0.7,那么我们能否说硬币的正面概率就是 0.7 呢?扔了多少次之后,我们就可以“自信”的说硬币的正面概率就是 0.7 呢?
第四,连续正面的次数会不会越来越长? 如果我们一直扔下去,连续正面的次数会不会越来越长?如果是的话,它会有什么规律呢?
为了回答这些问题,我们需要给扔硬币的试验建立一个数学模型。我们希望这个模型既能把我们眼前看到的现象描述清楚,又能让我们用数学的方法来分析它。
1.1 两个骰子的试验
我们来讨论一个更加简单并且具体的例子:扔两枚六面骰子,一枚红色,一枚蓝色。我们约定先记红骰子的点数,再记蓝骰子的点数。比如 (2,5) 就是红骰子为2、蓝骰子为5。所有可能的结果放在一起,就是
Ω={1,2,…,6}2.
我们把这个集合叫作样本空间(sample space),其中的一个元素 ω 叫作样本点(outcome)。名字听起来有点正式,其实在这个例子里,一个样本点就是我们扔完骰子后记下来的一对数,也就是一次投骰子试验的结果。注意,因为我们的骰子有颜色之分,所以 (2,5) 和 (5,2) 是两个不同的结果。
接下来给这些结果分配概率。我们假设两枚骰子都公平,而且两枚骰子之间的结果不会相互影响。换句话说,36个有序对,每一个出现的概率都是 1/36。做了一次试验之后,我们会关心一些事情,比如“两个点数的和是4” 这件事情有没有发生。它表达的意思是,投出来的结果是不是 (1,3)、(2,2)、(3,1) 这三个结果中的一个。因此,我们可以用下面这个子集来表示它:
A={(1,3),(2,2),(3,1)}.
我们把这样的子集叫作事件(event)。说“事件 A 发生”,就是实际扔出的那个样本点落在 A 里面。在这个例子里,A 有3个点,每个点的概率都是 1/36,所以,我们说 A 发生的概率,也就是投两个骰子,它们点数之和等于4的概率是 3/36=1/12。
1.2 概率空间与概率公理
概率公理都来自于对现实生活中随机试验的抽象。我们先把注意力集中在所谓的“离散概率空间”,即随机试验的结果是有限个或者至多可数无限个的情况。我们这样做的原因在于,需要先在离散的场合建立关于概率的正确直观,而不必过早地把精力花在不可数的概率空间引起的一些系统性问题上。当然,在这门课里,我们的目标是建立一个一般性的理论。我们将在对离散的世界理解得足够好之后,再讨论一般的概率空间,并看看哪些直观能够直接类比过去,哪些不能。
因此,在介绍抽象的概率公理时,我们脑海中最好能有一个例子,从而明白每一条公理出现的理由。在这儿,我们就继续想着上一节扔两个骰子的试验。
一个概率空间是一个三元组 (Ω,F,P)。我们分别来解释它们的含义。
其中 Ω 是样本空间,即随机试验所有可能结果的集合。在两个骰子的例子里,我们已经把它写成了 {1,2,…,6}2。
三元组中的第二项 F⊆2Ω 是“事件族”,用来表示这个随机试验中所有可以讨论的事件。我们在上一节已经看到,一个事件可以用 Ω 的一个子集表示,而 F 就是这些事件组成的集合。注意,Ω 中的元素是样本点,F 中的元素则是事件,也就是样本点的集合。
一个很自然的问题是,我们为什么不把 F 直接取成 2Ω,而只要求它是 2Ω 的一个子集呢?这里我认为有好几个原因。首先一个比较重要的原因是,在我们以后要研究的连续模型中,把 F 取成 2Ω 可能会“太大了”,以至于没有办法在上面定义我们所希望的概率。具体的原因,我们在 §1.4 给出一个证明。另外,允许 F 是 2Ω 的子集也给我们提供了一些便利;以后学习条件期望、随机过程时,我们会更多地把它解释成某种意义上的“信息”。
如果你同意 F 不一定要取成 2Ω,那么我们就要给它加一些限制,因为并不是 2Ω 的每一个子集都合适当成事件族。在这儿,我们要求 F 构成一个 σ-代数(σ-algebra),又称 σ-域。
定义 1.1 σ-代数
设 Ω 为非空集合。我们说集合族 F⊆2Ω 是一个 σ-代数,如果它满足:
- ∅∈F,Ω∈F;
- 如果事件 A∈F,则它在 Ω 中的补集 Ac∈F;
- 如果可数个事件 A1,A2,…∈F,则 ⋃n≥1An∈F。
这三条要求与我们对随机试验的直观理解是很对应的。第一条告诉我们,需要有“不可能事件”和“必然事件”。第二条告诉我们,如果 A 是一个合理的事件,那么“A 不发生”也应该是一个合理的事件。第三条是说,如果 A1,A2,… 都是合理的事件,那么“它们之中至少有一个发生”也应该是一个合理的事件。有限个事件的并自然也包括在内,只要在后面补上一串空集即可。
定义里没有另外要求对交集封闭,因为这已经可以从补集和并集的要求推出来。用 De Morgan 法则,我们有
n≥1⋂An=(n≥1⋃Anc)c∈F.
同样,A∖B=A∩Bc 也在 F 里。所以,接下来我们对事件取交、取差时,得到的仍然是可以讨论的事件。
三元组中的第三项 P:F→[0,1] 给每一个事件赋予一个 [0,1] 之间的数,表示这个事件发生的概率,被称为概率测度。与事件族的要求相对应,我们对 P 也有要求:
- P(∅)=0,P(Ω)=1;
- 对任意事件 A∈F,P(Ac)=1−P(A);
- 对任意两两不相交的事件 A1,A2,…∈F,有
P(n≥1⋃An)=n≥1∑P(An).
最后一条叫作可数可加性。右边的无穷和,指的是有限部分和的极限。我们已经要求空集的概率为零,因此有限个不相交事件的可加性也包括在这条要求里。
这里的要求有一些冗余,比如第二条可以由第一条和第三条推出:把 Ω 写成 A 与 Ac 的不交并就行了。我把它们都列出来,是为了让这些公理和我们对事件的直观理解对应起来。对 σ-代数的要求也是类似的:补集封闭且包含 Ω,就已经保证它包含空集。
有了这三样东西,我们就把一个随机试验写成了概率空间 (Ω,F,P)。
也许有人会问,为什么 P 要定义成事件族 F 上的函数,而不是样本空间 Ω 上的函数呢?事实上,当 Ω 是离散的,并且取 F=2Ω 时,这两种做法并没有多大区别。对每一个样本点 ω,我们记
pω=P({ω}).
那么根据可数可加性,每个事件的概率都可以写成
P(A)=ω∈A∑pω.
也就是说,P 在单点集上的取值决定了它在所有事件上的取值。但值得注意的是,在 Ω 不可数时,这种做法未必行得通,我们需要按照公理的形式把 P 定义成事件上的函数。
例 1.2 (第二枚骰子不均匀) 现在我们把第二枚,也就是蓝骰子,换成一枚不均匀的骰子。假设它出现1、2、3、4、5的概率各是 1/10,出现6的概率是 1/2。红骰子仍然公平,两枚骰子仍然相互独立。这些概率加起来是 5×1/10+1/2=1,所以蓝骰子本身的概率分配没有问题。
我们应该怎样修改刚才的概率空间?样本空间不用改,仍然是 Ω={1,2,…,6}2;事件族也不用改,仍然是 F=2Ω。改变的是每个样本点的概率。我们把新的概率记作 Q,与刚才的 P 区分开。对于任意 i∈{1,…,6},定义
Q({(i,j)})=⎩⎨⎧601,121,j≤5,j=6.
这个分配对应的正是我们刚才说的试验:红骰子的每个点数占 1/6,再分别乘上蓝骰子各点数的概率。比如 (1,2) 的概率是 1/6×1/10=1/60,而 (1,6) 的概率是 1/6×1/2=1/12。两种结果现在就不一样容易出现了。
我们也可以直接检查,36个样本点的总概率仍然是1。其中30个点的第二个坐标不是6,另外6个点的第二个坐标是6,所以
ω∈Ω∑Q({ω})=30⋅601+6⋅121=1.
对任意事件 E⊆Ω,让 Q(E) 等于其中各个样本点的概率之和,就得到了一个概率测度。因此,(Ω,F,Q) 是另一个完全合法的概率空间。
再算一次“两个点数之和是4”。事件仍然是刚才的 A={(1,3),(2,2),(3,1)},但现在这三个点的概率各是 1/60,所以
Q(A)=601+601+601=201.
比较 例 1.1 和 例 1.2:同样的36个样本点,同样的事件 A,换了一套概率分配,答案就从 1/12 变成了 1/20。我们定义概率空间时,并没有要求每个样本点的概率相同。只有在等可能的特殊情形下,才能用“事件里的点数除以总点数”来计算;一般情况下,要加的是各个点的概率。
1.3 集合运算与事件的基本性质
从上面关于概率公理的讨论可以看到,我们现在可以用集合的语言来讨论概率。特别是在有限、等可能的模型中,计算概率就是组合计数;如果样本点并不等可能,则要把相应的概率加起来。但在很多时候,我们希望把这些对于概率空间的操作和背后的随机试验结合起来,这样能够给出我们一些重要的直观。这些直观能够帮助我们从“概率”的视角去看待问题。在未来,你一定会发现,有很多在概率视角看起来显然正确、无比简单的事情,如果机械地把它翻译成对集合或者元素的操作,就会变得笨拙而繁琐。
我们首先来看一些简单的集合运算和随机试验之间的对应。一次试验得到结果 ω,事件 A 发生,就是说 ω∈A。沿着这个解释,下面两列说的其实是同一件事情。
| A |
事件 A 发生 |
| Ac |
事件 A 不发生 |
| A∪B |
事件 A 和 B 至少有一个发生 |
| A∩B |
事件 A 和 B 同时发生 |
| A∖B |
事件 A 发生,但是 B 没有发生 |
| A⊆B |
事件 A 发生就一定有 B 发生 |
| A∩B=∅ |
事件 A 和 B 不可能同时发生 |
| A∪B=Ω |
事件 A 和 B 至少有一个必定发生 |
比如,投掷两个骰子时,“两个点数都是偶数”蕴含“两个点数的和是偶数”。用集合的语言说,前一个事件是后一个事件的子集。所以后一个事件的概率不应该比前一个小。这样的解释很直观,不过我们还要看看,怎样从刚才的公理把它证明出来。
上面的表格其实已经用到了一些 σ-代数的性质:如果 A,B∈F,那么 A∩B 以及 A∖B 也应该在 F 中。我们先把这些基本性质验证一下。以下均在同一个概率空间 (Ω,F,P) 中讨论,A,B,A1,A2,… 都是事件。
命题 1.2 事件的交仍然是事件
对有限或可数多个事件 A1,A2,…,有
n≥1⋂An∈F.
这里 ⋂n≥1An 是所有同时属于每个 An 的样本点组成的集合。从随机试验的角度说,就是这些事件全部发生。
证明
我们在上一节已经见过这个办法。使用 De Morgan 法则,有
n≥1⋂An=(n≥1⋃Anc)c.
右边只用了取补集和可数并这两种操作,因此属于 F。有限个事件的情形也一样。
命题 1.3 事件的差仍然是事件
A∖B∈F。
证明
由于 A∖B=A∩Bc,结论由取补集的封闭性和刚才的命题得到。
命题 1.4 概率的单调性
如果 A⊆B,则 P(A)≤P(B)。
证明
把 B 拆成 A 和剩下的 B∖A。这两部分不相交,所以根据可加性,
P(B)=P(A)+P(B∖A)≥P(A).
最后一步用了概率的非负性。
命题 1.5 两个事件的并
P(A∪B)=P(A)+P(B)−P(A∩B).
这个公式从随机试验的视角也很好理解:我们把 A 和 B 发生的概率相加,同时发生的部分就算了两遍,所以需要减掉一份。
证明
我们同样把 A∪B 拆成不相交的部分:A∖B、A∩B 和 B∖A。因此
P(A∪B)=P(A∖B)+P(A∩B)+P(B∖A).
另一方面,同样由可加性,
P(A)P(B)=P(A∖B)+P(A∩B),=P(B∖A)+P(A∩B).
将这两个等式相加,再减去一份 P(A∩B),就得到结论。
Union bound:先求一个上界
有时候,交集很难算,但我们只想知道“至少有一件事情发生”的概率有多大。那就干脆不减这一份:多算了不要紧,反正我们要的是一个上界。这个简单的观察给出一个非常好用的工具。
命题 1.6 Union bound(并集上界)
对任意有限或可数多个事件 A1,A2,…,
P(n≥1⋃An)≤n≥1∑P(An).
这里不要求事件独立。
证明
有限个事件时,可以反复使用刚才两个事件的公式。对于可数多个事件,我们直接做一次整理:第一个事件照收;轮到第二个事件,只收之前没收过的部分;以后也这样继续。用符号写出来,就是令 D1=A1,并对 n≥2 定义
Dn=An∖k<n⋃Ak.
每个样本点只在它第一次出现时被收进来,既没有漏掉,也没有重复。也就是说,这些 Dn 两两不交,而它们的并仍然是原来的 ⋃nAn。再注意 Dn⊆An,使用可数可加性和单调性就得到
P(n⋃An)=n∑P(Dn)≤n∑P(An).
这个不等式也叫 Boole 不等式。它在概率分析中有很广泛的应用:不管事件之间有什么关系,只要能算出每个事件的概率,就有了它们至少发生一个的概率上界。
例 1.3 (100次投掷中,会出现连续10次正面吗?) 我们独立地扔100次公平硬币,出现连续10次正面的概率有多大?如果根据定义直接去数所有符合要求的结果不是一件简单的事情,因为这些连续的正面可能出现在不同位置,还可能重叠。比如连续11次正面,就包含了两段连续10次正面。但我们使用 union bound,就可以很容易的得到这个概率的一个上界。
令 Ai 表示“第 i 次到第 i+9 次投掷都是正面”这个事件。起点 i 可以从1取到91。对每个固定的起点,这10次投掷的 210 种正反面组合等可能,其中只有一种全是正面,所以
P(Ai)=2101.
用 C 表示事件“出现连续10次正面”,那么,它发生就等价于存在某个 Ai 发生。因此,使用 union bound,有
P(C)=P(i=1⋃91Ai)≤i=1∑91P(Ai)=102491<9%.
于是,至少有91%的概率,这100次投掷中不会出现连续10次正面。 注意,虽然每次投掷相互独立,但这些 Ai 会涉及相同的投掷,我们不能把它们也当成相互独立的事件。Union bound 不要求它们独立。我们的这个估计里可能把同一种结果算了好几遍,不过,多算只会让答案变大,因此得到的仍然是一个合法的上界。
概率与单调极限
接着我们来讨论集合序列的极限。这里先只考虑单调的集合序列;更一般的上极限和下极限,我们以后再定义。
对于非降的序列 A1⊆A2⊆⋯,定义
n→∞limAn:=n≥1⋃An,
也记作 An↑A,其中 A=⋃nAn。类似地,对于非增的序列 A1⊇A2⊇⋯,定义
n→∞limAn:=n≥1⋂An,
也记作 An↓A,其中 A=⋂nAn。
这两个定义也可以从随机试验的视角去理解。比如连续扔硬币,令 An 表示“前 n 次出现过正面”,那么 An 随 n 增大,而 ⋃nAn 表示“总有某一次会出现正面”。反过来,令 Bn 表示“前 n 次全是反面”,那么 Bn 随 n 减小,而 ⋂nBn 表示“永远没有出现正面”。这里先用这两个事件帮助理解;无限次投掷的概率空间怎样严格构造,我们以后会讨论。
我们当然希望能先算前 n 次的概率,再让 n 越来越大。接下来的命题就告诉我们,概率测度作为一个定义在事件上的函数,是“连续”的:对于单调事件序列,它可以和求极限交换。
命题 1.7 概率测度的连续性
若 An↑A 或 An↓A,则
P(A)=n→∞limP(An).
证明
我们先证明非降的情形。还是把事件拆成不相交的部分:第一步拿出 A1,以后每一步只拿新增加的部分。令 D1=A1,对 n≥2 令 Dn=An∖An−1。这些增量互不相交,而且
A=n≥1⨆Dn,AN=n=1⨆NDn.
由可数可加性和无穷级数的定义,
P(A)=n≥1∑P(Dn)=N→∞limn=1∑NP(Dn)=N→∞limP(AN).
对于非增的情形,取补集以后有 Anc↑Ac。把刚才的结论用在补集上,就有
P(A)=1−P(Ac)=1−n→∞limP(Anc)=n→∞limP(An).
大家在数学分析里已经见过,极限和别的运算换个顺序,有时是会出问题的。这里能把概率与极限交换,是因为事件序列单调,而且概率满足可数可加性。后面的课上,我们会用它计算“硬币永远都是反面”的概率。
1.4 为什么 F 不能总取 2Ω?
我们一开始说了,在 Ω 是不可数的时候,如果选 F=2Ω,也许没有办法定义出合适的概率测度。我们这儿给出一个证明。我们取 Ω=[0,1),F=2Ω,并且试图在上面定义一个均匀分布 P。那么 [0,1) 上的均匀分布应该给每一个集合 E⊆Ω 一个“长度”,而对于这个长度,我们有一些最基本的期待:首先是对于区间 (a,b)⊆[0,1),这个长度应该就是 b−a。另外就是所谓的“平移不变性”,也就是说如果我们把某个集合 E 整体平移一个距离 r,那么它的长度应该是不变的,即 P(E)=P(E+r)。这里 E+r 是把 E 平移了 r 之后,再绕回 [0,1) 的集合,即
E+r={(x+r)mod1:x∈E}.
其中记号 tmod1 的意思是如果 t 不在 [0,1) 内的话,就把它加上或者减去整数,使得其属于 [0,1)。
我们首先在 Ω 上定义一个等价关系:x∼y 当且仅当 x−y∈Q,即两者之差是有理数。那么,根据等价关系的基本性质,这个等价关系诱导出的等价类构成了 Ω 的一个分划,即 Ω=⋃i∈IPi,满足对于 i=j,Pi∩Pj=∅,并且任意 x,y∈Pi 都有 x∼y。
我们现在从每一个 Pi 中选出一个元素 si 来,把它们放在一起,构成集合 N,即 N={si:i∈I}。这一步需要选择公理保证。对于每一个 r∈Q∩[0,1),我们考虑集合
Nr:=N+r={(x+r)mod1:x∈N}.
我们首先证明,这些 Nr 构成了 [0,1) 的一个分划。
首先,任意一个 x∈[0,1) 一定属于某个 Nr。实际上,假设 x∈Pi,那么 x−si∈Q。取
r=(x−si)mod1,
就有 r∈Q∩[0,1),并且 (si+r)mod1=x,因此 x∈Nr。
另一方面,我们要说明,不同的 Nr 不会相交。如果 x∈Nr1∩Nr2,那么可以找到 s,s′∈N,使得
x=(s+r1)mod1=(s′+r2)mod1.
这说明 s+r1 与 s′+r2 相差一个整数。因此,s−s′ 是有理数,即 s∼s′。但我们从每一个等价类里只选了一个代表元,所以必有 s=s′。于是 r1−r2 是整数;由于 r1,r2 都在 [0,1) 中,只能有 r1=r2。这就证明了,当 r1=r2 时,Nr1 与 Nr2 不相交。
知道了这些 Nr 是 Ω 的一个分划之后,我们的公理就保证了,一定有
P(Ω)=r∈Q∩[0,1)∑P(Nr).
这里用到了两件事情:因为我们假设 F=2Ω,所以每个 Nr 都是事件;而 Q∩[0,1) 是可数集,所以可以使用可数可加性。
我们知道上式的左手边等于1,而且由于平移不变性,每一个 P(Nr) 都是相同的,并且都等于 P(N)。因此,我们有可数无穷个 P(N) 相加等于1。但这显然是不可能的:如果 P(N)=0,则右边等于0;如果 P(N)>0,则右边为无穷大。
这个证明告诉我们,F 里面的集合太多了,以至于我们没有办法给每个集合一个满足这些要求的长度。这里不能定义的是我们所希望的、平移不变的均匀概率测度。
所以我们应该如何设定 F,从而定义出 [0,1) 上的均匀分布呢?我们刚才说了,直观上对于区间 (a,b)⊆[0,1),我们一定要有 P((a,b))=b−a。因此,我们要把所有的区间都放到 F 里面去。我们考虑能省则省的原则,认为这就够了。由于我们要求 F 一定要是一个 σ-代数,我们可以取 F 为包含所有区间的“最小”的那个 σ-代数,这个被称为 Borel σ-代数。我们接着定义这个最小的概念,并说明它总是存在的。
首先我们说明一下,σ-代数是对求交封闭的。固定样本空间 Ω。假设对于非空的、可能不可数的指标集 I,每一个 Fα⊆2Ω 都是 σ-代数,则
F:=α∈I⋂Fα
也是 σ-代数。这件事情的证明非常简单,按照 σ-代数的定义逐条验证即可。值得说明的是,如果把交集换成并集,就不一定对了。
设 G⊆2Ω 是 Ω 的一些子集组成的集合族,不一定是 σ-代数。我们用 σ(G) 表示包含 G 的最小的 σ-代数:
- 首先,σ(G) 是一个 σ-代数,并且包含 G;
- 对于任何包含 G 的 σ-代数 F′,都有 σ(G)⊆F′。这便是“最小”的意思。
对于任何 G,σ(G) 总是存在的。这是由于首先 2Ω 本身就是包含 G 的一个 σ-代数。因此,我们可以取 σ(G) 为所有包含 G 的 σ-代数的交。它一定是存在的,而且根据交的定义,也一定是最小的。
有了合适的事件族,在它上面构造均匀概率测度就是接下来的任务。这件事情我们在后面讨论一般概率空间时完成。
参考与阅读
本讲以张驰豪 Prob2025 第2讲“概率空间” 为主要底稿。§1.4沿用旧稿的等价类、代表元和有理数平移证明,以及 Borel σ-代数与生成 σ-代数的讨论,修正了取模和集合族记号的细节。