概率统计¶
知识点¶
统计¶
定义 1. 抽样方法¶
-
简单随机抽样 :放回简单随机抽样和不放回简单随机抽样的统称.
不放回简单随机抽样中,未进入样本的个体被抽概率相等.
-
样本:通过简单随机抽样获得的样本为简单随机样本.
-
分层随机抽样:按变量将总体划分为若干子总体(层),在各层独立进行简单随机抽样,合并样本作为总样本.
-
比例分配:若每层样本量与层的大小成比例,称比例分配.
定义 2. 随机数表抽样¶
随机数表抽样是简单随机抽样的实现方式之一,利用随机数表生成的等概率随机,确保总体中每个个体被抽取的概率\(P\)相等(适用于N个个体的总体,\(P = \dfrac{1}{N}\) ),满足抽样的随机性与公平.
步骤1: 将总体\(N\)个个体唯一编码(如编号为\(00, 01, \dots, N-1\),编码位数与随机数表位数匹配,若\(N=120\),统一用\(3\)位编码:\(000\)无效,\(001\)至\(120\) ).
步骤2: 随机选择行与列作为起始点(如闭眼指表、随机数生成器选坐标),消除人为选择偏差.
步骤3: 沿固定方向(如从左到右、从上到下)读取数表,提取符合编码范围的数(超出的数跳过,重复数去重)
步骤4: 持续读取至抽取\(n\)个有效编码,对应个体组成样本.
定义 3. 总体均值与样本均值(简单随机抽样)¶
-
总体均值:总体有 \(N\) 个个体,变量值为 \(Y_1, Y_2, \cdots, Y_N\),则 \(\overline{Y} = \dfrac{Y_1 + Y_2 + \cdots + Y_N}{N} = \dfrac{1}{N}\sum\limits_{i=1}^{N}Y_i\)
若不同值有 \(k\) 个,频数为 \(f_i\),则 \(\overline{Y} = \dfrac{1}{N}\sum\limits_{i=1}^{k}f_iY_i\)(加权形式).
-
样本容量为 \(n\),变量值 \(y_1, y_2, \cdots, y_n\),则 \(\overline{y} = \dfrac{y_1 + y_2 + \cdots + y_n}{n} = \dfrac{1}{n}\sum\limits_{i=1}^{n}y_i\), 常用 \(\overline{y}\) 估计总体均值 \(\overline{Y}\).
定义 4. 估计总体平均数的方法¶
-
简单随机抽样:从总体中用简单随机抽样抽取一个容量为 \(n\) 的样本,它们的变量值分别为 \(y_1,y_2,\cdots,y_n\),则称 \(\overline{y}=\dfrac{y_1 + y_2+\cdots+y_n}{n}\) 为样本均值,又称样本平均数,我们常用样本平均数 \(\overline{y}\) 去估计总体平均数.
-
分层随机抽样:核心方法是用样本中各层的平均数估计总体中各层的平均数.
以将总体分 \(2\) 层为例,
设第 \(1\) 层各个个体的变量值分别为 \(X_1,X_2,\cdots,X_M\),从第 \(1\) 层中抽取的样本的变量值分别为 \(x_1,x_2,\cdots,x_m\),
则可用第 \(1\) 层的样本平均数 \(\overline{x}=\dfrac{x_1 + x_2+\cdots+x_m}{m}\) 来估计第 \(1\) 层的总体平均数 \(\overline{X}=\dfrac{X_1 + X_2+\cdots+X_M}{M}\)
设第 \(2\) 层的各个个体的变量值分别为 \(Y_1,Y_2,\cdots,Y_N\),从第 \(2\) 层中抽取的样本的变量值分别为 \(y_1,y_2,\cdots,y_n\),
则可用第 \(2\) 层的样本平均数 \(\overline{y}=\dfrac{y_1 + y_2+\cdots+y_n}{n}\) 来估计第 \(2\) 层的总体平均数 \(\overline{Y}=\dfrac{Y_1 + Y_2+\cdots+Y_N}{N}\).
所以总体的平均数的估计值为
\[ \dfrac{M\cdot\overline{x}+N\cdot\overline{y}}{M + N}=\dfrac{M}{M + N}\overline{x}+\dfrac{N}{M + N}\overline{y} \]在按比例分配的分层随机抽样中,\(\dfrac{m}{M}=\dfrac{n}{N}=\dfrac{m + n}{M + N}\),所以 \(\dfrac{M}{M + N}=\dfrac{m}{m + n}\),\(\dfrac{N}{M + N}=\dfrac{n}{m + n}\),
从而
\[ \dfrac{M}{M + N}\overline{x}+\dfrac{N}{M + N}\overline{y}=\dfrac{m}{m + n}\overline{x}+\dfrac{n}{m + n}\overline{y} \],其中 \(\dfrac{m}{m + n}\overline{x}+\dfrac{n}{m + n}\overline{y}\) 即为总样本平均数, 故可用总样本平均数估计总体平均数.
结论 1. 分层抽样的均值和方差(人教A必修二P216-11)¶
若总体划分为两层, 第一层\(m\)个数,分别为\(x_1, x_2, \dots, x_m\),平均数为\(\bar{x}\),方差为\(s_1^2\);
第二层\(n\)个数,分别为\(y_1, y_2, \dots, y_n\),平均数为\(\bar{y}\),方差为\(s_2^2\).
记总的样本平均数为\(\bar{\omega}\),样本方差为\(s^2\),则
解释:点到总中心的距离平方 = 点到层中心的距离平方 + 层中心到总中心的距离平方,
总方差 = 各层内部波动的加权平均 + 各层中心相对于总中心的偏移带来的波动
同理,若层数分为3层,第1层、第2层和第3层的样本量、样本平均数和样本方差分别为\(l,\bar{x},s_x^2\);\(m,\bar{y},s_y^2\)和\(n,\bar{z},s_z^2\).记总的样本平均数为\(\bar{w}\),样本方差为\(s^2\),则
定义 5. 频率分布直方图¶
绘制频率分布表和频率分布直方图的步骤:
第一步:求极差(即一组数据中最大值与最小值的差).
第二步:决定组距与组数.
组距是指每个小组的两个端点之间的距离,极差、组距、组数之间有如下关系:
-
若\(\dfrac{\text{极差}}{\text{组距}}\)为整数,则\(\dfrac{\text{极差}}{\text{组距}} =\)组数;
-
若\(\dfrac{\text{极差}}{\text{组距}}\)不为整数,则\(\left\lfloor\dfrac{\text{极差}}{\text{组距}}\right\rfloor + 1 =\)组数.(\(\lfloor x \rfloor\)表示不大于\(x\)的最大整数)
第三步:将数据分组.对组内数据所在区间取左闭右开区间,最后一组取闭区间.
第四步:统计各组数据的频数,计算频率,完成频率分布表.
第五步: 画频率分布直方图.根据频率分布表,画出频率分布直方图.在频率分布直方图中,纵轴表示\(\dfrac{\text{频率}}{\text{组距}}\),各小长方形的面积表示相应各组的频率.
频率分布直方图的特征:
-
各个小矩形的面积和为\(1\).
-
纵轴的含义为\(\dfrac{\htmlClass{blank}{\text{频率}}}{\htmlClass{blank}{\text{组距}}}\),矩形的面积\(=\)组距\(\times\dfrac{\text{频率}}{\text{组距}} =\)频率.
定义 6. 百分位数¶
一组数据的第 \(p\) 百分位数是这样一个值,它使得这组数据中至少有 \(p\%\) 的数据小于或等于这个值,且至少有 \((100 - p)\%\) 的数据大于或等于这个值,其计算步骤为:
-
按从小到大排列原始数据;
-
计算 \(i = n\times p\%\) ,其中 \(n\) 为样本量;
-
若 \(i\) 不是整数,而大于 \(i\) 的比邻整数为 \(j\),则第 \(p\) 百分位数为第 \(j\) 项数据;
若 \(i\) 是整数,则第 \(p\) 百分位数为第 \(i\) 项和第 \(i + 1\) 项的平均数.
常用的分位数有第25百分位数,第50百分位数(即中位数),第75百分位数.这三个分位数把一组由小到大排列后的数据分成四等份,因此称为四分位数.
其中第25百分位数也称为第一四分位数或下四分位数,第75百分位数也称为第三四分位数或上四分位数.
定义 7. 平均数¶
-
一组数据 \(x_1,x_2,\cdots,x_n\) 的平均数 \(\overline{x}=\dfrac{x_1 + x_2+\cdots+x_n}{n}\).
-
由频率分布直方图估计样本平均数,常用每组区间中点值代表落在该区间的数据,
若设各组区间中点为 \(x_1,x_2,\cdots,x_n\),对应各组的频率为 \(f_1,f_2,\cdots,f_n\),则可估计样本平均数 \(\overline{x}=\htmlClass{blank}{\sum\limits_{i = 1}^{n}x_if_i}\).
定义 8. 中位数¶
-
对于从小到大排列的一组数据,若数据个数为奇数,则中位数为最中间的一个数据;若数据个数为偶数,则中位数为中间两个数据的平均数.
-
由频率分布直方图估计样本中位数,应在横轴上找到一个数,使其左右两侧面积各占\(0.5\).
定义 9. 众数¶
-
一组数据中出现次数最多的数据即为该组数据的众数,若有几个数据出现次数一样多,且都比其它数据多,则它们都是众数.
-
由频率分布直方图估计样本众数,取最高的小矩形区间中点即可.
定义 10. 极差¶
一组数据的最大值与最小值之差,它可以一定程度反映数据的离散程度.
定义 11. 方差、标准差¶
方差、标准差:刻画数据的离散程度.方差、标准差越大,数据越分散,反之越集中.
-
一组数据 \(x_1,x_2,\cdots,x_n\) 的方差
\[ s^{2}=\htmlClass{blank}{\frac{1}{n}\sum\limits_{i = 1}^{n}(x_i-\overline{x})^{2}}=\htmlClass{blank}{\frac{1}{n}\sum\limits_{i = 1}^{n}x_{i}^{2}-\overline{x}^{2}}, \]方差公式的两种形式都需掌握,计算或证明时都可能用到. 方差的算术平方根 \(s\) 即为标准差. 若数据 \(x_1,x_2,\cdots,x_n\) 有重复,设其不重复的值为 \(y_1,y_2,\cdots,y_k\),对应的数据个数依次为 \(f_1,f_2,\cdots,f_k\),则 \(s^{2}=\frac{1}{n}\sum\limits_{i = 1}^{k}f_i(y_i - \overline{x})^{2}\).
-
由频率分布直方图估计样本方差,常用每组区间中点值代表落在该区间的数据,
若设各组区间中点为 \(x_1,x_2,\cdots,x_n\),对应各组的频率为 \(f_1,f_2,\cdots,f_n\),则可估计样本方差
\[ s^{2}=\sum\limits_{i = 1}^{n}(x_i-\overline{x})^{2}f_i \]
结论 2. \(ax_i+b\)的数据计算¶
假设一组数据\(x_1,x_2,\cdots,x_n\)的平均数为\(\bar{x}\),方差为\(s_x^2\),第\(p\)百分位数为\(x_p\),众数为\(x_0\),极差为\(x_{\text{max}} - x_{\text{min}}\);
数据\(y_1,y_2,\cdots,y_n\)的平均数为\(\bar{y}\),方差为\(s_y^2\),第\(p\)百分位数为\(y_p\),众数为\(y_0\),极差为\(y_{\text{max}} - y_{\text{min}}\).
若\(y_i = a x_i + b \ (i=1,2,\cdots,n)\),则:
概率¶
定义 1. 随机试验、样本点与样本空间¶
把对随机现象的实现和对它的观察称为随机试验,简称试验,常用字母\(E\)表示.具有以下特点:
-
相同条件下可重复进行
-
所有可能结果是明确可知的,并且不止一个;
-
每次试验总是恰好出现这些可能结果中的一个,但事先不能确定出现哪一个结果.
-
样本点:把随机试验\(E\)的每个可能的\(\textbf{基本结果}\)称为样本点,一般地,用\(\omega\)表示样本点.
-
样本空间:全体样本点的集合称为试验\(E\)的样本空间,一般地,用\(\Omega\)表示样本空间.
-
在本书中,我们只讨论\(\Omega\)为有限集的情况. 如果一个随机试验有\(n\)个可能结果\(\omega_1,\omega_2,\ldots,\omega_n\),则称样本空间\(\Omega = \{ \omega_1,\omega_2,\ldots,\omega_n \}\)为有限样本空间.
定义 2. 事件的分类¶
-
随机事件:可能发生也可能不发生的事件,称为随机事件,即样本空间的\(\Omega\)的子集为随机事件,把只包含一个样本点的事件称为基本事件
-
必然事件:一定会发生的事件,称为必然事件,\(\Omega\)作为自身的子集,包含了所有的样本点,在每次试验中总有一个样本点发生,即样本空间\(\Omega\)为必然事件.必然事件的概率\(P(\Omega)=1\).但概率为1的事件不一定是必然事件.
-
不可能事件:一定不会发生的事件,称为不可能事件,即\(\varnothing\)不包含任何样本点,为不可能事件.不可能事件的概率\(P(\varnothing)=0\).但概率为0的事件不一定是不可能事件.
-
确定事件:必然事件与不可能事件统称为确定事件
定义 3. 事件的关系和运算¶
定义 4. 古典概型¶
样本空间的样本点只有有限个,每个样本点发生的可能性相等. 满足这两个特征的试验称为古典概型试验,其数学模型称为古典概型. 在古典概型中,事件\(A\)发生的概率
,其中\(n(A)\)表示事件\(A\)包含的样本点的个数,\(n(\Omega)\)表示样本空间\(\Omega\)包含的样本点个数.
性质 1. 概率的基本性质¶
-
对任意随机事件\(A\),都有\(0\leq P(A)\leq 1\). 必然事件的概率为\(1\),不可能事件的概率为\(0\),即\(P(\Omega)=1\),\(P(\varnothing)=0\).
-
互斥事件的概率加法公式:若事件\(A\)与事件\(B\)互斥,则\(P(A\cup B)=\htmlClass{blank}{P(A)+P(B)}\).
-
若事件\(A\)与事件\(B\)互为对立事件,则\(P(A)=1 - P(B)\),\(P(B)=1 - P(A)\),事件\(A\)的对立事件一般记作\(\overline{A}\).
-
设\(A\),\(B\)是一个随机试验中的两个事件,则\(P(A\cup B)=\htmlClass{blank}{P(A)+P(B)-P(A\cap B)}=1 - P(\overline{A}\overline{B})\).
定义 5. 频率与概率(频率稳定性、随机模拟)¶
-
频率的稳定性:在\(n\)次重复试验中,事件\(A\)发生\(n_A\)次,称\(f_n(A) = \dfrac{n_A}{n}\)为\(A\)出现的频率. 当\(n\)很大时,频率\(f_n(A)\)总在某个常数附近摆动并趋于稳定,这个常数就是事件\(A\)的概率\(P(A)\).
-
用频率估计概率:在大量重复试验中,可用事件发生的频率作为其概率的估计值.
-
随机模拟(蒙特卡洛方法):用计算器或计算机产生的随机数来模拟随机试验,再以频率估计概率,是处理难以直接计算的概率(包括用面积比刻画的几何概型)的常用方法.
定义 6. 事件的独立性¶
如果事件 \(A\)(或 \(B\))是否发生对事件 \(B\)(或 \(A\))发生的概率没有影响,这样的两个事件叫做相互独立事件.
对任意两个事件\(A\)和\(B\),若
,则称事件\(A\)与事件\(B\)相互独立.
-
当事件\(A\)与\(B\)独立时,\(\overline{A}\)与\(B\),\(A\)与\(\overline{B}\),\(\overline{A}\)与\(\overline{B}\)也都相互独立.
证明:因为 \(A = AB \cup A\overline{B}\), \(AB\) 与 \(A\overline{B}\) 互斥, \(P(A) = P\left(AB \cup A\overline{B}\right) = P(AB) + P\left(A\overline{B}\right) = P(A)P(B) + P\left(A\overline{B}\right)\)
\(P\left(A\overline{B}\right) = P(A) - P(A)P(B) = P(A)\left(1 - P(B)\right) = P(A)P\left(\overline{B}\right)\) 所以由独立性的定义,\(A\) 与 \(\overline{B}\) 也相互独立.
-
如果事件 \(A_1, A_2, \ldots, A_n\) 相互独立,那么这 \(n\) 个事件同时发生的概率等于每个事件发生的概率的积,即
\[ P(A_1 A_2 \ldots A_n) = P(A_1) P(A_2) \ldots P(A_n) \] -
若三个事件 \(A,B,C\) 两两相互独立则 \(\begin{cases} P(AB) = P(A)P(B)\\ P(BC) = P(B)P(C)\\ P(AC) = P(A)P(C)\end{cases}\) 此时\(P(ABC) = P(A)P(B)P(C)\)一般不成立.
随机变量及其分布¶
定义 1. 条件概率(人教A选必三P44)¶
一般地,设\(A\),\(B\)为两个随机事件,且\(P(A){\gt}0\),我们称
为在事件\(A\)发生的条件下,事件\(B\)发生的条件概率,简称{条件概率}.
计算条件概率常用两种方法:
-
基于样本空间 \(\varOmega\),分别计算 \(P(A)\) 和 \(P(AB)\),代入上述条件概率公式求 \(P(B|A)\);
-
根据条件概率的直观意义,以事件 \(A\) 作为新的样本空间,求事件 \(B\) 发生的概率: \(P(B|A)\) 即为“在 \(A\) 中考虑 \(B\) 发生的概率”,故 \(P(B|A)\) 等于阴影部分的样本点个数除以事件 \(A\) 的样本点个数.
条件概率满足以下性质:
-
\(P(\varOmega \mid A) = 1\);\(P(B \mid A) + P(\overline{B} \mid A) = 1\).
-
若 \(B, C\) 互斥,则 \(P(B \cup C \mid A) = P(B \mid A) + P(C \mid A)\);
定义 2. 乘法公式¶
对于任意两个事件\(A\)与\(B\),若\(P(A){\gt}0,P(B){\gt}0\),则
我们称上式为概率的乘法公式,显然,若\(P(A){\gt}0\),则当且仅当事件\(A\)与\(B\)相互独立时,等式\(P(B|A)=P(B)\)成立. 实际应用时选择 \(A\) 还是 \(B\) 作为条件,要看问题中 \(P(B \mid A)\),\(P(A \mid B)\) 哪个好算,通常情况下,已知前面的试验结果,计算后面试验结果的概率比较好算,所以常选择以前面的试验结果为条件.
对于任意三个事件\(A,B,C\),当\(P(AB){\gt}0\)时,有 \(P(ABC)=P(A)P(B|A)P(C|AB)\)
这个公式还可以推广到\(n\)个事件\(A_1,A_2,\dots,A_n\),当\(P(A_1A_2\dots A_{n-1}){\gt}0\)时,有
定义 3. 全概率公式¶
若把样本空间 \(\varOmega\) 按某一事件 \(A\) 是否发生来划分,即 \(A\) 与 \(\bar{A}\),则对任意事件 \(B\),有
这是全概率公式的最简单情况. 用此公式求概率,其本质是将事件 \(B\) 划分成互斥的两部分 \(AB\) 和 \(\bar{A}B\) 分别求概率再相加.
一般地,设\(A_1\),\(A_2\),\(\cdots\),\(A_n\)是一组两两互斥的事件,且\(A_1\cup A_2\cup\cdots\cup A_n = \Omega\),\(P(A_i){\gt}0\),\(i = 1, 2, \cdots, n\),则对任意的事件\(B\subseteq\Omega\),有
建立全概率公式的过程,也就是寻找合适的划分样本空间的方法来解决复杂概率问题的过程.
贝叶斯公式(Bayes formula):设\(A_1\),\(A_2\),\(\cdots\),\(A_n\)是 一组两两互斥的事件,\(A_1\cup A_2\cup\cdots\cup A_n = \Omega\),且 \(P(A_i){\gt}0\),\(i = 1, 2, \cdots, n\),则对任意的事件 \(B\subseteq\Omega\), \(P(B){\gt}0\),有
定义 4. 离散型随机变量¶
一般地,对于随机试验样本空间\(\Omega\)中的每个样本点\(\omega\), 都有唯一的实数 \(X(\omega)\)与之对应,我们称 \(X\) 为{随机变量} . 可能取值为有限个或可以一一列举的随机变量,我们称 为{离散型随机变量}. 通常用大写 英文字母表示随机变量,例如 \(X\),\(Y\),\(Z\);用小写英文字母 表示随机变量的取值,例如 \(x\),\(y\),\(z\).
一般地,设离散型随机变量 \(X\) 的可能取值为\(x_1\),\(x_2\),\(\cdots\),\(x_n\),我们称 \(X\) 取每一个 值\(x_i\)的概率
为 \(X\) 的{概率分布列},简称{分布列}.
定义 5. 分布列¶
一般地,若离散型随机变量 \(X\) 的分布列如表所示,
为随机变量 \(X\) 的均值 或数学期望,数学期望简称期 望.
均值是随机变量可能取值关于取值概率的加权平均数,它综合了随机变量的取值和取 值的概率,反映了随机变量取值的平均水平.
为随机变量 \(X\) 的方差,有时也记为 \(Var(X)\),并称\(\sqrt{D(X)}\)为随机变量 \(X\) 的标准差,记为 \(\sigma(X)\).
随机变量的方差和标准差都可以度量随机变量取值与其均值的偏离程度,反映了随机变量取值的离散程度. 方差或标准差越小,随机变量的取值越集中;方差或标准差越大,随机变量的取值越分散.
性质 1. 均值、方差、标准差的性质¶
设 \(X\) 为离散型随机变量,\(a, b\) 为常数,则
-
\(D(X) = \htmlClass{blank}{E\left(X^2\right) - \left[ E(X) \right]^2} = \sum\limits_{i=1}^n x_i^2 p_i - \left[ E(X) \right]^2\),这是方差的简化计算公式;
-
\(E(aX + b) = \htmlClass{blank}{aE(X) + b}\);\(D(aX + b) = \htmlClass{blank}{a^2 D(X)}\),\(\sigma(aX + b) = \htmlClass{blank}{\lvert a \rvert \sigma(X)}\),这是期望和方差的性质.
定义 6. 伯努利试验¶
我们把只包含两个可能结果的试验叫做{伯努利试验}. 我们将一个伯努利试验独立地重复进行 \(n\) 次所组成的随 机试验称为\(n\) {重伯努利试验}. 显然,\(n\) 重伯努利试验具有如 下共同特征:
(1) 同一个伯努利试验重复(“重复”意味着各次试验成功的概率相同)做 \(n\) 次;
(2) 各次试验的结果相互独立.
定义 7. 二项分布¶
一般地,在 \(n\) 重伯努利试验中,设每次试验中事件 \(A\) 发生的概率为 \(p(0 {\lt} p {\lt} 1)\),用 \(X\) 表示事件 \(A\) 发生的次数, 则 \(X\) 的分布列为
如果随机变量 \(X\) 的分布列具有上式的形式,则称随机变量 \(X\) 服从{二项分布},记作 \(X\sim B(n,p)\).
由二项式定理,容易得到 \(\sum\limits_{k = 0}^{n}P(X = k)=\sum\limits_{k = 0}^{n}C_{n}^{k}p^{k}(1 - p)^{n - k}=[p+(1 - p)]^{n}=1.\)
结论 1. 二项分布的概率最大项¶
若 \(X \sim B(n, p)\),要使得 \(P(X=k)\) 取得最大值,求 \(k\).
通常通过作商法或作差法,即由 \(\begin{cases} P(X=k) \ge P(X=k-1) \\ P(X=k) \ge P(X=k+1) \end{cases}\),解得 \(\htmlClass{blank}{(n+1)p - 1} \le k \le \htmlClass{blank}{(n+1)p}\).
性质 2. 二项分布的期望和方差¶
一般地,可以证明: 如果 \(X\sim B(n,p)\),那么 \(E(X)=\htmlClass{blank}{np}\),\(D(X)=\htmlClass{blank}{np(1 - p)}\).
下面我们对均值进行证明. 令 \(q = 1 - p\),由 \(kC_{n}^{k}=nC_{n - 1}^{k - 1}\),可得
定义 8. 超几何分布¶
一般地,假设一批产品共有 \(N\) 件,其中有 \(M\) 件次品. 从 \(N\) 件产品中随机抽取 \(n\) 件 (不放回),用 \(X\) 表示抽取的 \(n\) 件产品中的次品数,则 \(X\) 的分布列为
其中 \(n\),\(N\),\(M\in\mathbf{N}^*\),\(M\leq N\),\(n\leq N\),\(m=\max\{0,n - N + M\}\),\(r=\min\{n,M\}\). 如果 随机变量 \(X\) 的分布列具有上式的形式,那么称随机变量 \(X\) 服从{超几何分布}.
二项分布与超几何分布的关系:对于不放回的抽取,当 \(n\) 远小于 \(N\) 时,每抽取一次后,对 \(N\) 的影响很小,此时,超几何分布可用二项分布近似.
结论 2. 超几何分布的概率最大项¶
若超几何分布 \(X\) 的分布列为 \(P(X = k)=\frac{C_{M}^{k}C_{N - M}^{n - k}}{C_{N}^{n}}\),要使得 \(P(X=k)\) 取得最大值,求 \(k\).
同样通过作差法或作商法,由\(\begin{cases} P(X=k) \ge P(X=k-1) \\ P(X=k) \ge P(X=k+1) \end{cases}\),解得 \(\dfrac{(M+1)(n+1)}{N+2} - 1 \le k \le \dfrac{(M+1)(n+1)}{N+2}\).
性质 3. 超几何分布的期望和方差¶
实际上,由随机变量均值的定义,令 \(m=\max(0,n - N + M)\),\(r=\min(n,M)\),有
备注:方差的公式解答题中是不能直接使用的,了解即可.
定义 9. 连续型随机变量¶
现实中, 有大量问题中的随机变量不是离散型的,它们的取值往往充 满某个区间甚至整个实轴,但取一点的概率为0,我们称这 类随机变量为{连续型随机变量}.
定义 10. 正态分布(人教A选必三P83)¶
设函数
其中 \(\mu\in\mathbf{R}\),\(\sigma{\gt}0\) 为参数.
显然,对任意的 \(x\in\mathbf{R}\),\(f(x){\gt}0\),它的图象在 \(x\) 轴的 上方. 可以证明 \(x\) 轴和曲线之间的区域的面积为1.
我们称 \(f(x)\)为{正态密度函数},称它的图象为{正态密度曲线},简称 {正态曲线}.若随机变量 \(X\) 的概率分布密度 函数为 \(f(x)\),则称随机变量 \(X\) 服从{正态分布},记为 \(X\sim N(\mu,\sigma^{2})\). 特别地,当 \(\mu = 0\),\(\sigma = 1\) 时,称随机变量 \(X\) 服从{标准正态分布}.
若 \(X\sim N(\mu,\sigma^{2})\),\(X\) 取值不超过 \(x\) 的概率 \(P(X\leq x)\)为图中区域 \(A\) 的面积,而 \(P(a\leq X\leq b)\) 为区域 \(B\) 的面积.
性质 4. 正态曲线的性质¶
由 \(X\) 的密度函数及图象可以发现,正态曲线还有以下特点:
-
曲线是单峰的,它关于直线 \(x = \mu\) 对称
-
曲线在 \(x = \mu\) 处达到峰值\(\frac{1}{\sigma\sqrt{2\pi}}\)
-
当\(\vert x\vert\)无限增大时,曲线无限接近 \(x\) 轴
-
当 \(\mu\) 取定值时,因为曲线的峰值\(\frac{1}{\sigma\sqrt{2\pi}}\)与 \(\sigma\) 成反比,而且对任意的 \(\sigma{\gt}0\),曲线与 \(x\) 轴 围成的面积总为1.
-
当 \(\sigma\) 较小时,峰值高,曲线 “瘦高”,表示随机变量 \(X\) 的分布 比较集中;
当 \(\sigma\) 较大时,峰值低,曲线 “矮胖”,表示随机变量 \(X\) 的分布比较分散.
-
参数 \(\mu\) 反映了正态 分布的集中位置,\(\sigma\) 反映了随机变量的分布相对于均值 \(\mu\) 的 离散程度.
-
期望和方差: 若 \(X\sim N(\mu,\sigma^{2})\),则 \(E(X)=\htmlClass{blank}{\mu}\),\(D(X)=\htmlClass{blank}{\sigma^{2}}\).
性质 5. \(3\sigma\) 原则¶
假设 \(X\sim N(\mu,\sigma^{2})\),可以证明:对给定的 \(k\in\mathbf{N}^*\),\(P(\mu - k\sigma\leq X\leq\mu + k\sigma)\)是一个只 与 \(k\) 有关的定值. 特别地,
尽管正态变量的取值范围是 \((-\infty,+\infty)\),但在一次试验中,\(X\) 的取值 几乎总是落在区间 \([\mu - 3\sigma,\mu + 3\sigma]\) 内,而 在此区间以外取值的概率大约只有 \(0.0027\),通常认为这种情况几乎不可能发生. 在实际应用中,通常认为服从于正态分布 \(N(\mu,\sigma^{2})\) 的随机变量 \(X\) 只取 \([\mu - 3\sigma,\mu + 3\sigma]\)中的值,这在统计学中称为{ \(3\sigma\) 原则}.
性质 6. 标准正态分布¶
-
在标准正态分布表中相应于\(x_0\)的值\(\Phi(x_0)\)是指总体取值小于\(x_0\)的概率,即\(\Phi(x_0) = P(x {\lt} x_0)\).
\(x_0 \geq 0\) 时,则\(\Phi(x_0)\)的值可在标准正态分布表中查到; \(x_0 {\lt} 0\) 时,可利用其图象的对称性获得\(\Phi(x_0) = 1 - \Phi(-x_0)\)来求出, 区间概率公式: \(P(x_1 {\lt} \xi {\lt} x_2) = P(\xi {\lt} x_2) - P(\xi {\lt} x_1) = \Phi(x_2) - \Phi(x_1)\)
-
\(N(\mu, \sigma^2)\)与\(N(0,1)\)的转换
-
若 \(\xi \sim N(\mu, \sigma^2)\),则\(\eta = \dfrac{\xi-\mu}{\sigma} \sim N(0,1)\),有 \(P(\xi {\lt} x_0) = F(x_0) = \Phi\left(\dfrac{x_0-\mu}{\sigma}\right);\)
-
若 \(\xi \sim N(\mu, \sigma^2)\),则 \(P(x_1 {\lt} x {\lt} x_2) = \Phi\left(\dfrac{x_2-\mu}{\sigma}\right) - \Phi\left(\dfrac{x_1-\mu}{\sigma}\right).\)
-
定义 11. 单点分布¶
若随机变量\(X\)的分布列为
,其中\(c\)为常数,则称\(X\)服从单点分布 .常数可看作服从单点分布的随机变量.
期望:根据期望公式\(E(X)=\sum\limits_{i}x_{i}P(X = x_{i})\),这里\(x_{i}=c\),\(P(X = c) = 1\),所以\(E(X)=c\times1 = c\).
方差:由方差公式\(D(X)=E[(X - E(X))^{2}]\),因为\(E(X)=c\),所以\(D(X)=(c - c)^{2}\times1 = 0\).这表明单点分布的随机变量没有波动,取值固定为\(c\).
定义 12. 两点分布¶
若随机变量\(X\)的分布列为
,则称\(X\)服从\(0 - 1\)分布(即两点分布 ). 常用于描述只有两种可能结果的伯努利试验,如抛一次硬币,正面记为\(1\)(概率为\(p\) ),反面记为\(0\)(概率为\(1 - p\) ).
-
期望:根据期望公式\(E(X)=\sum\limits_{i}x_{i}P(X = x_{i})\),\(E(X)=1\times p + 0\times(1 - p)=p\).它反映了在大量重复试验中,该随机变量取值的平均水平.
-
方差:\(E(X^{2})=1^{2}\times p + 0^{2}\times(1 - p)=p\),由\(D(X)=E(X^{2}) - [E(X)]^{2}\),得\(D(X)=p - p^{2}=p(1 - p)\) .方差衡量了随机变量取值相对于期望的离散程度,\(p(1 - p)\)越大,说明随机变量取值的离散程度越大.
定义 13. 几何分布¶
在独立重复试验中,每次试验只有两种结果,即事件\(A\)发生(概率为\(p\))和事件\(A\)不发生(概率为\(1 - p\)),设\(X\)表示首次取得成功(即事件\(A\)首次发生)时所进行的试验次数,则\(X\)是一个离散型随机变量,\(X\)的概率分布为
,\(k = 1,2,\cdots\),其中\(0 {\lt} p {\lt} 1\),称\(X\)服从几何分布,记为\(X\sim G(p)\).
几何分布具有如下特点:
-
无记忆性:如果\(X\)服从几何分布,对于任意正整数\(m\)和\(n\),有\(P(X{\gt}m + n|X{\gt}m)=P(X{\gt}n)\).
证明: 由条件概率公式,\(P(X{\gt}m+n \mid X{\gt}m) = \dfrac{P(X{\gt}m+n)}{P(X{\gt}m)}\). 先求 \(P(X{\gt}t)\):事件 \(\{X{\gt}t\}\) 表示前 \(t\) 次试验均未成功, 每次失败概率为 \(1-p\),各次独立,故 \(P(X{\gt}t) = (1-p)^t\).
代入得 \(P(X{\gt}m+n \mid X{\gt}m) = \dfrac{(1-p)^{m+n}}{(1-p)^m} = (1-p)^n = P(X{\gt}n).\).
这意味着在已经进行了\(m\)次试验且都失败的条件下,再进行\(n\)次试验仍未成功的概率,与从一开始就进行\(n\)次试验未成功的概率是一样的,即对过去的试验结果没有“记忆”.
-
期望与方差:{期望}\(E(X)=\dfrac{1}{p}\),{方差}\(D(X)=\dfrac{1 - p}{p^{2}}\).
【推导过程】 设 \(q = 1 - p\),利用“错位相减法”求期望:
\[ \begin{aligned} E(X) = \sum\limits_{k=1}^{\infty} kpq^{k-1} &= p \left( 1 + 2q + 3q^2 + \cdots + kq^{k-1} + \cdots \right) \\ q \cdot \frac{E(X)}{p} &= \qquad \quad q + 2q^2 + \cdots + (k-1)q^{k-1} + \cdots \\ \text{两式相减得:} (1-q) \frac{E(X)}{p} &= 1 + q + q^2 + \cdots = \frac{1}{1-q} \end{aligned} \]因为 \(1-q=p\),所以 \(p \dfrac{E(X)}{p} = \dfrac{1}{p}\),即 \(E(X) = \dfrac{1}{p}\).
类似地,求 \(E(X(X-1)) = \sum\limits_{k=1}^{\infty} k(k-1)pq^{k-1}\): 令 \(S = \sum\limits_{k=2}^{\infty} k(k-1)q^{k-2}\),运用错位相减法或对无穷等比数列求二次导, 可化简得 \(S = \dfrac{2}{(1-q)^3} = \dfrac{2}{p^3}\). 从而 \(E(X^2 - X) = pq \cdot S = \dfrac{2q}{p^2}\).
故方差 \(D(X) = E(X^2) - [E(X)]^2 = E(X^2-X) + E(X) - [E(X)]^2 = \dfrac{2q}{p^2} + \dfrac{1}{p} - \dfrac{1}{p^2} = \dfrac{2q+p-1}{p^2} = \dfrac{q}{p^2} = \dfrac{1-p}{p^2}\).
【例】某人投篮命中率为\(0.3\),设\(X\)为首次投中所需次数,则\(X\sim G(0.3)\). 第\(k\)次才首次投中的概率为
\(P(X = k) = 0.7^{k-1}\times 0.3\). 其期望为 \(E(X) = \dfrac{1}{0.3} = \dfrac{10}{3}\)(即平均需要投篮\(\dfrac{10}{3}\)次才能首次命中).
定义 14. 极大似然估计¶
设总体\(X\)的概率密度为\(f(x;\theta)\)(当\(X\)为离散型时,\(f(x;\theta)\)为概率分布律),\(\theta\in\Theta\),其中\(\theta\)为待估的未知参数,\(\Theta\)为参数\(\theta\)的可能取值所成的参数空间,\(x_1,x_2,\cdots,x_n\)是总体样本\(X_1,X_2,\cdots,X_n\)的一组观察值,称
为样本的{似然函数};若存在\(\hat{\theta}\in\Theta\),使得\(L(\hat{\theta})=\max_{\theta\in\Theta}L(\theta)\)成立,则称\(\hat{\theta}\)为参数\(\theta\)的{极大似然估计值},而称\(\hat{\theta}(X_1,X_2,\cdots,X_n)\)为\(\theta\)的{极大似然估计量}.当\(L(\theta)\)往往是关于\(\theta\)可微时,一般\(\hat{\theta}\)可由方程组\(\dfrac{dL(\theta)}{d\theta}=0\)解得,又由于\(L(\theta)\)与\(\ln L(\theta)\)同时取得最大值,故等价地可由方程组\(\dfrac{d\ln L(\theta)}{d\theta}=0\)求得,这两个方程都称为似然方程.当\(L(\theta)\)关于\(\theta\)不可微或上述方程组无解时,需根据极大似然估计的定义和\(\theta\)的取值范围\(\Theta\)求\(\hat{\theta}\).
性质 7. 极大似然估计的性质¶
-
渐近无偏性:在一定条件下,极大似然估计量随着样本容量\(n\)的增大,其期望趋近于真实参数值,即\(\lim\limits_{n \to \infty}E(\hat{\theta}) = \theta\) 这意味着当样本数据足够多时,极大似然估计得到的结果在平均意义上是接近真实参数的.
-
渐近有效性:随着样本容量增加,在所有的渐近无偏估计量中,极大似然估计量的方差会达到最小,也就是估计值更集中在真实参数附近,估计效果更好.
-
一致性:当样本容量趋向于无穷大时,极大似然估计量依概率收敛于真实参数值,即对任意正数\(\epsilon\),有\(\lim\limits_{n \to \infty}P(|\hat{\theta} - \theta| {\lt} \epsilon) = 1\) ,表明样本量越大,估计值越接近真实参数.
【例】:2018年高考课标I卷第20题: 某工厂产品成箱包装,每箱\(20\)件,每件产品不合格概率为\(p\),各件产品是否不合格相互独立.从一箱产品中任取\(2\)件作检验,记\(2\)件产品中恰有\(1\)件不合格品的概率为\(f(p)\) .
【分析】:求\(f(p)\)最大值点,实际就是在已知取\(2\)件产品恰有\(1\)件不合格品这一试验结果下,求不合格率\(p\)的极大似然估计.此时总体是两点分布(产品合格或不合格),从一箱产品中取\(2\)件产品相当于进行两次独立试验,是总体的样本.
【解】:\(f(p)=C_{2}^{1}p(1 - p)=2p - 2p^{2}\),令\(f^\prime(p)=2 - 4p = 0\),解得\(p = 0.5\) .当\(p {\lt} 0.5\)时,\(f^\prime(p){\gt}0\),\(f(p)\)单调递增;当\(p {\gt} 0.5\)时,\(f^\prime(p){\lt}0\),\(f(p)\)单调递减,所以\(f(p)\)最大值点是\(p = 0.5\),此\(p = 0.5\)就是不合格率\(p\)的极大似然估计值.
定义 15. 马尔可夫链¶
马尔可夫链是一组具有无后效性的随机状态序列. 通俗地说,就是将来只受现在影响,与过去无关. 即系统在下一个时刻的状态,只由当前时刻的状态决定,而不依赖于以往的历史状态. 这种性质称为马尔可夫性.
状态转移与转移图: 可以用带箭头的图直观地表示状态之间的转移过程:圆圈表示状态,箭头上的数字表示一步转移的概率.
【人教A选必三P50例4】某学校有 \(A\),\(B\) 两家餐厅,王同学第 \(1\) 天午餐时随机地选择一家餐厅用餐.如果第 \(1\) 天去 \(A\) 餐厅,那么第 \(2\) 天去 \(A\) 餐厅的概率为 \(0.6\);如果第 \(1\) 天去 \(B\) 餐厅,那么第 \(2\) 天去 \(A\) 餐厅的概率为 \(0.8\).
该过程的状态转移图和状态转移矩阵 \({P}\)可以表示为:
若设王同学第 \(n\) 天去 \(A\) 餐厅的概率为 \(p_n\),那么第 \(n\) 天去 \(B\) 餐厅的概率为 \(1-p_n\). 要计算第 \(n+1\) 天去 \(A\) 餐厅的概率 \(p_{n+1}\),同样根据全概率公式(分今日去\(A\)且明日去\(A\)、今日去\(B\)且明日去\(A\)两种情况):
化简便可得到从第 \(n\) 天到第 \(n+1\) 天的递推公式:\(p_{n+1} = -0.2p_n + 0.8\). 由此便可利用构造等比数列的方法求出 \(p_n\) 的通项公式及极限情况(稳态分布).
结论 3. 无吸收壁的一维随机游走¶
一维随机游走,指在一维空间中,即一条直线数轴上, 有一个可以任意移动的质点位于某处 \(x = i\)(\(i \in \mathbb{Z}\))的地方, 它能够以一定的概率向左、原地不动或向右移动一个单位长度,每个单位时间移动一次. 该模型分为没有吸收壁和有吸收壁两种类型. 所谓吸收壁,就是数轴上某处 \(x = m\)(\(m \in \mathbb{Z}\))存在一个可以吸收质点的屏障, 当质点运动至 \(x = m\) 时就被吸收,停止运动过程. 吸收壁这个概念并不是必要的,只是想刻意强调运动的边界性以及该运动存在尽头, 是一个终止条件,也可以直接定义说质点运动至 \(x = m\) 就停止运动.
无吸收壁的一维随机游走 是上述一维随机游走的原始定义,没有边界,永远移动.这时候研究它的位置状态.
设 \(P_i\) 为质点在 \(x = i\) 位置的概率,向左移动的概率为 \(a\),原地不动的概率为 \(b\),向右移动的概率为 \(c\),其中 \(a + b + c = 1\).
质点在 \(x = i\) 位置,有可能是之前它从 \(i+1\) 向左移动到 \(i\)(以 \(a\) 的概率), 也有可能是之前它在 \(i\) 原地不动(以 \(b\) 的概率), 或是之前它从 \(i-1\) 向右移动到 \(i\)(以 \(c\) 的概率).用全概率公式表述为:
因此质点在 \(x = i\) 位置的概率递推式为:
结论 4. 有吸收壁的一维随机游走¶
在原定义基础上,在某个位置 \(x = m\) 添加吸收壁对运动进行限制. 可以在单独一侧放置吸收壁,也可以两侧都放上吸收壁. 放上吸收壁以后,原本单调的一维空间就有了新的可以研究的东西.在有吸收壁的一维随机游走中,我们不再去关注它处在某一位置的概率, 因为这个一维空间变得不够自由,有吸收壁约束,原本的无吸收壁的递推式就不成立,研究位置概率并不好. 现在它在某位置 \(x = i\) 开始不停随机运动,之后非常有可能撞上吸收壁.现在研究它从到达吸收壁的概率.
设\(P_i\)为质点从 \(x = i\) 到吸收壁 \(x = m\) 的概率 ,初始位置 \(x = i\),吸收壁 \(x = 0\),\(x = m\), 其中 \(0 {\lt} i \leq m\)(\(i, m \in \mathbb{Z}\)).
质点每个单位时间移动一次,要从 \(x = i\) 到达 \(x = m\) 的方式有很多种,它有可能先以 \(a\) 的概率向左走一步到达 \(i-1\),再以 \(p_{i-1}\) 的概率到达吸收壁 \(x = m\); 也有可能以 \(b\) 的概率原地不动,以本来的概率 \(p_i\) 到达吸收壁 \(x = m\); 或者是以 \(c\) 的概率向右移动一步到达 \(i+1\),再以 \(p_{i+1}\) 的概率到达吸收壁 \(x = m\). 用全概率公式表述为:
因此质点从 \(x = i\) 到吸收壁 \(x = m\) 的概率递推式为:
注意:没有吸收壁的随机游走研究的是位置概率,有吸收壁的随机游走研究的是被吸收概率,所以它们的递推式才会不一样,思路也是不一样的.
例题 1. 人教A选必三P81-3拓展¶
如图,一个质点在随机外力的作用下,从原点 \(0\) 出发,每隔 \(1\ \text{s}\) 等可能地向左或向右移动一个单位, 求运动 \(n\) 秒后质点位于位置 \(i\) 的概率 \(P_{n, i}\) :
解:设第 \(n\) 秒后质点处于位置 \(i\) 的概率为 \(P_{n,i}\). 由于每次仅向左或向右等可能移动一个单位,即 \(a=\dfrac{1}{2}, b=0, c=\dfrac{1}{2}\). 若第 \(n\) 秒质点处于位置 \(i\),那么在第 \(n-1\) 秒时,它必定只能位于 \(i-1\) 或 \(i+1\),且各自向右或向左移动一步的概率均为 \(\dfrac{1}{2}\). 由全概率公式,可建立关于时间和位置的递推关系式:
为了使质点在 \(n\) 秒后到达位置 \(i\),设其中向右移动了 \(k\) 次,向左移动了 \(n-k\) 次,则有: \(\begin{cases} k + (n-k) = n \\ k - (n-k) = i \end{cases} \implies k = \dfrac{n+i}{2}\) 可知,质点要能到达位置 \(i\),必须满足 \(n\) 与 \(i\) 同奇偶,且 \(|i| \le n\). 此时,路径组合数相当于从 \(n\) 步中挑出 \(\dfrac{n+i}{2}\) 步向右(即 \(C_n^{\frac{n+i}{2}}\)),而每条特定路径的概率均为 \(\big(\dfrac{1}{2}\big)^n\). 因此通项公式为:
成对数据的统计分析¶
定义 1. 变量相关性定义(人教A选必三P93)¶
如果当一个变量的值增加时,另一个变量的相应值呈现增加的趋势,就称这两个变量正相关.
如果当一个变量的值增加时,另一个变量的相应值呈现减少的趋势,则称这两个变量负相关.
一般地,如果两个变量的取值呈现正相关或负相关,而且散点落在一条直线附近,我们就称这两个变量线性相关.
定义 2. 样本相关系数公式¶
设变量\(x\)和变量\(y\)的样本数据为\((x_1,y_1),(x_2,y_2),\cdots,(x_n,y_n)\),样本均值分别为\(\overline{x}=\frac{1}{n}\sum\limits_{i = 1}^{n}x_i\),\(\overline{y}=\frac{1}{n}\sum\limits_{i = 1}^{n}y_i\), 样本相关系数\(r\)的计算公式为:
其中\(x_i'=\dfrac{x_i-\overline{x}}{\sqrt{\sum\limits_{i = 1}^{n}(x_i-\overline{x})^2}}\),\(y_i'=\dfrac{y_i-\overline{y}}{\sqrt{\sum\limits_{i = 1}^{n}(y_i-\overline{y})^2}}\).
公式的来历:从散点 \((x_i-\overline{x},\,y_i-\overline{y})\)(\(i=1,2,\cdots,n\))的横、纵坐标是否同号得到启发,可以构造一个量
一般情形下,\(L_{xy}{\gt}0\) 表明成对样本数据正相关;\(L_{xy}{\lt}0\) 表明成对样本数据负相关.
因为 \(L_{xy}\) 的大小与数据的度量单位有关,所以不宜直接用它度量成对样本数据相关程度的大小. 例如,在研究体重与身高之间的相关程度时,如果体重的单位不变,把身高的单位由米改为厘米,则相应的 \(L_{xy}\) 将变为原来的 \(100\) 倍,但单位的改变并不会导致体重与身高之间相关程度的改变.
为了消除度量单位的影响,需要对数据作进一步的“标准化”处理. 我们用
分别除 \(x_i-\overline{x}\) 和 \(y_i-\overline{y}\)(\(i=1,2,\cdots,n\)),把“标准化”处理后的成对数据记为 \((x_1',y_1'),(x_2',y_2'),\cdots,(x_n',y_n')\),仿照 \(L_{xy}\) 的构造,可以得到
即为上面的样本相关系数公式.
取值范围 \(-1\leqslant r\leqslant1\) 的推导:观察 \(r\) 的结构,联想到平面向量、空间向量数量积的坐标表示,把向量的维数推广到 \(n\) 维:\(n\) 维向量 \(\boldsymbol{a}\),\(\boldsymbol{b}\) 的数量积仍定义为 \(\boldsymbol{a}\cdot\boldsymbol{b}=\vert\boldsymbol{a}\vert\,\vert\boldsymbol{b}\vert\cos\theta\),且 \(\boldsymbol{a}\cdot\boldsymbol{b}=a_1b_1+a_2b_2+\cdots+a_nb_n\). 设“标准化”后成对数据的第一分量构成 \(n\) 维向量 \(\boldsymbol{x}'=(x_1',x_2',\cdots,x_n')\),第二分量构成 \(n\) 维向量 \(\boldsymbol{y}'=(y_1',y_2',\cdots,y_n')\),则有
因为 \(\vert\boldsymbol{x}'\vert=\vert\boldsymbol{y}'\vert=\sqrt{n}\),所以样本相关系数 \(r=\cos\theta\),其中 \(\theta\) 为向量 \(\boldsymbol{x}'\) 和向量 \(\boldsymbol{y}'\) 的夹角. 由 \(-1\leqslant\cos\theta\leqslant1\),可知 \(-1\leqslant r\leqslant1\).
当 \(\vert r\vert=1\) 时,\(r=\cos\theta\) 中的 \(\theta=0\) 或 \(\pi\),向量 \(\boldsymbol{x}'\) 和 \(\boldsymbol{y}'\) 共线. 由向量的知识可知,存在实数 \(\lambda\),使得 \(\dfrac{y_i-\overline{y}}{s_y}=\lambda\dfrac{x_i-\overline{x}}{s_x}\)(\(i=1,2,\cdots,n\)). 这表明成对样本数据 \((x_i,y_i)\) 都落在直线 \(y-\overline{y}=\dfrac{\lambda s_y}{s_x}(x-\overline{x})\) 上,这时成对样本数据的两个分量之间满足一种线性关系.
性质 1. 样本相关系数性质¶
-
当\(r {\gt} 0\)时,称成对样本数据正相关. 当其中一个数据的值变小时,另一个数据的值通常也变小;当其中一个数据的值变大时,另一个数据的值通常也变大.
当\(r {\lt} 0\)时,称成对样本数据负相关. 当其中一个数据的值变小时,另一个数据的值通常会变大;当其中一个数据的值变大时,另一个数据的值通常会变小.
-
取值范围:\(- 1\leqslant r\leqslant1\).
-
当\(\vert r\vert\)越接近\(1\)时,成对样本数据的线性相关程度越强. 当\(\vert r\vert\)越接近\(0\)时,成对样本数据的线性相关程度越弱.
定义 3. 一元线性回归¶
用 \(x\) 表示父亲身高,\(Y\) 表示儿子身高,\(e\) 表示随机误差.假定随机误差 \(e\) 的均值为 \(0\),方差为与父亲身高无关的定值 \(\sigma^2\),则它们之间的关系可表示为:
称此为 \(Y\) 关于 \(x\) 的一元线性回归模型.其中,\(Y\) 为因变量/响应变量,\(x\) 为自变量/解释变量;\(a\)(截距参数)和 \(b\)(斜率参数)为未知参数,\(e\) 是 \(Y\) 与 \(bx + a\) 间的随机误差. 当 \(a\),\(b\) 取值为:
时,\(Q\) 达到最小. 将 \(\hat{y} = \hat{b}x + \hat{a}\) 称为 \(Y\) 关于 \(x\) 的经验回归方程(也称经验回归函数/公式),其图形为经验回归直线.求经验回归方程的方法为最小二乘法,\(\hat{b}\),\(\hat{a}\) 为 \(b\),\(a\) 的最小二乘估计.
最小二乘法:通常,我们利用点到直线 \(y=bx+a\) 的“距离”来刻画散点与该直线的接近程度. 由 \(y_i=bx_i+a+e_i\),得 \(\vert y_i-(bx_i+a)\vert=\vert e_i\vert\),显然 \(\vert e_i\vert\) 越小,表示样本点 \((x_i,y_i)\) 离直线 \(y=bx+a\) 的竖直距离越小. 因为绝对值使得计算不方便,所以人们通常用各散点到直线的竖直距离的平方之和
来刻画“整体接近程度”. 在上式中,\(x_i\),\(y_i\) 是已知的成对样本数据,所以 \(Q\) 是 \(a\),\(b\) 的函数;又因为 \(Q\) 还可以表示为 \(\sum\limits_{i=1}^{n}e_i^2\),即随机误差的平方和,这个和当然越小越好,所以我们取使 \(Q\) 达到最小的 \(a\),\(b\) 的值,作为截距和斜率的估计值.
推导:记 \(\overline{x}=\dfrac{1}{n}\sum\limits_{i=1}^{n}x_i\),\(\overline{y}=\dfrac{1}{n}\sum\limits_{i=1}^{n}y_i\). 因为
注意到
所以
上式右边各项均为非负数,且前 \(n\) 项与 \(a\) 无关. 所以,要使 \(Q\) 取到最小值,\(n(\overline{y}-b\overline{x}-a)^2\) 的值应为 \(0\),即 \(a=\overline{y}-b\overline{x}\). 此时
上式是关于 \(b\) 的二次函数,因此要使 \(Q\) 取得最小值,当且仅当 \(b\) 的取值为 \(\hat{b}=\dfrac{\sum\limits_{i=1}^{n}(x_i-\overline{x})(y_i-\overline{y})}{\sum\limits_{i=1}^{n}(x_i-\overline{x})^2}\). 综上,当 \(a\),\(b\) 的取值为上面的 \(\hat{b}\) 与 \(\hat{a}=\overline{y}-\hat{b}\overline{x}\) 时,\(Q\) 达到最小. 又由 \(\hat{a}=\overline{y}-\hat{b}\overline{x}\) 即 \(\overline{y}=\hat{b}\overline{x}+\hat{a}\),可知经验回归直线一定经过样本点的中心 \((\overline{x},\overline{y})\).
注: 上式中 \(\sum\limits_{i=1}^n (x_i - \bar{x})(y_i - \bar{y}) = \sum\limits_{i=1}^n x_i y_i - n\bar{x}\bar{y}\),\(\sum\limits_{i=1}^n (x_i - \bar{x})^2 = \sum\limits_{i=1}^n x_i^2 - n\bar{x}^2\).这种公式转换需熟练掌握(可能题目给一种形式,计算时需用另一种).以下给出 \(\sum\limits_{i=1}^n (x_i - \bar{x})(y_i - \bar{y}) = \sum\limits_{i=1}^n x_i y_i - n\bar{x}\bar{y}\) 的证明:
注意:回归方程一定通过样本点的中心\((\bar{x}, \bar{y})\),可能不经过\((x_1, y_1)\),\((x_2, y_2)\),\(\dots\),\((x_n, y_n)\)中的任何一点.
定义 4. 残差¶
对于响应变量 \(Y\),观测数据为观测值,经验回归方程得到的 \(\hat{y}\) 为预测值,观测值减预测值为残差(随机误差的估计结果). 用回归方程拟合变量 \(x\) 和 \(y\) 时,对样本点 \((x_1, y_1), (x_2, y_2), \dots, (x_n, y_n)\),称 观测值 \(y_i\) 与预测值 \(\hat{y}_i\) 的差 \(y_i - \hat{y}_i\) 为样本点 \((x_i, y_i)\) 的残差(\(i=1,2,\dots,n\)).
将残差绘制成图称为残差图:若残差点均匀落在水平带状区域,且区域越窄,模型拟合效果越好.
例如:用线性回归模型 \(l_1\) 和 \(l_2\) 拟合同一数据,残差图显示 \(l_1\) 的残差点分布在 \(x\) 轴附近更窄的带状区域,故 \(l_1\) 拟合效果优于 \(l_2\).
定义 5. 决定系数 \(R^2\)¶
分母 \(\sum\limits_{i=1}^n (y_i - \bar{y})^2\):样本数据的总偏差平方和(固定值).
分子 \(\sum\limits_{i=1}^n (y_i - \hat{y}_i)^2\):残差平方和. 比较回归模型时,可通过计算 \(R^2\) 对比优劣.
含义:在 \(R^2\) 的表达式中,\(\sum\limits_{i=1}^{n}(y_i-\overline{y})^2\) 与经验回归方程无关,残差平方和 \(\sum\limits_{i=1}^{n}(y_i-\hat{y}_i)^2\) 与经验回归方程有关. 这正是可以用 \(R^2\) 比较不同模型拟合效果的原因——对同一组数据,残差平方和越小的模型,其 \(R^2\) 越大.
\(R^2\) 越大,残差平方和越小,模型拟合效果越好;\(R^2\) 越小,残差平方和越大,拟合效果越差.
结论 1. 非线性回归模型¶
通过变换(取对数、取指数、平方等)转化为线性回归模型计算,有关考题一般会给出参考数据.
例如下图的这组观测数据 \((x_1, y_1), (x_2, y_2), \cdots, (x_n, y_n)\),若用线性回归模型 \(\hat{y} = \hat{b}x + \hat{a}\) 拟合,效果就比用指数模型 \(\hat{y} = \hat{a}e^{\hat{b}x}\) 拟合差. 而欲求模型 \(\hat{y} = \hat{a}e^{\hat{b}x}\) 中的 \(\hat{a}\) 和 \(\hat{b}\),可两端取自然对数,得到 \(\ln \hat{y} = \hat{b}x + \ln \hat{a}\) .若设 \(\begin{cases} \hat{z} = \ln \hat{y} \\ \hat{c} = \ln \hat{a} \end{cases}\), 则 \(\hat{z} = \hat{b}x + \hat{c}\),这样就将 \(y\) 关于 \(x\) 的非线性拟合转化成了 \(z\) 关于 \(x\) 的线性拟合. 这里用到的变换,就是取对数,我们可以将观测数据 \((x_1, y_1), (x_2, y_2), \cdots, (x_n, y_n)\) 变换成 \((x_1, z_1), (x_2, z_2), \cdots, (x_n, z_n)\),再用最小二乘法求得 \(z\) 关于 \(x\) 的线性回归方程,最后将 \(z\) 换回成 \(\ln y\) 即可.
定义 6. 零假设 \(H_0\)¶
设 \(X\) 和 \(Y\) 为取值于 \(\{0, 1\}\) 的成对分类变量,零假设为: \(H_0: P(Y = 1|X = 0) = P(Y = 1|X = 1)\),等价于分类变量 \(X\) 和 \(Y\) 独立,即:
定义 7. \(2 \times 2\) 列联表¶
\(a, b, c, d\) 为事件 \(\{X = x, Y = y\}\)(\(x, y = 0, 1\))的频数;\(n\) 为样本容量.
定义 8. 卡方统计量与检验规则(人教A选必三P124)¶
解释:在零假设 \(H_0\) 成立的条件下,根据频率稳定于概率的原理,可以把 \(\dfrac{(a+b)(a+c)}{n}\) 视为事件 \(\{X=0,Y=0\}\) 发生的频数的期望值(或预期值). 这样,该频数的观测值 \(a\) 与期望值 \(\dfrac{(a+b)(a+c)}{n}\) 应该比较接近,其余三格同理. 因此,如果 \(H_0\) 成立,下面四个量的取值都不应该太大:
反之,当这些量的取值较大时,就可以推断 \(H_0\) 不成立. 由于分别考虑四个差的绝对值比较困难,又因为期望值较大时相应差的绝对值也会较大,为合理地平衡这种影响,将四个差的绝对值取平方后分别除以相应的期望值再求和,得到统计量
该表达式可化简为上式 \(\chi^2=\dfrac{n(ad-bc)^2}{(a+b)(c+d)(a+c)(b+d)}\). \(\chi^2\) 的值越大,观测频数与“独立”假设下的期望频数偏离越大,就越有理由推断 \(X\),\(Y\) 不独立(若 \(X\),\(Y\) 恰好独立则 \(ad=bc\),\(\chi^2=0\));再借助小概率原理,用临界值 \(x_\alpha\) 作出判断.
查表确定\(x_{\alpha}\),基于小概率值 \(\alpha\) 的检验规则:
当 \(\chi^2 \htmlClass{blank}{\;\geq\;} x_{\alpha}\) 时,推断 \(H_0\) 不成立,认为 \(X\) 和 \(Y\) 不独立,有关联,犯错误概率不超过 \(\alpha\);
当 \(\chi^2 \htmlClass{blank}{\;{\lt}\;} x_{\alpha}\) 时,无充分证据推断 \(H_0\) 不成立,认为 \(X\) 和 \(Y\) 独立,没有关联.
结论 2. 独立性检验的基本步骤¶
根据小概率值 \(\alpha\) 的独立性检验,基本步骤如下:
-
提出零假设 \(H_0\): \(X\) 和 \(Y\) 相互独立, 并给出在问题中的解释.
-
根据抽样数据整理出 \(2 \times 2\) 列联表, 利用公式计算 \(\chi^2\) 的值.
-
根据实际问题的需要确定容许推断“两个分类变量有关系”犯错误概率的上界 \(\alpha\), 然后查表确定临界值 \(x_\alpha\).
-
当 \(\chi^2 \geq x_\alpha\) 时, 我们就推断 \(H_0\) 不成立, 即认为 \(X\) 和 \(Y\) 不独立, 该推断犯错误的概率不超过 \(\alpha\);
当 \(\chi^2 {\lt} x_\alpha\) 时, 我们没有充分证据推断 \(H_0\) 不成立, 可以认为 \(X\) 和 \(Y\) 独立.
题型¶
统计¶
题型 1. 抽样方法与分层抽样¶
题型识别:判断简单随机、系统、分层抽样,或计算各层抽样个数、估计总体均值.
核心思路:总体差异明显且可分层时优先分层抽样,各层样本量按总体占比确定. 总体均值估计是各层样本均值按层容量加权的平均.
解题步骤:
-
判断总体是否可按明显特征分层;
-
计算抽样比例\(\dfrac nN\);
-
各层按比例确定样本量并处理整数调整;
-
估计均值时按各层总体数量加权.
易错点:各层等量抽取而非按比例;样本均值直接平均;系统抽样起点和间隔不合法.
题型 2. 频率分布直方图与数字特征¶
题型识别:给频率分布表、直方图或样本数据,求频率、频数、百分位数、平均数、中位数、众数、方差或标准差.
核心思路:直方图柱高为频率/组距,柱面积才是频率. 分组数据的平均数、方差用组中值近似;比较波动性看方差或标准差,不看平均数.
解题步骤:
-
从横轴读组距、从纵轴读频率密度;
-
用“面积=频率”求未知频率或频数;
-
按累计频率定位百分位数、中位数所在组;
-
计算均值和方差时列频数或频率加权式.
易错点:将柱高直接当频率;组中值与组端点混用;方差平移、伸缩规律的平方关系遗漏.
概率¶
题型 1. 古典概型与样本空间¶
题型识别:掷骰、抽签、排列组合等等可能试验,要求某事件概率.
核心思路:先构造等可能且不重不漏的基本事件,再用\(P(A)=\dfrac{|A|}{|\Omega|}\). 分步过程常用排列组合计数,但必须保证分母、分子采用同一计数口径.
解题步骤:
-
明确一次试验的基本结果是否等可能;
-
计算样本空间总数;
-
计算满足事件的结果数;
-
约分并检查概率在\([0,1]\)内.
易错点:有序与无序口径不一致;重复抽取误当不放回;基本事件本身不等可能仍套古典概型.
题型 2. 互斥、对立与独立事件¶
题型识别:判断事件关系,或计算并、交、对立事件的概率.
核心思路:互斥指\(AB=\varnothing\),独立指\(P(AB)=P(A)P(B)\),两者概念不同. 并事件用加法公式,对立事件用\(P(\overline A)=1-P(A)\).
解题步骤:
-
先判断事件是否能同时发生;
-
写出所需的并、交、对立关系;
-
按互斥、独立或一般加法公式代入;
-
检查所得概率与事件包含关系一致.
易错点:把独立误认为互斥;并事件漏减交集;对立事件与“不独立”混淆.
题型 3. 对立事件与分类求概率¶
题型识别:直接计算目标事件较复杂,但其对立事件或按某特征分类后的事件较简单.
核心思路:至少、至多、不是全部等词常优先考虑对立事件;复杂事件可按互斥且完备的类别拆分后相加.
解题步骤:
-
判断目标是否适合改为“1减去对立事件”;
-
或选择唯一且完备的分类标准;
-
分别计算简单事件概率;
-
相加或相减后检查无重复遗漏.
易错点:对立事件写错;分类事件不互斥;将“至少一次”误作“恰好一次”.
条件概率与随机变量¶
题型 1. 条件概率、乘法公式与全概率¶
题型识别:有先后抽取、分组来源、检测筛查或多阶段试验,要求条件概率、交事件概率或总概率.
核心思路:\(P(A|B)=\dfrac{P(AB)}{P(B)}\)要求\(P(B){\gt}0\);乘法公式沿树状图逐支相乘;全概率公式按互斥完备的来源事件分解.
解题步骤:
-
明确条件事件和所求事件的先后、包含关系;
-
用树状图或表格列出各分支;
-
交事件沿路径相乘,总事件按互斥路径相加;
-
反向条件概率时最后再除以目标事件的总概率.
易错点:条件概率分母取错;全概率分类不完备;无放回抽样仍按独立乘法.
题型 2. 离散型随机变量分布列¶
题型识别:定义随机变量\(X\)记录次数、得分、抽到的某类物品数,要求写分布列、求参数或概率.
核心思路:先列出\(X\)所有可能取值,再逐个计算概率,保证概率非负且和为\(1\). 含参数分布列先用归一性求参数,再做其他计算.
解题步骤:
-
确定随机变量取值集合;
-
对每个取值翻译为相应事件并求概率;
-
填表并验证概率和为\(1\);
-
参数题先解非负性与归一性条件.
易错点:漏写可能取值;概率和不为\(1\)未检查;将随机变量取值与事件本身混写.
题型 3. 期望、方差与最优化¶
题型识别:给出分布列或游戏规则,要求期望、方差、收费定价、策略比较或参数最值.
核心思路:\(E(X)=\sum x_ip_i\),\(D(X)=\sum(x_i-E(X))^2p_i=E(X^2)-[E(X)]^2\). 先把收益、成本翻译为随机变量,再比较期望或方差.
解题步骤:
-
定义收益、得分等随机变量;
-
写出或调用分布列;
-
逐项计算\(E(X)\),必要时计算\(E(X^2)\);
-
将目标化为参数函数,结合实际约束求最值.
易错点:用样本平均数替代期望;方差漏平方;盈利问题忘扣成本或收费.
题型 4. 二项分布¶
题型识别:重复进行\(n\)次相互独立、成功概率恒为\(p\)的伯努利试验,要求概率、期望、方差或最可能取值.
核心思路:确认“重复、独立、两种结果、概率不变”四个条件后,\(X\sim B(n,p)\),\(P(X=k)=\binom nkp^k(1-p)^{n-k}\),\(E=np,D=np(1-p)\).
解题步骤:
-
核对是否满足二项分布条件;
-
明确\(X\)表示成功次数;
-
代入概率、期望或方差公式;
-
求最大概率项时比较相邻概率或用已有结论.
易错点:不放回抽取仍当二项分布;成功失败概率指数写反;将\(n\)次试验的成功次数与单次结果混淆.
题型 5. 超几何分布¶
题型识别:有限总体中不放回抽取\(n\)个,记录其中某类物品个数.
核心思路:若总体\(N\)个中有\(M\)个目标,\(X\)为抽到目标个数,则\(P(X=k)=\dfrac{\binom Mk\binom{N-M}{n-k}}{\binom Nn}\). 先写清\(k\)的取值范围.
解题步骤:
-
确定总体数、目标数、抽取数;
-
写\(k\)的上下界;
-
用“从目标选\(k\)个、非目标选其余”的组合数计数;
-
需要期望、方差时调用对应公式并检查参数范围.
易错点:分母用排列数而分子用组合数;\(k\)取值超出目标数或非目标数;与二项分布混淆.
题型 6. 正态分布与\(3\sigma\)原则¶
题型识别:随机变量服从正态分布,给均值、标准差、概率图或区间,要求概率、分位点、异常判定或实际解释.
核心思路:正态曲线关于\(\mu\)对称,区间概率可通过对称性和标准化转化. \(3\sigma\)原则用于估计数据集中范围,不是所有概率题都可直接套用.
解题步骤:
-
标出中心\(\mu\)与标准差\(\sigma\);
-
用对称性将陌生区间转成已知标准区间;
-
必要时令\(Z=\dfrac{X-\mu}{\sigma}\)标准化;
-
结合题意解释概率与实际数量.
易错点:将\(\mu\pm\sigma\)概率误作\(3\sigma\)概率;区间端点对称位置写错;概率与百分数换算错误.
成对数据统计分析¶
题型 1. 线性回归模型¶
题型识别:给成对数据、散点图、样本均值或回归系数,要求判断相关性、求回归方程、预测或分析残差.
核心思路:先由散点趋势判断线性相关方向,再计算或调用\(\hat y=\hat a+\hat bx\). 回归直线经过样本中心\(\left(\bar x,\bar y\right)\),预测值只宜在样本自变量范围附近解释.
解题步骤:
-
观察散点图判断模型类型及相关方向;
-
求\(\bar x,\bar y\)与回归系数;
-
写出回归方程并代入指定\(x\)预测;
-
用残差、相关系数或决定系数评价拟合效果.
易错点:把相关性当因果性;预测远离样本区间;回归系数正负与散点趋势不一致未检查.
题型 2. 非线性回归的模型选择¶
题型识别:散点图呈曲线趋势,给出多个候选模型或经过变换后可线性化的数据.
核心思路:比较散点趋势与候选函数图象,或通过取对数、倒数等变换将非线性关系线性化. 模型选择看拟合趋势和残差,不仅看某两个点.
解题步骤:
-
从散点图判断增长、衰减、饱和等总体趋势;
-
选择最匹配的候选函数或变量变换;
-
在线性化变量下建立回归关系;
-
回到原变量写模型并解释适用范围.
易错点:用少数点代替整体趋势;变换后忘回代;将非线性模型的参数当作线性斜率直接解释.
题型 3. 独立性检验¶
题型识别:给\(2\times2\)列联表,要求判断两个分类变量是否有关联,或补全频数、计算卡方统计量.
核心思路:以零假设“变量独立”为前提,计算\(\chi^2\)并与临界值比较. 期望频数由行和、列和与总数确定,结论必须使用“有足够证据/没有充分证据”的统计语言.
解题步骤:
-
整理列联表的行和、列和、总数;
-
计算各格理论频数;
-
代入卡方统计量公式;
-
与给定临界值比较,按显著性水平规范表述结论.
易错点:将相关性检验说成因果证明;理论频数计算错误;\(\chi^2\)较小时仍断言有关联.