0.引言#
在很多试验中,处理一个汇总的变量要比处理原来的概率结构方便的多。例如在一次幻想乡民意调查大会中,我们调查 个妖精对某个异变的态度是支持态度还是反对态度。
琪露诺.jpg那么按照古典概型的处理方式,所有可能的结果有 个,这是非常大的一个数字,显然一个一个列出是并不现实的。但是如果我们用 ,则 的可能取值为 ,由于 的取值现在无法确定, 所以称 是随机变量 (random variable).这样处理起来就比原来的概率结构要方便多了!
为了更深入地研究随机现象, 就要建立数学模型,随机变量是随机现象的最基本的数学模型,我们用随机变量的值表示随机试验的结果。
1.随机变量#
假设我们随机投了两枚骰子,根据两个骰子的点数和决定某个事情,显然样本空间 为:
Ω={(ω1,ω2):ω1,ω2∈{1,2,3,4,5,6})}但是我们实际上其实只对点数和感兴趣,即对函数 的值感兴趣:
S(ω1,ω2)=ω1+ω2(ω1,ω2)∈Ω 的可能值可以通过下表得到:
屏幕截图 2026-08-14 214333 1.png我们记事件:
{S=k}={(ω1,ω2)∈Ω:ω1+ω2=k}以及其概率为 。由若我们是根据两个骰子的最大值决定,则映射:
M(ω1,ω2)=max{ω1,ω2},(ω1,ω2)∈Ω类似可以由上表定出由 M 决定的事件及概率,像是 的函数,我们称其为离散型随机变量(Discrete Random Variable)
对于一个随机变量(Random Variable) , 是定义在样本空间 的一个实值函数 : 对每一个样本点 , 是一个实数。
具体地讲,称样本空间 到实数轴 的一个映射: 为随机变量,而且如果对任意的 :
{ω:X(ω)<x}∈F则 经常简写为 。
Notice :在概率论和数理统计学中, 人们习惯用大写的 等表示随机变量. 不够时还可以用 等表示.
1.1 随机变量的事件#
我们用 , 或更简单地用 表示事件:
{ω∣X(ω)≤x}于是:
{X∈A}={ω∣X(ω)∈A}{a<X≤b}={ω∣a<X(ω)≤b}.注: 这里和以后所述的数集都是高等数学中的实数的 (可测) 集合, 并且对数集 , 承认 是事件.
1.1 随机变量的分布函数#
F(x)=P(X≤x),forallx∈R为随机变量 的**(累积)分布函数(CDF,Cunulative Distribution Function)**
例如,投掷三枚硬币,令 正面向上的个数,则 的分布函数为:
F(x)=⎩⎨⎧0,若−∞<x<081,若0≤x<121,若1≤x<287,若2≤x<31,若3≤x<∞显然分布函数满足:
①: 和
②: 是一个非降的函数
③: 是一个右连续的函数,即对任意的 有
2.离散型随机变量#
设 为随机变量,如果随机变量 只取有限个值 , 或可列个值 , 就称 是离散型随机变量, 简称为离散随机变量 (discrete random variable).
以下就 取可列个值的情况加以表述, 对于 取有限个值的情况可类似的表述.
2.1 分布列#
P(X=xk)=pk,k≥1为 X 的概率分布(probability distribution)。称 是概率分布列,简称为分布列(distribution sequence).
有些变量只能取有限个或可列个值,比如,被访问者的性别、年龄、职业,一批产品中次品个数,一个医学试样中白细胞个数,掷两个骰子 第一次得到 12 点的时间,等等
设函数 取值于 , ,称 为随机变量 的概率质量函数 (PMF, probability mass function)。
当分布列 的规律性不够明显时, 也常常用如下的方式表达概率分布:
XPx1p1x2p2x3p3⋯⋯此外,也可以表述为:
(x1p1x1p2......)这也被称为密度阵。
分布列 有如下性质:
①:
②:
③:
2.2 离散型随机变量的常见分布#
2.2.1 伯努利分布(Bernoulli 分布)#
伯努利分布(又称 两点分布 或 0-1 分布)是最简单的离散型概率分布,用来描述只有两种可能结果(成功或失败、发生或不发生)的单次随机试验。
对于一离散型随机变量 ,如果 只取值 或 ,且概率分布是:
XP1p0q,p+q=1就称 服从伯努利分布,记作: 或
任何只考虑成功与否的试验都可以用两点分布的随机变量描述:
X={1,试验成功0,试验不成功2.2.2 二项分布(Binomial 分布)#
若一个随机试验只有两个可能的结果 和 ,则称这个随机试验为伯努利试验,记 ,将这个试验独立的重复 次,则称这一串独立的试验为 重伯努利试验。
在 重伯努利试验中,若以 表示成功的次数(即随机事件 发生的次数),则 为一离散型随机变量。易知 的概率函数为:
P(X=k)=(kn)pk(1−p)n−k=Cnkpkqn−kk=0,1...称此概率分布为二项分布,并称 服从二项分布,记为 。称为二项分布的原因是 为二项展开式。
Binomial_distribution_pmf.svg.webp2.2.3 几何分布(Geometric 分布)#
在 重伯努利试验中,当试验次数 时,称为可列重伯努利试验。
若以 表示在可列重伯努利试验中结果 出现时的试验次数,即若以“成功”表示结果 发生,则 表示首次成功的试验次数,所以
P(X=k)=qk−1pk=1,2...称此分布为几何分布,记作:
几何分布有如下性质:
以所有正整数为取值集合的随机变量 服从几何分布 ,当且仅当对任何正整数 和 ,都有:
P(ξ>m+n∣ξ>m)=P(ξ>n)这个性质称为几何分布的无记忆性(Memoryless Property)
几何分布是唯一具有无记忆性的离散概率分布。这意味着已经失败了 次后,再需要经历 次失败才成功的概率,和刚开始时需要 次失败才成功的概率完全一样。
2.2.4 泊松分布(Poisson 分布)#
如果随机变量 X 有如下的 概率分布:
P(X=k)=k!λke−λk=0,1,...就称 服从参数为 的 Poisson 分布,并记作
Poisson_pmf.svg.webp设有一列二项分布 ,其中的参数满足条件:
x→∞limnpn=λ>0则对任何非负整数 都有:
x→∞limb(k;n,pn)=x→∞limCnkpk(1−p)n−k=k!λke−λ这个定理叫做 **Poisson 定理 **
Poisson 分布的例子有:
-
单位时间放射性粒子个数;
-
某段高速公路上一年的事故数;
-
某商场一天中顾客到来个数;
-
一段时间内接到的电话个数;
-
等等。
2.2.5 超几何分布(Hypergeometric 分布)#
如果 的概率分布是:
P(X=m)=CNnCMmCN−Mn−m,m=0,1,...则称 X 服从超几何分布,记作 。注意对 或 , 约定 。 名称超几何分布来自超几何函数, 类似于二项分布来自二项展开式.
最常见的例子就是:有 个样本,其中 个是不及格的。超几何分布描述了在该 个样本中抽出 个,其中 个是不及格的个数
3.连续性随机变量#
设 是随机变量, 如果存在非负函数 使得对任何满足 的 ,有:
P(a<x≤b)=∫abf(x)dx就称 是连续型随机变量, 称 是 的概率密度函数(PDF), 简称为概率密度 (probability density) 或密度.
在线段上随机投点的位置,温度、气压、电压、电流等物理量等等,理论上可以在取到某个区间任何实数值。这样取值的随机变量称为连续 型随机变量。
3.1 连续型随机变量的常见分布#
设 ,如果分布函数 具有密度函数:
p(x)=b−a1,a≤x≤b则称 服从区间 上的均匀分布,记作 ,这里 是 的缩写.容易算出对应的分布函数为:
F(x)=⎩⎨⎧0,x≤ab−ax−a,a<x≤b1,x>b采用 的示性函数 (indicator function)
I(a,b)={1,x∈(a,b)0,x∈/(a,b)还可以表示为:
3.1.2 指数分布 (Exponential 分布)#
对正 常数 ,如果 的密度是:
F(x)={λe−λx,x≥00,x<0就称 服从参数 (或期望为 ) 的指数分布,记作 。这里 是 ,通常还简记为
F(x)=λe−λx,x≥0或
F(x)=λe−λxI[0,∞)
Exponential_distribution_pdf 1.png与几何分布类似,指数分布也是一种 无记忆分布 ,并且是唯一的无记忆的连续性分布。
指数分布经常用来表示电子元件寿命、事件到来间隔时间等。这样的量经常具有无后效性 ,即已经存活 (等待) 了多长时间对还会再存活 (等待) 多长时间没有影响。
若随机变量 满足 则称 为非负随机变量。
设 是连续型非负随机变量, 则 服从指数分布的充分必要条件是对任何 , 有:
P(X>s+t∣X>s)=P(X>t)这也被称为无后效性
3.1.3 正态分布 (Normal 分布)#
设 是常数, 是正常数,如果 的密度函数是:
F(x)=2πσ21e−2σ2(x−μ)2,x∈R就称该分布就是为以 和 为参数的正态分布,记做 . 这里 是 Normal 的缩写.
特别地, 当 时, 称 服从标准正态分布 (standard normal distribution). 标准正态分布的密度函数有特殊的地位, 所以用一个特定的符号 表示:
φ(x)=2π1e−2x2,x∈R
屏幕截图 2026-08-15 143204.png参数 是密度的中心和最大值点,密度在 两侧对称,即函数 关于 对称
参数 代表了密度的宽度, 越大密度越宽。
正态分布的随机变量 具有大部分值靠近 的特点。
P(∣X−μ∣≤σ)=68.27%P(∣X−μ∣≤2σ)=95.45%P(∣X−μ∣≤3σ)=99.73%P(∣X−μ∣>6σ)=1.96×10−9这一结果反映了正态随机变量的一个十分引人注目的性质。以大于 的概率取区间 中的值,从而若以该区间来估计取值范围,其误差小于,我们将这种估计称为“3σ原则”
近来, 原则被广泛地运用到企业的质量管理上,称为 管理原则(在 的左右各三个 ).