总体、样本与统计量

🏠 数理统计概念导航

核心问题

前面五章都在”已知分布,求性质”;从这里开始要”已知数据,猜分布”。方向反了,语言也得换一套。

第16–20章的对象是一个随机变量及其分布。第21章起对象变成一堆数据, 而”数据”在数学上必须被建模成随机变量——否则概率论的工具一件都用不上。 本篇就是这套翻译词典。

核心定义 / 定理 / 结论

一、四个基本对象

总体研究对象的全部,抽象成一个随机变量(或它的分布)样本个随机变量样本值一次抽样得到的个具体数统计量样本的函数,不含任何未知参数 总体就是一个分布,不是一堆东西

二、简单随机样本:两条要求

独立且与总体同分布

这两条合起来叫 i.i.d.(独立同分布),是本章一切公式的前提。它给出——联合密度可以写成乘积,这正是似然函数的来历。

三、统计量的定义要求:不许含未知参数

是统计量;在未知时不是

理由很实际:统计量必须能从数据算出来。含未知参数的式子写得出、算不出。

这条在选择题里直接送分(无偏性 的 1000 基础 17 就靠它砍掉两个选项)。

四、五个常用统计量

样本均值样本方差分母样本标准差样本阶原点矩样本阶中心矩分母 只有的分母是,其余全是

—— 两者只差这一个因子,但题目问哪个就写哪个。

五、对任意总体都成立的三条恒等式

只要 、 存在:

这三条不需要正态假设,是全章使用频率最高的公式

第三条的推导(三行,值得会):

这就是分母取 的全部理由(见 无偏性)。

六、次序统计量

把样本从小到大排列得 ,称为次序统计量。考研只用两端:

推导各一行:全部;全部。

详见 最大值与最小值的分布。

七、经验分布函数(相合性的第一个例子)

对固定的 ,,由伯努利大数定律

这是”用数据还原分布”这件事在数学上合法的第一个证据(见 大数定律)。

典型题型

  1. 判断某个式子是不是统计量 —— 看含不含未知参数。
  2. 算 、、 —— 直接套第五节三条。
  3. 与 的换算 —— 差因子 ,矩估计里高频。
  4. 极值统计量的分布 —— 见 均匀分布族与极值统计量。

图示 / 直觉

总体未知,是要猜的抽样随机变量观测一堆数对的猜测

四个箭头对应四种不同的东西,考研里最容易混的是第二个与第三个:

估计量是随机变量;估计值是一个数

所以”求 、“才有意义(对估计量),而”求 的矩估计值”要代数字。

常见误用

  1. 把 的分母写成 —— 那是 ,也是正态总体 的最大似然估计,但不是 。
  2. 在 未知时写 —— 这不是统计量。
  3. 以为 需要正态 —— 不需要,任何有二阶矩的总体都成立。
  4. 以为 与 总是独立 —— 只有正态总体才独立(见 正态总体的抽样分布定理)。
  5. 把 当成真的 —— , 有偏。
  6. 对”总体”作实体化理解 —— 说”总体有 个个体”是错的语言;总体就是分布本身。

与旧知识的连接

  • 独立性 —— i.i.d. 的第一条;联合密度可乘的依据。
  • 期望与 LOTUS —— 算 、 全靠期望的线性性。
  • 方差与矩 —— 是”独立和的方差可加”的直接推论。
  • 大数定律 —— 保证了样本能代替总体,这是整个数理统计的执照。
  • 中心极限定理 —— 给出 的近似分布,正态总体下升级成精确分布。

题型训练

链接