边界型最大似然:似然函数不可导

🏠 数理统计概念导航 · 数理统计题库

方法模板

一、什么时候求导法失效

参数出现在密度的定义域里(而不是只在表达式里)求导法失效

三个典型信号:

  • 的支撑是 、、 这类随 移动的区间;
  • 对 的导数恒正或恒负(无驻点);
  • 密度里含 ( 在 处不可导)。

二、标准操作:把约束写成” 的取值范围”

①写似然,但一定要把对每个都有支撑翻译成的不等式②看在这个范围内的单调性③单调递增取范围的右端点;单调递减取左端点

约束的翻译规则(背下来):

支撑支撑支撑 里的最强约束由极值统计量给出管上界,管下界

三、两条最常用的结论

的支撑是且(递减)的支撑是且(递增)

记忆口诀: 是上界就取 , 是下界就取 。 直觉:MLE 总是把参数顶到数据允许的极限。

四、两个特殊变体

(a)MLE 不唯一。 当 在一整段区间上取同一个最大值时(如 ,), 区间内任何一点都是 MLE。标准答案通常写

常取

(b)参数被人为限制在一个区间内。 先求无约束的驻点,再看它是否落在允许区间里;不在就取最近的端点。

五、 型:答案是中位数

最小化样本中位数

理由(不必求导):把 从左往右移动,每越过一个样本点,“左边点数减右边点数”就变化一次; 当左右点数相等时 达到最小。这正是中位数的定义。

(对比:最小化 给出样本均值。均值配平方,中位数配绝对值。)

必考

880 第二十二章 基础解答 17

原题 设总体 的概率密度为 ,,, 为 的简单随机样本。 (Ⅰ)当 已知时,求 的矩估计量和最大似然估计量; (Ⅱ)求 的矩估计量和最大似然估计量。

解析 这是位移指数分布:,故

(Ⅰ) 已知。

矩估计:。

最大似然:定义域约束是 无关的( 已知),所以求导法可用:

(与矩估计相同)

(Ⅱ)两个参数都未知。

矩估计:用一、二阶矩

的样本版

最大似然:现在 跑进了定义域,求导法对它失效。

要求

固定 , 关于 严格递增(指数里 )→ 顶到上界:再把 代回,对 求导(此时与(Ⅰ)同型):

同一道题, 已知与未知,方法完全不同

已知 → 定义域固定 → 求导;未知 → 定义域随 滑动 → 单调性 + 边界。 命题人把两问并排放,就是要你分清这条线。

另注: 的矩估计与最大似然不相等( vs ), 这与(Ⅰ)里两者相同形成对照——多一个未知参数,两种方法就分道扬镳。

880 第二十二章 拓展解答 2

原题 设总体 的概率密度为 其中 ()为未知参数, 为来自总体 的简单随机样本。 (Ⅰ)求 的矩估计量 与最大似然估计量 ; (Ⅱ)问 和 是否为 的无偏估计量? (Ⅲ)将 修正为 ,使 为 的无偏估计,并比较 的有效性。

解析 位移指数分布,:(Ⅰ) 矩估计:。

最大似然:,关于 严格递增,约束 :

(Ⅱ) : ✓ 无偏。

:先求 的分布。(),故

✗ 有偏(偏大 ,因为 总落在 右侧)。

(Ⅲ) 修正:

(已无偏,不用改)

比较方差:

,即更有效

这道题的分量: 级 vs 级

一般的估计量方差是 ,而”边界型”估计量的方差是 ——快一个数量级。 原因: 用全部样本”平均”出信息,而 直接盯住那个决定边界的样本,信息利用效率高得多。

这是**“支撑边界含参数”这类模型的共同特征**,均匀分布那一节还会再见一次(均匀分布族)。

务必记住这条推导: 当 —— 个独立指数的最小值仍是指数,参数相加。

1000 强化篇 第9章 13

原题 设总体 的概率密度为 其中 , 是来自总体 的简单随机样本。 (1) 求 的值;(2) 求 的矩估计量 与最大似然估计量 ;(3) 是否为 的无偏估计量?

解析

(1) 归一化:

(2)(3) 代入 之后,与 880 第二十二章拓展解答 2 是同一道题:

✗有偏

两本题册第四处撞题,1000 多问了一个

880 把它当”拓展题”并追加了修正与有效性比较;1000 把它当常规解答题,只加了一个求归一化常数的小问。 1000 的第 (1) 问是本节的通用第一步:凡是密度里带待定常数,先积分定常数。

两题合起来是位移指数分布的完整档案:

有偏

1000 基础篇 第6章 11

原题 设总体 的概率密度为 其他 是来自总体 的简单随机样本,则未知参数 的最大似然估计量 ___。

解析 同族():

约束

关于 严格递增 → 顶到上界:

三秒判断法

密度是 , 出现在支撑的左端点()→ 是下界 → 取 。 不需要写似然函数就能报答案,但考场上解答题仍要写出” 关于 单调递增”这一句。

1000 强化篇 第9章 7

原题 设总体 的概率密度为 其他 其中 。 为取自总体 的简单随机样本,并记 ,。 则参数 的最大似然估计量 满足 ___。

解析 这是MLE 不唯一的标准例子。

只要每个都落在内

把约束翻译成 的范围:

在这个区间上 取到最大值,故

可以是中的任意一点

(区间非空,因为 必然成立。)常用的具体取法:。

不等号的方向极易写反

对所有 成立 → 取最紧的那个 → 。 “对所有 都有 某量” → 取那个量的最小值。 反之取最大值。

结论里 出现在下界、 出现在上界,与直觉相反,务必按上面这条机械推。

880 第二十二章 基础解答 12

原题 设总体 在 上服从均匀分布, 为未知参数, 为总体 的样本,求 的矩估计量 和最大似然估计量 。

解析 与 1000 强化篇第 9 章第 7 题同题,880 多问了矩估计。

矩估计:(区间中点),故

最大似然:如上,

中任意一点,常取

罕见的一次:矩估计比最大似然"更有用"

是唯一确定的、无偏的、写起来最简单的。 而 甚至不唯一——这是最大似然的一个真实缺陷。

不过若取 (中程数),它其实比 更有效: ,而中程数的方差是 量级——又是”边界型比平均型快一个数量级”。

880 第二十二章 基础解答 16

原题 设随机变量 的概率密度为 ,, 为未知参数, 由样本值 ,求 的矩估计值和最大似然估计值。

解析 这是中心在 的拉普拉斯分布, 服从参数 的双边指数。

矩估计:密度关于 对称 → :

最大似然:

最大化 最小化 取样本中位数。

排序:,中位数是

(验算: 时 ; 时 ✓ 中位数确实更优。)

别对 求导

在 处不可导,且导数只取 这些离散值,永远解不出”导数为零”。 正确的语言是”分段线性、折点在样本点上、最小值在中位数处取到”。

平方配均值,绝对值配中位数

这道题的两个答案 与 不相等,正是矩估计与最大似然可以不同的最直观例子。 偶数个样本时中位数是中间两数的平均,此时 MLE 也不唯一(整个中间区间都是)。

1000 强化篇 第9章 16

原题 设总体 的概率密度为 均大于 , 为总体 的简单随机样本。 (1) 求 的最大似然估计量 ; (2) 对任意的 ,是否存在常数 ,使得 ? (3) 求 。

解析 这是帕累托分布,两个参数分工明确: 是支撑左端点(边界型), 是形状参数(可导型)。

(1) 似然(要求 ):

先定 :固定 , 中含 的项是 ,关于 严格递增 → 顶到上界:

再定 :代入 后对 求导:

(2) 存在,——即 是 的相合估计。证明:对 ,

(因 恒成立,,另一侧概率为 。)

由 ():

因为底数 ✓。

(3) 令 。对 :

三问其实是一条链

(1) 的 分母 里那个 ,正是 (3) 里那个 变量。 帕累托取对数就变成位移指数 —— 这一句话把三问全部串起来:

帕累托位移指数(位移,参数

于是 对应 (位移指数的 ), 对应位移指数的尺度倒数。 (2) 的相合性也是位移指数那条 的翻版。

1000 强化篇 第9章 14

原题 设 为来自总体 的简单随机样本, 为来自总体 的简单随机样本,且两样本相互独立,其中 ()是未知参数。利用样本 ,求 的最大似然估计量 ,并求 。

解析 两组样本,一个共同参数——似然要把两组乘在一起。

约束:所有 且所有 ,即

且

递减 → 取范围的左端点:

求 :先求 的分布。 关键观察——把每个样本都除以它自己的上界,全部化成 :于是

(有偏)

"全部归一到 " 是这类题的通用招

两组样本上界不同( 与 ),看起来没法一起 。 除以各自上界后全变成 , 个独立的 取最大,分布函数是 ,一切都算得出来。

一般结论: 个独立 的最大值 满足

代 : ✓, ✓。

拓展

880 第二十二章 基础解答 11

原题 设总体 ,参数 ,样本容量为 ,求 的最大似然估计值。

解析 样本只有一个观测 :分情况讨论(这就是全部工作):

  • :,在 上严格递增 → (右端点);
  • :,严格递减 → (左端点)。

无约束的答案是 ,落在区间外

不加限制时 ,而 、,两个都不在允许范围内。 参数空间受限时,MLE 是”在允许范围内离无约束最优点最近的那一点”。

这道题被列为拓展题,是因为”参数空间是闭区间”在考研里罕见。但它把 MLE 的定义讲得最透: 最大似然从来就不是”解似然方程”,而是”在参数空间上求最大值”——方程只是可导情形下的一个手段。

1000 基础篇 第6章 14

原题 在数集 中有放回地抽取 次,得 ,则 的最大似然估计量是( )。 (A)  (B)  (C)  (D)

解析 离散均匀分布:,。要求 关于 严格递减 → 取允许范围的最小值:

选 A。

离散版的

有 个等可能取值, 与连续情形的 同型, 结论也同型:,且系统性偏小( 不会超过真实的 )。

这就是二战时著名的”德国坦克问题”:盟军用缴获坦克的序列号 估计德军产量。 实用中要在 上乘一个 型的修正因子把偏差补回来——与 均匀分布族 里的 同一个思路。

选项 C(样本均值)是矩估计的雏形: → ,注意不是 ,所以 C 本身也是错的。

链接