你已经了解了假设检验和统计决策的语言,现在让我们来回顾一下我们在上一课中做过的假设检验吧。本案例中我们一直在努力提高某个小金属零件的尺寸合格率。我们的目标是让厚度尽量接近目标,即40.0(单位不限)。

在实施工程变更之前,你想确定变更后平均值会朝目标偏移。因此你在试做期间对进行了统计检验,并收集了 20 个零件的数据。下面是试做期间金属零件场景的原假设和备择假设。
原假设:H0:厚度平均值=40
备择假设:Ha:厚度平均值≠40
Ha=alternative hypothesis,在国内通常Ha也写成H1
这个检验被称为单样本 t 检验。让我们来看一看分析结果以及检验背后的某些机制。
假设值是 40,“实际估计值”是样本均值 40.345。

DF 是自由度。对于单样本 t 检验,自由度是样本量 n - 1。

标准差 1.28 是这 20 个零件样本的标准差。

下面这张图直观地显示了检验结果。曲线代表你可在原假设下预期的样本均值的分布。请注意,这条曲线在概念上与你之前看到过的模拟样本的均值分布相同。它以假设值为中心,范围大约是 39 至 41。

下图中的红色线条是以观测到的样本均值绘制的。蓝色阴影面积是观测到的与我们在原假设下观测到的样本均值一样极端或比其更加极端的样本均值的概率。

备择假设是平均厚度不是40.0。这被称为双尾检验。如果观测到的样本均值远大于或远小于原假设,我们将拒绝原假设。为了反映这个情况,双尾中都有阴影,与假设值的距离相等。这个阴影代表在输出报告的第一个 p 值。也就是说,双尾的合并面积是 0.2426。

如果备择假设是均值大于 40,会怎么样呢?这被称为单尾检验。这个检验的 p 值是 0.1213。这是曲线下方大于观测到的样本均值的面积。你可以看到,它恰好是双尾检验 p 值的一半。

同样,如果备择假设是均值小于 40,p 值就是 0.8787。这是曲线下方小于观测到的样本均值的面积。这个值就是前面那个 p 值的补集:1 减去 0.1213 等于 0.8787。

目前,我们还没有讨论过检验统计量。对于单样本 t 检验,检验统计量是 t 比。
分子是样本均值与假设值之差,分母是标准误差。这里给出了这个示例的 t 比计算。这个 t 比衡量了在以标准误差为单位的情况下,我们的样本均值与原假设值之间的距离。在之前的章节中,你已了解到样本均值服从 t 分布。

t 比基于样本均值,也服从 t 分布。这个分布以 0 为中心,而且 x 轴的计量单位是标准误差。

对于我们的检验,t 比是 1.206。在这张图中,JMP对 t 分布尾部超出 +/- 1.206 的面积添加了阴影。

你应该这样解读这个值:从试做数据中得到的样本均值与目标的距离是 1.2 个标准误差。在原假设下,这是一个相当典型的值。

请注意,JMP 中报告的 p 值会根据它相对于 t 分布的关系来表示。例如,“概率 > t”符号表示在原假设下观测到的 t 比大于 1.2 的概率。对于双尾检验,我们要查看双尾中的合并面积。t 值有负有正。“概率 > |t|”的符号就体现出这种情况。

你以后会在 JMP 中看到类似的符号。比如F检验,ChiSq,韦尔奇检验等。每当看到“概率 > 某个值”符号时,你就知道已经执行了某种类型的假设检验。让我们再看一看与 t 检验一起提供的图形。请注意,这张图看起来很像 t 分布的图形,但 X 轴是不同的。

在 JMP 中,原假设是图形的中心,因此更易于解读检验结果。如果看到大量的蓝色阴影,你就知道样本均值是接近假设值的。但是,如果看到极少量的阴影或者完全没有阴影,你就知道样本均值和假设值相距甚远。这个意思就是,对于给定的数据,原假设是不太可能的。
课后习题
将检验原假设(即元件的平均重量是 110),以及与之相反的备择假设(即均值小于 110)。根据以下输出,这个检验的 p 值是多少?
a. -2.2463
b. 0.0325
c. 0.0162
d. 0.9838
正确答案是 c。该输出包含多个 p 值。我们对具有 ”<” 备择假设的单尾检验的 p 值感兴趣。