在前一章节中,我们介绍了一个概念:当原假设为真时,我们可以期望样本均值落在某段范围内,同时在原假设的条件下,有些值是异常的,但还算合理的,而其他值则是不太可能或极不可能的。
在统计检验中,我们要问:“在原假设的条件下,出现我们结果的可能性有多大?”,同时我们还要设定边界,超出这个边界,样本就是不合情理的,以至于原假设也是不可信的了。我们使用“不太可能的”和“可信的”之类的词,是因为样本无法确定地告诉我们关于总体的真相。假设检验最终是要在面对不确定性的情况下做出决策。无论这个可能性有多小,总会存在你在原假设为真时,得到不太可能的样本均值的情况。
相反,也有可能是,符合备择假设的总体提供了看似来自原假设的样本均值。稍后我将详细介绍这些导致得出错误结论的可能性。现在,让我们先关注如何设定拒绝原假设所依据的边界。
对于在哪里设定拒绝的边界并没有硬性规定。现在请你思考这样一个问题:如果原假设为真,什么范围的结果会令人意外?

在上世纪20 年代,Ronald A. Fisher 爵士建议,每20 次中最多发生 1 次的事件可认为是不太可能的。Fisher 随口提出的“1/20”建议已被广泛接受为常规边界。
在统计检验中,我们使用“概率值”(即 p 值)来指导我们做出决策。p 值可以衡量否定原假设的证据的强度。p值越小,否定原假设的证据越强。如果p 值较大,否定原假设的证据就很弱。
p 值小于所选值(即显著性水平)的样本结果被称为具有统计显著性。显著性结果是令人意外或异常的,足以引起关注,因为仅仅是随机抽样变异是不可能导致这种情况发生的。
根据Fisher 的建议,显著性水平alpha 常被设置为0.05。但这不是硬性规定。假设你执行了检验,并确定检验结果具有统计显著性。那么你应该相应地拒绝原假设,并接受备择假设。
但是,有显著性结果并不意味着你拒绝原假设的行为是正确的!当你拒绝原假设时,无法保证你做出了正确的决策。统计检验的目标是做出明智的决策,但难免存在犯错的风险。
在统计检验术语中,当异常罕见的样本结果导致你错误地拒绝了正确的原假设时,你就犯了第一类错误。你的检验会导致假阳性。
相反,如果原假设为假,而你的检验没有导致你拒绝原假设,你就犯了第二类错误。你的检验会导致假阴性。
统计检验旨在最大程度地减少犯第一类错误的风险。作为分析师,你需要确定检验的显著性水平。这个显著性水平alpha 就是你愿意接受的第一类错误的风险。
我将在本系列课程中的最后给大家进一步说明第一类和第二类错误。在任何统计检验中,另一件需要思考的事情是,从实践的角度看,p值较低并不表示结果是有意义或重要的。
统计显著性的含义是,在给定原假设的条件下,结果不太可能仅仅是因为偶然性因素而发生的。作为决策者,你需要了解决策的背景信息。
你必须确定,观测到的结果与假设值之间的差异是否足够大,以至于具有实际的意义或相关性。我们将在下一课中回顾实际显著性这个概念。