昨天那篇涂布文章发出去后,增加了不少新关注的朋友。看到大家对技术这么较真,我很欣慰。
既然大家想学真东西,我就不想藏着掖着。
在实际工作中,比“懂工艺”更难的,是“懂得如何用最少的样本证明工艺有效”。这不仅是技术问题,更是成本问题,是你在老板面前的话语权问题。
这篇《JMP 样本大小与功效》是我压箱底的存货。是稀少的JMP机理和实操篇,即便不懂统计学也可以看得懂。
这篇教程其实是去年的旧文重发,当时设定98元是觉得它的作用确实很大也写了很久,但不知道定多少价格合适,索性定高点。(有一位朋友居然真的买了这篇文章,请你联络我,我邀请你免费进星球)。但没没买过的,强烈建议直接扫码加入星球,昨天的涂布长文、今天的 JMP 绝版教程,以及未来的干货,都在星球等你。
本来计划百人调价,结果这篇文章还在草稿箱时,第 100 位兄弟已经进场了。
所以,99 元的地板价正式成为历史。目前的加入价格是 129 元。
我知道这会让一些犹豫的朋友感到遗憾,但为了保证星球内 4600+ 份资料的稀缺性和答疑质量,这种阶梯式涨价会一直持续下去。 既然已经错过了两位数时代,就别再错过现在的 129 元了。毕竟,光是今天这篇价值 98 元的算法教程,就足够值回票价。
一、样本大小与功效简介
在前面的课程中,我们学习了区间估计和假设检验。
如果问题是“未知值是多少?”,就应该计算这个值的区间估计。
如果问题是“未知值是否大于 X?”,就应该执行假设检验。
在区间估计和假设检验中,样本量起着至关重要的作用。
对于区间估计,我们会围绕一个点估计来构建误差幅度。
增加样本量可以减小误差幅度,从而提高估计的精确度。
对于假设检验,我们会计算检验统计量,并使用 p 值来衡量否定原假设的证据的强度。
检验拒绝假的原假设的能力被称为统计功效,或简称功效。
增加样本量可以提高检验的功效。
在本课中,我们首先将学习在涉及连续型数据的简单情况下,样本量与功效的关系。
对于均值的置信区间,我们将学习如何计算在提供指定误差幅度时所需的样本量。
对于单样本 t 检验、双样本 t 检验和方差分析,我们将学习如何计算在提供指定检验功效时所需的样本量。
与统计学的最重要主题假设检验一样,样本量的确定是一个博大而精深的主题,它可能会变得相当复杂。
为了方便理解。在本课中,我尽量不涉及复杂运算的场景说明,而是用能理解的概念性语言和案例来阐述。因为我们一般会依赖软件为我们执行这些工作。
与其他方法一样,使用何种计算将取决于我们的数据、问题的背景以及要运行的分析。
在收集和分析数据之前,就要确定适当的样本量。
这就要求我们深入思考我们需要收集数据的类型,希望从数据中了解到什么信息,以及将如何使用这些数据。
数据分析的目标是使用数据做出明智的决策。
只有在收集数据之前,考虑了所需的样本量,才能确保有足够的信息来做出决策,也才更有可能明智地利用有限的资源。
对于任何超出本课程的内容,建议大家咨询数据分析专家。
二、问题
某报纸报道了选举的民调结果,涉及 1000 位潜在投票者。报道称,44% 的潜在投票者支持“A 候选人”。误差幅度是 ± 3%,置信水平是 95%。假设不是对 1000 位潜在投票者,而是对 2000 位潜在投票者开展调查。以下哪种说法是正确的?
a. A 候选人将赢得选举。
b. 误差幅度将变大。
c. 误差幅度将变小。
d. 95% 的投票者将支持 A 候选人。
正确答案是 c。假设其他因素不变,增加样本量可以减小误差幅度。产生的置信区间将变窄,因此我们的参数估计值将更精确。在这种情况下,参数是比例。本课程重点介绍了适用于连续型数据的基本推论方法,我们也可以在后面的练习案例中,了解如何为某个比例的置信区间计算样本量。
三、均值置信区间的样本大小