DOE 是一种用于收集和探索数据的高效结构化方法。在实验设计过程中,我们实施一组测试或试验,旨在深入研究产品、过程或系统。 在这些试验里,我们会有目的地改变实验因子的值,以此探究这些变化对一个或多个响应变量所产生的影响。同时,我们会尽可能让其他变量保持恒定,力求最大程度地降低其他变异来源的干扰。 也就是说,我们通过改变实验因子来引入有计划的变异,与此同时,尽力控制非预期的变异。这样一来,我们便能确定实验因子是否以及如何对响应产生作用 。
假设我们开展一项设计好的实验,旨在探究一个因子(即 “温度”)与一个响应(即 “良率”)之间的关联。在实验过程中,我们对 “温度” 的值进行有计划地变更,并同步测量对应的 “良率”,与此同时,竭尽全力控制其他所有可能引发变异的因素。
我们期望了解 “良率” 会如何随着 “温度” 的变动而发生改变。就这两个变量的关系而言,有可能呈现出这样的情形:随着 “温度” 逐步升高,“良率” 也会相应提升 。
为了清晰阐释 “温度” 这一因子与 “良率” 这一响应之间的关系,我们能够借助统计模型来加以描述,进而实现因子与响应的有效关联。在众多统计模型中,简单线性回归模型是一个可行之选。在具体操作时,我们会运用实验所获取的数据,对该模型中的参数进行精准估计 。
我们能够依据历史(或者说观测)数据构建回归模型。然而,利用历史数据时,我们难以确切判定响应产生变化的根本原因。这是由于响应的变化既可能源于我们所关注因子的变动,也可能是不受控变量改变所致。对历史数据或观测数据进行分析,本质上属于一种被动学习模式。在此模式下,我们只是基于现有的数据,从过往发生的事件中获取信息。
在 “温度” 实验里,我们有十足的把握认定 “良率” 的变化是由 “温度” 的更改所引发的。
那么,要是实验中存在 “温度” 和 “时间” 这两个因子,情况又会如何呢?
当针对这两个因子同时开展实验时,我们能够对模型进行拓展,将 “时间” 的主效应以及交互作用效应纳入其中。如此一来,我们便能够对 “良率” 如何随 “温度” 与 “时间” 的变化而改变展开估计了 。
倘若我们暂且不考虑交互作用的影响,那么实验因子(“温度” 和 “时间”)与 “良率” 之间的关系便能够用一个平面来加以刻画。在此情形下,我们可以清晰地观察到,当 “温度” 逐步升高时,“良率” 也会相应地随之提升 。
当实验中存在交互作用时,原本描述实验因子与 “良率” 关系的平面便会出现弯曲或扭曲的情况。要想更清楚地了解这一现象,我们有必要仔细观察一下三维图。
具体来看,在 “时间” 值较低的情况下,当我们升高 “温度”,“良率” 会随之提高;然而,当 “时间” 值处于较高水平时,即便升高 “温度”,“良率” 的提升效果也并不显著。由此可见,同时对 “温度” 和 “时间” 这两个因子开展实验,能够让我们对因子之间的交互作用进行估计和深入理解。
此外,我们所能构建的模型类型,在很大程度上取决于我们所采用的实验设计。比如说,基于某些依据,我们可能会认为,在因子与响应的关系中存在着曲率(如图 2 所示)。
因此,鉴于可能存在的曲率情况,我们或许需要精心设计一个实验,这个实验应具备能让我们对二次效应进行估计的能力,从而解释因子与响应关系中的曲率现象。在这样的考量下所构建的模型中,会存在 2 个二次效应:其中一个是与 “温度” 相关的二次效应,另一个则是与 “时间” 相关的二次效应。
实验设计的类型丰富多样,我们最终所选定的具体实验设计方案,在很大程度上取决于我们的实验目标。这里的实验目标涵盖了我们期望从实验中获取哪些具体信息,以及明确规划好打算怎样运用实验所得的结果。
举例来说,我们在设计实验时会基于多种目的。比如,要确定单个因子或者一组因子是否会对响应变量产生影响;探究因子在对响应变量产生作用的过程中,彼此之间是否存在交互作用;对响应变量随着因子变化而呈现的行为模式进行建模分析;亦或是实现对响应变量的优化。 此外,我们究竟会选择哪一种实验设计,还得综合考量诸多实际情况。像是实验所需的成本高低,执行整个实验所耗费的时间长短,以及我们在实验过程中可能面临的各种约束条件或限制因素等。