在为某些数据设计模型时,我们必须对产生这些数据的过程做出假设。事实上,我们可以说,模型就是这组假设,而这组假设就是模型。模型与它所表示的假设之间的关系如此重要,值得强调:
模型 = 关于数据的一组假设
选择在模型中包含哪些假设,是模型设计的关键环节。错误的假设会导致模型给出不准确的预测,正是这些有缺陷的假设造成了这种结果。然而,不做任何假设是不可能建立模型的——至少必须做出一些假设。
正如你在第 1 章中所见,本书将使用因子图来表示我们的模型。随着阅读的深入,你将学会如何构建对一组选定假设进行编码的因子图。同样,你也将学会观察一张因子图并推断出它所表示的假设。你可以把因子图看作一组假设的精确数学表示。例如,在第 1 章中,我们构建了一张因子图来表示关于一起谋杀之谜的一组精确假设。对于当前这个应用,我们需要对“一个具备特定技能集的候选人如何回答一组测试问题”这一过程做出假设。这将定义候选人的潜在技能与其测试答案之间的关系,随后我们可以将其反转,从测试答案中推断出他们的技能。
在设计因子图时,我们首先要选择希望图中包含哪些变量。图中至少必须包含表示我们实际拥有的数据的变量(候选人是否答对了每道题),以及我们想要了解的变量(技能)。正如我们将看到的,引入其它中间变量往往也很有用。选定变量之后,我们就可以开始向图中添加因子,以编码这些变量在答题过程中如何相互影响。通常从我们想要了解的变量(技能)开始,沿着这个过程一路推进,直到我们真正能够测量的变量(候选人是否答对了题目),这样做往往会很有帮助。
那么,从技能变量开始,这是我们的第一个假设:
1 每位候选人要么已掌握某项技能,要么没有掌握。
假设 2.1 意味着我们可以把候选人的技能表示为一个二值(true/false)变量:如果候选人掌握了该技能,则为 true;否则为 false。像我们目前见过的所有变量那样,只能取一组固定值之一的变量,称为离散变量。在本章后面,我们会遇到连续变量,它可以在一段连续取值范围内取任意值,例如 0 到 1 之间的任意实数。正如我们将看到的,连续变量在学习事件概率等许多用途上都非常有用。
……