基准率是指在相关参考人群中,事件、属性或类别的基本频率或概率,独立于任何特定案例或证据。在概率论和统计学中,它作为贝叶斯推断中的先验概率,代表在考虑新数据之前对结果可能性的初始信念。例如,如果一种疾病影响1%的人口,那么这1%就是该疾病的基准率。基准率在医学、金融、机器学习和认知心理学等领域至关重要,在这些领域中,准确判断需要将先验概率与案例特定信息相结合。
基准率忽视是一种有充分记录的认知偏差,即个体过度重视具体、生动或最近的信息,而低估更广泛的统计背景。这一现象在20世纪70年代由心理学家丹尼尔·卡尼曼和阿莫斯·特沃斯基通过涉及著名出租车事故场景等问题的实验进行了系统研究,参与者常常忽略出租车颜色的基准率,而偏向目击者的可靠性。这种偏差在许多领域持续存在,导致医学诊断、法律判决和招聘决策中的错误。理解基准率对于校准预测和避免推理中的系统性错误至关重要。
贝叶斯推断与基准率
在贝叶斯统计学中,基准率是在观察证据B之前假设A的先验概率P(A)。贝叶斯定理使用似然P(B|A)和边际概率P(B)更新这一先验,以得到后验概率P(A|B)。公式为:P(A|B) = [P(B|A) * P(A)] / P(B)。当基准率极端时,即使似然很强,它们也能主导后验。例如,对于基准率为1%的疾病,一个灵敏度为99%且特异性为99%的测试,其阳性预测值仅为约50%,这意味着阳性测试结果只有一半时间是正确的。这一反直觉的结果突显了为什么必须将基准率纳入诊断推理中。
机器学习中的基准率
在Machine learning中,基准率以分类问题中的类别先验形式出现。一个数据集中99%的实例属于一个类别,则该类别具有高基准率,而一个总是预测多数类的模型可以在不学习有意义模式的情况下实现高准确率。这个问题被称为类别不平衡问题。诸如重采样、成本敏感学习和调整决策阈值等技术用于减轻基准率效应。在Deep learning和Neural network训练中,像cross-entropy这样的损失函数隐式包含类别先验,从业者通常校准模型输出以匹配真实基准率。例如,在欺诈检测中,欺诈交易很少(低基准率),模型必须调整以平衡精确率和召回率,通常使用精确率-召回率曲线而不是仅使用准确率。
认知偏差与基准率忽视
基准率忽视是代表性启发式的一种形式,人们通过相似性而非统计频率来判断概率。在一项经典研究中,参与者被告知一个被描述为害羞且整洁的人,然后被问及他们更可能是图书管理员还是农民。大多数人选择了图书管理员,忽略了农民在人口中更高的基准率。这种偏差在不同文化中都很稳健,即使明确提供基准率时也持续存在。研究人员发现,以频率格式(例如“1000人中有10人”)而非百分比格式呈现基准率可以减少忽视,使参考类别更具体也能减少忽视。在法律环境中,检察官和陪审团在评估DNA证据或目击证词时常常陷入基准率忽视,导致误判。
医学与金融中的应用
在医学中,基准率对于解释筛查测试至关重要。对于低基准率的疾病,即使高度准确的测试也会产生许多假阳性,导致不必要的焦虑和程序。例如,50岁以下女性常规乳腺X光检查的疾病基准率较低,导致较高的假阳性率。在金融中,基准率为风险评估和资产配置提供信息。信用评分模型使用不同借款人细分的历史违约率(基准率)来设定利率和信用额度。保险公司依赖精算基准率来定价保费和储备资金。在这两个领域,未能考虑基准率可能导致灾难性误判,例如在金融危机期间低估系统性风险。
AI系统中的基准率
在Artificial intelligence和Generative AI中,基准率影响模型行为和评估。在互联网文本上训练的大型语言模型继承了语言模式的基准率,如果训练数据有偏差,可能导致有偏输出。例如,模型可能将某些职业与特定性别关联,因为这些关联在语料库中更频繁。研究人员通过去偏技术和调整采样方法(如Top-P (Nucleus) Sampling和Temperature Scaling)来控制输出多样性来解决这一问题。在Transformer (architecture)架构中,注意力机制学习权衡证据,但底层基准率仍塑造预测。校准误差等评估指标衡量模型置信度与实际基准率的对齐程度。随着AI系统在医疗保健和刑事司法等高风险领域部署,确保它们尊重基准率对于公平性和可靠性至关重要。
历史背景与研究
对基准率的兴趣早于现代概率论。在18世纪,托马斯·贝叶斯发展了以他命名的定理,皮埃尔-西蒙·拉普拉斯后来将其推广。基准率忽视的正式研究出现在20世纪70年代,卡尼曼和特沃斯基关于启发式和偏差的工作,这使卡尼曼在2002年获得诺贝尔经济学纪念奖。随后,格尔德·吉格伦泽等人的研究认为,当信息以自然频率呈现时,人类能够推理基准率,这表明偏差部分源于格式。在cognitive science中,像Joshua Tenenbaum和Brendan Lake这样的研究人员探索了人类如何将基准率与因果模型整合,为Machine learning中的计算方法提供信息。这一概念仍然是贝叶斯统计、决策理论和稳健AI系统发展的核心。