合取谬误

概览

类别 详情
定义 将两个事件共同发生的概率(A ∧ B)判断为高于其中一个事件单独发生的概率(A 或 B)的错误,这违反了概率论的基本合取规则。
类别 意义不足(大脑创造故事和模式来填补理解上的空白)
克服难度 非常困难
普遍程度 普遍(在 85% 的参与者中观察到,包括那些受过统计学训练的人)
相关偏差 代表性启发式、可用性启发式、基本比率忽视、叙事谬误、模拟启发式、外延忽视

1. 快速总结

听到一个细节丰富、前后连贯的故事时,我们的大脑往往判断它比一个更简单、更模糊的可能性更容易发生,哪怕逻辑上的结论恰恰相反。合取谬误的根源在于,我们衡量概率靠的是某件事与心理原型或叙事贴合到什么程度,而不是数学。我们是直觉的讲故事者,而不是直觉的统计学家,一个动人的故事足以推翻基本的逻辑。


2. 背后的科学

2.1. 发现与历史

心理学家阿莫斯·特沃斯基(Amos Tversky)和丹尼尔·卡尼曼(Daniel Kahneman)在 1983 年具有开创性的论文《外延与直觉推理:概率判断中的合取谬误》中,对合取谬误进行了正式的特征描述。此前也有人非正式地注意到类似的推理错误,但这篇论文把讨论对象变成了一个具体、可测试的现象,并给出了可重复的实验范式。

这一发现源于特沃斯基和卡尼曼自 20 世纪 70 年代初以来一直在发展的更广泛的“启发式和偏差”研究项目。他们的工作从根本上挑战了经济学和心理学中普遍存在的假设,即人类是做出理性概率判断的直觉统计学家。合取谬误成为这一观点的支持者和“生态理性”倡导者之间的主要战场。

过去四十年里,相关认识大为推进。最初的发现已在国际上得到复制,扩展到专业领域(医学、法律、情报),并且最近被应用于理解人工智能系统中的推理。“启发式和偏差”阵营与“生态理性”学派(由格尔德·吉仁泽 Gerd Gigerenzer 领导)之间的辩论,让人们更清楚这一谬误在什么条件下、因为什么而出现。

2.2. 主要研究人员

研究人员 贡献 年份
阿莫斯·特沃斯基 & 丹尼尔·卡尼曼 对合取谬误进行开创性特征描述;开发了“琳达问题”和多种实验范式 1983
格尔德·吉仁泽 & 拉尔夫·赫特维格 (Ralph Hertwig) 生态理性的批评;证明了频率格式能降低谬误发生率 1999
菲利普·泰特洛克 (Philip Tetlock) 对“超级预测家”的研究表明,专家可以通过明确的概率分解来克服这一谬误 2015
芭芭拉·梅勒斯 (Barbara Mellers) 等 对立阵营之间的对抗性合作,测试消除或保留该谬误的条件 2001
杰罗姆·布斯迈尔 (Jerome Busemeyer) 量子认知框架,将该谬误建模为非经典概率干涉 2012+

2.3. 里程碑研究

琳达问题 (Tversky & Kahneman, 1983)

最著名的合取谬误演示为受试者提供了一个旨在触发特定刻板印象的性格速写:

“琳达 31 岁,单身,直言不讳,非常聪明。她主修哲学。作为一名学生,她非常关注歧视和社会正义问题,也参加过反核示威活动。”

参与者对各种结果的概率进行排名,关键选项是:(1)琳达是一名银行出纳员,以及(2)琳达是一名银行出纳员并且活跃在女权主义运动中。

结果:大约 85% 的本科生受试者将合取选项(银行出纳员 AND 女权主义者)的概率排在单一组成部分(银行出纳员)之上。该描述被设计为高度代表“女权主义者”,而不代表“银行出纳员”。把不具代表性的特质与具有代表性的特质拼在一起,这个组合形象在心理上就比单一的描述符更连贯。

比约恩·博格研究 (Tversky & Kahneman, 1981)

就在 1981 年温布尔登网球公开赛决赛之前,参与者预测了网球传奇人物比约恩·博格 (Björn Borg) 的表现,并在选项之间进行选择,包括:(1)博格将输掉第一盘,以及(2)博格将输掉第一盘但赢得比赛。

结果:72% 的受访者为特定的合取条件(输 + 赢)分配了比一般条件(输)更高的概率。“逆转”的叙事是一个很容易在脑海中模拟的戏剧性剧本,它感觉比抽象的统计数据更有可能发生。这证明了模拟启发式:特定的序列创造了一个因果故事(“他开局缓慢,但他高超的技巧让他取得了胜利”),大脑把它当成一个有说服力的解释来读,而不是当成逻辑上的子集。

七字母单词研究 (Tversky & Kahneman, 1983)

参与者估计在一篇 2,000 字的文本中匹配模式的七个字母单词的频率:第六个位置是“n”的单词 vs. 以“ing”结尾的单词。

结果:参与者一致估计“ing”单词更加频繁,尽管在数学上可以肯定每个“ing”单词的第六个位置必然有一个“n”。这说明合取谬误可能来自可用性启发式:“-ing”是一个作为认知单元存储的常见后缀,这类单词更容易从记忆中提取,于是它们的频率被高估。

2.4. 神经学基础

合取谬误揭示了认知架构的基本方面:

双过程理论:该谬误体现了系统 1(快速、直觉、自动)和系统 2(缓慢、深思熟虑、逻辑)思维之间的紧张关系。系统 1 依靠代表性迅速将描述与原型相匹配,而本可以识别逻辑错误的系统 2 常常没能推翻这个初始判断。

起作用的认知机制

  • 代表性启发式:基于与心理原型的相似性而不是基本比率来判断概率
  • 模拟启发式:在脑海中模拟因果序列的容易程度影响感知概率
  • 可用性启发式:记忆提取的容易程度影响频率判断
  • 因果连贯性:大脑优先处理组织成因果叙事的信息

量子认知框架:最近的理论发展表明,人类判断可能遵循量子概率而不是经典概率。在这个模型中,判断的“状态”在被测量之前存在于叠加态中,而不相容的问题(“她是银行家吗?”和“她是女权主义者吗?”)会产生干涉图样,可以提高合取概率——这不是一个错误,而是非交换信息处理的自然结果。


3. 进化起源

合取谬误的产生很可能是因为叙事连贯性和模式识别是我们祖先必不可少的生存工具。在祖先的环境中,快速构建和评估因果故事的能力(“草丛中的沙沙声 + 一天中的时间 → 捕食者”)比严格的概率计算更有价值。

生存优势

  • 快速的因果推断实现了快速的威胁评估
  • 社会凝聚力要求通过连贯的性格判断来理解他人的动机
  • 模式匹配有助于识别食物来源、安全路线和季节变化
  • 故事是跨代传递生存知识的主要方法

是特性,不是漏洞:合取谬误可能代表了一种适应性的权衡。在大多数现实世界的情况下,详细、连贯的解释确实比模糊的可能性更有可能是真实的——能够解释为什么会发生某事的人通常比只是说“可能会发生某事”的人更有洞察力。当这种普遍适应性的启发式遇到刻意让连贯性与逻辑相冲突的人为问题时,谬误就出现了。

节能:为每个决策建立完整的概率模型在计算上将是昂贵的。像代表性这样的启发式方法可以快速给出“足够好”的答案,把认知资源留给真正需要仔细分析的场合。


4. 这种偏差如何表现

4.1. 在日常生活中

合取谬误以微妙的方式塑造着日常判断:

  • 性格评估:“她很安静而且戴着眼镜,所以她很可能是个读推理小说的图书管理员”感觉比“她是个图书管理员”更有可能——即使前者在数学上概率更小
  • 预测朋友的行为:“他会忘记我们的晚餐计划,因为他被工作缠住了”似乎比简单的“他会忘记我们的晚餐计划”更合理
  • 新闻解读:对事件的详细解释比承认不确定性感觉更可信
  • 关系判断:特定的情景(“他们离婚了,因为他在经过多年的疏远后出轨了”)感觉比一般的结果(“他们离婚了”)更有可能发生

4.2. 在工作场所

  • 项目规划:具有具体里程碑的详细项目时间表感觉比承认广泛的不确定性更容易实现
  • 招聘决策:背景形成连贯叙事的候选人比具有“零散”经历的同等资历候选人获得更有利的评价
  • 绩效评估:关于员工成功或失败原因的具体叙事比承认多个不确定因素更有说服力
  • 战略预测:具有详细因果链的商业计划(“我们将增加营销,这将提高知名度,从而推动销售额增长 20%”)感觉比简单的预测更可信

4.3. 在商业和营销中

营销人员经常借助合取谬误:

  • 属性捆绑:像麦当劳(“我就喜欢”——有趣且方便)或 Bounty(“吸水快”——吸水且快速)这样的品牌,通过合取创造了卓越表现的原型
  • 产品描述:“辛辣、美味且令人垂涎”被视为质量的单一属性,而不是一系列独立的声明
  • 客户评价:包含具体好处的详细客户故事比普遍的满意度声明感觉更有说服力
  • 广告叙事:展示产品使用具体场景的广告创造了连贯的故事,从而提升了感知效果

4.4. 在政治和媒体中

  • 政治叙事:人生故事形成连贯弧线(“挣扎、坚持、成功”)的候选人被认为更可信
  • 阴谋论:连接多个事件的详细解释感觉比承认随机性更合理
  • 新闻报道:具有清晰因果解释的故事比承认不确定性的报道吸引更多的参与
  • 选举预测:具体情景预测(“由于三个摇摆州的投票率,该候选人将获胜”)感觉比概率范围更专业

4.5. 在医疗保健中

合取谬误是诊断错误的一大来源:

  • “F 先生”研究:医疗专业人员认为“F 先生心脏病发作且年龄超过 55 岁”的可能性高于“F 先生心脏病发作”——这直接违反了合取规则
  • 过早闭合:医生专注于高度特异性、“具有代表性”的疾病表现(“典型病例”),而错过了常见疾病更广泛、非典型的表现
  • 症状解释:“由伴有中风的肺栓塞引起的呼吸困难和偏瘫”感觉比单纯的“肺栓塞”更容易诊断
  • 医患沟通:即使不确定性更诚实,患者也发现带有因果解释的具体诊断更令人满意

4.6. 在金融和投资中

  • 过关投注 (Parlay Betting):投注者倾向于组合投注,不仅是为了获得回报,而且因为具有因果故事的相关结果感觉很有可能
  • 市场叙事:“市场将因为强劲的盈利而上涨,这将提振信心,从而吸引机构投资者”感觉比简单的方向性预测更可信
  • 复杂衍生品:由于经纪人兜售的“故事”,捆绑的金融工具的估值可能高于其组成部分
  • 投资论点:具有多个支持理由的详细投资案例感觉比承认根本的不确定性更有说服力

5. 真实世界案例研究

案例研究 1:冷战情报分析

  • 背景: 在冷战期间,中央情报局(CIA)分析员的任务是预测苏联的军事和政治行动。
  • 发生了什么: 在一项 1980 年的研究中,情报分析员认为“苏联入侵波兰 AND 美国断绝外交关系”的可能性高于单独的“美国断绝外交关系”。
  • 起作用的偏差: 这种特定的情景(入侵 → 断绝外交关系)形成了一个连贯的因果链,感觉比孤立的抽象政治事件更有可能发生。合取为断绝外交关系提供了一个“理由”。
  • 后果: 把详细威胁情景的评级排在较简单情景之上,有可能让资源过度集中于特定威胁,同时低估普遍的脆弱性。
  • 经验教训: 菲利普·泰特洛克 (Philip Tetlock) 的“超级预测家”研究表明,最好的预测者通过将复合问题分解为独立的概率并将它们相乘来明确避免这种错误。

案例研究 2:匹兹堡大学医学中心的干预

  • 背景: 诊断错误是医疗保健中医疗事故索赔和患者伤害的重要来源。
  • 发生了什么: UPMC 开发了“退后两步 (Two Steps Back)”课程,专门针对临床推理中的合取谬误。
  • 起作用的偏差: 医生一直将带有伴随症状的具体诊断评为比广泛诊断本身更有可能,导致过早地在“代表性”表现上闭合诊断。
  • 后果: 错过了以非典型方式呈现的常见疾病的诊断,而罕见的“教科书”表现受到不成比例的关注。
  • 经验教训: 该干预迫使临床医生暂停,制定总结陈述(问题表示),并在添加具体特征之前明确评估广泛疾病类别的基本比率,等于给这一谬误加了一道逻辑检查。

历史案例:法律推理和叙事陷阱

合取谬误对法律程序有着重大影响。提供详细时间表(“被告买了枪 AND 开车去了房子 AND 等待受害者”)的检察官往往比那些提供脱节事实的检察官更有说服力——即使每个增加的特定要素在数学上降低了确切情景的概率。

People v. Collins (1968) 案中,虽然在技术上是关于检察官谬误的,但该案件证明了陪审员是如何被复合概率淹没的。展示多个匹配特征导致陪审团将详细故事的合理性与其概率混为一谈。同样的模式出现在冤假错案中:详细但不正确的叙事比承认不确定性更能说服人。


6. 这种偏差的代价

6.1. 个人代价

  • 预测过度自信:基于过于具体的情景(职业规划、期望的关系)做出的个人决定会在现实出现偏差时带来失望
  • 误判他人:基于连贯叙事的性格评估可能会错过重要的细微差别
  • 财务规划:详细的退休或投资情景可能会忽略更广泛的不确定性
  • 健康决策:更喜欢特定的诊断或治疗叙事,而不是承认不确定性

6.2. 职业代价

  • 医学诊断错误:执着于“经典”表现会导致漏诊常见疾病
  • 情报失败:对特定威胁情景的评级过高,而低估了一般性脆弱性
  • 糟糕的预测:商业和财务预测基于详细叙事而不是概率分布
  • 法律不公:引人入胜的故事压倒了对证据的逻辑评估

6.3. 社会代价

  • 政策决策:公共政策基于具体的情景规划,而不是可靠的概率评估
  • 资源错配:为特定的预测事件做准备,而不是建立一般的复原力
  • 市场效率低下:由于叙事吸引力导致金融工具定价错误
  • 民主扭曲:政治选择受到引人入胜的故事而非政策实质的影响

6.4. 统计影响

  • 即使在受过统计训练的参与者中,也观察到了 85% 的错误率
  • 72% 的受访者在比约恩·博格研究中犯了该谬误
  • 医学研究表明,诊断推理中存在一致的合取违背
  • 情报分析研究揭示了系统性地过分看重详细情景

7. 隐藏的益处

合取谬误的背后是一批适应性机制:

  • 社会理解:在社会背景下,假设细节的相关性(格莱斯含义 Gricean implicature)有助于沟通。如果有人提供详细描述,将其视为相关信息在社会层面上是理性的。
  • 因果学习:偏好具有因果连贯性的解释促进了对机制的理解,而不仅仅是相关性
  • 叙事记忆:故事比概率分布更容易记忆和传递,支持文化知识的转移
  • 快速评估:在时间紧迫的情况下,代表性匹配提供了快速的“足够好”的判断
  • 适应性怀疑:详细的解释通常确实表明了真正的知识——当应用于诚实的沟通者时,这种启发式方法效果很好

“生态理性”的观点认为,在对话中假设细节是相关的,是一种良好的语用推理。这种谬误主要出现在把概率从沟通背景中剥离出来的人为实验环境里。彻底根除这种倾向,会削弱我们从解释中学习、理解他人意图的能力。


8. 自我评估:你有这种偏差吗?

8.1. 警告标志检查表

  • 我觉得详细的解释比承认“我们不知道”更有说服力
  • 在预测结果时,我会自然而然地构建具体的情景而不是概率范围
  • 我更喜欢给出自信、详细预测的专家,而不是表达不确定性的专家
  • 有着清晰因果解释的新闻报道让人感觉更可信
  • 我根据人们过去的连贯叙事来判断他们的性格
  • 具体的投资或商业计划感觉比总体目标更容易实现
  • 听到详细的解释而不检查逻辑时,我经常认为“这说得通”
  • 当医疗诊断包含明确的因果机制时,会让人感觉更满意
  • 在争论中,我发现详细的情景比统计摘要更有说服力
  • 我很少将复合预测分解为其独立的组成部分

评分:

  • 勾选 0-2 项:低易感性
  • 勾选 3-5 项:中度易感性
  • 勾选 6-8 项:高易感性
  • 勾选 9-10 项:极高易感性

8.2. 自我反思问题

  1. 上一次详细的解释说服你相信某件事是什么时候?你是否检查过细节是增加还是减少了概率?
  2. 当专家表达真正的不确定性与自信的具体预测时,你有何反应?
  3. 你能回想起你喜欢“好故事”胜过承认随机性或不确定性的时候吗?
  4. 你是否自然地根据概率范围来思考,还是你倾向于具体的情景规划?
  5. 是否有其他人指出你的预测过于具体或过于依赖特定叙事?

8.3. 快速诊断情景

情景: 一个朋友告诉你一位新同事的事: “莎拉拥有计算机科学博士学位,业余时间写代码,参加科技会议,并志愿教孩子们编程。她要么 (A) 是一名软件工程师,要么 (B) 是一名参加国际象棋比赛的软件工程师。”

哪个看起来更有可能?

  • A) 选项 B 似乎更有可能或大致相等 → 高易感性(国际象棋细节虽然符合“技术人员”的原型,但在数学上降低了概率)
  • B) 我注意到选项 B 肯定可能性较小,但选项 B 仍然“感觉”更完整 → 中度易感性(意识到了陷阱,但直觉的拉力仍然存在)
  • C) 选项 A 显然更有可能,因为每个下国际象棋的工程师必然是工程师 → 低易感性

9. 识别他人身上的这种偏差

9.1. 行为指标

  • 偏好详细的预测和计划,而不是范围和应急方案
  • 相信提供具体情景的“专家”预测
  • 对不确定性感到不适;寻求“说得通”的解释
  • 基于连贯的生活叙事而不是能力来评估人
  • 偏爱提供清晰因果解释的新闻来源

9.2. 对话中的红旗

处于这种偏差下的人会说的话:

  • “这说得通”(在不检查逻辑的情况下回应详细解释时)
  • “这发生的原因是因为 X,这会导致 Y,从而引发 Z”
  • “我就是知道——整个画面都拼凑起来了”
  • “任何人都能看出这将如何发展”
  • “一旦你了解了细节,这就很明显了”

他们提出的论点类型:

  • 将基于详细情景的推理呈现为比应有的更确定
  • 将多个条件连接起来,仿佛它们加强而不是削弱了概率

他们避免问的问题:

  • “每个组成部分独立的基本比率是多少?”
  • “如果这个因果链中的一环断裂会发生什么?”
  • “这个解释之所以有说服力,是因为它很可能发生,还是因为它是一个好故事?”

9.3. 情境触发因素

  • 高风险:重要的决定放大了对连贯解释的渴望
  • 时间压力:快速的决定偏向于代表性而不是仔细分析
  • 情感投入:我们关心的结果会吸引叙事性思维
  • 社会背景:对话自然地假设提供的细节是相关的
  • 专业领域:讽刺的是,专家可能更容易受到影响,因为他们的模式匹配更强

10. 认知去偏策略

10.1. 即时技巧

  • 频率转换:将“概率是多少?”转换为“在 100 个类似案例中,有多少会...?”这会触发外延推理。
  • 子集检查:问自己,“X 必然包含在 Y 中吗?”如果是,那么 P(Y) ≥ P(X)
  • 分解:将复合预测分解为独立的组件并相乘
  • 魔鬼代言人:对于任何详细情景,问“这个结果可能发生(或不发生)的其他方式是什么?”
  • 基本比率锚点:在考虑细节之前,建立更广泛类别的基线概率

10.2. 长期策略

  • 概率素养:训练自己以分布而不是点预测来思考
  • 预测实践:记录预测并根据结果进行校准
  • 暴露于反例:研究引人入胜的叙事被证明是错误的情况
  • 深思熟虑的暂停:养成在接受连贯解释之前暂停的习惯
  • 超级预测技术:学习显式的概率分解方法

10.3. 环境设计

  • 决策检查表:要求在详细分析之前进行明确的基本比率评估
  • 团队多样性:在规划过程中包括具有统计头脑的个人
  • 结构化分析技术:使用强制考虑替代方案的框架
  • 红队 (Red Teams):专门分配角色来挑战基于叙事的推理
  • 概率培训:组织在统计素养方面的投资

10.4. 何时寻求外部输入

  • 高风险的医疗诊断:寻求第二意见,尤其是针对“经典”表现
  • 重大财务决策:咨询量化不确定性的顾问
  • 法律判决:确保具备统计专业知识
  • 战略规划:纳入接受过概率校准培训的预测者
  • 当一个故事感觉“太好了”:叙事越引人入胜,核实就越重要

11. 实践练习

练习 1:频率转换练习

  • 目标: 训练自动将概率问题转换为频率格式
  • 所需时间: 每天 10 分钟,持续 2 周
  • 所需材料: 新闻文章,专家的预测
  • 难度级别: 初学者
  • 说明:
    1. 在新闻中找出一个概率陈述(“有 30% 的衰退几率”)
    2. 转换它:“在 100 个类似的情况下,有多少个会导致衰退?”
    3. 问:“100 个中的 30 个感觉和 30% 不同吗?”
    4. 使用合取陈述进行练习:“在 100 个琳达中,有多少是银行出纳员?有多少是女权主义银行出纳员?”
    5. 记录感觉不同的地方
  • 反思问题:
    • 频率格式是否改变了你的直觉?
    • 哪种格式使子集关系更清晰?
    • 你什么时候可以在日常决定中使用这种技巧?
  • 频率: 每天进行,持续两周,然后根据需要进行

练习 2:情景分解

  • 目标: 练习将复合预测分解为独立的组成部分
  • 所需时间: 15 分钟
  • 所需材料: 纸和笔
  • 难度级别: 中级
  • 说明:
    1. 写下一个你相信的具体预测(“团队 X 将获胜,因为因素 A、B 和 C”)
    2. 独立估计每个组成部分的概率
    3. 将它们相乘(如果它们是真正独立的)或记录依赖关系
    4. 将这个计算出的概率与你最初的直觉进行比较
    5. 相应地调整你的信心
  • 反思问题:
    • 你最初的信心是否高于计算出的概率?
    • 这揭示了叙事对你判断的何种影响?
    • 你如何将此应用于重要的决定?
  • 频率: 每周在决策过程中进行

练习 3:欧拉图可视化

  • 目标: 建立对集合关系的直观理解
  • 所需时间: 20 分钟
  • 所需材料: 纸、彩色笔
  • 难度级别: 初学者
  • 说明:
    1. 画一个大圆圈,标为“银行出纳员”
    2. 画一个表示“女权主义者”的圆圈(相交或不相交,由你估计)
    3. 给交集“女权主义银行出纳员”打上阴影
    4. 观察:阴影部分可以比任何一个圆圈都大吗?
    5. 使用你生活中的其他类别重复此操作
  • 反思问题:
    • 可视化集合如何影响你的概率直觉?
    • 听到复合声明时,你能把这个图像记在脑海里吗?
    • 你还可以用图表表示哪些其他的合取主张?
  • 频率: 当遇到重要的复合概率判断时

日常练习

每当你听到或做出复合预测时,停下来问一问:“这是不是更具体了,因此可能性更小了?”在接受“说得通”的解释之前,练习 5 秒钟的暂停。

  • 建议时长:每次 5 秒
  • 最佳时间:全天,每当预测出现时
  • 如何追踪进度:记下发现的次数;每周记日记

每周挑战

选择一个领域(健康、金融、工作、人际关系)并审查你的假设:

  • 列出三个属于复合预测的信念
  • 将每个信念分解为组成部分
  • 研究组成部分的基本比率
  • 重新校准你的信心

4 周后的预期结果:提高对叙事拉力的认识、更精确的预测、适应不确定性

反思的日记提示:

  • 本周我发现了自己做出的哪个复合预测?
  • 什么时候一个“好故事”几乎推翻了我的逻辑分析?
  • 我对表达不确定性的适应程度有何变化?

12. 针对特定受众

致领导者和管理者

  • 战略规划:要求对主要预测进行概率分解;不要接受没有独立概率估计的详细情景
  • 团队决策:在计划会议中包括“概率审计员”
  • 招聘:对背景形成“过于完美”叙事的候选人保持怀疑;关注具体能力
  • 沟通:恰当地模拟不确定性;避免奖励虚假的自信
  • 文化:为表达真正的不确定性创造心理安全感

致父母和教育工作者

  • 适合年龄的教学:使用视觉辅助工具(维恩图)教授集合关系
  • 基于游戏的学习:骰子游戏和纸牌概率练习建立直观的理解
  • 故事意识:讨论媒体中的故事如何可能“更详细但可能性更小”
  • 提问示范:当孩子做出预测时,问他们“这可能发生的其他方式是什么?”
  • 赞美不确定性:使说“我不知道”和“这取决于”正常化

致医疗保健专业人员

  • “退后两步”协议:在最终确定诊断之前,明确说明主要疾病的基本比率
  • 非典型表现意识:积极考虑“经典”模式匹配是否正在推翻概率
  • 与患者沟通:平衡他们对连贯解释的渴望与诚实的不确定性
  • 诊断检查表:使用强制考虑替代方案的结构化协议
  • 继续教育:在诊断推理课程中包括合取谬误培训

致金融专业人员

  • 投资委员会纪律:要求对投资论点进行概率分解
  • 客户沟通:向客户解释为什么详细的预测通常不如范围可靠
  • 风险评估:对解释为什么相关性将成立的“故事”保持特别怀疑
  • 情景规划:使用概率加权情景而不是详细的单一预测
  • 尽职调查:当一笔交易“完全合理”时,加强审查

13. 与其他偏差的相互作用

放大此偏差的偏差

偏差 如何相互作用
基本比率忽视 (Base Rate Neglect) 忽略先验概率会使连贯的叙事相对于统计现实变得更加引人入胜
确认偏误 (Confirmation Bias) 一旦接受了一个叙事,我们就会寻找证实它的信息,从而加强合取
叙事谬误 (Narrative Fallacy) 偏好故事而不是统计数据的普遍倾向直接助长了合取错误
过度自信 (Overconfidence) 预测中的虚假确定性使得能够在不进行概率检查的情况下接受详细情景

抵消此偏差的偏差

偏差 如何提供帮助
悲观偏见 (Pessimism Bias) 预期负面结果可以促使对乐观的详细情景进行审查
分析瘫痪 (Analysis Paralysis) 过度深思熟虑可能会抓住快速直觉漏掉的逻辑错误

常见的偏差链

基本比率忽视 → 合取谬误 → 过度自信 → 糟糕的决定

解释:忽略基本比率让连贯的叙事主导判断,这夸大了对特定情景的信心,导致基于引人入胜但不太可能的预测做出决策。在考虑细节之前,通过锚定基本比率来打断这个链条。


14. 文化视角

对合取谬误中文化差异的研究有限,但表明既有普遍性也有特定文化的方面:

  • 普遍性:核心现象(将详细连贯的情景评为比更简单的情景更有可能)跨文化出现,表明其有深刻的认知根源
  • 变异:强调整体思维的文化可能表现出与强调分析思维的文化不同的模式
  • 语言影响:对于“和 (and)”具有不同逻辑结构的语言可能表现出不同的易感性
文化类型 表现形式
个人主义文化 更注重个人品格评估;琳达型问题高度稳健
集体主义文化 基于群体的情景和群体角色的连贯性可能驱动类似效应
高语境文化 对关系细节的更多关注可能会放大基于叙事的推理
低语境文化 明确的逻辑训练可能提供部分保护,但影响依然存在

特沃斯基/卡尼曼和吉仁泽/赫特维格之间的争论部分涉及文化和背景因素:语用推理(假设相关性)在文化上可能更具适应性,即使在逻辑上是谬误。


15. 神话和误解

神话 现实
只有未受过教育的人才会犯这种谬误 85% 的错误率包括受过统计训练的人;概率方面的专业知识并不能消除这种偏差
这只是关于“和 (and)”的语言混淆 虽然语言歧义解释了部分差异,但即使使用明确的措辞和下注情景,谬误依然存在
可以很容易地通过训练消除这种谬误 频率格式有很大帮助,但并不能消除偏差;它反映了深层的认知架构
这只在人为的实验室环境中才重要 该谬误已在医疗诊断、情报分析、法律推理和财务预测中得到证实
人工智能/计算机没有这个问题 大型语言模型表现出类似的模式,特别是当问题细节与训练样例相比发生变化时

16. 专家见解

“对概率的判断被对相似性的判断所取代。” —— 阿莫斯·特沃斯基 & 丹尼尔·卡尼曼,1983 年

“人类思维不是为解决概率问题而设计的。它是为讲述和理解故事而设计的。” —— 丹尼尔·卡尼曼,《思考,快与慢》

“当信息以符合我们进化的认知环境的格式呈现时,人类是相当理性的。” —— 格尔德·吉仁泽,关于频率格式效应

“超级预测家将复合问题分解为独立的概率并将它们相乘,认识到添加的每一个细节都会降低整体的可能性。” —— 菲利普·泰特洛克,《超预测》


17. 核心要点

  1. 当我们判断“A 和 B”比“单独的 A”更有可能时,就会发生合取谬误——这在逻辑上是不可能的
  2. 这种错误源于代表性:我们根据某事物与我们的心理原型吻合的程度来判断概率,而不是根据数学外延
  3. 这种谬误是普遍存在的,在标准范式中以大约 85% 的比例影响专家和新手
  4. 现实世界的后果出现在医学(诊断错误)、情报(威胁评估)、法律(陪审团说服)和金融(复杂工具)中
  5. 频率格式显着减少了谬误;问“100 个中有多少?”触发了外延推理
  6. 该偏差背后是一种适应性机制——连贯的叙事通常确实表明了真正的理解——但在需要精确概率的环境中会失败
  7. 仅仅意识到是不够的;需要有意的方法(分解、可视化、基本比率锚定)来抵消引人入胜的故事的拉力

18. 进一步的资源

学术论文

  • Tversky, A., & Kahneman, D. (1983). Extensional versus intuitive reasoning: The conjunction fallacy in probability judgment. Psychological Review, 90(4), 293-315.
  • Hertwig, R., & Gigerenzer, G. (1999). The 'conjunction fallacy' revisited: How intelligent inferences look like reasoning errors. Journal of Behavioral Decision Making, 12(4), 275-305.
  • Mellers, B., Hertwig, R., & Kahneman, D. (2001). Do frequency representations eliminate conjunction effects? An exercise in adversarial collaboration. Psychological Science, 12(4), 269-275.

书籍

  • Kahneman, D. (2011). Thinking, Fast and Slow. Farrar, Straus and Giroux.(中译本:《思考,快与慢》)
  • Tetlock, P., & Gardner, D. (2015). Superforecasting: The Art and Science of Prediction. Crown.(中译本:《超预测》)
  • Gigerenzer, G. (2002). Calculated Risks: How to Know When Numbers Deceive You. Simon & Schuster.

书籍章节

  • Tversky, A., & Kahneman, D. (1982). Judgments of and by representativeness. In D. Kahneman, P. Slovic, & A. Tversky (Eds.), Judgment under uncertainty: Heuristics and biases (pp. 84-98). Cambridge University Press.

19. 总结卡片

元素 内容
偏差名称 合取谬误 (Conjunction Fallacy)
定义 将“A 和 B”判断为比“单独的 A”更有可能——一种逻辑上的不可能性
类别 意义不足(用连贯的故事填补空白)
关键标志 详细的情景感觉比更简单的可能性更有可能
主要原因 代表性启发式用相似性代替概率
最大风险 诊断错误、情报失败、糟糕的预测
快速修复 转换为频率:“在 100 个案例中,有多少个...?”
长期策略 练习概率分解和基本比率锚定
牢记 “一个好故事不是一个很可能发生的故事——增加的每一个细节都会降低概率”

20. 使用术语表

术语 定义
外延推理 (Extensional Reasoning) 基于集合的大小或外延(计算成员数量)来评估概率
内涵推理 (Intensional Reasoning) 基于属性、特征或代表性来评估概率
代表性启发式 (Representativeness Heuristic) 通过与心理原型的相似性来判断概率
基本比率 (Base Rate) 在考虑具体细节之前某事件的先验概率
模拟启发式 (Simulation Heuristic) 通过在心理上想象因果序列的容易程度来判断概率
可用性启发式 (Availability Heuristic) 通过从记忆中检索示例的容易程度来判断频率
柯尔莫哥洛夫公理 (Kolmogorov Axioms) 概率论的数学基础
合取规则 (Conjunction Rule) P(A ∧ B) ≤ P(A) 且 P(A ∧ B) ≤ P(B)——交集不能超过任何一个集合
格莱斯含义 (Gricean Implicature) 提供的信息与对话相关的语用推理
量子认知 (Quantum Cognition) 应用量子概率形式体系来模拟人类判断的框架

21. 讨论问题

供读书俱乐部、课堂或自我反思:

  1. 你能回想起你被一个“好故事”引导去相信一些不太可能的事情吗?当现实偏离叙事时发生了什么?

  2. 即使在专家中,合取谬误也持续存在。这挑战了还是支持了你对专家预测的信心?我们怎样才能更好地评估专业知识?

  3. 吉仁泽认为该谬误揭示的是有缺陷的实验,而不是有缺陷的头脑。你如何评估“认知偏误”和“生态理性”之间的辩论?

  4. 社交媒体和 24 小时新闻——它们强调引人入胜的叙事——可能会如何在公共话语中放大合取谬误?

  5. 如果人工智能系统从训练数据中继承了这种偏差,那么在医疗诊断或刑事司法等高风险决策中使用人工智能有何影响?