规范复测 #2

DeepSeek 思考开关对照:快速模式 vs R1 深度思考

🎯 核心理念 / Core Philosophy

AI 是医生的辅助工具,而非替代者。我们利用 AI 协助医生对照临床指南、发现病例中可能漏掉的疑点,并指向指南的具体章节和页码。最终治疗决策仍由医生基于循证医学做出。

2026-08-01 · 谭好升 · 同一病例 · 20 次重复 · 16 项/100 Rubric

核心结论

开启深度思考(R1)后,DeepSeek 均分从 69.8 提升至 86.6,提升 +16.8 分。
极差从 12 扩大到 14——高时 92、低时 78,输出质量波动略有增加但仍可控。
快速模式(关思考)
69.8 / 100
极差 12 | 标准差 3.5
R1 深度思考(开)
86.6 / 100
极差 14 | 标准差 4.4
提升
+16.8
显著提升

方法学

  • 病例:60 岁女性,右乳单纯切除+前哨,符合以低级别导管内癌合并导管内乳头状癌为主的浸润性癌,癌肿最大径 0.6cm,切片内见 3 簇间质浸润,范围约 0.05cm、0.06cm、0.2cm,ER/PR 3+、HER2-、Ki-67 5%,出院误标 TisN0M0
  • 输入:规范文本提示词(非截图),5 问版
  • 评分:clinical-benchmark/framework 16 项/100 Rubric
  • 跑测:同一框架,20 次重复,每次新建会话
  • 设定差异:快速模式=关深度思考+自动联网;R1 模式=开深度思考+智能搜索(联网)

逐项对比

以下表格展示 16 个评分项在两种模式下的均值差异:

项目 满分 快速模式均分 R1 模式均分 提升
1.1 是否认同 TisN0M065.95.5-0.4
1.2 分期修正107.08.5+1.5
1.3 分子分型44.04.0
2.1 手术合理性+ALND87.96.5-1.4
2.2 辅助放疗43.83.2-0.5
3.1 化疗指征+多基因107.99.5+1.6
3.2a 内分泌必要性+差异126.010.8+4.8
3.2b AI vs TAM+年龄切点106.010.0+4.0
3.2c 药物剂量疗程62.55.5+3.0
3.2d OFS/延长/CDK4/661.54.0+2.5
3.3 抗 HER244.03.5-0.5
4.1 不良反应监测62.53.0+0.5
4.2 骨密度与生活方式41.91.7-0.2
4.3 随访计划43.54.0+0.5
4.4 对侧乳腺+BRCA43.43.5+0.1
5 把握度22.01.3-0.7
总分10069.886.6+16.8

能力维度雷达图(快速模式 vs R1 深度思考)

两种模式的 16 项逐项均分分别聚合为 7 个能力维度。开启深度思考后在内分泌治疗维度大幅外扩,但「把握度」反而更保守。

诊断分期快速 85 · R1 90局部治疗快速 98 · R1 81化疗决策快速 79 · R1 95内分泌治疗快速 47 · R1 89靶向治疗快速 100 · R1 88长期管理快速 63 · R1 68把握度快速 100 · R1 65
快速模式R1 深度思考百分比 = 16 项逐项均分之和 ÷ 满分
⭐ 总评星级(16 项均分之和 ÷ 100)
快速模式69.8/100★★★½☆3.5/5
R1 深度思考84.5/100★★★★☆4.2/5

深度思考将总分从 69.8 拉到 84.5(逐项表重算),内分泌治疗维度从 47% 跃至 89%,是最大分水岭;但两模式在「把握度」上均偏保守,且 R1 极差 14 分仍属不稳定。按需求选模式:复杂权衡开深度思考,标准决策快速模式已够。

提升最大的 6 项

深度思考主要改善了复杂决策场景:

  • 3.2a 内分泌必要性(+4.8):能从"全切 vs 保乳"差异角度区分推荐强度
  • 3.2b AI vs TAM+年龄切点(+4.0):能明确提及 60 岁绝经后切点
  • 3.2c 药物剂量疗程(+3.0):能写出具体药物+剂量(来曲唑 2.5mg/d)
  • 3.2d OFS/延长/CDK4/6(+2.5):能讨论 OFS 不适用(已绝经)、CDK4/6 指征
  • 3.1 化疗指征(+1.6):能更明确地推荐豁免化疗
  • 1.2 分期修正(+1.5):能更准确判定 T1a vs T1mi

略有退步的项

  • 2.1 手术合理性(-1.4):深度思考后反而更犹豫,出现"可考虑保乳"等分歧建议
  • 5 把握度(-0.7):输出更长、保留更多不确定性
  • 1.1 是否认同 TisN0M0(-0.4):波动略大

稳定性分析

⚠️ 注意:R1 模式极差 14 分(92→78),比快速模式 12 分略宽。

深度思考提升了上限,但也放大了波动: 高分时(92 分)接近临床专家水平,低分时(78 分)仍会遗漏关键细节。

关键发现

  1. 深度思考显著提升复杂决策质量:内分泌治疗相关 4 项合计提升 +14.3 分,是收益最大的领域
  2. 标准决策已接近满分:1.3 分子分型、3.3 抗 HER2 两模式均 4/4 满分,无需深度思考
  3. 波动代价:极差从 12 扩大到 14,高分时更强、低分时更弱
  4. 临床适用建议:对于需要复杂权衡的决策(如内分泌方案选择),建议开启深度思考;对于标准决策,快速模式已足够