DeepSeek 思考开关对照:快速模式 vs R1 深度思考
🎯 核心理念 / Core Philosophy
AI 是医生的辅助工具,而非替代者。我们利用 AI 协助医生对照临床指南、发现病例中可能漏掉的疑点,并指向指南的具体章节和页码。最终治疗决策仍由医生基于循证医学做出。
核心结论
开启深度思考(R1)后,DeepSeek 均分从 69.8 提升至 86.6,提升 +16.8 分。
极差从 12 扩大到 14——高时 92、低时 78,输出质量波动略有增加但仍可控。
极差从 12 扩大到 14——高时 92、低时 78,输出质量波动略有增加但仍可控。
快速模式(关思考)
69.8 / 100
极差 12 | 标准差 3.5
R1 深度思考(开)
86.6 / 100
极差 14 | 标准差 4.4
提升
+16.8
显著提升
方法学
- 病例:60 岁女性,右乳单纯切除+前哨,符合以低级别导管内癌合并导管内乳头状癌为主的浸润性癌,癌肿最大径 0.6cm,切片内见 3 簇间质浸润,范围约 0.05cm、0.06cm、0.2cm,ER/PR 3+、HER2-、Ki-67 5%,出院误标 TisN0M0
- 输入:规范文本提示词(非截图),5 问版
- 评分:clinical-benchmark/framework 16 项/100 Rubric
- 跑测:同一框架,20 次重复,每次新建会话
- 设定差异:快速模式=关深度思考+自动联网;R1 模式=开深度思考+智能搜索(联网)
逐项对比
以下表格展示 16 个评分项在两种模式下的均值差异:
| 项目 | 满分 | 快速模式均分 | R1 模式均分 | 提升 |
|---|---|---|---|---|
| 1.1 是否认同 TisN0M0 | 6 | 5.9 | 5.5 | -0.4 |
| 1.2 分期修正 | 10 | 7.0 | 8.5 | +1.5 |
| 1.3 分子分型 | 4 | 4.0 | 4.0 | — |
| 2.1 手术合理性+ALND | 8 | 7.9 | 6.5 | -1.4 |
| 2.2 辅助放疗 | 4 | 3.8 | 3.2 | -0.5 |
| 3.1 化疗指征+多基因 | 10 | 7.9 | 9.5 | +1.6 |
| 3.2a 内分泌必要性+差异 | 12 | 6.0 | 10.8 | +4.8 |
| 3.2b AI vs TAM+年龄切点 | 10 | 6.0 | 10.0 | +4.0 |
| 3.2c 药物剂量疗程 | 6 | 2.5 | 5.5 | +3.0 |
| 3.2d OFS/延长/CDK4/6 | 6 | 1.5 | 4.0 | +2.5 |
| 3.3 抗 HER2 | 4 | 4.0 | 3.5 | -0.5 |
| 4.1 不良反应监测 | 6 | 2.5 | 3.0 | +0.5 |
| 4.2 骨密度与生活方式 | 4 | 1.9 | 1.7 | -0.2 |
| 4.3 随访计划 | 4 | 3.5 | 4.0 | +0.5 |
| 4.4 对侧乳腺+BRCA | 4 | 3.4 | 3.5 | +0.1 |
| 5 把握度 | 2 | 2.0 | 1.3 | -0.7 |
| 总分 | 100 | 69.8 | 86.6 | +16.8 |
能力维度雷达图(快速模式 vs R1 深度思考)
两种模式的 16 项逐项均分分别聚合为 7 个能力维度。开启深度思考后在内分泌治疗维度大幅外扩,但「把握度」反而更保守。
快速模式R1 深度思考百分比 = 16 项逐项均分之和 ÷ 满分
⭐ 总评星级(16 项均分之和 ÷ 100)
快速模式69.8/100★★★½☆3.5/5
R1 深度思考84.5/100★★★★☆4.2/5
深度思考将总分从 69.8 拉到 84.5(逐项表重算),内分泌治疗维度从 47% 跃至 89%,是最大分水岭;但两模式在「把握度」上均偏保守,且 R1 极差 14 分仍属不稳定。按需求选模式:复杂权衡开深度思考,标准决策快速模式已够。
提升最大的 6 项
深度思考主要改善了复杂决策场景:
- 3.2a 内分泌必要性(+4.8):能从"全切 vs 保乳"差异角度区分推荐强度
- 3.2b AI vs TAM+年龄切点(+4.0):能明确提及 60 岁绝经后切点
- 3.2c 药物剂量疗程(+3.0):能写出具体药物+剂量(来曲唑 2.5mg/d)
- 3.2d OFS/延长/CDK4/6(+2.5):能讨论 OFS 不适用(已绝经)、CDK4/6 指征
- 3.1 化疗指征(+1.6):能更明确地推荐豁免化疗
- 1.2 分期修正(+1.5):能更准确判定 T1a vs T1mi
略有退步的项
- 2.1 手术合理性(-1.4):深度思考后反而更犹豫,出现"可考虑保乳"等分歧建议
- 5 把握度(-0.7):输出更长、保留更多不确定性
- 1.1 是否认同 TisN0M0(-0.4):波动略大
稳定性分析
⚠️ 注意:R1 模式极差 14 分(92→78),比快速模式 12 分略宽。
深度思考提升了上限,但也放大了波动: 高分时(92 分)接近临床专家水平,低分时(78 分)仍会遗漏关键细节。
关键发现
- 深度思考显著提升复杂决策质量:内分泌治疗相关 4 项合计提升 +14.3 分,是收益最大的领域
- 标准决策已接近满分:1.3 分子分型、3.3 抗 HER2 两模式均 4/4 满分,无需深度思考
- 波动代价:极差从 12 扩大到 14,高分时更强、低分时更弱
- 临床适用建议:对于需要复杂权衡的决策(如内分泌方案选择),建议开启深度思考;对于标准决策,快速模式已足够