🔁 Benchmark Repeats · 规范复测 #3 / 2026-08-02

GLM vs DeepSeek R1 同口径对比:深度思考模式谁更稳?

🎯 核心理念 / Core Philosophy

AI 是医生的辅助工具,而非替代者。我们利用 AI 协助医生对照临床指南、发现病例中可能漏掉的疑点,并指向指南的具体章节和页码。最终治疗决策仍由医生基于循证医学做出。

⚠️ Medical disclaimer: All clinical case analyses are for educational and research purposes only. They are based on a single anonymized case and do not constitute individual medical advice.

核心结论

同开深度思考 + 联网搜索,DeepSeek R1 在准确性和稳定性上双优:
均值 86.5 vs 80.8(+5.7分),极差 14 vs 35(少 21 分),标准差 4.4 vs 9.9(少 5.5)。
GLM-5.2 均值
80.8
极差 35 | 标准差 9.9
DeepSeek R1 均值
86.5
极差 14 | 标准差 4.4
R1 优势
+5.7
均值 +5.7 · 极差 -21
📊 关键洞察
GLM 虽然开启了深度思考,但输出质量波动极大(63→98分,跨 4 个五分档)。DeepSeek R1 在同一设定下更稳定,最低 79 分、最高 92 分,极差仅 14 分。

方法学

  • 病例:60 岁女性,右乳单纯切除+前哨,符合以低级别导管内癌合并导管内乳头状癌为主的浸润性癌,癌肿最大径 0.6cm,切片内见 3 簇间质浸润,范围约 0.05cm、0.06cm、0.2cm,ER/PR 3+、HER2-、Ki-67 5%,出院误标 TisN0M0
  • 输入:规范文本提示词(非截图),同一 5 问版
  • 模型设定两者均开启深度思考 + 联网搜索(与第二篇 R1 设定一致)
  • 评分:clinical-benchmark/framework 16 项/100 Rubric
  • 跑测:GLM 16 次有效(1 次 INVALID)、DeepSeek R1 20 次有效

逐项对比(16 项 Rubric)

以下表格展示两模型在 16 个评分项上的均值差异:

项目 满分 GLM 均分 R1 均分 差异
1.1 是否认同 TisN0M065.85.5-0.3
1.2 分期修正108.48.5
1.3 分子分型44.04.0
2.1 手术合理性+ALND86.96.5-0.4
2.2 辅助放疗43.43.2-0.2
3.1 化疗指征+多基因108.19.5+1.4
3.2a 内分泌必要性129.610.8+1.2
3.2b AI vs TAM+年龄切点107.510.0+2.5
3.2c 药物剂量疗程64.85.5+0.7
3.2d OFS/CDK4/663.24.0+0.8
3.3 抗 HER243.83.5-0.3
4.1 不良反应监测63.43.0-0.4
4.2 骨密度与生活方式42.31.7-0.6
4.3 随访计划43.64.0+0.4
4.4 对侧乳腺+BRCA43.13.5+0.4
5 把握度21.81.3-0.5
总分10080.886.5+5.7

能力维度雷达图(7 维聚合自 16-item Rubric)

将 16 个评分项归并为 7 个能力维度,每个维度的百分比 = 该组 Rubric 项的均值之和 ÷ 满分。两模型在同一病例、同一规范提示词下评测,便于一眼看出各自的强弱面。

诊断分期GLM 91 · R1 90局部治疗GLM 86 · R1 81化疗决策GLM 81 · R1 95内分泌治疗GLM 74 · R1 89靶向治疗GLM 95 · R1 88长期管理GLM 69 · R1 68把握度GLM 90 · R1 65
GLM-5.2 DeepSeek R1 百分比 = 该维度 Rubric 项均值之和 ÷ 满分
⭐ 总评星级(16 项均分之和 ÷ 100)
GLM-5.280.8/100★★★★☆4.0/5
DeepSeek R184.5/100★★★★☆4.2/5

同开深度思考 + 联网搜索,R1 均值更高(84.5 vs 80.8)且更稳定(极差 14 vs 35)。两模型在内分泌细节上仍偏弱,R1 把握度略低但决策更一致;GLM 偶有高质量答案但波动大。

DeepSeek R1 优势项

  • 3.2b AI vs TAM(+2.5):R1 更明确提及绝经后切点,推荐 AI 更果断
  • 3.1 化疗指征(+1.4):R1 更能准确引用 21 基因检测指征
  • 3.2a 内分泌必要性(+1.2):R1 能更完整覆盖全切 vs 保乳差异
  • 3.2d OFS/CDK4/6(+0.8):R1 更能讨论 OFS 不适用(已绝经)

GLM 优势项

  • 2.1 手术合理性(+0.4):GLM 更倾向于确认单纯切除+SLNB 的合理性
  • 4.1 不良反应监测(+0.4):GLM 更详细讨论内分泌治疗不良反应

⚠️ 注意:GLM 在 3.2b(AI vs TAM)上失分明显,可能因为未能明确区分绝经前后用药差异。

稳定性分析:极差是关键

📉 GLM 极差 35 分(63→98)
GLM 的最低分仅 63 分(run7),最高分 98 分(run12),跨 4 个五分档。这种波动对医疗决策场景是不可接受的——医生不能接受"今天给 98 分,明天给 63 分"的方案。
📈 DeepSeek R1 极差 14 分(79→92)
R1 的最低分 79 分、最高分 92 分,跨 2 个五分档。虽然仍有波动,但比 GLM 稳定得多。

从临床决策角度看,稳定性比偶尔的高分更重要。一个均值 86、极差 14 的模型,比均值 81、极差 35 的模型更适合辅助决策。

各次运行得分

GLM(16 次有效)

Run得分档位
172AMBER
269AMBER
374AMBER
490GREEN
590GREEN
680AMBER
763RED
886GREEN
975AMBER
1092GREEN
1182AMBER
1298GREEN
1367RED
1484AMBER
1584AMBER
1686GREEN

DeepSeek R1(20 次有效)

Run得分档位
191GREEN
288GREEN
392GREEN
482AMBER
591GREEN
692GREEN
782AMBER
886GREEN
979AMBER
1087GREEN
1178AMBER
1290GREEN
1384AMBER
1488GREEN
1589GREEN
1684AMBER
1790GREEN
1882AMBER
1992GREEN
2084AMBER

结论与启示

在深度思考 + 联网搜索的设定下,DeepSeek R1 比 GLM-5.2 更准确且更稳定。
均值 +5.7 分,极差缩小 60%(35→14),标准差减少 55%。

对临床场景的启示

  • 稳定性 > 偶尔的高分:医疗决策需要可重复性,极差 35 分的模型不适合独立决策
  • 深度思考的价值:两个模型都从快速模式升级到深度思考后,均值都提升,但 R1 的稳定性更好
  • 模型选择建议:在同等设定下,DeepSeek R1 是更可靠的临床决策辅助工具

局限性

  • 样本量有限(GLM 16 次、R1 20 次),需更多重复验证
  • 仅测试单一病例,结论不能泛化到其他病例类型
  • 评分基于关键词覆盖,可能与人工评分存在偏差

常见问题

为什么 GLM 的极差比 R1 大这么多?

GLM 在深度思考模式下可能出现两种极端:思考充分时给出高质量答案(98分),但思考路径偏差时给出遗漏关键项的答案(63分)。R1 的思考路径更一致,波动较小。

这个对比公平吗?两个模型设定一样吗?

是的,本次对比严格同口径:同一病例、同一规范提示词、同开深度思考+联网搜索、同一 16 项 Rubric 评分。唯一变量是模型本身。

极差 14 分算稳定吗?

根据框架标准(极差 ≥ 8 分 = 不稳定),R1 的极差 14 分仍属"不稳定",但比 GLM 的 35 分好很多。理想目标是极差 < 8 分。

" defer>