GLM vs DeepSeek R1 同口径对比:深度思考模式谁更稳?
🎯 核心理念 / Core Philosophy
AI 是医生的辅助工具,而非替代者。我们利用 AI 协助医生对照临床指南、发现病例中可能漏掉的疑点,并指向指南的具体章节和页码。最终治疗决策仍由医生基于循证医学做出。
⚠️ Medical disclaimer: All clinical case analyses are for educational and research purposes only. They are based on a single anonymized case and do not constitute individual medical advice.
核心结论
同开深度思考 + 联网搜索,DeepSeek R1 在准确性和稳定性上双优:
均值 86.5 vs 80.8(+5.7分),极差 14 vs 35(少 21 分),标准差 4.4 vs 9.9(少 5.5)。
均值 86.5 vs 80.8(+5.7分),极差 14 vs 35(少 21 分),标准差 4.4 vs 9.9(少 5.5)。
GLM-5.2 均值
80.8
极差 35 | 标准差 9.9
DeepSeek R1 均值
86.5
极差 14 | 标准差 4.4
R1 优势
+5.7
均值 +5.7 · 极差 -21
📊 关键洞察
GLM 虽然开启了深度思考,但输出质量波动极大(63→98分,跨 4 个五分档)。DeepSeek R1 在同一设定下更稳定,最低 79 分、最高 92 分,极差仅 14 分。
GLM 虽然开启了深度思考,但输出质量波动极大(63→98分,跨 4 个五分档)。DeepSeek R1 在同一设定下更稳定,最低 79 分、最高 92 分,极差仅 14 分。
方法学
- 病例:60 岁女性,右乳单纯切除+前哨,符合以低级别导管内癌合并导管内乳头状癌为主的浸润性癌,癌肿最大径 0.6cm,切片内见 3 簇间质浸润,范围约 0.05cm、0.06cm、0.2cm,ER/PR 3+、HER2-、Ki-67 5%,出院误标 TisN0M0
- 输入:规范文本提示词(非截图),同一 5 问版
- 模型设定:两者均开启深度思考 + 联网搜索(与第二篇 R1 设定一致)
- 评分:clinical-benchmark/framework 16 项/100 Rubric
- 跑测:GLM 16 次有效(1 次 INVALID)、DeepSeek R1 20 次有效
逐项对比(16 项 Rubric)
以下表格展示两模型在 16 个评分项上的均值差异:
| 项目 | 满分 | GLM 均分 | R1 均分 | 差异 |
|---|---|---|---|---|
| 1.1 是否认同 TisN0M0 | 6 | 5.8 | 5.5 | -0.3 |
| 1.2 分期修正 | 10 | 8.4 | 8.5 | — |
| 1.3 分子分型 | 4 | 4.0 | 4.0 | — |
| 2.1 手术合理性+ALND | 8 | 6.9 | 6.5 | -0.4 |
| 2.2 辅助放疗 | 4 | 3.4 | 3.2 | -0.2 |
| 3.1 化疗指征+多基因 | 10 | 8.1 | 9.5 | +1.4 |
| 3.2a 内分泌必要性 | 12 | 9.6 | 10.8 | +1.2 |
| 3.2b AI vs TAM+年龄切点 | 10 | 7.5 | 10.0 | +2.5 |
| 3.2c 药物剂量疗程 | 6 | 4.8 | 5.5 | +0.7 |
| 3.2d OFS/CDK4/6 | 6 | 3.2 | 4.0 | +0.8 |
| 3.3 抗 HER2 | 4 | 3.8 | 3.5 | -0.3 |
| 4.1 不良反应监测 | 6 | 3.4 | 3.0 | -0.4 |
| 4.2 骨密度与生活方式 | 4 | 2.3 | 1.7 | -0.6 |
| 4.3 随访计划 | 4 | 3.6 | 4.0 | +0.4 |
| 4.4 对侧乳腺+BRCA | 4 | 3.1 | 3.5 | +0.4 |
| 5 把握度 | 2 | 1.8 | 1.3 | -0.5 |
| 总分 | 100 | 80.8 | 86.5 | +5.7 |
能力维度雷达图(7 维聚合自 16-item Rubric)
将 16 个评分项归并为 7 个能力维度,每个维度的百分比 = 该组 Rubric 项的均值之和 ÷ 满分。两模型在同一病例、同一规范提示词下评测,便于一眼看出各自的强弱面。
GLM-5.2
DeepSeek R1
百分比 = 该维度 Rubric 项均值之和 ÷ 满分
⭐ 总评星级(16 项均分之和 ÷ 100)
GLM-5.280.8/100★★★★☆4.0/5
DeepSeek R184.5/100★★★★☆4.2/5
同开深度思考 + 联网搜索,R1 均值更高(84.5 vs 80.8)且更稳定(极差 14 vs 35)。两模型在内分泌细节上仍偏弱,R1 把握度略低但决策更一致;GLM 偶有高质量答案但波动大。
DeepSeek R1 优势项
- 3.2b AI vs TAM(+2.5):R1 更明确提及绝经后切点,推荐 AI 更果断
- 3.1 化疗指征(+1.4):R1 更能准确引用 21 基因检测指征
- 3.2a 内分泌必要性(+1.2):R1 能更完整覆盖全切 vs 保乳差异
- 3.2d OFS/CDK4/6(+0.8):R1 更能讨论 OFS 不适用(已绝经)
GLM 优势项
- 2.1 手术合理性(+0.4):GLM 更倾向于确认单纯切除+SLNB 的合理性
- 4.1 不良反应监测(+0.4):GLM 更详细讨论内分泌治疗不良反应
⚠️ 注意:GLM 在 3.2b(AI vs TAM)上失分明显,可能因为未能明确区分绝经前后用药差异。
稳定性分析:极差是关键
📉 GLM 极差 35 分(63→98)
GLM 的最低分仅 63 分(run7),最高分 98 分(run12),跨 4 个五分档。这种波动对医疗决策场景是不可接受的——医生不能接受"今天给 98 分,明天给 63 分"的方案。
GLM 的最低分仅 63 分(run7),最高分 98 分(run12),跨 4 个五分档。这种波动对医疗决策场景是不可接受的——医生不能接受"今天给 98 分,明天给 63 分"的方案。
📈 DeepSeek R1 极差 14 分(79→92)
R1 的最低分 79 分、最高分 92 分,跨 2 个五分档。虽然仍有波动,但比 GLM 稳定得多。
R1 的最低分 79 分、最高分 92 分,跨 2 个五分档。虽然仍有波动,但比 GLM 稳定得多。
从临床决策角度看,稳定性比偶尔的高分更重要。一个均值 86、极差 14 的模型,比均值 81、极差 35 的模型更适合辅助决策。
各次运行得分
GLM(16 次有效)
| Run | 得分 | 档位 |
|---|---|---|
| 1 | 72 | AMBER |
| 2 | 69 | AMBER |
| 3 | 74 | AMBER |
| 4 | 90 | GREEN |
| 5 | 90 | GREEN |
| 6 | 80 | AMBER |
| 7 | 63 | RED |
| 8 | 86 | GREEN |
| 9 | 75 | AMBER |
| 10 | 92 | GREEN |
| 11 | 82 | AMBER |
| 12 | 98 | GREEN |
| 13 | 67 | RED |
| 14 | 84 | AMBER |
| 15 | 84 | AMBER |
| 16 | 86 | GREEN |
DeepSeek R1(20 次有效)
| Run | 得分 | 档位 |
|---|---|---|
| 1 | 91 | GREEN |
| 2 | 88 | GREEN |
| 3 | 92 | GREEN |
| 4 | 82 | AMBER |
| 5 | 91 | GREEN |
| 6 | 92 | GREEN |
| 7 | 82 | AMBER |
| 8 | 86 | GREEN |
| 9 | 79 | AMBER |
| 10 | 87 | GREEN |
| 11 | 78 | AMBER |
| 12 | 90 | GREEN |
| 13 | 84 | AMBER |
| 14 | 88 | GREEN |
| 15 | 89 | GREEN |
| 16 | 84 | AMBER |
| 17 | 90 | GREEN |
| 18 | 82 | AMBER |
| 19 | 92 | GREEN |
| 20 | 84 | AMBER |
结论与启示
在深度思考 + 联网搜索的设定下,DeepSeek R1 比 GLM-5.2 更准确且更稳定。
均值 +5.7 分,极差缩小 60%(35→14),标准差减少 55%。
均值 +5.7 分,极差缩小 60%(35→14),标准差减少 55%。
对临床场景的启示
- 稳定性 > 偶尔的高分:医疗决策需要可重复性,极差 35 分的模型不适合独立决策
- 深度思考的价值:两个模型都从快速模式升级到深度思考后,均值都提升,但 R1 的稳定性更好
- 模型选择建议:在同等设定下,DeepSeek R1 是更可靠的临床决策辅助工具
局限性
- 样本量有限(GLM 16 次、R1 20 次),需更多重复验证
- 仅测试单一病例,结论不能泛化到其他病例类型
- 评分基于关键词覆盖,可能与人工评分存在偏差
常见问题
为什么 GLM 的极差比 R1 大这么多?
GLM 在深度思考模式下可能出现两种极端:思考充分时给出高质量答案(98分),但思考路径偏差时给出遗漏关键项的答案(63分)。R1 的思考路径更一致,波动较小。
这个对比公平吗?两个模型设定一样吗?
是的,本次对比严格同口径:同一病例、同一规范提示词、同开深度思考+联网搜索、同一 16 项 Rubric 评分。唯一变量是模型本身。
极差 14 分算稳定吗?
根据框架标准(极差 ≥ 8 分 = 不稳定),R1 的极差 14 分仍属"不稳定",但比 GLM 的 35 分好很多。理想目标是极差 < 8 分。