⚠️ 利益披露 / Affiliate Disclosure: 本页可能含联盟或推广链接。若通过此类链接注册或订阅,我可能获得佣金——但不会增加你的价格,也不会改变我的独立结论。详见利益披露页

4 个免费 AI 模型同测一个乳腺癌病例 — 一位外科医生的扩展实测

作者 谭好升 · 副主任医师 / 医学博士 (Associate Chief Physician, MD/PhD) · 甲状腺乳腺外科 (Thyroid & Breast Surgery), 泰州市人民医院 (Taizhou People's Hospital) · 发布于 2026-07-30
🧪 原创实测 #2 / 5  ·  第 2 篇 / 共 5 篇 — 四模型扩展对决
为什么写这篇续作: 我的首测让 DeepSeek 网页快速模式对阵 ChatGLM,用固定的 16 项/100 分标准对照 2026 CBCS 指南评了一个真实的脱敏术后乳腺癌病例。两个模型不够看。读者(也包括我自己)都想知道豆包(Doubao)和新的DeepSeek V4 Pro(跑在 WorkBuddy 智能体里)排在哪里。于是我把同一个病例、同一段 prompt、同一套评分标准在四个模型上各跑一遍,并列摆出来。剧透:四个里只有一个识破了病历里藏着的那个最关键错误——而且不是你以为的那个。

相比第 1 篇,变了什么

病例不变、16 项 prompt 不变、评分标准不变(正确且引用指南=满分;正确但未引=半分;错误=0)。新增两员:

病例(陷阱本身就是重点)

60 岁女性,右乳癌根治术后第 1 天。病理:3 簇间质浸润,最大灶 0.2 cm(2 mm),ER 90%+,PR 90%+,HER2 0,Ki-67 5%。前哨淋巴结阴性(0/2 + 1/1)。出院诊断:TisN0M0(0 期,DCIS)

陷阱:"3 簇浸润、最大 0.2 cm" 本该拉响警报。微浸润定义为单一浸润灶 ≤1 mm;2 mm 已超线 → 至少是 pT1a(IA 期),而非 0 期。任何照单全收"TisN0M0"的模型,都漏掉了病历里最要命的那处矛盾。指南依据:CBCS 2026 TNM 分期 pp.33–34,DCIS 定义 p.50。

结果速览

🟣 DeepSeek V4 Pro(WorkBuddy)
50/100
三次:强 / 强 / 1 次翻车
语言:中文
识破分期陷阱:
引用指南:0 / 16
🟠 豆包 Doubao(手机版)
41/100
三次:均结构清晰
语言:英文(!)
识破分期陷阱:
引用指南:0 / 16
🔵 DeepSeek(网页快速模式)
28/100
三次:28 · 28 · 28(中位 28)
语言:中文
识破分期陷阱:
引用指南:0 / 16
🟢 ChatGLM 5.2(网页版)
5/100
三次:10 · 2 · 5(中位 5)
语言:英文(!)
识破分期陷阱:
引用指南:0 / 16

16 项评分表(四模型,同一标准)

项目(满分)DS V4 Pro豆包DS 网页ChatGLM
1.1 质疑 TisN0M0(6)3000
1.2 分期修正(10)5000
1.3 分子分型(4)2221
2.1 手术合理性 + ALND(8)4442
2.2 辅助放疗(4)2222
3.1 化疗 + 多基因检测(10)5552
3.2a 内分泌必要性(12)6600
3.2b AI vs TAM + 年龄(10)5500
3.2c 剂量与疗程(6)3331
3.2d OFS / CDK4-6(6)3331
3.3 抗 HER2(4)2221
4.1 不良反应监测(6)3321
4.2 骨密度(4)2221
4.3 随访计划(4)2221
4.4 对侧乳腺 + BRCA(4)2221
5 自我评估(2)1010
合计 / 1005041285

评分规则统一:正确但未引用具体 CBCS 章节/页码的答案封顶半分(这正是冠军也只到 50 的原因——四个模型无一引用指南)。

总排名 —— 四模型,同一病例

四个模型都在同一个第 2 篇病例上、用同一套 16 项/100 分标准评分,因此这个排名是"苹果对苹果"(不存在跨病例的注水):

排名模型(包装)分数识破陷阱?一句话结论
#1DeepSeek V4 Pro(WorkBuddy 智能体)50 / 100唯一标出分期错误的模型。但 3 次里有 1 次错荐放疗——不能单独采信。
#2豆包 Doubao(手机版)41 / 100未识破陷阱的模型里结构最好;但在全中文病例上用英文作答。
#3DeepSeek 网页版(快速模式)28 / 100极其稳定(28·28·28),但漏掉陷阱与 AI/TAM 年龄细节。
#4ChatGLM 5.2(网页版)5 / 1003 次里 2 次崩、仅英文、几乎全错。
V2 一句话结论:在本例上,DeepSeek V4 Pro(经 WorkBuddy 智能体)明显最强,但它 1/3 次的放疗错误说明它并未"认证安全"。豆包是黑马亚军。ChatGLM 5.2 不可用。

头条:只有 DeepSeek V4 Pro 识破了陷阱

DeepSeek V4 Pro(WorkBuddy)是唯一标记出分期错误的模型。 它的回答一开头就指出出院诊断"TisN0M0(0 期)"与病理(浸润性癌、浸润灶 2 mm)相矛盾,并修正为 pT1N0(sn)M0 / IA 期——随后整套方案都建立在修正后的分期上。这一处动作值约 16 个评分点,也是"有用的第二意见"与"自信地错"的分水岭。

反观豆包、DeepSeek 网页版、ChatGLM 全都照单全收"TisN0M0"——包括豆包,尽管它是本测的黑马(见下)。对临床医生而言,一个默默背书错误"0 期"标签的模型是最危险的一类失败:它看起来很权威,你未必会再去复核。

DeepSeek V4 Pro —— 赢家,但有一道裂缝

优点:识破分期;正确豁免化疗(还提到 Oncotype DX RS <20/25);正确豁免全切 + N0 的放疗;给出 AI 5–10 年及具体药名剂量;提示骨密度/维 D 监测;明确自我评估并建议医生修正病历分期。
裂缝——可复现性:三次里有一次错误推荐了术后放疗,还把术式误写成"保乳",而病历明确是右乳单纯切除(全切)。全切 + 切缘阴性 + N0 本无放疗指征。所以 V4 Pro 并非完全稳定——三次中两次优秀、一次严重出错。我按其实质最优回答计分,但把这点标为真实的可靠性隐患:同一 prompt 可能返回危险的自相矛盾。

豆包 —— 惊喜,但有两个软肋

比预期强:豆包三次回答结构清晰,正确处理了"全切→不放疗"的逻辑,正确豁免化疗,并给出合理的 AI 5 年方案及骨监测。单论临床结构,它轻松超过 DeepSeek 网页版和 ChatGLM。
软肋 1——漏掉陷阱:三次均不问青红皂白接受"pTisN0M0(0 期)",因此和较弱的模型一样掉进了分期错误。
软肋 2——中文 prompt 用英文答:和首测的 ChatGLM 一模一样,豆包对一个全中文病例用英语作答。对中文临床场景这是可用性减分:术语/剂量上丢细节、重读成本高。(不计入评分 rubric,但作为中文临床使用的硬伤标出。)

四者共同的失分项

四宫格:什么任务选谁

任务为什么
本例的中文临床推理DeepSeek V4 Pro(WorkBuddy)唯一识破分期陷阱;中文
结构化草稿、偏英文豆包结构干净,但用英语回答
快速问答 / 药品事实DeepSeek 网页快速即时、中文、可复现
读英文文献ChatGLM / 豆包英文输出是它们的强项
分期再判读都不单独用仅 V4 Pro 过关,且不稳定
引用具体指南章节都不行全部 0/16

我实际怎么用这些工具

第一人称、不绕弯:我把免费 LLM 当作草稿与第二意见助手,绝不当决策权威。本轮扩展实测后,实战法则更清晰了:当病例藏着分期或分级陷阱时,只有 V4 Pro 这一档模型值得扫一眼——即便如此,分期我仍自己重推一遍。0/16 的引用率意味着我从不接受"指南这么说"这类主张而不去翻开 PDF。免费模型在无聊的 80%(出院小结草稿、患者解释话术、英文润色)上真有用,在最要命的 20% 上却自信得危险。

局限

📎 完整数据: 公开测试框架(prompt + 16 项 rubric)、四个模型的完整回答、逐项评分表,均存于 临床 LLM 基准数据附录(中英双语)。读长文,然后自己验证。
One-line conclusion (English): Same case, same 16-item rubric, four free models — DeepSeek V4 Pro (WorkBuddy) tops at 50, the only one to catch the "invasive carcinoma mislabeled Tis stage 0" trap; Doubao 41 is the surprise (clean structure, correct no-radiation-after-mastectomy logic, but accepted the wrong staging and replied in English); DeepSeek web 28, ChatGLM 5 carry over. All four scored 0/16 on guideline citations, and V4 Pro contradicted itself once (radiotherapy). None is safe to trust alone.
⚠️ 医疗免责声明: 本文是 LLM 工具对比评测,不构成任何医疗建议,模型输出绝不可用于真实患者决策。病例已脱敏,仅用于演示测试方法。

常见问题

DeepSeek V4 Pro 一定比 DeepSeek 网页版强吗?还是 WorkBuddy 智能体的功劳?

好问题,我暂时无法完全拆开。V4 Pro 是跑在 WorkBuddy 智能体内部的,智能体的系统提示/上下文可能也促成了更好的分期识别。本系列后续我会单独测"裸"V4 Pro(无智能体)来隔离这个效应。

豆包为什么用英语回答?

和首测 ChatGLM 同样的表现——尽管 prompt 与病历全中文,模型默认切到英文。对中文临床使用是真实的可用性减分,不过它没拉低豆包的临床得分(rubric 评的是准确性,不是语言)。

有一次 V4 Pro 推荐了放疗,这不是大错吗?

是,而且严重:全切 + 切缘阴性 + N0 本无放疗指征,那次还把术式误称"保乳"。我按 V4 Pro 实质最优回答计分,但把不一致性显著标出——同一 prompt 既返回优秀方案也返回危险方案。这种不稳定性正是为何此处无一模型获准单独使用。

我能自己复现吗?

能。完整 prompt 与 16 项 rubric 已发布于 /clinical-benchmark/framework.html。粘贴进任意模型,对照 2026 CBCS 指南评分,你就能得到自己的数字。

这是计划中的 5 篇原创实测 / Hands-on Review系列第 2 篇——真实、署名、可复现的 AI 工具实测,皆为我临床与科研中真在用的工具。下一篇:隔离 V4 Pro 的提升究竟来自模型本身还是 WorkBuddy 智能体。