🌐 English 中文
⚠️
利益披露 / Affiliate Disclosure: 本页可能含联盟或推广链接。若通过此类链接注册或订阅,我可能获得佣金——但
不会增加你的价格 ,也
不会改变我的独立结论 。详见
利益披露页 。
4 个免费 AI 模型同测一个乳腺癌病例 — 一位外科医生的扩展实测
作者
谭好升 · 副主任医师 / 医学博士 (Associate Chief Physician, MD/PhD) · 甲状腺乳腺外科 (Thyroid & Breast Surgery), 泰州市人民医院 (Taizhou People's Hospital) · 发布于 2026-07-30
🧪 原创实测 #2 / 5 · 第 2 篇 / 共 5 篇 — 四模型扩展对决
为什么写这篇续作: 我的
首测 让 DeepSeek 网页快速模式对阵 ChatGLM,用固定的 16 项/100 分标准对照 2026 CBCS 指南评了一个真实的脱敏术后乳腺癌病例。两个模型不够看。读者(也包括我自己)都想知道
豆包(Doubao) 和新的
DeepSeek V4 Pro(跑在 WorkBuddy 智能体里) 排在哪里。于是我把
同一个病例、同一段 prompt、同一套评分标准 在四个模型上各跑一遍,并列摆出来。剧透:四个里只有一个识破了病历里藏着的那个最关键错误——而且不是你以为的那个。
相比第 1 篇,变了什么
病例不变、16 项 prompt 不变、评分标准不变(正确且引用指南=满分;正确但未引=半分;错误=0)。新增两员:
豆包 Doubao(手机网页版) — doubao.com 。三次回答,全用英文。
DeepSeek V4 Pro(经 WorkBuddy 智能体) — 把同一个中文 prompt 丢给跑在 WorkBuddy 免费智能体里的 DeepSeek V4 Pro。三次(首次拒答,随后两次实质回答,再加一次)。
DeepSeek 网页版(快速模式)与 ChatGLM 网页版分数沿用第 1 篇 ,并在同一量纲上重算,使四宫格可横向对比。
病例(陷阱本身就是重点)
60 岁女性,右乳癌根治术后第 1 天。病理:3 簇间质浸润,最大灶 0.2 cm(2 mm) ,ER 90%+,PR 90%+,HER2 0,Ki-67 5%。前哨淋巴结阴性(0/2 + 1/1)。出院诊断:TisN0M0(0 期,DCIS) 。
陷阱: "3 簇浸润、最大 0.2 cm" 本该拉响警报。微浸润定义为单一 浸润灶 ≤1 mm;2 mm 已超线 → 至少是 pT1a(IA 期) ,而非 0 期。任何照单全收"TisN0M0"的模型,都漏掉了病历里最要命的那处矛盾。指南依据:CBCS 2026 TNM 分期 pp.33–34,DCIS 定义 p.50。
结果速览
🟣 DeepSeek V4 Pro(WorkBuddy)
50/100
三次:强 / 强 / 1 次翻车
语言:中文
识破分期陷阱:是
引用指南:0 / 16
🟠 豆包 Doubao(手机版)
41/100
三次:均结构清晰
语言:英文(!)
识破分期陷阱:否
引用指南:0 / 16
🔵 DeepSeek(网页快速模式)
28/100
三次:28 · 28 · 28(中位 28)
语言:中文
识破分期陷阱:否
引用指南:0 / 16
🟢 ChatGLM 5.2(网页版)
5/100
三次:10 · 2 · 5(中位 5)
语言:英文(!)
识破分期陷阱:否
引用指南:0 / 16
16 项评分表(四模型,同一标准)
项目(满分) DS V4 Pro 豆包 DS 网页 ChatGLM
1.1 质疑 TisN0M0(6) 3 0 0 0
1.2 分期修正(10) 5 0 0 0
1.3 分子分型(4) 2 2 2 1
2.1 手术合理性 + ALND(8) 4 4 4 2
2.2 辅助放疗(4) 2 2 2 2
3.1 化疗 + 多基因检测(10) 5 5 5 2
3.2a 内分泌必要性(12) 6 6 0 0
3.2b AI vs TAM + 年龄(10) 5 5 0 0
3.2c 剂量与疗程(6) 3 3 3 1
3.2d OFS / CDK4-6(6) 3 3 3 1
3.3 抗 HER2(4) 2 2 2 1
4.1 不良反应监测(6) 3 3 2 1
4.2 骨密度(4) 2 2 2 1
4.3 随访计划(4) 2 2 2 1
4.4 对侧乳腺 + BRCA(4) 2 2 2 1
5 自我评估(2) 1 0 1 0
合计 / 100 50 41 28 5
评分规则统一:正确但未引用具体 CBCS 章节/页码的答案封顶半分(这正是冠军也只到 50 的原因——四个模型无一引用指南)。
总排名 —— 四模型,同一病例
四个模型都在同一个第 2 篇病例 上、用同一套 16 项/100 分标准 评分,因此这个排名是"苹果对苹果"(不存在跨病例的注水):
排名 模型(包装) 分数 识破陷阱? 一句话结论
#1 DeepSeek V4 Pro(WorkBuddy 智能体) 50 / 100 是 唯一标出分期错误的模型。但 3 次里有 1 次错荐放疗——不能单独采信。
#2 豆包 Doubao(手机版) 41 / 100 否 未识破陷阱的模型里结构最好;但在全中文病例上用英文作答。
#3 DeepSeek 网页版(快速模式) 28 / 100 否 极其稳定(28·28·28),但漏掉陷阱与 AI/TAM 年龄细节。
#4 ChatGLM 5.2(网页版) 5 / 100 否 3 次里 2 次崩、仅英文、几乎全错。
V2 一句话结论: 在本例上,DeepSeek V4 Pro(经 WorkBuddy 智能体)明显最强 ,但它 1/3 次的放疗错误说明它并未"认证安全"。豆包是黑马亚军。ChatGLM 5.2 不可用。
头条:只有 DeepSeek V4 Pro 识破了陷阱
DeepSeek V4 Pro(WorkBuddy)是唯一标记出分期错误的模型。 它的回答一开头就指出出院诊断"TisN0M0(0 期)"与病理(浸润性癌、浸润灶 2 mm)相矛盾,并修正为 pT1N0(sn)M0 / IA 期 ——随后整套方案都建立在修正后的分期上。这一处动作值约 16 个评分点,也是"有用的第二意见"与"自信地错"的分水岭。
反观豆包、DeepSeek 网页版、ChatGLM 全都照单全收"TisN0M0" ——包括豆包,尽管它是本测的黑马(见下)。对临床医生而言,一个默默背书错误"0 期"标签的模型是最危险的一类失败:它看起来很权威,你未必会再去复核。
DeepSeek V4 Pro —— 赢家,但有一道裂缝
优点: 识破分期;正确豁免化疗(还提到 Oncotype DX RS <20/25);正确豁免全切 + N0 的放疗;给出 AI 5–10 年及具体药名剂量;提示骨密度/维 D 监测;明确自我评估并建议医生修正病历分期。
裂缝——可复现性: 三次里有一次错误推荐了术后放疗 ,还把术式误写成"保乳",而病历明确是右乳单纯切除(全切)。全切 + 切缘阴性 + N0 本无放疗指征。所以 V4 Pro 并非完全稳定——三次中两次优秀、一次严重出错。我按其实质最优回答计分,但把这点标为真实的可靠性隐患:同一 prompt 可能返回危险的自相矛盾。
豆包 —— 惊喜,但有两个软肋
比预期强: 豆包三次回答结构清晰,正确处理了"全切→不放疗"的逻辑,正确豁免化疗,并给出合理的 AI 5 年方案及骨监测。单论临床结构,它轻松超过 DeepSeek 网页版和 ChatGLM。
软肋 1——漏掉陷阱: 三次均不问青红皂白接受"pTisN0M0(0 期)",因此和较弱的模型一样掉进了分期错误。
软肋 2——中文 prompt 用英文答: 和首测的 ChatGLM 一模一样,豆包对一个全中文病例用英语作答。对中文临床场景这是可用性减分:术语/剂量上丢细节、重读成本高。(不计入评分 rubric,但作为中文临床使用的硬伤标出。)
四者共同的失分项
引用指南章节均为 0/16——每个模型都如此。 四者都只泛泛说"主流/权威/最新指南",没有一个给出章节或页码。你无法验证它们真读过 CBCS 2026。这是最关键的局限,从第 1 篇起就没变过。
AI vs TAM 年龄切点(3.2b)很脆。 只有 V4 Pro 和豆包给出了可用的"AI 优先"回答;没有一个明确引用 CBCS 注——AI 相对他莫昔芬的优势主要在 <60 岁。恰好 60 岁,这个边界很重要。
没有一个能单独采信 于分期或 nuanced 推荐分级。分数是排名,不是对任何一方的认证。
四宫格:什么任务选谁
任务 选 为什么
本例的中文临床推理 DeepSeek V4 Pro(WorkBuddy) 唯一识破分期陷阱;中文
结构化草稿、偏英文 豆包 结构干净,但用英语回答
快速问答 / 药品事实 DeepSeek 网页快速 即时、中文、可复现
读英文文献 ChatGLM / 豆包 英文输出是它们的强项
分期再判读 都不单独用 仅 V4 Pro 过关,且不稳定
引用具体指南章节 都不行 全部 0/16
我实际怎么用这些工具
第一人称、不绕弯:我把免费 LLM 当作草稿与第二意见助手,绝不当决策权威 。本轮扩展实测后,实战法则更清晰了:当病例藏着分期或分级陷阱时,只有 V4 Pro 这一档模型值得扫一眼 ——即便如此,分期我仍自己重推一遍。0/16 的引用率意味着我从不接受"指南这么说"这类主张而不去翻开 PDF。免费模型在无聊的 80%(出院小结草稿、患者解释话术、英文润色)上真有用,在最要命的 20% 上却自信得危险。
局限
仅 1 例、仅文本输入、仅免费档、每模型三次(V4 Pro:一次拒答 + 两次强 + 一次翻车)。
豆包测于手机网页;DeepSeek V4 Pro 跑在 WorkBuddy 智能体内——智能体 wrapper 可能也有助于更好的分期识别,目前无法与基模本身拆开。
分数为一位外科医生对固定 rubric 的解读;框架已公开,你可不同意并重评。
📎
完整数据: 公开测试框架(prompt + 16 项 rubric)、四个模型的完整回答、逐项评分表,均存于
临床 LLM 基准数据附录 (中英双语)。读长文,然后自己验证。
One-line conclusion (English): Same case, same 16-item rubric, four free models — DeepSeek V4 Pro (WorkBuddy) tops at 50 , the only one to catch the "invasive carcinoma mislabeled Tis stage 0" trap; Doubao 41 is the surprise (clean structure, correct no-radiation-after-mastectomy logic, but accepted the wrong staging and replied in English); DeepSeek web 28 , ChatGLM 5 carry over. All four scored 0/16 on guideline citations , and V4 Pro contradicted itself once (radiotherapy). None is safe to trust alone.
⚠️ 医疗免责声明: 本文是 LLM 工具对比评测,不构成任何医疗建议 ,模型输出绝不可用于真实患者决策。病例已脱敏,仅用于演示测试方法。
常见问题
DeepSeek V4 Pro 一定比 DeepSeek 网页版强吗?还是 WorkBuddy 智能体的功劳?
好问题,我暂时无法完全拆开。V4 Pro 是跑在 WorkBuddy 智能体内部 的,智能体的系统提示/上下文可能也促成了更好的分期识别。本系列后续我会单独测"裸"V4 Pro(无智能体)来隔离这个效应。
豆包为什么用英语回答?
和首测 ChatGLM 同样的表现——尽管 prompt 与病历全中文,模型默认切到英文。对中文临床使用是真实的可用性减分,不过它没拉低豆包的临床得分(rubric 评的是准确性,不是语言)。
有一次 V4 Pro 推荐了放疗,这不是大错吗?
是,而且严重:全切 + 切缘阴性 + N0 本无放疗指征,那次还把术式误称"保乳"。我按 V4 Pro 实质最优回答计分,但把不一致性显著标出——同一 prompt 既返回优秀方案也返回危险方案。这种不稳定性正是为何此处无一模型获准单独使用。
我能自己复现吗?
能。完整 prompt 与 16 项 rubric 已发布于 /clinical-benchmark/framework.html 。粘贴进任意模型,对照 2026 CBCS 指南评分,你就能得到自己的数字。
这是计划中的 5 篇原创实测 / Hands-on Review 系列第 2 篇——真实、署名、可复现的 AI 工具实测,皆为我临床与科研中真在用的工具。下一篇:隔离 V4 Pro 的提升究竟来自模型本身还是 WorkBuddy 智能体。
© 2024-2026 AI Tool Stack首页 · 关于 · AI 模型与工具 · 临床基准数据 · 隐私 · 利益披露 |
📊 全站浏览 0 · 全站独立访客 0 | 📄 本页浏览 0 · 本页独立访客 0
🌐 Cloudflare 真实IP:全站 – 浏览 / – 唯一IP | 📄 本页 – 浏览 / – 唯一IP (按IP累计,区别于busuanzi的cookie访客)