ENHANCE_CSSENHANCE_CSS
🌐 English 中文
⚠️
利益披露 / Affiliate Disclosure: 本页可能含联盟或推广链接。若通过此类链接注册或订阅,我可能获得佣金——但
不会增加你的价格 ,也
不会改变我的独立结论 。详见
利益披露页 。
📊 想要完整的基准数据?
本文是 DeepSeek 对阵 ChatGLM 临床决策实测的精简版。完整的 16 项评分表、病例原文、以及评分标准都存放在下方微站中。这些模型的官方联盟/推荐计划仍在评估中。
打开完整基准微站 →
🏠 首页 › 🧪 模型实测系列 › 📊 基准数据
ChatGLM 5.2 对阵 DeepSeek:同测一个真实乳腺癌病例 — 一位外科医生的实机测试
🎯 核心理念 / Core Philosophy
AI 是医生的辅助工具,而非替代者。我们利用 AI 协助医生对照临床指南、发现病例中可能漏掉的疑点,并指向指南的具体章节和页码。最终治疗决策仍由医生基于循证医学做出。
作者
谭好升 · 副主任医师 / 医学博士 (Associate Chief Physician, MD/PhD) · 甲状腺乳腺外科 (Thyroid & Breast Surgery), 泰州市人民医院 (Taizhou People's Hospital) · 发布于 2026-07-29
⚠️ 医疗免责声明 / Medical Disclaimer: 本站所有临床病例分析、模型评测与治疗讨论均仅用于教育与研究目的 。它们基于单一脱敏病例,不构成针对个体的医疗建议、诊断或治疗 。对于任何真实患者,请务必咨询您自己的合格医师,并遵循现行指南(NCCN / CSCO / CBCS)。AI 的输出不能 替代专业临床判断。最后审阅 / Last reviewed: 2026-07-31.
🧪 原创实测 #1 / 5 · 第 1 篇 / 共 5 篇 — DeepSeek 对阵 ChatGLM 实测
最初的问题: 一个免费的 聊天机器人,能放心拿它来定术后乳腺癌的治疗方案吗?我是一名甲状腺乳腺外科医生,不是提示词工程师——所以与其争论,我直接把能找到的两款最便宜的模型,跑在一个真实的、完全脱敏的本科病例 上,并用一套固定标准对照2026 中国抗癌协会乳腺癌专业委员会(CBCS)指南 给它们的回答打分。结果如下。剧透:两个都没及格,但失败的方式截然不同。
为什么我要做这个测试
我在一家公立医院工作。科室的软件预算买不起 GPT-4 级别的订阅,我猜大多数同事也是一样。我确实 拥有的是对几款国产 LLM 的免费网页访问。所以真正实用的问题不是"哪个模型理论上最好"——而是"哪个免费模型,对我实际在做的临床相关推理仍然够用?"
我选了一个难、可核验、且高风险的任务:读一份术后病理报告、并为一份早期乳腺癌病例推荐下一步的辅助治疗 。如果一个模型连这都处理不好,它就当不了决策辅助。如果它能处理、却讲不清过程,我还是没法信它。两款免费模型正面交锋:
两者都是 0 美元。这才是重点——这是一次"预算测试",不是旗舰模型的大比武。
我是怎么测的(方便你复现)
我搭了一套固定框架,让对比公平且可复跑:
一个病例,一段 prompt。 同一张脱敏门诊记录截图(病例 + 16 项任务清单合并在一张图里)同时给两个模型看。注:这篇 DeepSeek 对阵 ChatGLM 的对比最初写作"使用文本",因为 DeepSeek 的专家模式无法读图;按作者更正,整个系列——包括这一对——实际输入都是这张截图。
对照 2026 CBCS 评分。 一套 16 项 / 100 分的评分标准,对应 2026 CBCS 指南(Version 2026.1.0)——分期、手术、放疗、化疗、内分泌治疗、安全性、随访、以及自我评估。
各跑 3 次,取中位。 若最好与最差一次相差 ≥8 分,则标记该模型"不稳定"。
引用规则。 答案正确但未 引用具体 2026 CBCS 章节/页码的,封顶 1 分(满分 2)。如果我无法验证它真的读过指南,就不会把"读过"的分给它。
你可以从公开的测试框架 复制一模一样的 prompt 和评分标准,自己跑一遍。公开发布的意义就在于此。
病例(已脱敏)
60 岁女性,右乳癌术后第 1 天。病理:主要病灶为3 簇间质浸润,最大灶 0.2 cm(2 mm) ,ER 90%+,PR 90%+,HER2 0,Ki-67 5%。前哨淋巴结阴性(0/2 + 1/1)。出院诊断:TisN0M0(0 期,DCIS) 。
陷阱: "3 簇浸润、最大 0.2 cm" 本该拉响警报。微浸润定义为单一 浸润灶 ≤1 mm。2 mm 的灶已经超线 → 至少是 pT1a(IA 期) ,而非 0 期。任何照单全收"TisN0M0"的模型,都漏掉了病历里最要命的那处矛盾。指南依据:CBCS 2026 TNM 分期 pp.33–34,DCIS 定义 p.50。
结果速览
🔵 DeepSeek(快速模式)
28/100
三次:28 · 28 · 28(中位 28 )
波动:0 — 完全可复现
语言:中文
响应:约 3–4 秒
引用指南:0 / 16
🟢 ChatGLM 5.2(网页版)
5/100
三次:10 · 2 · 5(中位 5 )
波动:8 — 不稳定
语言:英文(!)
响应:约 5–8 秒
引用指南:0 / 16
一句话结论: DeepSeek 得分高出 5–6 倍,且稳如磐石;ChatGLM 既低分又飘忽,而且——诡异的是——全程用英语回答一个全中文的 prompt。但"DeepSeek 赢了"掩盖了更重要的故事:两个模型都栽在同一处核心临床推理上,只是深度不同。
DeepSeek 栽在哪(3 处系统性失误——每次都中)
① 从未质疑分期(1.1 + 1.2,丢 16 分)。 三次回答都原封不动接受了"TisN0M0,0 期",尽管病理明确描述了 2 mm 的浸润。分期错误在这里是安全级错误:0 期 vs IA 期,会改变辅助治疗的强度、随访节奏,以及患者整个风险叙事。
② 未因"全切后 DCIS"下调内分泌治疗强度(3.2a,丢 12 分)。 CBCS 2026 p.59 注 a 指出:对于全乳切除后的 DCIS,内分泌药物属于化学预防 范畴——"可考虑 / 可选",而非强推荐。DeepSeek 套用了"DCIS → 强烈推荐内分泌治疗"的模板,没有区分全切与保乳。这是评分标准里区分度最高的一项;它得了 0 分。
③ 未引用 AI 对比 TAM 的年龄切点(3.2b,丢 10 分)。 CBCS 2026 p.59 注 b:AI 相对他莫昔芬(TAM)的优势,主要体现在绝经后且 <60 岁 人群;到 ≥60 岁时两者几乎相当。患者恰好 60 岁——正卡在边界上。DeepSeek 只说"AI 优先",却没表现出它知道这个切点的存在。
公平地说,DeepSeek 正确地豁免了化疗 (有一次甚至提到了 Oncotype DX),给出了合理的随访频次,并提示骨密度/维 D 监测。而且它的三次回答一模一样 ——说明输出是模板化的、不是随机的,所以你至少能预判会得到什么。
ChatGLM 栽在哪(2 处独立缺陷)
① 全程用英文回答(可用性硬伤)。 prompt 和病历都是中文;ChatGLM 三次回答全用英文。对中文临床医生而言,这意味着重读成本更高、指南术语和剂量上的细微差别丢失,实质上等于——把决定权交给了一个"没用你的语言思考"的模型。无论分数高低,临床场景下都不可接受。
② 极短且含糊,且不稳定(中位 5,波动 8)。 平均每次约 130 字(DeepSeek 约 450 字)。大多是"复述病历 + 泛泛建议 + 免责声明"。第 2 次只拿了 2/100——几乎就是把病例重述一遍,外加"让医生决定"。8 分的波动触发了框架的"不稳定"阈值,所以同一个问题重复问,可能返回质量天差地别的回答。
值得注意的是,两个模型都栽在同一三项核心题 (质疑分期、全切后 DCIS 内分泌降级、年龄切点),且两者在"引用指南"上都拿了 0/16 。差别只在深度:DeepSeek 给的是"错了但可核验"的推理链;ChatGLM 给的是"含糊且不可核验"。
正面对决
维度 DeepSeek(快速) ChatGLM 5.2
中位得分 / 100 28 5
稳定性(最高 − 最低) 0(可复现) 8(不稳定)
输出语言 中文 英文
平均长度 / 次 约 450 字 约 130 字
豁免化疗判断(3.1) 正确 + 提及 Oncotype DX 未提及
随访细节(4.3) 给出具体频次 仅"定期复查"
质疑分期(1.1+1.2) 0 0
核心 DCIS 项(3.2a) 0 0
引用 CBCS 章节 0 / 16 0 / 16
结论:什么任务选哪个模型
中文临床推理上,DeepSeek 快速模式 ≫ ChatGLM 5.2 ——它在每个可比维度都胜出,而且是中文,我才能真正核验它。但真正的结论比"DeepSeek 更好"更窄、也更实用:两个免费模型,都不宜在分期或细粒度指南解读上单独采信。 在正是低年资医生最需要一个可靠第二意见的那些题上,两者都自信地错了。
任务 用 为什么
中文临床推理(本例) DeepSeek 快速 中文、信息更密、可复现
快速问答 / 药品事实 / 患者教育话术 DeepSeek 快速 即时、方向性安全
引用具体指南章节 都不行 两者均 0/16
分期再解读 / 推荐微调 都不宜单独用 两者都自信地漏掉核心题
阅读英文医学文献 ChatGLM(或许) 它的英文输出在此是优势——但本次未测
我实际怎么用这些工具
第一人称、不绕弯:我把免费 LLM 当作草稿与第二意见助手,绝不当决策权威 。它们确实擅长那无聊的 80%——深夜 11 点一份干净的出院小结草稿、给稿件做英文润色、写一段给患者的话术。但只要任务变成"解读这份病理、选定治疗方案",我读模型的输出,就像读一位低年资同事的病历记录:核对分期、核对推荐等级,绝不接受任何我无法追溯到指南的自信断言。
这次测试里最重要的一课,不是"DeepSeek 打败了 ChatGLM",而是那 0/16 的引用率 。免费模型会改写指南——但不会引用指南。写东西时没问题,做决定时很危险。
局限
仅 1 例、图片(门诊记录截图)输入、仅免费档、每模型三次。
我未测 DeepSeek 更深入的"推理"模式(若提供)或任何付费 API——那是本系列后续评测的候选。
评分是一位外科医生对固定 rubric 的解读;框架已公开,你可以不同意并重新打分。
📎
本文背后的完整数据: 公开的测试框架(prompt + 评分标准)、两个模型各三次的完整回答、以及逐项评分表,存于
临床 LLM 基准数据附录 (中英双语)。先读长文,然后自己去验证。
One-line conclusion (English): In the triangle of "Chinese + clinical-decision reasoning + zero cost," DeepSeek fast mode decisively beats ChatGLM 5.2 (median 28 vs 5; the former is stable, reproducible, and outputs Chinese). But neither free model clears the bar for "safe to trust alone" — both miss the same three core items (staging challenge, post-mastectomy DCIS endocrine downgrade, and the 60-year AI/TAM age cutoff) — and both do so confidently. Free models can help you write and think, but they should not make the decision for you.
⚠️ 医疗免责声明。 本文是一篇 LLM 工具选型评测。不构成医疗建议 ,模型输出绝不可用于真实患者决策。病例已脱敏,仅用于演示测试方法。
常见问题
你测了这些模型的付费版本吗?
没有。这本身就是一次刻意只测免费网页档的预算测试。DeepSeek 更深入的推理模式,以及任何付费 API 档,留待这个 5 篇系列后续的评测。
为什么两个模型在引用指南上都得 0 分?
评分标准把"正确但未引用"的答案封顶 1 分,并且要求给出具体的 2026 CBCS 章节/页码才能拿满分。两个模型都从未引用过章节或页码——它们只说"主流 / 权威 / 最新指南"这类空话,没有具体出处,所以我无法验证它们真的读过原文。
我自己能复现吗?
能。完整的 prompt(病例 + 16 项 rubric)已作为截图内容的转录发布于 /clinical-benchmark/framework.html 。实测中模型收到的是图片;把文字版粘贴进任意模型,即可对照 2026 CBCS 指南复现评分。
那 ChatGLM 在临床上就毫无用处了吗?
它的英文输出在阅读国际文献时确实是优势,但在中文临床决策支持上,它用英语作答,且既含糊又不稳定——不是我愿意依赖的对象。DeepSeek 快速模式是中文推理更好的免费选择,但需带上前述保留意见。
这是计划中的 5 篇原创实测 / Hands-on Review 系列第 1 篇——真实、署名、可复现的 AI 工具实测,皆为我临床与科研中真在用的工具。下一篇:同一病例的付费 API 交叉验证。