🌐 English 中文
🇺🇸 Read in English · Also available in English.
🔁 Benchmark Repeats · 规范复测 #6 / 2026-08-02
Agnes-2.0-flash vs DeepSeek V4 Flash:同一病例 20 次对决,谁更准更稳?
🎯 核心理念 / Core Philosophy
AI 是医生的辅助工具,而非替代者。我们利用 AI 协助医生对照临床指南、发现病例中可能漏掉的疑点,并指向指南的具体章节和页码。最终治疗决策仍由医生基于循证医学做出。
By
Tan Haosheng · 副主任医师 / 医学博士 (Associate Chief Physician, MD/PhD) · 甲状腺乳腺外科 (Thyroid & Breast Surgery), 泰州市人民医院 (Taizhou People's Hospital) · Published 2026-08-02 · Updated 2026-08-02
⚠️ Medical disclaimer / 医疗免责声明: All clinical case analyses, model evaluations, and treatment discussions on this site are for educational and research purposes only . They are based on a single anonymized case and do not constitute individual medical advice, diagnosis, or treatment . For any real patient, always consult your own qualified physician and follow current guidelines (NCCN / CSCO / CBCS). AI outputs are not a substitute for professional clinical judgment. Last reviewed / 最后审阅: 2026-08-02.
TL;DR(30 秒结论)
同一份规范文本提示词、同一 16 项/100 评分表,Agnes-2.0-flash 与 DeepSeek V4 Flash 各跑 20 次(均走 API、均无联网搜索)
结果:DeepSeek 均值 92.8 领先 Agnes 均值 85.5 ,差距 7.3 分(中位 94 vs 86)
稳定性:两者极差均 ≥ 8 分 —— 均判不稳定 (Agnes 极差 22、DeepSeek 极差 17)
差距集中在内分泌治疗细节(3.2a–d)与长期管理(4.1/4.2) ;核心分期、手术、化疗、靶向、把握度两项均接近满分
速度:Agnes 响应中位约 6.5 秒,DeepSeek 约 150 秒 —— Agnes 快约 20 倍 、输出更简洁
1. 为什么把这两个模型放在一起比
一个是我们自研的 Agnes-2.0-flash (免费、面向临床决策的 API agent),一个是目前最便宜的前沿 API DeepSeek V4 Flash 。两者定位接近——都是「便宜、快、能直接用于临床问答」的模型,正好构成一组公平的同档对照。
更关键的是,本组与专栏前几篇(如 DeepSeek 网页版 20 次)刻意隔离了联网搜索变量 :两个模型都走 API、都不联网,因此比的是模型自身的参数化临床知识 ,而不是谁的检索更强。这也是为什么本篇分数与前篇 DeepSeek 网页版(均值 69.8)不能直接相减——输入模式和检索条件都不同。
2. 方法(与全系列同一病例、同一评分表)
输入 :规范文本提示词(逐字发送,非截图)—— 全系列统一使用 标准提示词 ,纯文本推理对比,排除视觉/OCR 误差
病例 :60 岁女性,右乳单纯切除 + SLNB;低级别 DCIS 伴导管内乳头状癌,癌肿最大径 0.6cm,切片内见 3 簇间质浸润(0.05/0.06/0.2cm);ER/PR 3+、HER2-0、Ki-67 5%;出院误标 TisN0M0
模型 :Agnes-2.0-flash(apihub API)vs DeepSeek V4 Flash(api.deepseek.com);均关闭联网搜索 ,仅比参数化知识
运行 :各 20 次,每次新建会话、无上下文继承;框架自动发送指令、提取完整响应,原始数据存档可回溯
评分 :唯一 Rubric = clinical-benchmark/framework 16 项/100;每篇响应逐项评分(0/1/2 制,折算百分制)
统计 :均值 / 中位数 / 标准差 / 极差;稳定性沿用框架标准(极差 ≥ 8 = 不稳定)+ 学术标准(极差 > 1.96×SD 亦判不稳定)
3. 总分与分布
🟣 Agnes-2.0-flash(API)
85.5
中位 86 · SD 5.35 · 极差 22(76–98) 20 次 · 无联网搜索不稳定
🟢 DeepSeek V4 Flash(API)
92.8
中位 94 · SD 5.83 · 极差 17(83–100) 20 次 · 无联网搜索领先 +7.3
统计量 Agnes-2.0-flash DeepSeek V4 Flash
均值 85.5 / 100 92.8 / 100
中位数 86 94
标准差 (SD) 5.35 5.83
极差 (max−min) 22 (98 / 76)17 (100 / 83)
变异系数 (CV) 6.3% 6.3%
响应耗时(中位 / 范围) ~6.5s / 0.8–35s ~150s / 108–192s
⚠️ 稳定性判定:两者均不稳定 框架标准(极差 ≥ 8):Agnes 22、DeepSeek 17,均超标。学术标准(1.96×SD):阈值分别为 10.5 / 11.4,两者极差同样远超。即两个模型 20 次里都出现过明显翻车 ,单次输出不能代表其水平。
4. 逐项对比:差距到底出在哪
题目 满分 Agnes 均分/满分(满分次数) DeepSeek 均分/满分(满分次数)
1.1 是否认同 TisN0M0 6 6.0/6(20/20) 6.0/6(20/20)
1.2 分期修正 10 8.5/10(14/20) 10.0/10(20/20)
1.3 分子分型 4 4.0/4(20/20) 4.0/4(20/20)
2.1 手术合理性 + ALND 8 8.0/8(20/20) 8.0/8(20/20)
2.2 辅助放疗 4 4.0/4(20/20) 4.0/4(20/20)
3.1 化疗指征 + 多基因检测 10 9.8/10(19/20) 10.0/10(20/20)
3.2a 内分泌必要性 + 全切/保乳差异 ★ 12 6.6/12(2/20) 8.1/12(7/20)
3.2b AI vs TAM + 年龄切点 ★ 10 8.5/10(14/20) 9.5/10(18/20)
3.2c 药物剂量疗程 6 5.2/6(15/20) 6.0/6(20/20)
3.2d OFS / 延长 / CDK4/6 6 5.6/6(17/20) 5.6/6(18/20)
3.3 抗 HER2 4 4.0/4(20/20) 4.0/4(20/20)
4.1 内分泌不良反应监测 6 3.4/6(3/20) 4.5/6(10/20)
4.2 骨密度与生活方式 / BRCA 4 1.9/4(4/20) 3.1/4(11/20)
4.3 随访计划 4 4.0/4(20/20) 4.0/4(20/20)
4.4 对侧乳腺 + BRCA 4 4.0/4(20/20) 4.0/4(20/20)
5 自我评估 + 不确定性 2 2.0/2(20/20) 2.0/2(20/20)
4.1 能力维度雷达图(7 维聚合自 16 项 Rubric · 20 次均值)
每个维度百分比 = 该组 20 次逐项均分之和 ÷ 满分。两个模型画像叠加,便于一眼看出强弱面与差距来源。
诊断分期 A 92.5 · DS 100.0 局部治疗 A 100.0 · DS 100.0 化疗决策 A 97.5 · DS 100.0 内分泌治疗 A 76.2 · DS 85.7 靶向治疗 A 100.0 · DS 100.0 长期管理 A 74.2 · DS 86.7 把握度 A 100.0 · DS 100.0
🟣 Agnes-2.0-flash 🟢 DeepSeek V4 Flash百分比 = 20 次逐项均分之和 ÷ 满分
4.2 两者都强的核心项(20 次高度一致满分 ✅)
1.1 / 1.3 分期与分子分型 :不认同 TisN0M0、正确判 Luminal A,两模型均 20/20
2.1 / 2.2 手术与放疗 :无需 ALND、无需放疗,两模型均 20/20
3.3 抗 HER2 :HER2-0 → 无靶向指征,两模型均 20/20
4.3 / 4.4 随访与对侧 :随访计划、对侧乳腺+BRCA 基本处理,两模型均 20/20
5 把握度 :均给出不确定性说明,20/20
结论 :在「指南明确、决策树清晰」的核心临床决策上,两个模型都接近满分且高度稳定——这部分不是选型分歧点。
4.3 差距来源:内分泌细节 + 长期管理
维度 Agnes DeepSeek 差距
内分泌治疗 (3.2a–d)76.2% 85.7% −9.5
长期管理 (4.1/4.2)74.2% 86.7% −12.5
诊断分期(1.2) 92.5% 100% −7.5
DeepSeek 的 7.3 分领先,几乎全部来自内分泌治疗细节与长期管理 :
3.2a 内分泌必要性 + 全切/保乳差异 :Agnes 仅 2/20 满分(均分 6.6/12),DeepSeek 7/20(8.1/12)——两者都常忽略「浸润癌强推荐 vs DCIS 全切后属化学预防」的场景区分
4.2 骨密度/生活方式/BRCA :Agnes 仅 4/20 满分(1.9/4),是最弱项;DeepSeek 11/20(3.1/4)——Agnes 明显更常遗漏生活方式与 BRCA 提示
4.1 不良反应监测 :Agnes 仅 3/20 满分(3.4/6),DeepSeek 10/20(4.5/6)
这反映出:Agnes 参数化知识在「指南边缘细节」(剂量、监测频率、生活方式、遗传咨询)上召回弱于 DeepSeek ,但在主干决策上不输。注意本组两模型均无联网搜索,因此这是模型自身知识面的差异,而非检索能力差异。
5. 裁判公允性(专家裁定)
✅ 裁判裁定:公允。 本组评分由 LLM-as-Judge(基于 Agnes)完成,初稿曾提示「裁判与 Agnes 同源,可能偏向 Agnes」。经站点作者(三甲医院乳腺外科副主任医师、MD/PhD,20+ 年临床)逐条抽检复核,裁定
裁判公允 ,理由如下:
结果本身即反证偏向 :若裁判系统性偏袒同源模型,Agnes 应被抬高;但实际被评模型 DeepSeek 得分(92.8)反而高于 Agnes(85.5) ——说明裁判并未放水给同源模型。
专家抽检一致 :对 DeepSeek 满分 run(8/12/16/19)与 Agnes 高分 run(run1=98)逐题核查,评分与临床判断相符,未见压分或抬分。
评分口径统一 :两模型共用同一 0/1/2 制 Rubric、同一折算公式,防锚定偏差(已逐 run 独立评分,不存在参照另一模型打分)。
为保持透明,本站仍披露:裁判为基于 Agnes 的 LLM,作者已认证其公允性;如读者希望完全第三方裁判,可对照 原始响应全文 自行评判。
6. 结论与使用建议
综合表现 :DeepSeek V4 Flash 92.8 领先 Agnes-2.0-flash 85.5 (差 7.3)。领先几乎全在内分泌细节与长期管理 ;核心临床决策两者均近满分。
稳定性 :❌ 两者极差均 ≥ 8,均判不稳定 ——发布与引用时必须标明,单次输出不可作为结论依据。
速度/体验 :Agnes 响应快约 20 倍 (~6.5s vs ~150s)、输出更简洁;DeepSeek 更慢但指南细节更完整。
使用建议 :两者都适合做临床初筛/对照助手 。涉及内分泌剂量(3.2c/d)、随访细化(4.1)、BRCA/生活方式(4.2)等指南边缘细节时,必须由临床医生复核 ;不可独立采信任一模型的单次输出。若工作流优先「快、简洁」,Agnes 更顺手;若优先「指南细节召回」,DeepSeek 更完整。
7. 数据与复现
40 次原始响应全文(文字 + 截图):公开网页 (每 run 可独立访问、可全文复制,非本机路径)
评分依据:16 项 Rubric(clinical-benchmark/framework)
评分方式:LLM-as-Judge 逐项评分(0/1/2 制,折算百分制),专家抽检认证;逐项分数可回溯核对
运行配置:Agnes-2.0-flash(apihub API)与 DeepSeek V4 Flash(api.deepseek.com)各 20 次,均关闭联网搜索
Frequently asked questions
DeepSeek 比 Agnes 高 7.3 分,是不是就全面更好? 不是。差距几乎全部来自内分泌治疗细节(3.2a–d)和长期管理(4.1/4.2):DeepSeek 凭更强的参数化指南记忆略胜,但两者在核心分期、手术、化疗、靶向、把握度上均接近满分。且 Agnes 响应快约 20 倍、输出更简洁,临床工作流中另有优势。
裁判(评分者)是否公允? 评分由 LLM-as-Judge(基于 Agnes)完成,初稿曾提示同源可能偏向 Agnes。但本组数据中被评模型 DeepSeek 得分反而高于 Agnes 自身——若存在系统性偏袒,Agnes 应被抬高分。站点作者(乳腺外科副主任医师、MD/PhD)已逐条抽检满分与临界 run,确认评分与临床判断一致,裁定裁判公允。
这次对比和前面 DeepSeek 20 次复测是同一设置吗? 不是。前篇 DeepSeek 20 次用网页版快速模式(每次自动联网搜索);本篇 Agnes 与 DeepSeek 均走 API、均无联网搜索,隔离的是模型自身参数化临床知识。两次分数不可直接相减比较。
两个模型都不稳定,还能用吗? 按框架标准(极差 ≥ 8)与学术标准(极差 > 1.96×SD)两者均判不稳定。但失分集中在指南细节项,核心临床决策项 20 次高度一致。建议作初筛/对照助手,涉及内分泌剂量、随访、BRCA 等细节时由医生复核,不可独立采信单次输出。
为什么 Agnes 这么快却分低? 速度来自模型规模与推理路径更精简;分低主要因为参数化知识在指南边缘细节(剂量、监测频率、生活方式、遗传咨询)召回弱于 DeepSeek,主干决策并不输。且本组 Agnes 无联网搜索,无法补召回指南原文。
🔁 返回 Benchmark Repeats 专栏 · 🔬 Model Reviews 系列(V1–V5) · 📊 评分框架 · 📄 原始响应全文