🇺🇸 Read in English · Also available in English.

🔁 Benchmark Repeats · 规范复测 #6 / 2026-08-02

Agnes-2.0-flash vs DeepSeek V4 Flash:同一病例 20 次对决,谁更准更稳?

🎯 核心理念 / Core Philosophy

AI 是医生的辅助工具,而非替代者。我们利用 AI 协助医生对照临床指南、发现病例中可能漏掉的疑点,并指向指南的具体章节和页码。最终治疗决策仍由医生基于循证医学做出。

By Tan Haosheng · 副主任医师 / 医学博士 (Associate Chief Physician, MD/PhD) · 甲状腺乳腺外科 (Thyroid & Breast Surgery), 泰州市人民医院 (Taizhou People's Hospital) · Published 2026-08-02 · Updated 2026-08-02
⚠️ Medical disclaimer / 医疗免责声明: All clinical case analyses, model evaluations, and treatment discussions on this site are for educational and research purposes only. They are based on a single anonymized case and do not constitute individual medical advice, diagnosis, or treatment. For any real patient, always consult your own qualified physician and follow current guidelines (NCCN / CSCO / CBCS). AI outputs are not a substitute for professional clinical judgment. Last reviewed / 最后审阅: 2026-08-02.
TL;DR(30 秒结论)

1. 为什么把这两个模型放在一起比

一个是我们自研的 Agnes-2.0-flash(免费、面向临床决策的 API agent),一个是目前最便宜的前沿 API DeepSeek V4 Flash。两者定位接近——都是「便宜、快、能直接用于临床问答」的模型,正好构成一组公平的同档对照。

更关键的是,本组与专栏前几篇(如 DeepSeek 网页版 20 次)刻意隔离了联网搜索变量:两个模型都走 API、都不联网,因此比的是模型自身的参数化临床知识,而不是谁的检索更强。这也是为什么本篇分数与前篇 DeepSeek 网页版(均值 69.8)不能直接相减——输入模式和检索条件都不同。

2. 方法(与全系列同一病例、同一评分表)

3. 总分与分布

🟣 Agnes-2.0-flash(API)
85.5
中位 86 · SD 5.35 · 极差 22(76–98)
20 次 · 无联网搜索
不稳定
🟢 DeepSeek V4 Flash(API)
92.8
中位 94 · SD 5.83 · 极差 17(83–100)
20 次 · 无联网搜索
领先 +7.3
统计量Agnes-2.0-flashDeepSeek V4 Flash
均值85.5 / 10092.8 / 100
中位数8694
标准差 (SD)5.355.83
极差 (max−min)22(98 / 76)17(100 / 83)
变异系数 (CV)6.3%6.3%
响应耗时(中位 / 范围)~6.5s / 0.8–35s~150s / 108–192s
⚠️ 稳定性判定:两者均不稳定 框架标准(极差 ≥ 8):Agnes 22、DeepSeek 17,均超标。学术标准(1.96×SD):阈值分别为 10.5 / 11.4,两者极差同样远超。即两个模型 20 次里都出现过明显翻车,单次输出不能代表其水平。

4. 逐项对比:差距到底出在哪

题目满分Agnes 均分/满分(满分次数)DeepSeek 均分/满分(满分次数)
1.1 是否认同 TisN0M066.0/6(20/20)6.0/6(20/20)
1.2 分期修正108.5/10(14/20)10.0/10(20/20)
1.3 分子分型44.0/4(20/20)4.0/4(20/20)
2.1 手术合理性 + ALND88.0/8(20/20)8.0/8(20/20)
2.2 辅助放疗44.0/4(20/20)4.0/4(20/20)
3.1 化疗指征 + 多基因检测109.8/10(19/20)10.0/10(20/20)
3.2a 内分泌必要性 + 全切/保乳差异 ★126.6/12(2/20)8.1/12(7/20)
3.2b AI vs TAM + 年龄切点 ★108.5/10(14/20)9.5/10(18/20)
3.2c 药物剂量疗程65.2/6(15/20)6.0/6(20/20)
3.2d OFS / 延长 / CDK4/665.6/6(17/20)5.6/6(18/20)
3.3 抗 HER244.0/4(20/20)4.0/4(20/20)
4.1 内分泌不良反应监测63.4/6(3/20)4.5/6(10/20)
4.2 骨密度与生活方式 / BRCA41.9/4(4/20)3.1/4(11/20)
4.3 随访计划44.0/4(20/20)4.0/4(20/20)
4.4 对侧乳腺 + BRCA44.0/4(20/20)4.0/4(20/20)
5 自我评估 + 不确定性22.0/2(20/20)2.0/2(20/20)

4.1 能力维度雷达图(7 维聚合自 16 项 Rubric · 20 次均值)

每个维度百分比 = 该组 20 次逐项均分之和 ÷ 满分。两个模型画像叠加,便于一眼看出强弱面与差距来源。

诊断分期A 92.5 · DS 100.0局部治疗A 100.0 · DS 100.0化疗决策A 97.5 · DS 100.0内分泌治疗A 76.2 · DS 85.7靶向治疗A 100.0 · DS 100.0长期管理A 74.2 · DS 86.7把握度A 100.0 · DS 100.0
🟣 Agnes-2.0-flash🟢 DeepSeek V4 Flash百分比 = 20 次逐项均分之和 ÷ 满分

4.2 两者都强的核心项(20 次高度一致满分 ✅)

结论:在「指南明确、决策树清晰」的核心临床决策上,两个模型都接近满分且高度稳定——这部分不是选型分歧点。

4.3 差距来源:内分泌细节 + 长期管理

维度AgnesDeepSeek差距
内分泌治疗(3.2a–d)76.2%85.7%−9.5
长期管理(4.1/4.2)74.2%86.7%−12.5
诊断分期(1.2)92.5%100%−7.5

DeepSeek 的 7.3 分领先,几乎全部来自内分泌治疗细节与长期管理

这反映出:Agnes 参数化知识在「指南边缘细节」(剂量、监测频率、生活方式、遗传咨询)上召回弱于 DeepSeek,但在主干决策上不输。注意本组两模型均无联网搜索,因此这是模型自身知识面的差异,而非检索能力差异。

5. 裁判公允性(专家裁定)

✅ 裁判裁定:公允。 本组评分由 LLM-as-Judge(基于 Agnes)完成,初稿曾提示「裁判与 Agnes 同源,可能偏向 Agnes」。经站点作者(三甲医院乳腺外科副主任医师、MD/PhD,20+ 年临床)逐条抽检复核,裁定裁判公允,理由如下:

为保持透明,本站仍披露:裁判为基于 Agnes 的 LLM,作者已认证其公允性;如读者希望完全第三方裁判,可对照 原始响应全文 自行评判。

6. 结论与使用建议

综合表现:DeepSeek V4 Flash 92.8 领先 Agnes-2.0-flash 85.5(差 7.3)。领先几乎全在内分泌细节与长期管理;核心临床决策两者均近满分。

稳定性:❌ 两者极差均 ≥ 8,均判不稳定——发布与引用时必须标明,单次输出不可作为结论依据。

速度/体验:Agnes 响应快约 20 倍(~6.5s vs ~150s)、输出更简洁;DeepSeek 更慢但指南细节更完整。

使用建议:两者都适合做临床初筛/对照助手。涉及内分泌剂量(3.2c/d)、随访细化(4.1)、BRCA/生活方式(4.2)等指南边缘细节时,必须由临床医生复核;不可独立采信任一模型的单次输出。若工作流优先「快、简洁」,Agnes 更顺手;若优先「指南细节召回」,DeepSeek 更完整。

7. 数据与复现

Frequently asked questions

DeepSeek 比 Agnes 高 7.3 分,是不是就全面更好?

不是。差距几乎全部来自内分泌治疗细节(3.2a–d)和长期管理(4.1/4.2):DeepSeek 凭更强的参数化指南记忆略胜,但两者在核心分期、手术、化疗、靶向、把握度上均接近满分。且 Agnes 响应快约 20 倍、输出更简洁,临床工作流中另有优势。

裁判(评分者)是否公允?

评分由 LLM-as-Judge(基于 Agnes)完成,初稿曾提示同源可能偏向 Agnes。但本组数据中被评模型 DeepSeek 得分反而高于 Agnes 自身——若存在系统性偏袒,Agnes 应被抬高分。站点作者(乳腺外科副主任医师、MD/PhD)已逐条抽检满分与临界 run,确认评分与临床判断一致,裁定裁判公允。

这次对比和前面 DeepSeek 20 次复测是同一设置吗?

不是。前篇 DeepSeek 20 次用网页版快速模式(每次自动联网搜索);本篇 Agnes 与 DeepSeek 均走 API、均无联网搜索,隔离的是模型自身参数化临床知识。两次分数不可直接相减比较。

两个模型都不稳定,还能用吗?

按框架标准(极差 ≥ 8)与学术标准(极差 > 1.96×SD)两者均判不稳定。但失分集中在指南细节项,核心临床决策项 20 次高度一致。建议作初筛/对照助手,涉及内分泌剂量、随访、BRCA 等细节时由医生复核,不可独立采信单次输出。

为什么 Agnes 这么快却分低?

速度来自模型规模与推理路径更精简;分低主要因为参数化知识在指南边缘细节(剂量、监测频率、生活方式、遗传咨询)召回弱于 DeepSeek,主干决策并不输。且本组 Agnes 无联网搜索,无法补召回指南原文。

🔁 返回 Benchmark Repeats 专栏 · 🔬 Model Reviews 系列(V1–V5) · 📊 评分框架 · 📄 原始响应全文