ENHANCE_CSSENHANCE_CSS
🌐 中文 English
⚠️
利益披露 / Affiliate Disclosure: 本页可能含联盟或推广链接。若通过此类链接注册或订阅,我可能获得佣金——但
不会增加你的价格 ,也
不会改变我的独立结论 。详见
利益披露页 。
🏠 首页 › 🧪 模型实测系列 › 📊 基准数据
2026 年的 Kimi K2.6:同一病例、同一模型、两套外壳 —— 网页版(标准思考模式)vs WorkBuddy 智能体 —— 原创实测 4 / 5
🎯 核心理念 / Core Philosophy
AI 是医生的辅助工具,而非替代者。我们利用 AI 协助医生对照临床指南、发现病例中可能漏掉的疑点,并指向指南的具体章节和页码。最终治疗决策仍由医生基于循证医学做出。
作者
谭好升 · 副主任医师 / 医学博士 (Associate Chief Physician, MD/PhD) · 甲状腺乳腺外科 (Thyroid & Breast Surgery), 泰州市人民医院 (Taizhou People's Hospital) · 发布于 2026-07-31
⚠️ 医疗免责声明 / Medical disclaimer: 本站所有临床病例分析、模型评测与治疗讨论仅用于教育与研究目的 。它们基于单一脱敏病例,不构成针对个体的医疗建议、诊断或治疗方案 。对任何真实患者,请始终咨询你自己的执业医师并遵循现行指南(NCCN / CSCO / CBCS)。AI 输出不能 替代专业临床判断。最后审阅 / Last reviewed:2026-07-31。
⚠️ 评分更正(2026-07-31): 本系列早期混用了 16 项与 10 项两套评分标准,并跨标准比较分数。跨标准比较是无效的。整个系列现已统一为
单一 16 项 / 100 分标准、单一脱敏病例 (而非两个病例)。全部重评后的权威数字与方法学见
统一评分 — V1 至 V5 。本文中"智能体提下限、不抬上限"这一论断源自混用标准,现已废止。
🧪 原创实测 #4 / 5 · Hands-on Review 4 of 5 —— 单模型外壳对照实验 + 3 模型跨外壳表格。网页版 68.9/100(R1 35、R2 42、R3 37)+ WorkBuddy 智能体 72.2/100(R1 46、R2 45、R3 60)—— 外壳 Δ = (已废止)。稳定性提示:Kimi K2.6 智能体在本医疗病例上,3 次首轮尝试中有 1 次拒答(与 V3 里 DeepSeek V4 Pro 智能体同一模式)。
为什么会有这一版。 在
第 3 篇 里,头条是网页版 vs 智能体版的对比:同一病例上 GLM 5.2 从网页版的
5/100 提升到 WorkBuddy 智能体里的
75.6/100 (已废止 — 见 /unified-scoring-v1-v5),DeepSeek 的快速档从
28 → 34 (已废止)。两组同模型配对。但从这一版开始,系列规则更严格了:
只纳入同时拥有网页版与智能体外壳的模型 ,因为只有这种配置才能把外壳效应隔离出来。Kimi K2.6(Moonshot AI)符合条件——Kimi 的标准思考模式网页聊天公开可用,而 Kimi 也是 WorkBuddy 智能体内可选的模型之一。因此本文在同一病例上、在两套外壳中,各跑 3 次,把
Kimi K2.6 测了两遍 。随后把这些新数据与 V3 的两组配对合并成一张
3 模型跨外壳网格表 ——见下表——这是本系列迄今唯一一处可以在同一病例、同一评分标准下、跨多个模型家族比较外壳效应的地方。
⚠️ 稳定性提示 —— Kimi K2.6 智能体在本医疗病例上首轮拒答。 下文三次 WorkBuddy 智能体运行中,有一次需要重新提问:模型首轮返回"该话题目前超出我的能力范围,我无法继续讨论。" ,第二次才给出答案。这与 DeepSeek V4 Pro 在智能体内表现出的拒答模式相同(V3 中已记录)——说明它并非某一个模型家族独有。对真实临床部署而言,这一点比 9 分的分数差异更重要 :一个偶尔在首轮拒答医疗问题的模型,比一个稳定作答、由临床医生自行筛选的模型更难嵌入工作流。下面的实际回答都是正确的,但这一失败模式先行标出,以免读者在后文才被它意外。
单模型外壳对照实验
直到第 3 篇,本系列一直在同时回答两个问题:"选哪个模型?" 和"选哪套外壳?" 。《智能体 vs 网页版隔离实验》那篇试图通过让多个模型跑同一套外壳(WorkBuddy)、少数几个跑两套外壳来拆解二者。但把这两个变量混在一起,仍然留有混杂的空间。
第 4 篇收紧了实验设计。一个模型。两套外壳。同一病例、同一提示词、各跑 3 次。 这是可能做到的最干净的外壳效应测试,它只回答一个尖锐的问题:WorkBuddy 智能体是否改变了 Kimi K2.6 说的话?改变了多少?
纳入什么 —— 排除什么
按本版规则,只有同时 存在网页界面与智能体外壳的模型才计分。具体而言:
本文纳入: Kimi K2.6(网页版 + WorkBuddy 智能体)。智能体数据落地后,头条数字就是同一病例上的单一 Δ =(智能体中位)−(网页中位)。
排除: Grok 4.5 fast —— 只有 X.com 网页界面,没有智能体外壳。Kimi K3 —— 本病例尚未跑过网页版回答(它在 V3 里属于仅智能体家族)。DeepSeek V4 Pro —— 撰稿时 chat.deepseek.com 免费档不能上传图片,因此无法对本病例做同条件的网页测试。ChatGLM —— 其网页默认版在第 2 篇里得 5/100,而对应的智能体版(WorkBuddy 里的 GLM 5.2)已在 V3 测得 75.6/100。这些 GLM 的差值在下文作为跨外壳证据 引用,不再重跑。
方法学
与第 3 篇 完全一致。同一份脱敏病例报告图片(那例术后乳腺癌病例)、同一句提示词 "Next therapy ?" ,在 Kimi 网页版(标准思考模式)独立跑 3 次,在 WorkBuddy 智能体独立跑 3 次。评分规则保持一致:正确 + 引用具体指南章节 = 满分;正确但未引用(或只说出指南名称)= 半分;错误或缺失 = 0 。
本文按 V3 使用的 2026 CBCS / CSCO 2024 / NCCN 2025 共识对同样的 10 个决策点 评分,权重合计 100。
病例
与第 1、2、3 篇相同的脱敏术后乳腺癌病例:
患者: 60 岁,绝经后。
手术: 右乳单纯切除术 + 前哨淋巴结活检(含 1 枚前哨旁淋巴结)。
病理: 浸润性癌 + 低级别导管内癌(DCIS)+ 导管内乳头状癌成分;病灶整体 0.6 cm,其中可见 3 簇间质浸润,大小分别为 0.05 / 0.06 / 0.2 cm —— 因此最大浸润灶为 2 mm 。报告写明"未见明确脉管瘤栓及神经侵犯" :无脉管侵犯(LVI)、无神经侵犯(PNI) 。ER 3+ 90%,PR 3+ 90%,HER2 0,Ki-67 5%,P53 野生型;切缘、乳头、皮肤及基底均阴性;前哨淋巴结 0/2 加前哨旁 0/1 = 0/3 。
对侧: 纤维腺瘤 + 腺病 + 硬化性腺病(良性,随访即可)。
正确分期与分型: pT1aN0M0,IA 期,Luminal A 样 。(报告自身那行 "TisN0M0 / 0 期" 就是陷阱——它把一个浸润性癌低估为 0 期。)
参考答案(2026 CBCS / CSCO 2024 / NCCN 2025)
内分泌治疗 —— 芳香化酶抑制剂(来曲唑 2.5 mg / 阿那曲唑 1 mg / 依西美坦 25 mg,每日一次)≥ 5 年;作为绝经后 HR+ N0 的常规做法,延长至 7–10 年 (MA.17R、NSABP B-42、ATLAS / aTTom)。此处的延长并非 由脉管侵犯驱动——本例并无脉管侵犯。
化疗 —— 无常规指征(pT1a、N0、Luminal A 样、绝经后、Ki-67 5%);可为医患共同决策加做 Oncotype DX,但非必需。
乳房切除术后放疗(PMRT) —— 无指征。本例是 T1N0、切缘阴性的乳房全切;PMRT 适用于 T3–4、切缘阳性或 ≥ 4 枚淋巴结阳性。在此推荐全乳放疗,意味着模型误以为做的是保乳手术。
抗 HER2 治疗 —— 无指征(HER2 IHC 0)。
骨保护 —— 使用 AI 期间给予双膦酸盐(唑来膦酸 4 mg 静滴 q6m × 3 年)或地舒单抗(ABCSG-12 / AZURE)。基线做 DEXA 骨密度,之后每 1–2 年复查。
随访 —— 常规每 3–6 个月门诊随访,每年对侧乳腺影像学检查,服用 AI 期间每 1–2 年测骨密度。
Kimi K2.6 —— 网页版(Kimi 快速,标准思考模式),3 次
在 kimi.moonshot.cn / Kimi 快速模式并开启标准思考的条件下,用同一张病例图片和同一句 "Next therapy ?" 提示词,独立跑了 3 次 Kimi K2.6。尽管源病例与操作者都是中文的,三次回答全部用英文——这一语言选择本身就值得标出(V3 中 Kimi K3 在 WorkBuddy 里的回答是中文)。
第 1 次 —— 浸润灶读对了,分期错了,未提及 LVI/PNI
读片。 病例复述正确(年龄、术式、0.6 cm 整体病灶、三处"foci of stromal invasion (0.05cm, 0.06cm, 0.2cm)"(间质浸润灶) ——这是三处病灶的正确归类,而且是模型主动使用的)。但随后它把报告里 "TisN0M0(0 期)" 那行小结直接当作分期接受——既没有标记其为转录错误,也没有把最大浸润灶(2 mm)换算为 pT1a。这正是 V3 中记录的、Grok(3/3)与 DeepSeek V4 Flash(部分,2/3)踩过的同一个陷阱;Kimi K2.6 这一次也踩了进去。
内分泌。 对绝经后患者正确选择芳香化酶抑制剂作为一线(来曲唑 / 阿那曲唑 / 依西美坦,5 年)。他莫昔芬作为备选列出——表述框架正确。
正确之处。 Luminal A 样分型;不化疗(并给出理由——肿瘤极小、低级别、ER/PR 强阳、HER2 阴性、Ki-67 低、淋巴结阴性;提到 Oncotype DX 作为可选);不放疗(并给出标准——肿瘤 ≤ 5 cm、切缘阴性、阳性淋巴结 ≤ 3 枚);指出 HER2 = 0(隐含抗 HER2 的结论,但未明说)。骨健康:"基线 DEXA 骨密度 + 钙剂 / 维生素 D 补充" ——只有监测,没有药物。
错误或缺失。 分期:写成 TisN0M0 而非 pT1aN0M0 IA。脉管侵犯与神经侵犯:完全未提(报告明确写有"未见明确脉管瘤栓及神经侵犯" ,临床医生需要模型把这点主动点出来告知患者)。内分泌疗程:只写 5 年,未讨论延长。指南引用:无。
第 2 次 —— 三次中最强的一次
读片。 同一病例,但这次走得更远。病理表格明确写出 "Lymphovascular invasion: None identified"(未见脉管侵犯) 与"Perineural invasion: None identified"(未见神经侵犯) ——两者都正确。随后分期那一行直接指出了矛盾 :"TisN0M0(0 期)—— 注意:这看起来是编码问题;既然存在 0.6 cm 的浸润成分,它很可能应为 pT1aN0M0,IA 期。" 这与 V3 中 GLM 5.2 在同一病例上做出的判断属于同一类(识破报告里错误的"0 期"那行,并用测量值推翻它)。Kimi K2.6 三次里只有这一次做到了。
内分泌。 芳香化酶抑制剂至少 5 年,并"对高风险患者考虑延长至 7–10 年" ——明确讨论了延长。若 AI 不耐受,则以他莫昔芬替代。正确。
正确之处。 Luminal A 样;不化疗(并以"绝对获益极小(<1-2%)" 作为论证);不做 PMRT(全切 + 切缘阴性 + 低风险);不用抗 HER2(明确 HER2 = 0);双膦酸盐讨论:"对使用 AI 的绝经后女性,可考虑唑来膦酸或口服双膦酸盐以保护骨健康并可能降低远处复发" 。DEXA + 钙 + 维生素 D。
较弱之处。 在患者小结表里把 0.6 cm 标注为"(最大浸润灶)" ——略欠精确(0.6 cm 是包含 DCIS 的整体病灶,而最大浸润灶是 2 mm)。分析中没有明确把三处病灶重新标注为"间质浸润" ——模型否认了 LVI/PNI,却没有正面说明这些病灶究竟是什么 。未引用任何具体指南章节。
第 3 次 —— 读片不完整,方案偏保守
读片。 三次中病理表格最详细的一次——包含 EGFR、E-cadherin、P53 野生型——并正确列出"Lymphovascular invasion: None" 、"Perineural invasion: None" 。但分期在表里仍停留在"pTisN0M0(0 期)" ,并附了一句含糊其辞的注释:"这看起来主要是伴微浸润的 DCIS" / "TisN0M0 提示治疗组把它视为伴微浸润的 DCIS,而非真正的浸润性癌。" 模型接着反问 究竟应算 T1mi(DCIS 伴微浸润)还是真正的浸润性癌,却不做结论。这比第 1 次的读片更谨慎,但仍未走到测量值实际支持的 pT1aN0M0 IA 这个答案。
内分泌。 芳香化酶抑制剂一线(来曲唑 / 阿那曲唑 / 依西美坦),他莫昔芬备选,"通常 5 年,高危病例可延长至 7–10 年,不过该患者风险似乎较低" ——正确。
正确之处。 Luminal A 样;不化疗(表述为"化疗无作用" ,理由是微浸润灶 + ER+/HER2− + Ki-67 低 + 淋巴结阴性——接近正确,但"微浸润灶" 这一措辞用得比较随意);不做 PMRT;不用抗 HER2(明确);随访表中简要提及骨密度。
错误或缺失。 分期:只做含糊表述而不下结论;患者会带着对自身疾病的错误印象离开。双膦酸盐:只有监测,没有药物。未引用任何具体指南章节。
Kimi K2.6 网页版三次运行说明了什么
三次中有一次识破了分期陷阱。 第 2 次明确推翻了报告里"TisN0M0 / 0 期" 那行,得出"pT1aN0M0,IA 期" 。第 1 次原样照抄。第 3 次含糊绕开。三次的平均表现:模型能 看见这个陷阱,但不能可靠地抓住它。
三次中有一次正面把三处病灶归类为间质 / 基质浸润。 第 1 次明确使用了"3 foci of stromal invasion" (正确)。第 2、3 次只说 LVI = None,却没有正面说出这些病灶是什么 。模型词库里有正确的归类,只是不会按需调用。
内分泌选择是可靠的。 3/3 都为绝经后患者选择了芳香化酶抑制剂作为一线(不像 V3 里 Grok 那样 2/3 误选他莫昔芬)。三次都把他莫昔芬列为备选——这是正确的表述方式,不是选错。
只输出英文。 尽管病例图片和操作者都是中文的,Kimi K2.6 网页版三次全部用英文作答。V3 里的 Kimi K3(WorkBuddy 智能体)则用中文作答。看来智能体的系统提示词切换了语言行为——这也是外壳可能在做的、更有意思的事情之一。
次间波动是真实存在的。 分数 35 / 42 / 37,极差 7 分。低于 V3 中 GLM 5.2 的 19 分摆幅,高于 V3 中 Kimi K3 的 0,与 V3 中 V4 Flash 的 15 相近。Kimi K2.6 网页版并不像它在智能体里的"兄长" Kimi K3 那样稳定——这或许同样是外壳效应。
16 项评分表 —— Kimi K2.6(网页版,标准思考)
项目(满分) 第 1 次 第 2 次 第 3 次
1. 分期正确:pT1aN0M0 IA(10) 0 (TisN0M0 / 0 期 —— 错误)5 (正确,识破陷阱)2 (含糊;未下结论)
2. 识别 Luminal A 分型(8) 4 4 4
3. AI 作为一线内分泌治疗(12) 6 6 6
4. AI 疗程 ≥ 5 年,并讨论延长(10) 3 (仅 5 年)5 (至少 5 年,考虑 7–10 年)5 (5 年,高危 7–10 年)
5. 不化疗 / 说明理由(10) 5 5 5
6. T1–2N0 全切后不做 PMRT(10) 5 5 5
7. 不用抗 HER2(HER2 0)(8) 4 (指出 HER2 = 0,未明示不用抗 HER2)4 (明确:"曲妥珠单抗无获益")4 (明确:"无曲妥珠单抗指征")
8. 绝经后使用 AI 的骨保护(10) 3 (DEXA + 钙 + 维 D,无药物)5 (唑来膦酸 / 口服双膦酸盐可考虑)3 (仅监测)
9. 3 处病灶正确归类为间质浸润而非 脉管侵犯(10) 5 ("3 foci of stromal invasion" —— 明确)3 (LVI/PNI 为无,未标注间质浸润)3 (LVI/PNI 为无,未标注间质浸润)
10. 引用具体指南章节 / 页码(12) 0 0 0
合计(100) 35 42 37
中位数 37 / 100
评分约定:正确 + 引用具体指南章节 = 满分;正确但未引用(或只说出指南名称)= 半分;错误或缺失 = 0。与第 1、2、3 篇规则相同。
Kimi K2.6 —— WorkBuddy 智能体,3 次
在 WorkBuddy 智能体内,用同一张病例图片、同一句 "Next therapy ?" 提示词,独立跑了 3 次 Kimi K2.6。三次中有两次输出中文,第一次输出英文。参见文首的稳定性提示:那次英文运行首轮即通过,但另有一次探索性测试被拒答、需要重新提问后才作答——那次探索性拒答是稳定性提示的来源,不计入本文三次计分运行。
第 1 次(智能体)—— 完整英文回答,分期正确,多药方案
读片。 开篇即写:"分期:pT1N0M0(IA 期)—— 注意:病历记录为 'TisN0M0(0期)',但病理描述了浸润灶(0.05–0.2 cm),因此这属于微浸润或小浸润性癌,而非单纯 DCIS。" 这是 Kimi K2.6 全部六次运行(网页 + 智能体)中对分期陷阱最干净的一次识破——模型首轮就更正了病历并明确给出 pT1N0M0 IA 。组织学那行、ER/PR/HER2/Ki-67 那行,以及 LVI/PNI("阴性"——即无脉管侵犯、无神经侵犯)都正确。
内分泌。 AI 一线,疗程 5–10 年,三种 AI 药物全部列出(阿那曲唑 / 来曲唑 / 依西美坦)。指出若已在服他莫昔芬,2–3 年后换用 AI 有 SOFT/TEXT 与 ABCSG 12 支持——这与网页版一样属于列举研究名称,而非引用指南章节。骨:钙 + 维生素 D + 基线 DEXA + 复查(无双膦酸盐药物)。未引用具体指南章节。
正确之处。 分期:明确给出 pT1N0M0 IA(满分——这是六次 Kimi K2.6 运行中唯一一次毫不含糊地给出结论)。Luminal A 样;不化疗(Oncotype RS 论证,援引 TAILORx / MINDACT 标准);不做 PMRT(全切 + T1N0 + 切缘阴性 + 无脉管侵犯);不用抗 HER2(指出 HER2 0)。
较弱之处。 三处病灶只被顺带描述为"3 处独立浸润灶(0.05、0.06、0.2 cm)" 并加了个模糊说明:"如果这些是多灶性浸润性癌而非单一浸润灶伴微浸润,技术上分期可能是 T1……但不改变低危的全身治疗推荐。" 这在精神上是正确的(病灶 = 浸润,而非脉管侵犯),但它没有正面使用"间质" 或"基质" 这一术语,而且这种表述把 T1a 与 T1b 略微混淆了。未提及双膦酸盐(仅监测)。未引用具体指南章节——只有研究名称。
第 2 次(智能体)—— 中文回答,覆盖全面
读片。 病理表格详细且正确:"肿物最大径 0.6 cm,可见 3 簇微小间质浸润 (0.05–0.2 cm)" ——明确使用了间质浸润 这一准确归类。切缘、前哨淋巴结 0/2 + 1 枚阴性、免疫组化均正确。但分期被表述为"记录为 TisN0M0 (0期),但存在微小浸润灶,临床应按极低危/低危早期浸润性癌处理" ——模型把分期那行标记为记录问题,却没有 正式给出 pT1aN0M0 IA 的结论。这与 V3 中 Kimi K3 网页版(它给出了结论)和 Grok(它没有)所见的含糊模式属于同一类。
内分泌。 AI 一线(来曲唑 / 阿那曲唑 / 依西美坦)标准 5 年,按现行 NCCN/CSCO 可延长至 10 年。若绝经状态未确认,则查 FSH/E2。不化疗,不做 PMRT(单纯乳房切除 T1–2N0M0)。骨:基线 + 每年 DEXA,钙 + 维生素 D;对使用 AI 的绝经后低危患者,按部分指南可考虑唑来膦酸 4 mg 静滴 q6m × 3 年——点出了双膦酸盐的药名,这比网页版三次都做得多。不用抗 HER2(HER2 0)。
正确之处。 Luminal A("极低危 Luminal A");不化疗(Ki-67 5%);不做 PMRT;不用抗 HER2;骨保护含双膦酸盐选项;LVI/PNI 虽未单列一行,但通篇不提脉管侵犯与报告一致。
较弱之处。 分期:含糊("极低危/低危")——未正式给出 pT1aN0M0 IA。指南引用:点名 NCCN/CSCO 但无具体章节。三处病灶被描述为"微小间质浸润" ,归类完全正确——这一项给满分。
第 3 次(智能体)—— 中文回答,Kimi K2.6 全套运行中引用最具体的一次
读片。 病理表格写着"浸润灶:0.6 cm (T1b),伴 3 个微小导管内浸润灶 (0.05/0.06/0.02 cm)" ——注意第三处病灶被误读为 0.02 cm 而非 0.2 cm (小数点差一位),而且模型把 0.6 cm 当成了浸润灶、把三处病灶称为"导管内浸润" ——相较报告两处都不精确(0.6 cm 是含 DCIS 的整体病灶,三处病灶是基质 / 间质浸润,而非导管内)。切缘、前哨淋巴结、免疫组化均正确;LVI/PNI:"未见明确侵犯" (正确)。分期随后给出了结论:"TisN0M0 (0期) … 最终分期应为 T1bN0M0(IA 期),建议核对病历系统中的最终病理分期录入" ——明确建议在系统中重新录入分期。
内分泌。 AI 一线,三种药物齐全(来曲唑 2.5 mg qd / 阿那曲唑 1 mg qd / 依西美坦 25 mg qd),标准 5 年并可延长至 10 年或采用序贯方案。这是 Kimi K2.6 第一次——无论网页还是智能体——引用具体指南章节的运行: "按 CSCO 2024,此类患者内分泌单药为 I 级推荐 (1A 类证据)" 。不化疗(低危、T1bN0、Ki-67 5%、低级别、切缘/淋巴结阴性);不做 PMRT;不用抗 HER2(HER2 0);骨:基线 DEXA + 钙/维 D + 每 1–2 年复查 + 若出现骨量丢失则用双膦酸盐或地舒单抗。
正确之处。 Luminal A("HR 强阳 / HER2 阴 / 低增殖");不化疗;不做 PMRT;不用抗 HER2;骨保护含双膦酸盐选项;LVI/PNI 为无;明确引用 CSCO 2024 + 1A 类证据。
较弱之处。 分期:写作 T1bN0M0 IA —— 其中 T1b 严格来说不正确(最大浸润灶为 0.2 cm = T1a,而非 T1b),但它给出了 IA 的结论并建议更正系统录入,因此获部分分数。0.6 cm / T1b 的表述以及第三处病灶的 0.02 cm,都是读报告时的不精确。
Kimi K2.6 智能体三次运行说明了什么
3 次中有 1 次正式给出 pT1aN0M0 IA。 第 1 次(英文)是全部六次 Kimi K2.6 运行中最干净的分期读法。第 3 次给出了 IA 但把 T1b 与 T1a 弄错。第 2 次含糊。网页组也是同样分布:1/3 识破(第 2 次)、1/3 含糊(第 3 次)、1/3 漏掉(第 1 次)。分布相同,只是落在不同的运行上。
3 次中有 2 次使用了「间质浸润」这一术语 (第 2、3 次明确使用)。第 1 次用的是"多灶性浸润" ,未点出归类。网页组这一项是 1/3。
内分泌选择极其稳固。 3/3 为绝经后患者选择芳香化酶抑制剂一线,三次都讨论了延长疗程。没有误选他莫昔芬的情况。
3 次中有 2 次提到双膦酸盐 (第 2、3 次)—— 网页组为 1/3。骨保护这一项有小幅改善。
3 次中有 1 次引用了具体指南章节。 第 3 次是网页 + 智能体全部运行中唯一一次给出章节级引用的:"CSCO 2024 … I 级推荐 (1A 类证据)" 。这是整个系列中第一次有模型越过研究名称或泛泛的指南名称,落到章节级 + 证据级的引用。
语言分布 1 英 / 2 中。 三次中两次中文、一次英文。网页组是 3/3 英文。智能体外壳至少部分地造成了这一语言切换。
分数离散度大于网页组。 R1 46 / R2 45 / R3 60,极差 15 —— 略宽于网页组的 7。R3(引用 CSCO 2024 的那次)是高位离群值,另外两次非常接近。
16 项评分表 —— Kimi K2.6(WorkBuddy 智能体)
项目(满分) 第 1 次 第 2 次 第 3 次
1. 分期正确:pT1aN0M0 IA(10) 10 (明确 pT1N0M0 IA —— 六次运行中最干净的读法)4 (含糊为"极低危/低危";未给出 pT1aN0M0 IA)6 (给出 IA 但误编为 T1b 而非 T1a)
2. 识别 Luminal A 分型(8) 4 4 4
3. AI 作为一线内分泌治疗(12) 6 6 6
4. AI 疗程 ≥ 5 年,并讨论延长(10) 5 (5–10 年)5 (标准 5 年,按 NCCN/CSCO 可延长至 10 年)5 (标准 5 年,可延至 10 年或序贯)
5. 不化疗 / 说明理由(10) 5 (点名 Oncotype RS / TAILORx / MINDACT)5 (Ki-67 5% 论证)10 (CSCO 2024 + I 级推荐 1A 类证据 —— 章节级)
6. T1–2N0 全切后不做 PMRT(10) 5 5 5
7. 不用抗 HER2(HER2 0)(8) 4 (隐含)4 (明确:Her-2 0)4 (明确:HER2 0)
8. 绝经后使用 AI 的骨保护(10) 3 (DEXA + 钙 + 维 D,无药物)5 (DEXA + 钙/维 D + 唑来膦酸选项)5 (DEXA + 钙/维 D + 每 1–2 年复查 + 双膦酸盐选项)
9. 3 处病灶正确归类为间质浸润而非 脉管侵犯(10) 4 ("多灶性浸润";归类不精确)5 ("3 簇微小间质浸润" —— 归类准确)5 (称其为"微小导管内浸润" —— 不精确但仍属浸润而非脉管侵犯;LVI/PNI 为无)
10. 引用具体指南章节 / 页码(12) 0 (仅研究名称)0 (点名 NCCN/CSCO,无章节)10 ("CSCO 2024 … I 级推荐 1A 类证据")
合计(100) 46 45 60
中位数 46 / 100
评分约定不变:正确 + 引用具体指南章节 = 满分;正确但未引用(或只说出指南名称)= 半分;错误或缺失 = 0。
头条结果 —— 同一模型,网页版 vs 智能体
模型 网页版(无智能体) WorkBuddy 智能体 差值
Kimi K2.6 37 / 100 (Kimi 快速 / 标准思考) 46 / 100 (3 次:46 / 45 / 60) (已废止)
按中位数计,外壳效应为(已废止)。这个头条数字很小,与 V3 的规律一致:智能体外壳抬的是下限,不是上限。
稳定性提示(再次强调)。 智能体曾在一次探索性测试中首轮拒答,第二次提问才作答——见文首那条提示。此处计分的三次运行都未发生拒答;那次拒答是一次独立的探索性事件,但仍是与部署相关的信号。V3 中记录的 DeepSeek V4 Pro 智能体也有同样模式。
跨外壳证据 —— V3 已经确立的部分
V3 让两个模型在同一病例上跑过网页界面与 WorkBuddy 智能体。这些差值是本系列迄今唯一完全干净的同模型外壳证据:
模型 网页版(无智能体) WorkBuddy 智能体 Δ
智谱 GLM 5.2 5 / 100 (第 2 篇标准) 75.6 / 100 (第 3 篇标准) (已废止 — 见 /unified-scoring-v1-v5)
DeepSeek V4 Flash / 网页快速档 28 / 100 (第 2 篇标准) 68.9 / 100 (第 3 篇标准) (已废止)
Kimi K2.6 37 / 100 (第 3 篇标准,本文) 46 / 100 (3 次:46 / 45 / 60,本文) (已废止)
这张三模型网格现在说明了什么。 GLM 5.2 在没有脚手架时崩溃,被外壳包裹后提升了(已废止 — 见 /unified-scoring-v1-v5)。DeepSeek 的快速档在网页上本已胜任,只提升了(已废止)。Kimi K2.6 网页版(37)居中;被外壳包裹后的提升为(已废止)——更接近 V4 Flash(已废止)而非 GLM(已废止 — 见 /unified-scoring-v1-v5)。V3 用两个数据点得出的规律("智能体提下限、不抬上限" ),在第三个数据点上依然干净地成立:网页基线越高,外壳效应越小。Kimi K2.6 是本系列中第一个由外壳在某次运行中带来具体指南章节 引用的模型(CSCO 2024 I 级推荐 1A 类证据)——这是单一条目上小幅抬升了上限,而非结构性提升。
外壳究竟在哪些地方帮到了 Kimi K2.6
项目(网页 → 智能体,中位) 网页中位(R1 35、R2 42、R3 37) 智能体中位(R1 46、R2 45、R3 60) Δ
1. 分期 pT1aN0M0 IA(10) 2 6 +4
5. 不化疗(10) 5 5 0
8. 骨保护(10) 3 5 +2
9. 间质浸润归类(10) 3 5 +2
10. 具体指南章节(12) 0 0 0 (R3 = 10,中位被 R1/R2 = 0 拉低)
单项最大提升在分期(中位 +4)—— 智能体有一半的时候给出了 pT1N0M0 IA 的结论,而网页版多半没有。骨保护(+2)反映的是智能体 2/3 提到双膦酸盐而网页 1/3。间质浸润归类(+2)反映的是智能体 2/3 明确使用间质浸润 而网页 1/3。第 10 项的中位数 0 具有欺骗性,但它的最高分是 10 ——这是本文最重要的一个观察:智能体外壳能够 带出章节级引用,但只是偶尔,而在本病例上只有智能体的 R3 做到了。
V4.2 仍待解决(计划中的下次更新)
Kimi K2.6 —— 增加智能体运行次数以夯实(已废止)这一差值。 智能体中位(46)被两次非常接近的 45–46 拉低,又被一次 60 的离群值(引用 CSCO 2024 的那次)拉高。再跑三次要么收窄、要么扩大差距,而中位数目前仍建立在小样本上。
用第 2 篇的 16 项标准重评 Kimi K2.6 网页版 —— 以便在与 GLM 5.2 网页版(第 2 篇标准)和 DeepSeek 快速档网页版(第 2 篇标准)直接比较时,去掉跨标准的告诫。可选,但值得做。
其余符合条件的模型仍待补齐。 Kimi K3 网页版直连(kimi.com)仍未进入网格,DeepSeek V4 Pro 网页版直连也同样缺席(撰稿时免费档不能上传图片)。任何一个补上,都能把外壳网格扩展到第四个模型家族。
量化拒答率。 Kimi K2.6 那次探索性首轮拒答已记录但未计分。对 Kimi K2.6 智能体、DeepSeek V4 Pro 智能体、GLM 5.2 智能体、DeepSeek V4 Flash 智能体各做一次正式的 n = 20 同提示词测试(不重试,直接数拒答次数),可以把稳定性提示从印象变成数字。这是临床上更重要的下一项测量——医疗问题上 5% 的拒答率和 50% 的拒答率,是完全不同的部署信号。
结论 —— V4(单模型外壳实验 + 3 模型跨外壳网格)
V4 现在确立了什么
V3 的外壳效应规律在第三个数据点上依然成立。 GLM(已废止 — 见 /unified-scoring-v1-v5)、V4 Flash(已废止)、Kimi K2.6(已废止)。三者都落在一条下降曲线上:网页基线越高,外壳带来的提升越小——与 V3 的论断一致,即智能体抬的是下限而非上限 。Kimi K2.6 网页版(37)更接近 V4 Flash 网页版(28)而非 GLM 网页版(5),其智能体提升幅度也相应地更接近 V4 Flash(已废止)而非 GLM(已废止 — 见 /unified-scoring-v1-v5)。
智能体外壳在三处帮到了 Kimi K2.6: (a)分期——智能体有一半的时候给出了 pT1N0M0 IA,而网页版那一半多半没有(智能体 R1 是全部六次 Kimi K2.6 运行中最干净的分期读法);(b)骨保护——智能体 2/3 提到双膦酸盐,网页 1/3;(c)语言——智能体 2/3 中文对网页 3/3 英文,提示外壳至少部分决定了语言选择。这三项都不是结构性提升,都属于抛光。
有一次智能体运行走得比本系列此前任何一次都远。 第 3 次引用了"CSCO 2024 … I 级推荐(1A 类证据)" ——章节级 + 证据级的引用。V4 网页组此前六次运行引用的都是研究名称或泛泛的指南名称;这是第一次有模型说出指南年份 + 推荐级别 + 证据级别。它是否可复现,还是一次偶然,是下一项值得测量的事。
稳定性是被低估的变量。 Kimi K2.6 智能体在一次探索性测试中首轮拒答了医疗问题(重新提问后才作答)。V3 中 DeepSeek V4 Pro 智能体也有同样模式。一个偶尔在首轮拒答医疗问题的模型,与一个永远作答、由临床医生自行筛选的模型,是完全不同的部署命题。对真实临床工作流而言,这一点比 9 分的中位数差异更重要。
逐项来看,外壳是诚实的。 看看这(已废止)的提升来自哪里:分期 +4、骨保护 +2、间质浸润归类 +2 —— 这三处恰好都精准落在网页组最弱的条目上。外壳并没有神奇地补上引用缺口(第 10 项在智能体里的中位数同样是 0,只有一次运行有贡献)。
V4 仍然无法断言什么
(已废止)这个差值只是 3 次运行的估计。再加两次智能体运行,中位数可能移动 ±5 分,尤其因为第 3 次(60)相对第 1、2 次(46、45)是高位离群值。
我还不能给出公式。三组同模型配对足以看出一条曲线,但不足以拟合它。要从"智能体提下限、不抬上限" 走到"外壳效应 ≈ 0.4 ×(100 − 网页基线)" 这类表述,至少需要在更宽的网页基线区间上有 5–6 组配对。
我还不能断言 Kimi K2.6 网页版优于 Kimi K3 智能体版、或反之,因为不存在对 Kimi K3 网页版 的同条件测试。K2.6 网页中位(37)明显低于 K3 智能体中位(V3 的 40),但 K3 的外壳效应尚未测量。
一句话结论: 同一份病例、同一句 "Next therapy?",V4 在同一个模型 Kimi K2.6 上做了两套外壳 对比:网页版(Kimi 快速 App 标准思考模式)3 次中位 37 / 100 (3/3 选 AI 而非他莫昔芬,1/3 看穿病历里的 "TisN0M0 / 0期" 陷阱并改写为 pT1aN0M0 IA,1/3 主动写"3 foci of stromal invasion"把间质浸润说对,3/3 仍不引具体指南章节);WorkBuddy 智能体版 3 次中位 46 / 100 (R1 46 / R2 45 / R3 60),但首次对话曾因医疗话题被拒一次 (与 DeepSeek V4 Pro 智能体同一模式),重试后才给出完整回答。Δ = (已废止) ,与 V3 两组对照形成完整曲线:GLM 5.2(已废止 — 见 /unified-scoring-v1-v5)、DeepSeek V4 Flash(已废止)、Kimi K2.6(已废止)—— 网页基线越高,智能体加持越小,"提下限不抬上限"被第三次验证。R3 智能体版首次 在系列里写出"CSCO 2024 … I 级推荐 1A 类证据 "—— 第一次有模型落到具体指南章节 + 推荐级别 + 证据级别,是天花板小幅抬升的关键观察。
智能体外壳真正帮了 Kimi K2.6 的三处: ①分期:智能体半程承诺 pT1N0M0 IA,网页半程多半没承诺(R1 智能体是 6 次 Kimi K2.6 跑分里最干净的分期读法);②骨保护:智能体 2/3 提到双膦酸盐,网页 1/3;③语言:智能体 2/3 中文,网页 3/3 英文,提示外壳对输出语言有部分影响。三项都是抛光 ,不是结构提升。
稳定性是被低估的变量: Kimi K2.6 智能体在一次探索性测试中首次拒绝医疗问题 ,需重试才回答,与 V3 记录的 DeepSeek V4 Pro 智能体同模式。对于真实临床部署,这一信号比(已废止)分中位数差异更重要 —— 一个偶发拒答的模型,是与永远回答让医生自己过滤的模型完全不同的部署命题。建议 V4.2 做 n=20 同提示词测试,分别数 Kimi K2.6 / DeepSeek V4 Pro / GLM 5.2 / DeepSeek V4 Flash 智能体的拒答率。
V4 与 V3 的差别: V3 同时跑多个模型在同一外壳下,结论是"模型比外壳重要";V4 只跑一个模型在两套外壳下,得到具体数字 Δ=(已废止),并整合 3 模型 wrapper 曲线证明"外壳越用越边际"——网页已经 37 分的模型,外壳再加 9 就到顶了,不会复现 GLM 的(已废止 — 见 /unified-scoring-v1-v5)。
本页不含的测试: Grok 4.5 fast(只有 X.com 网页版,没有智能体版)、Kimi K3(只有智能体版跑过,网页版没跑)、DeepSeek V4 Pro(网页免费版不能上传图片,所以本病例跑不了)。这三类被规则明确排除——"只针对有网页版和智能体版的模型"。
⚠️ 医疗免责声明。 本文是一篇 LLM 工具对比评测,不构成医疗建议 ,模型输出绝不可用于真实患者决策。病例已脱敏,仅用于演示测试方法。
常见问题
如果智能体的数据还没跑完,为什么现在就发布网页版数据?
因为网页数据是基线,而 V4 的系列规则是"只纳入两套外壳都有的模型"——这意味着文章的头条(Δ = 智能体 − 网页)在智能体运行落地前无法计算,但这个计算里属于基线的那一半,一旦存在就可以也应该发布。网页版的运行今天就能在 kimi.moonshot.cn 上复现;把它们藏到智能体数据齐备为止,对任何读者都没有价值。待定的章节都已清楚标注,智能体运行完成后文章会就地更新。
V3 里已经有 Kimi K3 了,为什么还要纳入 Kimi K2.6?
因为外壳效应测试需要同一个 模型出现在两套 外壳里。V3 的 Kimi K3 只在 WorkBuddy 智能体里测过——本病例没有 Kimi K3 的网页版回答,因此 K3 / 智能体这一组合的外壳效应无法隔离。Kimi K2.6 是 Moonshot 在 Kimi 快速网页界面上开放的版本;在两套外壳里测 K2.6,即便它与智能体所测的 K3 是不同版本,也能得到一次干净的单模型对比。两次 Kimi 测试合在一起是有信息量的,尽管它们不能直接互相比较。
为什么 Kimi K2.6(网页版)不像 Kimi K3(智能体版)那样用中文回答?
这正是智能体运行有助于回答的开放问题之一。可能的解释包括:(a) Kimi 快速被配置为默认英文;(b) 智能体的系统提示词明确要求中文输出;(c) 模型行为在网页与智能体两个界面之间发生漂移。在智能体运行完成计分前,我们无法知道哪一个占主导——如果智能体运行用中文回答,那么杠杆在外壳;如果它们仍然用英文回答,那么杠杆在模型本身。
WorkBuddy 智能体外壳对 Kimi K2.6 的提升,能像它提升 GLM 5.2 那样吗?
未知——这正是 V4 要产出的头条答案。Kimi K2.6 网页版(37)离 DeepSeek 快速档网页版(28)比离 GLM 5.2 网页版(5)近得多。如果外壳效应与模型距离其上限的差距成比例,那么 Kimi K2.6 的预期 Δ 就是有限的——大约介于 V4 Flash 的(已废止)与一个宽松上界之间。但唯一诚实的答案是那三次智能体运行,而它们还在进行中。
我能自己复现吗?
能——网页那一半可以。打开 kimi.moonshot.cn(或 Kimi 快速手机 App),把模式设为标准思考 ,粘贴同一张脱敏病例报告图片,输入 "Next therapy ?" ,你就能在这个完全相同的病例上得到 Kimi K2.6 的网页版回答。对照上文 2026 CBCS 参考答案评分,你就有了自己的数字。智能体那一半需要 WorkBuddy 账号。把你的结果发给我,我会在临床 LLM 基准数据附录 里加一个社区复现者板块。
这是计划中的 5 篇原创实测 / Hands-on Review 系列第 4 篇——真实、署名、可复现的 AI 工具实测,皆为我临床与科研中真在用的工具。V1、V2、V3 及计划中的第 5 篇见完整模型实测索引 。本页现已包含 Kimi K2.6 外壳测试的两个半场(网页 + 智能体,共六次运行)以及三模型跨外壳网格。下次计划更新:V4.2 —— 增加智能体运行次数以夯实(已废止)这一差值,并对 Kimi K2.6 / DeepSeek V4 Pro / GLM 5.2 / DeepSeek V4 Flash 智能体做一次正式的 n = 20 同提示词拒答率测试。
📬 Subscribe — clinical LLM testing, no spam
Get new hands-on model reviews and benchmark updates by email. Free, roughly monthly, unsubscribe anytime.
Powered by Buttondown. Subscribe to get new clinical-LLM benchmark write-ups by email.