ENHANCE_CSSENHANCE_CSS
⚠️ 利益披露 / Affiliate Disclosure: 本页可能含联盟或推广链接。若通过此类链接注册或订阅,我可能获得佣金——但不会增加你的价格,也不会改变我的独立结论。详见利益披露页

2026 年的 Kimi K2.6:同一病例、同一模型、两套外壳 —— 网页版(标准思考模式)vs WorkBuddy 智能体 —— 原创实测 4 / 5

🎯 核心理念 / Core Philosophy

AI 是医生的辅助工具,而非替代者。我们利用 AI 协助医生对照临床指南、发现病例中可能漏掉的疑点,并指向指南的具体章节和页码。最终治疗决策仍由医生基于循证医学做出。

作者 谭好升 · 副主任医师 / 医学博士 (Associate Chief Physician, MD/PhD) · 甲状腺乳腺外科 (Thyroid & Breast Surgery), 泰州市人民医院 (Taizhou People's Hospital) · 发布于 2026-07-31
⚠️ 医疗免责声明 / Medical disclaimer: 本站所有临床病例分析、模型评测与治疗讨论仅用于教育与研究目的。它们基于单一脱敏病例,不构成针对个体的医疗建议、诊断或治疗方案。对任何真实患者,请始终咨询你自己的执业医师并遵循现行指南(NCCN / CSCO / CBCS)。AI 输出不能替代专业临床判断。最后审阅 / Last reviewed:2026-07-31。
⚠️ 评分更正(2026-07-31): 本系列早期混用了 16 项与 10 项两套评分标准,并跨标准比较分数。跨标准比较是无效的。整个系列现已统一为单一 16 项 / 100 分标准、单一脱敏病例(而非两个病例)。全部重评后的权威数字与方法学见 统一评分 — V1 至 V5。本文中"智能体提下限、不抬上限"这一论断源自混用标准,现已废止。
🧪 原创实测 #4 / 5  ·  Hands-on Review 4 of 5 —— 单模型外壳对照实验 + 3 模型跨外壳表格。网页版 68.9/100(R1 35、R2 42、R3 37)+ WorkBuddy 智能体 72.2/100(R1 46、R2 45、R3 60)—— 外壳 Δ = (已废止)。稳定性提示:Kimi K2.6 智能体在本医疗病例上,3 次首轮尝试中有 1 次拒答(与 V3 里 DeepSeek V4 Pro 智能体同一模式)。
为什么会有这一版。第 3 篇里,头条是网页版 vs 智能体版的对比:同一病例上 GLM 5.2 从网页版的 5/100 提升到 WorkBuddy 智能体里的 75.6/100(已废止 — 见 /unified-scoring-v1-v5),DeepSeek 的快速档从 28 → 34(已废止)。两组同模型配对。但从这一版开始,系列规则更严格了:只纳入同时拥有网页版与智能体外壳的模型,因为只有这种配置才能把外壳效应隔离出来。Kimi K2.6(Moonshot AI)符合条件——Kimi 的标准思考模式网页聊天公开可用,而 Kimi 也是 WorkBuddy 智能体内可选的模型之一。因此本文在同一病例上、在两套外壳中,各跑 3 次,把 Kimi K2.6 测了两遍。随后把这些新数据与 V3 的两组配对合并成一张 3 模型跨外壳网格表——见下表——这是本系列迄今唯一一处可以在同一病例、同一评分标准下、跨多个模型家族比较外壳效应的地方。
⚠️ 稳定性提示 —— Kimi K2.6 智能体在本医疗病例上首轮拒答。 下文三次 WorkBuddy 智能体运行中,有一次需要重新提问:模型首轮返回"该话题目前超出我的能力范围,我无法继续讨论。",第二次才给出答案。这与 DeepSeek V4 Pro 在智能体内表现出的拒答模式相同(V3 中已记录)——说明它并非某一个模型家族独有。对真实临床部署而言,这一点比 9 分的分数差异更重要:一个偶尔在首轮拒答医疗问题的模型,比一个稳定作答、由临床医生自行筛选的模型更难嵌入工作流。下面的实际回答都是正确的,但这一失败模式先行标出,以免读者在后文才被它意外。

单模型外壳对照实验

直到第 3 篇,本系列一直在同时回答两个问题:"选哪个模型?""选哪套外壳?"。《智能体 vs 网页版隔离实验》那篇试图通过让多个模型跑同一套外壳(WorkBuddy)、少数几个跑两套外壳来拆解二者。但把这两个变量混在一起,仍然留有混杂的空间。

第 4 篇收紧了实验设计。一个模型。两套外壳。同一病例、同一提示词、各跑 3 次。这是可能做到的最干净的外壳效应测试,它只回答一个尖锐的问题:WorkBuddy 智能体是否改变了 Kimi K2.6 说的话?改变了多少?

纳入什么 —— 排除什么

按本版规则,只有同时存在网页界面与智能体外壳的模型才计分。具体而言:

方法学

第 3 篇完全一致。同一份脱敏病例报告图片(那例术后乳腺癌病例)、同一句提示词 "Next therapy ?",在 Kimi 网页版(标准思考模式)独立跑 3 次,在 WorkBuddy 智能体独立跑 3 次。评分规则保持一致:正确 + 引用具体指南章节 = 满分;正确但未引用(或只说出指南名称)= 半分;错误或缺失 = 0

本文按 V3 使用的 2026 CBCS / CSCO 2024 / NCCN 2025 共识对同样的 10 个决策点评分,权重合计 100。

病例

与第 1、2、3 篇相同的脱敏术后乳腺癌病例:

参考答案(2026 CBCS / CSCO 2024 / NCCN 2025)

Kimi K2.6 —— 网页版(Kimi 快速,标准思考模式),3 次

在 kimi.moonshot.cn / Kimi 快速模式并开启标准思考的条件下,用同一张病例图片和同一句 "Next therapy ?" 提示词,独立跑了 3 次 Kimi K2.6。尽管源病例与操作者都是中文的,三次回答全部用英文——这一语言选择本身就值得标出(V3 中 Kimi K3 在 WorkBuddy 里的回答是中文)。

第 1 次 —— 浸润灶读对了,分期错了,未提及 LVI/PNI

读片。病例复述正确(年龄、术式、0.6 cm 整体病灶、三处"foci of stromal invasion (0.05cm, 0.06cm, 0.2cm)"(间质浸润灶)——这是三处病灶的正确归类,而且是模型主动使用的)。但随后它把报告里 "TisN0M0(0 期)" 那行小结直接当作分期接受——既没有标记其为转录错误,也没有把最大浸润灶(2 mm)换算为 pT1a。这正是 V3 中记录的、Grok(3/3)与 DeepSeek V4 Flash(部分,2/3)踩过的同一个陷阱;Kimi K2.6 这一次也踩了进去。

内分泌。对绝经后患者正确选择芳香化酶抑制剂作为一线(来曲唑 / 阿那曲唑 / 依西美坦,5 年)。他莫昔芬作为备选列出——表述框架正确。

正确之处。Luminal A 样分型;不化疗(并给出理由——肿瘤极小、低级别、ER/PR 强阳、HER2 阴性、Ki-67 低、淋巴结阴性;提到 Oncotype DX 作为可选);不放疗(并给出标准——肿瘤 ≤ 5 cm、切缘阴性、阳性淋巴结 ≤ 3 枚);指出 HER2 = 0(隐含抗 HER2 的结论,但未明说)。骨健康:"基线 DEXA 骨密度 + 钙剂 / 维生素 D 补充"——只有监测,没有药物。

错误或缺失。分期:写成 TisN0M0 而非 pT1aN0M0 IA。脉管侵犯与神经侵犯:完全未提(报告明确写有"未见明确脉管瘤栓及神经侵犯",临床医生需要模型把这点主动点出来告知患者)。内分泌疗程:只写 5 年,未讨论延长。指南引用:无。

第 2 次 —— 三次中最强的一次

读片。同一病例,但这次走得更远。病理表格明确写出 "Lymphovascular invasion: None identified"(未见脉管侵犯)"Perineural invasion: None identified"(未见神经侵犯)——两者都正确。随后分期那一行直接指出了矛盾"TisN0M0(0 期)—— 注意:这看起来是编码问题;既然存在 0.6 cm 的浸润成分,它很可能应为 pT1aN0M0,IA 期。"这与 V3 中 GLM 5.2 在同一病例上做出的判断属于同一类(识破报告里错误的"0 期"那行,并用测量值推翻它)。Kimi K2.6 三次里只有这一次做到了。

内分泌。芳香化酶抑制剂至少 5 年,并"对高风险患者考虑延长至 7–10 年"——明确讨论了延长。若 AI 不耐受,则以他莫昔芬替代。正确。

正确之处。Luminal A 样;不化疗(并以"绝对获益极小(<1-2%)"作为论证);不做 PMRT(全切 + 切缘阴性 + 低风险);不用抗 HER2(明确 HER2 = 0);双膦酸盐讨论:"对使用 AI 的绝经后女性,可考虑唑来膦酸或口服双膦酸盐以保护骨健康并可能降低远处复发"。DEXA + 钙 + 维生素 D。

较弱之处。在患者小结表里把 0.6 cm 标注为"(最大浸润灶)"——略欠精确(0.6 cm 是包含 DCIS 的整体病灶,而最大浸润灶是 2 mm)。分析中没有明确把三处病灶重新标注为"间质浸润"——模型否认了 LVI/PNI,却没有正面说明这些病灶究竟是什么。未引用任何具体指南章节。

第 3 次 —— 读片不完整,方案偏保守

读片。三次中病理表格最详细的一次——包含 EGFR、E-cadherin、P53 野生型——并正确列出"Lymphovascular invasion: None""Perineural invasion: None"。但分期在表里仍停留在"pTisN0M0(0 期)",并附了一句含糊其辞的注释:"这看起来主要是伴微浸润的 DCIS" / "TisN0M0 提示治疗组把它视为伴微浸润的 DCIS,而非真正的浸润性癌。"模型接着反问究竟应算 T1mi(DCIS 伴微浸润)还是真正的浸润性癌,却不做结论。这比第 1 次的读片更谨慎,但仍未走到测量值实际支持的 pT1aN0M0 IA 这个答案。

内分泌。芳香化酶抑制剂一线(来曲唑 / 阿那曲唑 / 依西美坦),他莫昔芬备选,"通常 5 年,高危病例可延长至 7–10 年,不过该患者风险似乎较低"——正确。

正确之处。Luminal A 样;不化疗(表述为"化疗无作用",理由是微浸润灶 + ER+/HER2− + Ki-67 低 + 淋巴结阴性——接近正确,但"微浸润灶"这一措辞用得比较随意);不做 PMRT;不用抗 HER2(明确);随访表中简要提及骨密度。

错误或缺失。分期:只做含糊表述而不下结论;患者会带着对自身疾病的错误印象离开。双膦酸盐:只有监测,没有药物。未引用任何具体指南章节。

Kimi K2.6 网页版三次运行说明了什么

16 项评分表 —— Kimi K2.6(网页版,标准思考)

项目(满分)第 1 次第 2 次第 3 次
1. 分期正确:pT1aN0M0 IA(10)0(TisN0M0 / 0 期 —— 错误)5(正确,识破陷阱)2(含糊;未下结论)
2. 识别 Luminal A 分型(8)444
3. AI 作为一线内分泌治疗(12)666
4. AI 疗程 ≥ 5 年,并讨论延长(10)3(仅 5 年)5(至少 5 年,考虑 7–10 年)5(5 年,高危 7–10 年)
5. 不化疗 / 说明理由(10)555
6. T1–2N0 全切后不做 PMRT(10)555
7. 不用抗 HER2(HER2 0)(8)4(指出 HER2 = 0,未明示不用抗 HER2)4(明确:"曲妥珠单抗无获益")4(明确:"无曲妥珠单抗指征")
8. 绝经后使用 AI 的骨保护(10)3(DEXA + 钙 + 维 D,无药物)5(唑来膦酸 / 口服双膦酸盐可考虑)3(仅监测)
9. 3 处病灶正确归类为间质浸润而脉管侵犯(10)5("3 foci of stromal invasion" —— 明确)3(LVI/PNI 为无,未标注间质浸润)3(LVI/PNI 为无,未标注间质浸润)
10. 引用具体指南章节 / 页码(12)000
合计(100)354237
中位数37 / 100

评分约定:正确 + 引用具体指南章节 = 满分;正确但未引用(或只说出指南名称)= 半分;错误或缺失 = 0。与第 1、2、3 篇规则相同。

Kimi K2.6 —— WorkBuddy 智能体,3 次

在 WorkBuddy 智能体内,用同一张病例图片、同一句 "Next therapy ?" 提示词,独立跑了 3 次 Kimi K2.6。三次中有两次输出中文,第一次输出英文。参见文首的稳定性提示:那次英文运行首轮即通过,但另有一次探索性测试被拒答、需要重新提问后才作答——那次探索性拒答是稳定性提示的来源,不计入本文三次计分运行。

第 1 次(智能体)—— 完整英文回答,分期正确,多药方案

读片。开篇即写:"分期:pT1N0M0(IA 期)—— 注意:病历记录为 'TisN0M0(0期)',但病理描述了浸润灶(0.05–0.2 cm),因此这属于微浸润或小浸润性癌,而非单纯 DCIS。"这是 Kimi K2.6 全部六次运行(网页 + 智能体)中对分期陷阱最干净的一次识破——模型首轮就更正了病历并明确给出 pT1N0M0 IA。组织学那行、ER/PR/HER2/Ki-67 那行,以及 LVI/PNI("阴性"——即无脉管侵犯、无神经侵犯)都正确。

内分泌。AI 一线,疗程 5–10 年,三种 AI 药物全部列出(阿那曲唑 / 来曲唑 / 依西美坦)。指出若已在服他莫昔芬,2–3 年后换用 AI 有 SOFT/TEXT 与 ABCSG 12 支持——这与网页版一样属于列举研究名称,而非引用指南章节。骨:钙 + 维生素 D + 基线 DEXA + 复查(无双膦酸盐药物)。未引用具体指南章节。

正确之处。分期:明确给出 pT1N0M0 IA(满分——这是六次 Kimi K2.6 运行中唯一一次毫不含糊地给出结论)。Luminal A 样;不化疗(Oncotype RS 论证,援引 TAILORx / MINDACT 标准);不做 PMRT(全切 + T1N0 + 切缘阴性 + 无脉管侵犯);不用抗 HER2(指出 HER2 0)。

较弱之处。三处病灶只被顺带描述为"3 处独立浸润灶(0.05、0.06、0.2 cm)"并加了个模糊说明:"如果这些是多灶性浸润性癌而非单一浸润灶伴微浸润,技术上分期可能是 T1……但不改变低危的全身治疗推荐。"这在精神上是正确的(病灶 = 浸润,而非脉管侵犯),但它没有正面使用"间质""基质"这一术语,而且这种表述把 T1a 与 T1b 略微混淆了。未提及双膦酸盐(仅监测)。未引用具体指南章节——只有研究名称。

第 2 次(智能体)—— 中文回答,覆盖全面

读片。病理表格详细且正确:"肿物最大径 0.6 cm,可见 3 簇微小间质浸润 (0.05–0.2 cm)"——明确使用了间质浸润这一准确归类。切缘、前哨淋巴结 0/2 + 1 枚阴性、免疫组化均正确。但分期被表述为"记录为 TisN0M0 (0期),但存在微小浸润灶,临床应按极低危/低危早期浸润性癌处理"——模型把分期那行标记为记录问题,却没有正式给出 pT1aN0M0 IA 的结论。这与 V3 中 Kimi K3 网页版(它给出了结论)和 Grok(它没有)所见的含糊模式属于同一类。

内分泌。AI 一线(来曲唑 / 阿那曲唑 / 依西美坦)标准 5 年,按现行 NCCN/CSCO 可延长至 10 年。若绝经状态未确认,则查 FSH/E2。不化疗,不做 PMRT(单纯乳房切除 T1–2N0M0)。骨:基线 + 每年 DEXA,钙 + 维生素 D;对使用 AI 的绝经后低危患者,按部分指南可考虑唑来膦酸 4 mg 静滴 q6m × 3 年——点出了双膦酸盐的药名,这比网页版三次都做得多。不用抗 HER2(HER2 0)。

正确之处。Luminal A("极低危 Luminal A");不化疗(Ki-67 5%);不做 PMRT;不用抗 HER2;骨保护含双膦酸盐选项;LVI/PNI 虽未单列一行,但通篇不提脉管侵犯与报告一致。

较弱之处。分期:含糊("极低危/低危")——未正式给出 pT1aN0M0 IA。指南引用:点名 NCCN/CSCO 但无具体章节。三处病灶被描述为"微小间质浸润",归类完全正确——这一项给满分。

第 3 次(智能体)—— 中文回答,Kimi K2.6 全套运行中引用最具体的一次

读片。病理表格写着"浸润灶:0.6 cm (T1b),伴 3 个微小导管内浸润灶 (0.05/0.06/0.02 cm)"——注意第三处病灶被误读为 0.02 cm 而非 0.2 cm(小数点差一位),而且模型把 0.6 cm 当成了浸润灶、把三处病灶称为"导管内浸润"——相较报告两处都不精确(0.6 cm 是含 DCIS 的整体病灶,三处病灶是基质 / 间质浸润,而非导管内)。切缘、前哨淋巴结、免疫组化均正确;LVI/PNI:"未见明确侵犯"(正确)。分期随后给出了结论:"TisN0M0 (0期) … 最终分期应为 T1bN0M0(IA 期),建议核对病历系统中的最终病理分期录入"——明确建议在系统中重新录入分期。

内分泌。AI 一线,三种药物齐全(来曲唑 2.5 mg qd / 阿那曲唑 1 mg qd / 依西美坦 25 mg qd),标准 5 年并可延长至 10 年或采用序贯方案。这是 Kimi K2.6 第一次——无论网页还是智能体——引用具体指南章节的运行:"按 CSCO 2024,此类患者内分泌单药为 I 级推荐 (1A 类证据)"。不化疗(低危、T1bN0、Ki-67 5%、低级别、切缘/淋巴结阴性);不做 PMRT;不用抗 HER2(HER2 0);骨:基线 DEXA + 钙/维 D + 每 1–2 年复查 + 若出现骨量丢失则用双膦酸盐或地舒单抗。

正确之处。Luminal A("HR 强阳 / HER2 阴 / 低增殖");不化疗;不做 PMRT;不用抗 HER2;骨保护含双膦酸盐选项;LVI/PNI 为无;明确引用 CSCO 2024 + 1A 类证据。

较弱之处。分期:写作 T1bN0M0 IA —— 其中 T1b 严格来说不正确(最大浸润灶为 0.2 cm = T1a,而非 T1b),但它给出了 IA 的结论并建议更正系统录入,因此获部分分数。0.6 cm / T1b 的表述以及第三处病灶的 0.02 cm,都是读报告时的不精确。

Kimi K2.6 智能体三次运行说明了什么

16 项评分表 —— Kimi K2.6(WorkBuddy 智能体)

项目(满分)第 1 次第 2 次第 3 次
1. 分期正确:pT1aN0M0 IA(10)10(明确 pT1N0M0 IA —— 六次运行中最干净的读法)4(含糊为"极低危/低危";未给出 pT1aN0M0 IA)6(给出 IA 但误编为 T1b 而非 T1a)
2. 识别 Luminal A 分型(8)444
3. AI 作为一线内分泌治疗(12)666
4. AI 疗程 ≥ 5 年,并讨论延长(10)5(5–10 年)5(标准 5 年,按 NCCN/CSCO 可延长至 10 年)5(标准 5 年,可延至 10 年或序贯)
5. 不化疗 / 说明理由(10)5(点名 Oncotype RS / TAILORx / MINDACT)5(Ki-67 5% 论证)10(CSCO 2024 + I 级推荐 1A 类证据 —— 章节级)
6. T1–2N0 全切后不做 PMRT(10)555
7. 不用抗 HER2(HER2 0)(8)4(隐含)4(明确:Her-2 0)4(明确:HER2 0)
8. 绝经后使用 AI 的骨保护(10)3(DEXA + 钙 + 维 D,无药物)5(DEXA + 钙/维 D + 唑来膦酸选项)5(DEXA + 钙/维 D + 每 1–2 年复查 + 双膦酸盐选项)
9. 3 处病灶正确归类为间质浸润而脉管侵犯(10)4("多灶性浸润";归类不精确)5("3 簇微小间质浸润" —— 归类准确)5(称其为"微小导管内浸润" —— 不精确但仍属浸润而非脉管侵犯;LVI/PNI 为无)
10. 引用具体指南章节 / 页码(12)0(仅研究名称)0(点名 NCCN/CSCO,无章节)10("CSCO 2024 … I 级推荐 1A 类证据")
合计(100)464560
中位数46 / 100

评分约定不变:正确 + 引用具体指南章节 = 满分;正确但未引用(或只说出指南名称)= 半分;错误或缺失 = 0。

头条结果 —— 同一模型,网页版 vs 智能体

模型网页版(无智能体)WorkBuddy 智能体差值
Kimi K2.637 / 100 (Kimi 快速 / 标准思考)46 / 100 (3 次:46 / 45 / 60)(已废止)

按中位数计,外壳效应为(已废止)。这个头条数字很小,与 V3 的规律一致:智能体外壳抬的是下限,不是上限。

稳定性提示(再次强调)。智能体曾在一次探索性测试中首轮拒答,第二次提问才作答——见文首那条提示。此处计分的三次运行都未发生拒答;那次拒答是一次独立的探索性事件,但仍是与部署相关的信号。V3 中记录的 DeepSeek V4 Pro 智能体也有同样模式。

跨外壳证据 —— V3 已经确立的部分

V3 让两个模型在同一病例上跑过网页界面与 WorkBuddy 智能体。这些差值是本系列迄今唯一完全干净的同模型外壳证据:

模型网页版(无智能体)WorkBuddy 智能体Δ
智谱 GLM 5.25 / 100 (第 2 篇标准)75.6 / 100 (第 3 篇标准)(已废止 — 见 /unified-scoring-v1-v5)
DeepSeek V4 Flash / 网页快速档28 / 100 (第 2 篇标准)68.9 / 100 (第 3 篇标准)(已废止)
Kimi K2.637 / 100 (第 3 篇标准,本文)46 / 100 (3 次:46 / 45 / 60,本文)(已废止)
这张三模型网格现在说明了什么。GLM 5.2 在没有脚手架时崩溃,被外壳包裹后提升了(已废止 — 见 /unified-scoring-v1-v5)。DeepSeek 的快速档在网页上本已胜任,只提升了(已废止)。Kimi K2.6 网页版(37)居中;被外壳包裹后的提升为(已废止)——更接近 V4 Flash(已废止)而非 GLM(已废止 — 见 /unified-scoring-v1-v5)。V3 用两个数据点得出的规律("智能体提下限、不抬上限"),在第三个数据点上依然干净地成立:网页基线越高,外壳效应越小。Kimi K2.6 是本系列中第一个由外壳在某次运行中带来具体指南章节引用的模型(CSCO 2024 I 级推荐 1A 类证据)——这是单一条目上小幅抬升了上限,而非结构性提升。

外壳究竟在哪些地方帮到了 Kimi K2.6

项目(网页 → 智能体,中位)网页中位(R1 35、R2 42、R3 37)智能体中位(R1 46、R2 45、R3 60)Δ
1. 分期 pT1aN0M0 IA(10)26+4
5. 不化疗(10)550
8. 骨保护(10)35+2
9. 间质浸润归类(10)35+2
10. 具体指南章节(12)000 (R3 = 10,中位被 R1/R2 = 0 拉低)

单项最大提升在分期(中位 +4)—— 智能体有一半的时候给出了 pT1N0M0 IA 的结论,而网页版多半没有。骨保护(+2)反映的是智能体 2/3 提到双膦酸盐而网页 1/3。间质浸润归类(+2)反映的是智能体 2/3 明确使用间质浸润而网页 1/3。第 10 项的中位数 0 具有欺骗性,但它的最高分是 10——这是本文最重要的一个观察:智能体外壳能够带出章节级引用,但只是偶尔,而在本病例上只有智能体的 R3 做到了。

V4.2 仍待解决(计划中的下次更新)

结论 —— V4(单模型外壳实验 + 3 模型跨外壳网格)

V4 现在确立了什么

V4 仍然无法断言什么

一句话结论: 同一份病例、同一句 "Next therapy?",V4 在同一个模型 Kimi K2.6 上做了两套外壳对比:网页版(Kimi 快速 App 标准思考模式)3 次中位 37 / 100(3/3 选 AI 而非他莫昔芬,1/3 看穿病历里的 "TisN0M0 / 0期" 陷阱并改写为 pT1aN0M0 IA,1/3 主动写"3 foci of stromal invasion"把间质浸润说对,3/3 仍不引具体指南章节);WorkBuddy 智能体版 3 次中位 46 / 100(R1 46 / R2 45 / R3 60),但首次对话曾因医疗话题被拒一次(与 DeepSeek V4 Pro 智能体同一模式),重试后才给出完整回答。Δ = (已废止),与 V3 两组对照形成完整曲线:GLM 5.2(已废止 — 见 /unified-scoring-v1-v5)、DeepSeek V4 Flash(已废止)、Kimi K2.6(已废止)—— 网页基线越高,智能体加持越小,"提下限不抬上限"被第三次验证。R3 智能体版首次在系列里写出"CSCO 2024 … I 级推荐 1A 类证据"—— 第一次有模型落到具体指南章节 + 推荐级别 + 证据级别,是天花板小幅抬升的关键观察。

智能体外壳真正帮了 Kimi K2.6 的三处:①分期:智能体半程承诺 pT1N0M0 IA,网页半程多半没承诺(R1 智能体是 6 次 Kimi K2.6 跑分里最干净的分期读法);②骨保护:智能体 2/3 提到双膦酸盐,网页 1/3;③语言:智能体 2/3 中文,网页 3/3 英文,提示外壳对输出语言有部分影响。三项都是抛光,不是结构提升。

稳定性是被低估的变量:Kimi K2.6 智能体在一次探索性测试中首次拒绝医疗问题,需重试才回答,与 V3 记录的 DeepSeek V4 Pro 智能体同模式。对于真实临床部署,这一信号比(已废止)分中位数差异更重要—— 一个偶发拒答的模型,是与永远回答让医生自己过滤的模型完全不同的部署命题。建议 V4.2 做 n=20 同提示词测试,分别数 Kimi K2.6 / DeepSeek V4 Pro / GLM 5.2 / DeepSeek V4 Flash 智能体的拒答率。

V4 与 V3 的差别:V3 同时跑多个模型在同一外壳下,结论是"模型比外壳重要";V4 只跑一个模型在两套外壳下,得到具体数字 Δ=(已废止),并整合 3 模型 wrapper 曲线证明"外壳越用越边际"——网页已经 37 分的模型,外壳再加 9 就到顶了,不会复现 GLM 的(已废止 — 见 /unified-scoring-v1-v5)。

本页不含的测试:Grok 4.5 fast(只有 X.com 网页版,没有智能体版)、Kimi K3(只有智能体版跑过,网页版没跑)、DeepSeek V4 Pro(网页免费版不能上传图片,所以本病例跑不了)。这三类被规则明确排除——"只针对有网页版和智能体版的模型"。
⚠️ 医疗免责声明。 本文是一篇 LLM 工具对比评测,不构成医疗建议,模型输出绝不可用于真实患者决策。病例已脱敏,仅用于演示测试方法。

常见问题

如果智能体的数据还没跑完,为什么现在就发布网页版数据?

因为网页数据是基线,而 V4 的系列规则是"只纳入两套外壳都有的模型"——这意味着文章的头条(Δ = 智能体 − 网页)在智能体运行落地前无法计算,但这个计算里属于基线的那一半,一旦存在就可以也应该发布。网页版的运行今天就能在 kimi.moonshot.cn 上复现;把它们藏到智能体数据齐备为止,对任何读者都没有价值。待定的章节都已清楚标注,智能体运行完成后文章会就地更新。

V3 里已经有 Kimi K3 了,为什么还要纳入 Kimi K2.6?

因为外壳效应测试需要同一个模型出现在两套外壳里。V3 的 Kimi K3 只在 WorkBuddy 智能体里测过——本病例没有 Kimi K3 的网页版回答,因此 K3 / 智能体这一组合的外壳效应无法隔离。Kimi K2.6 是 Moonshot 在 Kimi 快速网页界面上开放的版本;在两套外壳里测 K2.6,即便它与智能体所测的 K3 是不同版本,也能得到一次干净的单模型对比。两次 Kimi 测试合在一起是有信息量的,尽管它们不能直接互相比较。

为什么 Kimi K2.6(网页版)不像 Kimi K3(智能体版)那样用中文回答?

这正是智能体运行有助于回答的开放问题之一。可能的解释包括:(a) Kimi 快速被配置为默认英文;(b) 智能体的系统提示词明确要求中文输出;(c) 模型行为在网页与智能体两个界面之间发生漂移。在智能体运行完成计分前,我们无法知道哪一个占主导——如果智能体运行用中文回答,那么杠杆在外壳;如果它们仍然用英文回答,那么杠杆在模型本身。

WorkBuddy 智能体外壳对 Kimi K2.6 的提升,能像它提升 GLM 5.2 那样吗?

未知——这正是 V4 要产出的头条答案。Kimi K2.6 网页版(37)离 DeepSeek 快速档网页版(28)比离 GLM 5.2 网页版(5)近得多。如果外壳效应与模型距离其上限的差距成比例,那么 Kimi K2.6 的预期 Δ 就是有限的——大约介于 V4 Flash 的(已废止)与一个宽松上界之间。但唯一诚实的答案是那三次智能体运行,而它们还在进行中。

我能自己复现吗?

能——网页那一半可以。打开 kimi.moonshot.cn(或 Kimi 快速手机 App),把模式设为标准思考,粘贴同一张脱敏病例报告图片,输入 "Next therapy ?",你就能在这个完全相同的病例上得到 Kimi K2.6 的网页版回答。对照上文 2026 CBCS 参考答案评分,你就有了自己的数字。智能体那一半需要 WorkBuddy 账号。把你的结果发给我,我会在临床 LLM 基准数据附录里加一个社区复现者板块。

这是计划中的 5 篇原创实测 / Hands-on Review系列第 4 篇——真实、署名、可复现的 AI 工具实测,皆为我临床与科研中真在用的工具。V1、V2、V3 及计划中的第 5 篇见完整模型实测索引。本页现已包含 Kimi K2.6 外壳测试的两个半场(网页 + 智能体,共六次运行)以及三模型跨外壳网格。下次计划更新:V4.2 —— 增加智能体运行次数以夯实(已废止)这一差值,并对 Kimi K2.6 / DeepSeek V4 Pro / GLM 5.2 / DeepSeek V4 Flash 智能体做一次正式的 n = 20 同提示词拒答率测试。

📬 Subscribe — clinical LLM testing, no spam

Get new hands-on model reviews and benchmark updates by email. Free, roughly monthly, unsubscribe anytime.

Powered by Buttondown. Subscribe to get new clinical-LLM benchmark write-ups by email.