AIGC标识 中医竟是AI Harness祖师爷?

背景:

  1. 最近一直在看中医/喝中药补身体,医生每2周去看一次,诊脉看舌苔问诊后再微调中药配比和成分。感觉这个流程很有意思。
  2. 今天在学习 AI Harness:《
    Why The Harness Matters More Than The Model | YC Paper Club》
  3. 突然灵光乍现,感觉这两者有点交集,便问了 AI 好几个问题。以下是 AI 自己根据它自己的回答总结的技术文章。
    背景完。

一句话总结
传统软件工程处理的是可规定、可复现、可验证的确定性逻辑;现代 AI 处理的是从数据中归纳出来的概率性泛化。中医辨证论治,与 AI 有结构上的相似:知识不是明文规则,而是隐式经验模式;输出不是逻辑必然,而是条件分布下的高概率选择。AI Harness 最该学的,不是让模型变确定,而是用确定性外壳包住概率内核,把方差和尾部风险压到可接受范围。


0. 摘要

本文整理一次关于“AI 与传统软件工程最大区别”的讨论,并延伸到中医与 AI Harness 的类比。

核心脉络如下:

  1. AI 与传统软件工程的最大区别:传统软件追求规格、代码、执行、验证的确定性闭环;AI 是数据、训练、权重、概率生成。
  2. 中医是“概率性泛化”的典型传统体系:辨证论治、方证相应、针灸配穴,都是从大量经验样本中归纳隐式模式,再对新情境做情境化判断。
  3. 中医用一套经验工程控制风险:强先验、辨证纲领、四诊合参、安全禁忌、三因制宜、复诊反馈、师承会诊、药材炮制、制度监管、现代循证。
  4. 这些手段几乎可以一一映射到 AI Harness:版本化政策包、任务路由、规则引擎、RAG、多源证据、沙箱、审批、回滚、监控、拒答转人工、案例回流。
  5. 成熟度不均:提示、路由、RAG、护栏、微调、监控、转人工已较广泛;但版本化与 eval 门禁联动、风险分层硬约束、多源证据仲裁、工具事务回滚、OOD 校准拒答、在线闭环案例回流仍不成熟。
  6. 后续优先级:先压尾部风险,再提上限。优先做版本化 + eval 门禁、风险路由 + 硬规则、工具沙箱 + 审批 + 回滚、证据分级 + 冲突仲裁 + 校准、OOD 拒答 + 转人工 + 案例回流。

1. 起点:AI 与传统软件工程的最大区别

传统软件工程的核心链路是:

规格 → 代码 → 执行 → 验证

你写下规则,系统按规则运行。相同输入、相同状态,原则上应得到相同输出。Bug 可以被定位到某一行代码、某个状态、某个依赖;正确性可以用单元测试、契约、形式化验证来逼近“布尔式”的保证。

现代 AI,尤其是大模型,核心链路是:

数据 → 训练 → 权重 → 概率生成

它没有把“如果 A 则 B”的规则显式写出来,而是把统计规律压进参数里。它的输出不是逻辑推导的结果,而是对“最可能合适答案”的采样。

因此:

  • 同一问题换个说法,答案可能变;
  • 同一输入,因采样设置不同,输出可能变;
  • 错误不是“某一行写错了”,而可能是数据偏差、分布偏移、提示敏感、幻觉;
  • 正确性很难用“满足/不满足规格”判断,只能用评估集、指标、人类反馈、线上监控来统计性判断。

所以,最大区别不是“AI 会不会犯错”,而是“正确性是否可以被确定性地规定和复现”。

传统软件工程追求的是:在明确边界内,行为可预测、可审计、可验证。
AI 工程追求的是:在开放分布中,行为统计上可用、可评估、可对齐、可监控。

工程方法也因此不同:

维度 传统软件 AI 系统
核心资产 代码、规格、架构 数据、权重、提示、上下文
正确性 布尔式、可证明 统计式、可评估
复现性 弱,受采样与分布影响
错误定位 行级、状态级 数据、分布、提示、模型、工具链
工程重点 测试、契约、版本 评估、对齐、监控、回滚

传统软件更像“造一台按图纸运行的机器”;现代 AI 更像“训练一个在统计意义上表现良好的专家系统”。


2. 中医:另一种“从数据中归纳出来的概率性泛化”

如果只选一项类似,最典型的是:

中医的辨证论治体系,尤其是经方方证与针灸配穴。

2.1 为什么说它们和 AI 有结构同构

不是“中医就是 AI”,而是它们的知识形态和决策方式有结构上的相似:

层次 中医 AI
数据层 医案、脉案、舌象、本草性味 语料、标注、日志、反馈
模型层 六经、脏腑、经络、方证、药证 权重、隐层表示、概率分布
输出层 同病异治、异病同治、随证治之 条件生成、采样、多候选
验证层 复诊、反馈、调整 评估集、指标、在线监控
传承层 师承、口诀、手感、默会知识 微调、few-shot、人类反馈

中医看到一组症状、脉象、舌象、体质、节气,并不是在查一张固定表,而是在做模式识别:这组表现更像哪个“证”?这个证与哪些方、哪些穴、哪些加减法在历史上高频共现?

这很像大模型从语料中压进权重的统计关联,只不过中医的“权重”藏在师承口诀、医案类比和身体记忆里。

2.2 典型特征:同病异治、异病同治、随证治之

同一个感冒,有人用麻黄汤,有人用银翘散,有人要扶正;同一个人,夏天和冬天不同,南方和北方不同。处方不是确定性的唯一解,而是对当前情境最可能合适的方案。

针灸也一样:同一种病,取穴、补泻、时辰、得气反应都可能不同。

这非常像概率生成:输出不是逻辑必然,而是条件分布下的高概率选择。

2.3 区别也要说清

AI 靠数学优化和大规模算力;中医靠身体感官、师徒传承和文化语境。中医并不“保证”优质结果,也没有现代统计学意义上的校准。误诊、误治、药害、“坏病”始终存在。

所以,更准确的说法是:

中医是一套前现代的经验工程,用强先验、结构化辨证、安全禁忌、反馈复诊和制度监管,把概率性泛化的方差和尾部风险尽量压小。


3. 中医如何控制概率泛化的质量与风险

中医并不保证每次高分,但它试图避免最坏结果,并在反馈中不断修正。具体手段可以分十层。

3.1 强先验与经典约束:相当于基座模型加版本管理

《黄帝内经》《伤寒论》《金匮要略》《神农本草经》《本草纲目》等,构成了一套强先验。后世注疏、校勘、医案,类似不断更新的训练语料和版本修订。

尤其是“方证相应”“有是证用是方”,把很多决策压成较硬的对应关系,减少随意泛化。

3.2 辨证纲领:相当于降维、正则化和隐变量

八纲辨证、六经辨证、脏腑辨证、卫气营血、三焦辨证,把高维、嘈杂的症状映射到低维“证型”。

这既像特征工程,也像正则化:防止一两个症状就过度推断。证型不是确定规则,但它让泛化有框架、有边界。

3.3 四诊合参与置信度加权:相当于多模态融合

望闻问切、十问歌,要求多源信息互证,不能单凭一脉一舌。遇到矛盾时,有“舍脉从证”“舍证从脉”等权衡原则,类似不同模态的置信度加权。

目的是降低单点噪声导致的误判。

3.4 方证相应:相当于规则引擎与约束解码

有是证,用是方。关键动作必须满足硬规则。比如麻黄汤证要求无汗、脉浮紧,若汗出脉弱则禁用,防止误汗。

这类似输出 JSON schema、grammar、前置条件检查。

3.5 安全护栏与禁忌:相当于约束解码和拒绝采样

十八反、十九畏、妊娠禁忌、毒性药炮制、先煎久煎、剂量法度、中病即止、得下即止,都是硬约束。

大承气汤“得下即止”,类似 early stopping。这些手段不保证最优,但优先避免灾难性错误。

3.6 三因制宜:相当于条件生成

因时、因地、因人,强调同病异治。它承认输出不是全局唯一解,而是条件分布下的情境解。

这能提高个体适配度,但也要求医生对上下文有准确判断。

3.7 复诊与随证治之:相当于在线学习和反馈闭环

《伤寒论》讲“观其脉证,知犯何逆,随证治之”,这是典型的纠错机制。还有“效不更方,无效更方”、小剂量试服、试探性治疗、复诊调方。

中医把一次处方看作一次带反馈的干预,而不是一锤定音。

3.8 师承、医案、会诊:相当于微调、人类反馈和集成投票

师带徒是典型的默会知识传递,类似领域微调。医案记录成败,类似带标注的经验数据。会诊、病案讨论、流派互参,类似多模型集成,降低单个医生“模型”的偏差。

但医案也有发表偏倚和幸存者偏差。

3.9 道地药材与炮制规范:相当于数据治理和输入标准化

“橘生淮南则为橘,生于淮北则为枳。”产地、采收、炮制、煎服法,都会改变药性。

道地药材、如法炮制、药典规范,是在控制输入分布,减少数据漂移。没有这一层,再好的辨证也会被劣质药材拖垮。

3.10 制度与伦理:相当于监管和准入

行医资格、药肆管理、药典、师承考试、医案考核,以及“六不治”等拒治原则,都是制度性护栏。

危重症转诊、不治已病治未病,类似分诊和拒答机制。

3.11 现代补强:循证医学、RCT、真实世界研究、药物警戒、AI 辅助

传统中医的这些手段,能提高稳定性和安全性,但不能像形式化验证那样给出确定性保证。

所以现代中医必须加上随机对照试验、Meta 分析、真实世界数据、毒理与药物警戒、标准化电子病历,以及 AI 辅助决策和监控。


4. 映射到 AI Harness:确定性外壳包裹概率内核

4.1 什么是 AI Harness

本文讨论的 AI Harness 取广义:

围绕模型的运行、评估、反馈、治理脚手架:提示与策略、工具调用、状态机、护栏、评估集、监控、回滚、审计。

核心原则一句话:

用确定性外壳,包裹概率性内核。

中医的“辨证论治”是概率内核;禁忌、炮制、复诊、师承、药典、制度是确定性外壳。AI Harness 也该这么干。

4.2 一一映射表

中医手段 AI Harness 对应 具体怎么做
经典先验、版本注疏 系统提示、政策包、模型/数据版本 把 system prompt、工具 schema、安全策略、知识库版本化;变更必须过 eval 门禁,可回滚
八纲、六经、脏腑辨证 任务路由、状态机、本体 先分类意图、领域、风险等级,再选模型、提示、工具和流程;高风险走慢路径
方证相应 规则引擎、约束解码 输出 JSON schema、grammar、前置条件;关键动作必须满足硬规则
四诊合参 多源证据融合、RAG 用户输入、检索、工具结果、记忆都带来源和置信度;冲突时按权威、时效、投票解决;强制引用
十八反、十九畏、妊娠禁忌 安全护栏、权限控制 工具白名单、最小权限、沙箱、禁止组合、预算、超时、最大步数、kill switch
三因制宜 上下文条件化 注入用户画像、地域、时间、合规区域;个性化但受策略约束
复诊、随证治之 在线反馈闭环 执行后验证,失败重试、换策略、回滚;A/B、监控、告警
师承、医案、会诊 微调、案例库、多智能体 few-shot、LoRA、专家反馈、相似案例检索;高风险用多模型投票/辩论/仲裁
道地药材、炮制 数据治理、预处理 权威源、时效、去重、清洗、脱敏、格式规范化、嵌入模型版本管理
药典、行医资格 治理、审计、合规 日志、trace、审计、准入评估、责任链、SLO、模型卡、数据卡
六不治 拒答、转人工 低置信度、分布外、高风险、超出能力时转人工或拒绝
现代补强 统计评估、红队、形式化验证 eval harness、回归门禁、校准、OOD 检测、红队、关键路径形式化验证

4.3 具体架构流水线

可以做成这样一条流水线:

  1. 入口层:输入规范化、脱敏、意图分类、风险评分。
  2. 路由层:按任务类型和风险选模型、提示、工具、检索源。
  3. 上下文层:RAG 检索、工具查询、记忆注入;每条证据带来源、时间、置信度。
  4. 推理层:生成计划、多候选答案、自检;高风险任务多模型投票或辩论。
  5. 约束层:schema 验证、规则引擎、权限检查、约束解码。
  6. 执行层:工具沙箱、dry-run、审批、事务、幂等、超时、回滚。
  7. 验证层:事实核查、引用检查、单元测试、模拟执行、输出过滤。
  8. 反馈层:日志、指标、用户反馈、在线评估、案例入库、定期微调。
  9. 治理层:版本管理、审计、合规、SLO、灰度、回滚、责任链。

4.4 例子:退款 Agent

  • 入口:识别“退款”意图,风险中高。
  • 路由:走退款专用提示和工具。
  • 上下文:检索退款政策、订单历史。
  • 推理:模型生成退款方案。
  • 约束:规则引擎检查订单存在、金额≤原额、时间窗口、用户权限。
  • 执行:沙箱 dry-run,高风险转人工审批,再真实调用支付工具。
  • 验证:确认退款成功、金额正确、日志完整。
  • 反馈:失败则回滚或重试;案例入 eval 集;监控退款异常率。

这其实就是中医的“辨证—方证—禁忌—复诊”结构。


5. 成熟度盘点:哪些已经用了,哪些没有

以下按头部生产系统与一般团队的成熟度判断。很多手段是“有,但很浅”。

5.1 已经广泛应用或部分广泛应用的

中医手段 AI Harness 对应 成熟度
经典先验、版本注疏 system prompt、模型、知识库、工具 schema 版本化 头部广泛,小团队弱
八纲/六经辨证 意图分类、任务路由、状态机、Agent 框架 广泛
方证相应 JSON schema、function calling、约束解码、规则引擎 广泛
四诊合参 RAG、多源检索、引用来源 广泛,但冲突仲裁弱
十八反、妊娠禁忌 内容过滤、权限、沙箱、工具白名单 广泛
三因制宜 用户画像、地域、时间、合规上下文注入 广泛但粗糙
复诊、随证治之 日志、监控、A/B、重试 部分广泛,自动回滚少
师承、医案、会诊 few-shot、微调、案例库 广泛;多智能体辩论生产少
道地药材、炮制 数据清洗、去重、脱敏、格式规范 广泛但质量参差
药典、行医资格 审计、合规、模型卡 头部广泛,小团队少
六不治 拒答、转人工 广泛
现代补强 离线 eval、红队 头部广泛,形式化验证少

一句话:“提示、路由、RAG、护栏、微调、监控、转人工”已经广泛;但把它们串成严格闭环和门禁的很少。

5.2 还没有广泛应用或很不成熟的

  1. 版本化政策包 + eval 门禁联动:很多团队改 prompt、换模型、换知识库不上回归测试,也不强制灰度回滚。
  2. 风险分层路由 + 硬规则全覆盖:有意图分类,但高风险任务没有强制走慢路径、规则引擎和人工审批。
  3. 多源证据的权威分级、时效加权、冲突仲裁、置信度校准:RAG 有引用,但来源谁更权威、冲突时听谁、置信度是否校准,普遍弱。
  4. 工具组合安全、dry-run、事务回滚:单工具权限有,多工具组合风险、预执行、幂等、回滚不系统。
  5. OOD 检测与校准驱动的拒答转人工:拒答有,但很多靠关键词或阈值,不是校准后的分布外检测。
  6. 在线闭环自动诊断、策略切换、案例回流:监控有,自动定位失败、换策略、回滚、把失败案例回流到 eval/训练集,少。
  7. 多模型集成/辩论/仲裁用于高风险:研究多,生产少。
  8. 数据漂移、嵌入模型版本、输入分布监控:数据治理有,但漂移监控和版本联动不普遍。
  9. 因果评估、真实世界研究、药物警戒式线上安全监控:A/B 有,因果推断和长期安全信号少。
  10. 责任链、审计、模型卡/数据卡标准化:大厂有,行业不统一。
  11. 关键路径形式化验证:几乎只在金融、航天等少数领域。

6. 后续优先级:先压尾部风险,再提上限

按“先压尾部风险,再提上限”的顺序,建议如下。

P0,立刻做

  1. 版本化政策包 + eval 门禁
    所有 prompt、工具 schema、安全策略、知识库、模型版本全部版本化;变更必须过离线 eval、红队、回归测试,可灰度、可回滚。
    对应中医“经典先验 + 药典 + 版本注疏”。
  2. 风险分层路由 + 硬约束
    先判风险等级和领域,再选模型、提示、工具、流程。关键动作用传统代码、规则引擎、约束解码兜底。
    对应“辨证纲领 + 方证相应 + 禁忌”。
  3. 工具沙箱 + 审批 + 回滚
    最小权限、dry-run、事务、幂等、超时、最大步数、kill switch;高风险动作转人工。
    对应“十八反 + 复诊 + 中病即止”。

P1,紧接着做

  1. 多源证据权威分级 + 冲突仲裁 + 置信度校准
    来源分级、时效加权、强制引用、投票/仲裁、校准。
    对应“四诊合参”。
  2. OOD 检测 + 拒答转人工 + 在线监控
    低置信、分布外、高风险、超能力时转人工;监控告警。
    对应“六不治 + 复诊”。
  3. 案例回流 + 定期更新
    失败案例入 eval 集,专家标注,更新 few-shot、RAG、微调。
    对应“师承 + 医案”。

P2,中期做

  1. 多模型集成/辩论/仲裁用于高风险。对应“会诊”。
  2. 数据漂移与嵌入模型版本监控。对应“道地药材 + 炮制”。
  3. 审计责任链、模型卡、数据卡、合规。对应“药典 + 行医资格”。
  4. 关键路径形式化验证、因果评估、真实世界研究。对应“现代补强”。

如果只做五件事

  1. 版本化 + eval 门禁
  2. 风险路由 + 硬规则
  3. 工具沙箱 + 审批 + 回滚
  4. 证据分级 + 冲突仲裁 + 校准
  5. OOD 拒答 + 转人工 + 案例回流

这五个,正好对应中医的“经典先验、辨证、方证、禁忌、四诊合参、六不治、复诊”。


7. 结语

AI Harness 不能让模型变确定,但可以把概率泛化的方差和尾部风险压到可接受范围。

中医的经验工程,是一套前现代版本的概率系统治理:

强先验、分型路由、多证据、硬禁忌、反馈复诊、师承集成、数据治理、制度护栏。

AI Harness 最该学的,不是玄学化中医,而是把这套思路转译成现代工程语言:

确定性外壳 + 概率内核 + 反馈闭环 + 治理审计。

传统软件像按图纸运行的机器;现代 AI 像训练出来的专家系统。
而 AI Harness 的任务,就是让这个概率性专家系统在真实世界里:
少犯大错,可被监控,可被纠正,可被追责,可被回滚。

📚参考链接

Why The Harness Matters More Than The Model | YC Paper Club

posted @ 2026-09-15 11:19  东风微鸣  阅读(222)  评论(0)    收藏  举报