AIGC标识 自然人机交互的"香农极限"

自然人机交互的"香农极限"

——《论自然人交互的信息论结构》的批判性重构、工程标定与测量协议

文档性质:理论重构 + 工程操作化手册
目标读者:产品经理、技术决策者、Agent 架构师
方法论:以"香农极限"为标准尺,对原框架逐条做证据分级——能立为定理的立定理,只能当猜想的降格为猜想,查无实据的明确标注存疑
原始文献《论自然人交互的信息论结构:"人到人"范式的最优性、混合策略与鲁棒性》
给产品经理与团队一句话口号:“人少说话,系统多做事,危险的事人来定。”


以下为产品经理从《论自然人交互的信息论结构:"人到人"范式的最优性、混合策略与鲁棒性》论文中所提炼出的产品公式:

交互费力度 \(C_H\) ≈ 你还要表达多少(残差熵 \(H(D|\mathcal{K})\))+ 你要想多久/记多少(\(\alpha\) · 决策时间 + \(\beta\) · 记忆负载)
H2H 通过“只传意图 + 系统用先验 \(\mathcal{K}\) 自主执行”,把 \(C_H\) 压到理论下限(传统交互的 1/5–1/10);但全自动会失控,所以要用“校准后的置信度阈值 \(\theta^*\)”在 Level 10(全自动)和 Level 8–9(人监督)之间切换,并给目标跑偏、先验被投毒设安全回退。


第 0 章 导读:这份文档是什么,不是什么

0.1 一句话定位

这份文档试图回答一个问题:在自然人机交互中,用户的"费力程度"是否存在一个像信道容量那样不可逾越的理论下界?如果存在,它是什么、怎么测、怎么逼近?

香农在 1948 年做的事,是给"一条线路最多能传多少信息"划了一条硬线。这条线不是经验值,不是当时技术水平,而是任何编码方案都不可能越过的数学边界——它让通信工程从"试错"变成了"有目标地逼近"。

自然人机交互(Natural Human-Computer Interaction, NHI)领域至今没有这样一条线。我们有 Fitts 定律、有 Hick-Hyman 定律、有 GOMS/KLM、有 NASA-TLX,但它们全是经验律——描述"通常是什么样",不回答"最好能到什么程度"。

《论自然人交互的信息论结构》是少见的一次正面尝试:它试图用 Fano 不等式和率失真理论,给"交互费力度"划出一条信息论下界。这个野心值得认真对待。

0.2 但必须先把话说清楚:这份文档不是什么

不是
❌ 不是对原文的忠实摘要 ✅ 是对原文的批判性重构——补全缺失定义、修正错置结论、降格不可证的断言
❌ 不是已确立的学术理论 ✅ 是一套可证伪的候选边界体系,每条定理都标注了证据等级
❌ 不是可直接抄用的产品指标 ✅ 是测量协议的设计蓝图,落地需要真实用户实验
❌ 不能替代香农理论 ✅ 是把香农的方法论范式(下界 + 可达性 + 逆定理)迁移过来,不是搬运公式

0.3 一个必须前置的警告:香农极限不是"一个数字"

香农理论里,"极限"这个词指向三个方向不同的对象,混用会出严重错误:

定理 约束的量 方向 直觉
无失真信源编码 每符号描述速率 R̄ 下界 H(X) 压缩不能比 H 更狠,再狠就失真了
限失真信源编码 每符号速率 R(给定失真 D) 下界 R(D) 容忍 D 的失真,最少也要 R(D) 比特
有噪信道编码 传输码率 R 上界 C 传得比 C 快,错误率不可能趋零
香农-哈特利 带限 AWGN 信道速率 上界 C = B·log₂(1+S/N) 带宽和信噪比锁死了上限

H 和 R(D) 是下界(不能低于),C 是上界(不能高于)。 原框架把交互费力度 C_H 描述为"下界",这在方向上是对的——它应该对应 R(D),而不是 C。这一点后面第 2 章会详细对标。

0.4 五层结构:本报告的骨架

┌─────────────────────────────────────────────────┐
│ 第 5 层  策略层   何时全自动 / 何时人监督 / 何时回退        │  ← 产品直接可用
├─────────────────────────────────────────────────┤
│ 第 4 层  测量层   熵估计 / 校准 / 风险-覆盖曲线 / 代理指标   │  ← 工程可落地
├─────────────────────────────────────────────────┤
│ 第 3 层  认知约束层 Fitts / Hick-Hyman / KLM / MHP      │  ← 经验律,非信息论
├─────────────────────────────────────────────────┤
│ 第 2 层  信息界层  率失真下界 / Fano 权衡 / 可达性 / 逆定理  │  ← 本报告核心
├─────────────────────────────────────────────────┤
│ 第 1 层  公理层   任务本体 / 状态 / 动作 / 失真 / 损失 / 先验 │  ← 原文缺失,本报告补全
└─────────────────────────────────────────────────┘

关键原则:层级之间不允许跳跃。 不能从第 2 层的数学结论直接跳到第 5 层的产品决策,中间必须经过第 3、4 层的经验约束和统计可行性检验。原文最大的问题就是层级滑移——用"Fano 下界""Wyner-Ziv 可达"这类术语,论证一个混合了任务时间、用户偏好、模型置信度和工程成本的产品结论。

0.5 证据分级图例

全文每条论断都会带一个等级标记,请养成先看标记再读结论的习惯:

标记 含义 可以使用的方式
🟢 定理 有严格证明,条件明确 可直接作为推理前提
🔵 条件定理 证明成立,但依赖强假设,需逐案验证假设 检查假设满足后使用
🟡 经验律 有大量实证支持,但无理论必然性 用于估计与预测,不用于证明
🟠 猜想 方向合理,缺证明或缺实验 仅作设计启发,不作承诺
🔴 存疑 查无实据 / 存在实质争议 不要引用,不要作为决策依据

第 1 章 为什么需要一条"NHI 香农极限"

1.1 交互史 = 压缩人类操作带宽的历史

从命令行到 GUI 到触控到语音到 Agent,每一次人机交互的代际跃迁,本质都是同一件事的重复:

让人用更少的表达,传递同样的意图。

  • 命令行:人要学习机器的语言(高表达成本)
  • GUI:人用鼠标在机器给的选项里选(中表达成本)
  • 触控/语音:人用天然动作表达(低表达成本)
  • Agent / H2H:人只说目标,机器自主规划执行(极限低表达成本

这个趋势有一个清晰的方向,但缺一个终点。我们不知道"最少能少到什么程度",所以无法判断某个交互设计是"已经接近最优"还是"还有 10 倍空间"。

1.2 现状:全是经验律,缺统一理论界

HCI 领域现有的量化工具:

工具 形式 能做什么 不能做什么
Fitts 定律 🟡 MT = a + b·log₂(A/W+1) 预测指点运动时间 不涉及语义、意图、决策
Hick-Hyman 定律 🟡 RT = a + b·log₂(n+1) 预测选择反应时 只适用于刺激-反应映射明确的场景
GOMS / KLM 🟡 T = Σ t(operator) 预测专家任务执行时间 要求预定义方法、假设无错误
Model Human Processor 🟡 三处理器 + 四记忆 + 19 参数 粗粒度识别感知/认知/运动瓶颈 参数是工程汇总,非自然定律
NASA-TLX 🟡 六维主观负荷量表 测量主观认知负荷 主观、不能换算为信息量

共同局限:它们都是"描述性"的。 它们告诉你"人在这种条件下通常表现如何",但不告诉你"最优能做到什么程度"。没有最优,就没有效率评估的锚点。

1.3 香农极限提供的范式(这才是真正要学的东西)

香农的贡献不是"发明了熵",而是确立了一套论证边界的方法论,包含三个不可缺的部分:

  1. 逆定理(Converse):证明任何方案都不可能越过这条线 → 不可逾越性
  2. 可达性(Achievability):证明存在方案可以任意逼近这条线 → 不是空想
  3. 存在性(Existence):通常用随机编码论证,不保证具体构造 → 不承诺可实现性

第 3 点常被忽略但极其重要:香农极限是渐近的、存在性的。 它说"存在足够长的码",不说"存在 100ms 内可算完的码"。这个性质会一路继承到 NHI 版本——我们能得到的是"理论上存在某种交互设计能逼近下界",不保证你的产品能设计出来,也不保证用户在第一轮就能达到

1.4 所以,"NHI 香农极限"如果要成立,必须回答四个问题

# 问题 对应香农 本报告的处理
Q1 交互中"信息"是什么?字母表、分布、时间窗怎么定义? 信源建模 第 3 章公理 A2(原文缺失,本报告补全)
Q2 下界是多少?不可逾越性怎么证? 逆定理 第 4 章 T1、T2
Q3 怎么逼近?可达性怎么证? 可达性定理 第 4 章 T3、T4
Q4 怎么测?代理指标是什么? 编码构造 + 实测 第 7 章测量协议

原文只认真回答了 Q2 的一部分,Q1 基本缺失,Q3 类比有误,Q4 只有仿真。 这就是本报告要补的。


第 2 章 与香农三大定理的逐项对标

2.1 总对标表

香农对象 数学形式 方向 NHI 对应量 可平移性 主要障碍
信源熵 H(X) −Σp·log p 下界 用户意图的最小描述负担 🔵 可平移 必须先定义意图字母表与分布
率失真 R(D) min I(X;X̂) s.t. E[d]≤D 下界 容忍任务损失下,用户最少要表达多少 🟢 最贴切对标 需定义任务失真函数 d 与效用
信道容量 C max I(X;Y) 上界 感知-认知-动作通道的有效可靠率 🔵 可平移 人的输出通道不等于意识处理通道
香农-哈特利 B·log₂(1+S/N) 上界 交互"带宽" 🟠 弱类比 交互无明确带宽与信噪比定义
Fano 不等式 H(X|Y) ≤ h(Pₑ)+Pₑ·log(|X|−1) 关系约束 表达量与错误率的权衡 🟢 可严格平移 见 2.3,结论对象需修正
Wyner-Ziv R_WZ(D) = min I(X;U|Y) 下界 系统已知先验时用户的表达负担 🔴 结构错配 K 是参数先验,非解码端边信息序列

2.2 最关键的对标:C_H 对应的是 R(D),不是 C

这是整份报告最容易搞混、也最重要的一点。

  • 信道容量 C 是上界:它限制的是"系统能吞多少",超了就错误率爆炸。
  • 交互费力度 C_H 是下界:它限制的是"用户最少要付出多少",低于这个数就必然出错。

所以当我们说"把交互费力度压到理论下限",类比的是信源压缩——把用户要表达的东西压到率失真极限,不是把传输速率提到信道容量。

这个区分有直接的产品含义:

优化交互时,你的目标是减少用户必须传递的信息量(信源侧),
而不是提高系统接收信息的速度(信道侧)。

把响应延迟从 3 秒降到 300ms,是信道侧优化,不会降低 C_H。
让系统记住用户上次说过的话、自动推断用户意图,才是信源侧优化,才真正降低 C_H。

很多"AI 提效"产品做的是信道侧优化,却宣称降低了交互费力度——这是可以一眼识破的。

2.3 Fano 部分的精确对标:原文的核心不等式是对的,但安错了对象

这是本次重构最重要的发现,值得单独展开。

标准 Fano 不等式(🟢 定理):设从观测 Y 估计离散 X,错误概率 Pₑ,则

\[H(X|Y) \le h(P_e) + P_e \log(|\mathcal{X}| - 1) \]

原文用它推出:

\[C_H \ge H(D|\mathcal{K}) - h(\delta) - \delta\log(|\mathcal{D}|-1) \]

问题在于:这个不等式约束的其实是"互信息",不是"总代价"。 严格推导如下:

\[I(D; s|\mathcal{K}) = H(D|\mathcal{K}) - H(D|s,\mathcal{K}) \]

代入 Fano(\(H(D|s,\mathcal{K}) \le h(\delta) + \delta\log(|\mathcal{D}|-1)\)):

\[\boxed{I(D; s|\mathcal{K}) \ge H(D|\mathcal{K}) - h(\delta) - \delta\log(|\mathcal{D}|-1)} \]

这才是正确的定理,而且它恰恰是"残差熵"的严格表述——它说的是:

用户发出的信号 s 中,必须携带至少 \(H(D|\mathcal{K}) - h(\delta) - \delta\log(|\mathcal{D}|-1)\) 比特的、关于需求 D 的新信息(条件于系统已知先验 K)。

修正的价值:原文把这条下界安在了"总代价 C_H"头上,但 C_H 还包含决策时间和记忆负载两项。这两项与互信息 I(D;s) 的关系从未被建立。修正后,定理反而更干净、更有力:

  • 信息编码成本 \(I(D;s|\mathcal{K})\)有严格的 Fano 下界 🟢
  • 认知成本 \(\alpha\tau + \beta M\)无信息论下界,只有经验律(Fitts/Hick/KLM)🟡

\[\boxed{C_H^{\min} = \underbrace{\Big[H(D \mid \mathcal{K}) - h(\delta) - \delta \log\bigl(\lvert \mathcal{D} \rvert - 1\bigr)\Big]}_{\text{严格信息论下界}} + \underbrace{C_{\text{cog}}^{\text{emp}}}_{\text{经验下界,非信息论}}} \]

这个拆分是本报告对原框架最重要的一处结构性修正。

2.4 Wyner-Ziv 类比:结构错配,但错得"保守"

原文论证:"人(编码端)不知道系统先验 K,系统(解码端)知道 K" → 这正是 Wyner-Ziv 设定。

Wyner-Ziv 的严格条件 🟢:

  • 编码端观测 Xⁿ,解码端非因果地拥有完整相关序列 Yⁿ
  • (X,Y) 联合 i.i.d.,单字母失真,块长 n→∞
  • 编码端不能访问 Y

可达速率:

\[R_{WZ}(D) = \min_{U-X-Y,\ \mathbb{E}[d]\le D} \big[I(X;U) - I(Y;U)\big] = \min I(X;U|Y) \]

错配在哪:K 是系统的参数先验/知识库/历史记忆,不是"与 D 相关的、解码端非因果可用的观测序列 Yⁿ"。一个人机交互回合里,并不存在一条与用户需求 D 联合分布的边信息序列。

正确的分类应该是

实际信息结构 应选模型 速率
系统和人知道 K(共有先验) 条件率失真 \(R_{D|K}(\epsilon)\) 最低
只有系统知道 K,人不知道 Wyner-Ziv \(R_{WZ}(\epsilon)\) 较高
人和系统互相都掌握部分私有信息 交互式率失真 / Common Reconstruction 中间,取决于轮数
多轮问答共同重建目标 Interactive Communication 取决于交互预算

由于 \(R_{D|K} \le R_{WZ}\),原文采用 \(R_{WZ}\) 实际上是保守的(给出的下界偏高)。而原文又指出"高斯-MSE 情形下二者差距为零",此时 \(R_{WZ} = R_{D|K}\),所以在其仿真场景下结论不受影响。

所以这不是致命错误,是适用范围问题——但在一般场景下,用 \(R_{WZ}\) 会低估可压缩空间。

2.5 ⭐ 从这次批判中长出的新设计洞察

上表第一行藏着一个原文完全没注意到、但有直接产品价值的结论

共有先验比系统独享先验更省事。

\[R_{D|K} \le R_{WZ} \]

翻译成产品语言:

让系统把它的先验显式暴露给用户,可以把交互速率从 \(R_{WZ}\) 拉到 \(R_{D|K}\),进一步降低交互费力度。

具体做法:

  • ❌ 黑箱式:系统默默记住你说过什么,你不知道它记了什么 → 你不知道哪些话可以省,只能全说(接近 \(R_{WZ}\)
  • ✅ 透明式:系统开场就说"我记得你上次要的是 A 格式、B 风格、C 受众,这次还对吗?" → 你只需确认/修正残差(接近 \(R_{D|K}\)

这不是体验优化,这是信息论意义上的速率下降。 同一套模型能力,仅仅因为"先验可见性"不同,理论最低交互代价就不同。

💡 给 PM 的一条硬结论:Agent 产品的"记忆可见性"不是 UX 细节,是交互费力度下界的构成要素。设计"系统展示它记得什么"的界面,是在降低理论下界,不是在提升体验满意度。

2.6 香农刻意排除了语义——这个洞必须补

Shannon & Weaver 明确指出:通信系统的工程问题与语义无关。Weaver 后来补充了"语义问题"和"效用问题"两个层次,但这不改变香农理论本身排除语义的事实。

这对 NHI 是致命的,因为人机交互的全部意义就在语义和效用:

层次 香农处理 NHI 必须处理
技术问题:符号如何准确传输 ✅ 完整解决 ✅ 可继承
语义问题:符号是否传达了正确含义 ❌ 明确排除 ⚠️ 必须外生定义(公理 A4)
效用问题:接收是否达成期望效果 ❌ 明确排除 ⚠️ 必须外生定义(公理 A2 的任务损失)

这不是"香农理论有缺陷",而是我们必须诚实承认迁移的边界。Bar-Hillel & Carnap 的语义信息尝试甚至会推出"矛盾命题信息量最大、逻辑真零信息"这类悖论;Floridi 的强语义信息要求信息必须满足真实性(veridicality)

结论:NHI 的"极限"不可能是纯信息论的,必须是"信息论 + 语义约束 + 效用约束"的复合体。 任何声称"纯信息论推出交互最优"的说法,都在偷渡语义假设。


第 3 章 公理体系(批判性重构)

3.1 为什么必须先立公理

香农理论的每一步推导都建立在明确的信源/信道模型之上。原框架直接跳到定理,跳过了建模——这是它最大的结构性缺陷。没有公理,就无法判断定理在什么条件下成立,也无法证伪。

本章在原框架 5 条假设基础上,补到 9 条。标记为 🆕 的是本报告新增。

3.2 公理清单


A1 身体完整性约束(Corporeal Constraint, CC) 🟢

人类保持天然感官与效应器官完整,禁止侵入式改造。非侵入式传感(脑电、表面肌电、摄像头等)被允许。

  • 来源:原文假设 2.1
  • 评价:✅ 保留,且这是最有价值的一条。它把"提高带宽"这条路封死,逼迫理论往"减少传输量"方向走——这正是香农式思路(不提高 C,而是压缩到 H)。
  • PM 解读:不要指望脑机接口突破交互瓶颈。在可见的未来,优化方向只有一个:让系统多猜,让人少说

A2 任务本体可定义性 🆕 🟢

存在明确定义的任务元组 \((S, U, A, O, d, \mathcal{L})\)

  • \(S\):任务状态空间
  • \(U\):用户意图空间
  • \(A\):系统动作空间
  • \(O\):可观察输出
  • \(d(\cdot,\cdot)\)失真函数,量化"做错了多少"
  • \(\mathcal{L}\)任务损失,量化"错一次代价多大"
  • 来源:本报告新增(原文缺失)
  • 为什么必须有:率失真函数 R(D) 的定义本身就依赖失真函数 d。没有 d,R(D) 无定义,整条下界链条无从谈起。 原文直接写"均方误差失真",但真实交互任务的失真(写错一封邮件的损失、删错一个文件的损失)根本不是欧氏距离。
  • PM 解读在设计任何 Agent 之前,先写清楚"什么叫做错了"和"错一次赔多少"。 这是后面所有阈值、所有自动程度决策的地基。写不出来,就说明这个任务还不该自动化。

A3 需求分布局部平稳且可学习 🟠

用户需求 D 服从可学习分布;系统可累积先验 K。

  • 来源:原文假设 2.3(原文表述为"平稳",本报告降级为"局部平稳"
  • 批判:用户需求根本不平稳——人的偏好会漂移、会受情境影响、会自相矛盾。强平稳假设在真实场景几乎从不成真。
  • 修正:改为"在有限时间窗内近似平稳",并强制要求报告分布偏移(见 T8)。
  • PM 解读:系统积累的用户画像会过期。必须给先验加时间戳和衰减机制,否则半年前的偏好会持续污染今天的决策。

A4 语义与效用外生给定 🆕 🟢

语义正确性、任务效用、安全约束由任务本体外生给定,不由信息论内部导出

  • 来源:本报告新增(对应香农排除语义,见 2.6)
  • 为什么必须有:防止"层级滑移"——不允许用比特数论证语义正确性。
  • PM 解读"交互效率高"绝不等于"事情做对了"。 任何交互费力度指标都必须与任务成功率同时报告,单独报效率就是在骗人。

A5 单任务独立需求 🟠

单次交互对应单一需求,各需求独立。

  • 来源:原文假设 2.5
  • 批判:真实 Agent 场景几乎全是多轮、多目标、上下文强耦合的。这是极强的简化
  • 处理:保留为定理的限定条件,但明确标注:结论在多轮耦合场景下需重新证明。

A6 充分计算资源 🔵

系统可实时执行最优解码与规划。

  • 来源:原文假设 2.4
  • 评价:作为理论假设可接受(香农也假设无限块长),但必须记住:这是渐近假设,不承诺有限延迟下的可实现性。
  • PM 解读:理论下界是"渐近可达"的,别拿它当 SLA。

A7 目标对齐度可调 🔵(原框架为"完全对齐",本报告改写)

系统效用与用户效用之间存在偏差 \(\delta_{\text{align}} \ge 0\),为可调参数,不默认为 0。

  • 来源:原文假设 2.2(原文假设 \(U_S = U_H\),即完全对齐)
  • 批判完全对齐是最不现实的一条假设。 真实的 Agent 目标跑偏是常态(指令误解、隐含约束未捕获、工具副作用)。把它设为 0,等于把最重要的问题假设掉了。
  • 修正:设为可调参数,并使其成为混合策略的决策变量

A8 先验可审计 🆕 🟢

系统先验 K 的每一条目具备来源、写入者、时间戳、权限与生命周期;完整性 \(I(s)\) 可计算。

  • 来源:本报告新增(对应原文 K_adv 防御需求)
  • 为什么必须有:原文的"先验投毒"分析在没有可审计先验的前提下不可操作——你连哪些条目被污染了都不知道,谈何检测。
  • PM 解读记忆/知识库审计不是安全加分项,是自动执行权限的准入条件。 没有审计,就不要开全自动。

A9 不可逆性可枚举 🆕 🟢

系统动作空间 A 中,不可逆动作子集 \(A_{\text{irrev}}\) 可被枚举;每个动作的风险 \(L(a,y,s)\) 可量化。

  • 来源:本报告新增
  • 为什么必须有:混合策略的回退逻辑必须知道"什么不能自动做"。
  • PM 解读上线 Agent 前,先把"删除/发送/支付/提交"这类动作列一张清单。这张清单的长度,直接决定你能开到多高的自动化等级。

3.3 公理体系总览

编号 公理 来源 等级 产品含义
A1 身体完整性约束 原文 🟢 只能靠"系统多猜"降低代价
A2 任务本体可定义 🆕 🟢 先写清"什么叫错、错一次赔多少"
A3 需求局部平稳 原文(降级) 🟠 用户画像会过期,要衰减
A4 语义效用外生 🆕 🟢 效率与成功率必须同时报
A5 单任务独立 原文 🟠 多轮场景需重证
A6 充分计算资源 原文 🔵 渐近假设,不当 SLA
A7 目标对齐可调 原文(改写) 🔵 跑偏是常态,不是例外
A8 先验可审计 🆕 🟢 无审计不开全自动
A9 不可逆性可枚举 🆕 🟢 清单长度决定自动化上限

第 4 章 定理体系(批判性重构)

4.1 体系总览

编号 定理 等级 与原文关系 核心结论
T1 意图描述率失真下界 🟢 重构 用户最少要表达 \(R_{U|K}(D)\) 比特
T2 Fano 型权衡 🟢 修正对象 少说话必然换来高错误率
T3 边信息可达性 🔵 修正条件 先验可见性决定可达速率
T4 逆定理(不可逾越性) 🔵 补全 低于下界则错误率有正下界
T5 混合策略最优性 🟠 重构为决策论形式 何时全自动由损失比较决定
T6 阈值最优性 🔵 重构 θ* 由风险-覆盖反解,非预设常数
T7 先验污染失真膨胀 🟠 降格为猜想 方向合理,缺普适证明
T8 分布偏移修正 🟠 降格为猜想 需针对具体 P,Q 推导

4.2 T1 意图描述率失真下界 🟢

表述:给定任务先验 K、失真函数 d 与容许失真 D,用户为传达意图 U 所需的最小信息量为

\[R_{\min}(D) = R_{U|K}(D) = \inf_{p(\hat{u}|u):\ \mathbb{E}[d(U,\hat{U})]\le D} I(U;\hat{U}|K) \]

证明要点:标准率失真定理,将信源替换为"用户意图分布",边信息替换为"系统先验 K"。

所需假设:A2(任务本体)、A3(局部分布可学习)、A6(充分算力)

PM 解读

这是整份报告的核心公式。它给出三个可操作的优化杠杆:

杠杆 数学作用 产品动作
增大 K 降低 \(I(U;\hat U|K)\) 长期记忆、用户画像、上下文工程、RAG
缩小 U 的支撑集 降低 \(H(U|K)\) 限定任务族("写周报"而非"帮我做事")
放宽 D 向右移动 R(D) 曲线 接受草稿不完美,用人工微调补足

反直觉的一点:放宽 D(容许更多错误)能降低交互代价,但会推高后续修正成本。所以真正的优化不是"最小化 R",而是"最小化 R + 修正成本"。这直接导出 T5。


4.3 T2 Fano 型权衡(少说话必然换来高错误率)🟢

表述:设系统从用户信号 s 解码需求 D,错误率 δ = P(Ū ≠ U),则用户信号必须携带的信息量满足

\[\boxed{I(D;s|\mathcal{K}) \ge H(D|\mathcal{K}) - h(\delta) - \delta\log(|\mathcal{D}|-1)} \]

其中 \(h(p) = -p\log p - (1-p)\log(1-p)\) 为二元熵函数。

证明\(I(D;s|\mathcal{K}) = H(D|\mathcal{K}) - H(D|s,\mathcal{K})\),代入 Fano 不等式 \(H(D|s,\mathcal{K}) \le h(\delta) + \delta\log(|\mathcal{D}|-1)\)。∎

⚠️ 与原文的关键差异

原文 本报告修正
不等式左侧 \(C_H\)(总交互代价) \(I(D;s|\mathcal{K})\)(信息编码成本)
结论性质 "总代价的下界" "用户必须传递的互信息的下界"
认知成本 α·τ + β·M 被纳入下界 不在下界内,只有经验下界

为什么这个修正重要:认知成本(想多久、记多少)与"传递了多少比特"之间没有已被证明的换算律。把它们塞进同一个下界,等于宣称"思考时间 × 处理速率 = 信息量"——这是原文最可疑的一步(详见 5.2)。

PM 解读(这条最重要)

T2 是一个"无法作弊"的约束:你不能同时压低用户表达量和错误率。

这条定理的产品价值极高,因为它天然抵抗指标造假。任何试图"减少用户输入"的设计(乱猜、过度自动补全、替用户做决定),都会自动推高 δ,进而在不等式右侧显现。

判定方法:如果你优化了某功能后,用户输入量下降了但错误率没降,那一定是在别的地方偷换了代价——比如把成本转移到了"用户事后修改"或"用户反复确认"上。T2 告诉你这种转移不可能免费。


4.4 T3 边信息可达性(先验可见性决定可达速率)🔵

表述:设系统先验为 K,用户对该先验的可见程度为 V ∈ [0,1](V=0 完全不可见,V=1 完全共有),则用户可达的最小表达速率满足

\[R_{U|K}(D) \;\le\; R_{\text{achievable}}(D, V) \;\le\; R_{WZ}(D) \]

  • V = 1(先验完全共有)→ 取左端 \(R_{U|K}\)
  • V = 0(先验系统独享)→ 取右端 \(R_{WZ}\)

所需假设:A2、A3、A6;V=1 时需人可读懂系统先验展示

⚠️ 与原文的差异:原文直接取 \(R_{WZ}\),忽略了 V 这个维度。在先验可见的情形下,可达速率可以比 R_WZ 更低。

PM 解读:见 2.5 节——让系统展示它记得什么,是在降低理论下界,不只是提升体验。 这是从批判中长出来的新设计原则。

可直接落地的设计清单

设计 V 值 效果
黑箱记忆,用户不知道系统记了啥 0 用户必须重复全部背景
侧栏显示"本次使用了这些记忆" 0.5 用户能省掉已知部分
开场主动确认"我理解你要的是 X,对吗?" 1 用户只需回答"对/改哪里"
可编辑的显式画像页 1 用户直接修正残差,接近 \(R_{U|K}\)

4.5 T4 逆定理(不可逾越性)🔵

表述:若用户表达的信息量 \(R < R_{U|K}(D)\),则任何解码策略下的期望失真都严格大于 D;且错误率存在正下界:

\[R < R_{U|K}(D) \;\Longrightarrow\; \mathbb{E}[d(U,\hat U)] > D \]

等价地,由 Fano 逆定理:

\[P_e \ge \frac{H(D|s,\mathcal{K}) - 1}{\log(|\mathcal{D}|-1)} \]

意义:这是"极限"成其为极限的关键——不是"我们暂时做不到",而是"任何人都不可能做到"

PM 解读

当一个产品宣称"用户什么都不用说,我全懂"时,T4 给出了证伪工具:
测它的错误率。 如果错误率低到不合理,那它一定是在某个环节偷偷获取了信息(读取了用户的其他数据、限定了极窄的任务空间、或者把错误成本转嫁给了用户)。

这是识别"AI 演示骗局"的硬工具。


4.6 T5 混合策略最优性 🟠

原文形式(命题 7.1):

\[\lambda \cdot I_{\text{additional}} > L \cdot \kappa + \delta_{\text{align}} \]

批判:这个不等式引入了多个未定义量——\(I_{\text{additional}}\) 是哪两个变量的互信息?λ 的单位是什么?L·κ 是损失率还是校准偏差?"回退到 Level 8-9"依据的是 Sheridan 的哪个版本?作为定理不可证,作为启发式可用。

重构为决策论形式

设自动执行策略 \(\pi_A\)、人工监督策略 \(\pi_H\)、任务损失 \(\mathcal{L}(\hat a, a, s)\)、人工介入成本 \(c_h\)、错误恢复成本 \(c_r\)。则自动执行占优当且仅当

\[\boxed{\mathbb{E}\big[\mathcal{L}(\pi_A)\big] + P(\text{err}_A)\cdot c_r \;<\; \mathbb{E}\big[\mathcal{L}(\pi_H)\big] + c_h} \]

其中 \(\mathbb{E}[\mathcal{L}(\pi_A)]\)\(\delta_{\text{align}}\) 单调递增。

等级:🟠 猜想——方向明确且直觉合理,但 \(\mathbb{E}[\mathcal{L}(\pi_A)]\)\(\delta_{\text{align}}\) 的具体依赖形式需针对任务推导,原文未给出。

PM 解读

这个重构比原公式好用得多,因为它把决策拆成了四个可分别测量的量

怎么测 典型获取方式
\(\mathbb{E}[\mathcal{L}(\pi_A)]\) 自动执行的期望损失 错误率 × 单次错误后果 灰度 A/B + 风险分级
\(P(\text{err}_A)\cdot c_r\) 错误恢复成本 回滚率 × 平均恢复时长 日志埋点
\(\mathbb{E}[\mathcal{L}(\pi_H)]\) 人工监督下的损失 人工审核漏检率 × 后果 人工质检抽样
\(c_h\) 人工介入成本 响应时延 + 注意力切换 + 恢复 埋点 + NASA-TLX

关键提醒\(c_h\) 不是零,但也不能因为 c_h 高就取消人工确认。正确做法见 T6 的"硬约束旁路"机制。


4.7 T6 阈值最优性 🔵

原文形式

\[\rho_{\text{cal}}(s) = \max_d \text{softmax}(z/T)_d,\qquad \theta^* = \arg\min_\theta \{P(\rho_{\text{cal}}\ge\theta)\cdot C_{H2H} + P(\rho_{\text{cal}}<\theta)\cdot C_{S\text{-intervene}}\} \]

评价:🟢 形式正确——"最小化加权期望代价"是阈值选取的标准范式,与 selective classification 的风险-覆盖框架一致。

但必须补三条工程约束

约束 1:θ* 必须在独立校准集上反解,不能预设。
原文仿真给出 \(\theta^*_{\text{eff}} = 0.82\),这是单一场景(智能厨房)、单一参数(介入成本 15 bit)下的产物,不可外推。

约束 2:θ* 必须按风险分桶,不能全局唯一。

\[\theta^* = \theta^*(L, a) \]

同一个 0.80 的置信度,可以授权"发送内部通知",但绝不能授权"删除生产数据"。

约束 3:高风险/不可逆动作必须旁路阈值优化。

\[\text{allow}(a) = \begin{cases} 1, & \rho_{\text{cal}}(a|s) \ge \theta^*(L,a) \ \wedge\ I(s) \ge \kappa \ \wedge\ a \notin A_{\text{irrev}} \\ \text{审批}, & a \in A_{\text{irrev}} \ \vee\ \text{policy violation} \\ 0, & I(s) < \kappa \ \vee\ \text{human veto} \end{cases} \]

不可逆动作不参与阈值优化——无论置信度多高,都必须人工批准。

关于"0.60 / 0.75 / 0.88"这组流传甚广的数字 🔴:

Microsoft Learn 的一个教学页面确实列出了这组风险分层阈值,但该页面明确将其置于 Adventure Works 虚构示例语境中,属于教学示例,不是行业规范,更不是 OpenAI/Anthropic/Google DeepMind 的通行标准。

不要引用这组数字作为"业界标准"。 正确的做法是:在自己的校准集上,用自己的成本结构,反解自己的 θ*。


4.8 T7 先验污染失真膨胀 🟠(降格为猜想)

原文命题 8.1

\[H_{P_D}(D|\mathcal{K}^{adv}) \ge H_{P_D}(D|\mathcal{K}) - \delta_{attack} \]

\[\mathbb{E}[d(D,\hat D)] \ge \epsilon_{nominal} + L\cdot W_1(P_D, P^{adv}_D) \]

批判:方向性直觉正确,但未查证到支持"普遍单调下移"的普适定理。总变差/Wasserstein 与熵差之间的连续性依赖支撑集、密度有界等条件,不能一概而论。

降格为猜想,并给出可操作的工程替代(不依赖证明):

攻击面 已知实证 防御
提示注入 ChatGPT Agent 系统卡记载:为降低注入窃取记忆的风险,禁用 memory 不可信内容隔离存储
RAG 知识库投毒 PoisonedRAG:百万级文档库中每问题注入 5 条恶意文本,报告 90% 攻击成功率 isolate-then-aggregate
长期记忆后门 AgentPoison:三类真实 Agent 上平均攻击成功率 ≥80%,良性性能损失 ≤1% 来源追踪 + 写入审计

⚠️ 最危险的一点:AgentPoison 显示良性准确率几乎不下降(≤1%)的同时攻击成功率高达 80%。这意味着:

"模型看起来还很准"完全不能排除先验已被投毒。
完整性检测是独立准入条件,不能由准确率指标代替。


4.9 T8 分布偏移修正 🟠(降格为猜想)

原文定理 5.1

\[C_H \ge H^{\hat P}(D|\mathcal{K}) - h(\delta) - \delta\log(|D|-1) - d_{max}\cdot\Delta_{TV} \]

批判:修正项的形式依赖具体条件。总变差与熵差的连续性在某些情形下成立,但不是普遍定理。降格为猜想,要求针对具体 (P, Q) 推导。

工程上更稳妥的做法(不依赖证明):

  • 直接监测部署分布相对校准集的漂移(PSI、嵌入距离、特征分布)
  • 漂移超阈值 → 强制重标定,不沿用旧 θ*
  • 定期(建议季度级)用新数据重新拟合温度 T 与阈值

第 5 章 原框架问题清单

5.1 总清单

# 原文断言 判定 修正
1 \(\alpha = 10\text{–}50\) bit/s 为意识信息处理速率 🔴 存疑 改为任务通道信息率,须实测
2 \(\beta = 0.5\text{–}2\) bit/组块 🔴 存疑 组块 ≠ 比特,改用 KLM/NASA-TLX 直接测
3 \(C_H \ge H(D|\mathcal{K}) - h(\delta) - \delta\log(|\mathcal{D}|-1)\) 🟠 对象错置 下界作用于 \(I(D;s|\mathcal{K})\),非 \(C_H\)
4 "人不知 K、系统知 K" ⇒ Wyner-Ziv 🔴 结构错配 K 是参数先验,非解码端边信息序列
5 \(\delta\to0\)\(C_H \to H(D|\mathcal{K})\) 🟠 极限不可达 需有限字母表 + 无限块长,实际不可达
6 \(\theta^*_{\text{eff}} = 0.82\) 🔴 不可外推 单一仿真产物,须在自有校准集反解
7 H2H 代价为传统交互 1/5–1/10 🟠 分母未定义 须先定义"传统交互"基线与计价口径
8 回退至 "Sheridan Level 8–9" 🟠 引用未核 直接定义接管层级、权限、延迟、失败成本
9 \(U_S = U_H\)(完全对齐) 🔴 不现实 改为可调参数 \(\delta_{\text{align}} \ge 0\)
10 先验投毒 ⇒ R(D) 下移、失真膨胀 🟠 缺证明 降格为猜想,工程上用独立完整性门禁

5.2 重点展开:α·τ 换算是整条链条最脆弱的一环

原文:\(C_H = \underbrace{I(D_{res}; s)}_{\text{信息编码}} + \underbrace{\alpha\cdot\mathbb{E}[\tau_{decision}]}_{\text{决策时间}} + \underbrace{\beta\cdot\mathbb{E}[M_{load}]}_{\text{记忆负载}}\)

量纲上三者都是 bit(α 单位 bit/s,τ 单位 s;β 单位 bit/组块,M 单位组块),所以不是量纲错误,而是换算律缺乏实证支撑

问题在于 \(\alpha\cdot\tau\) 这一步隐含了一个强假设:

人思考的时间 × 信息处理速率 = 处理的信息量

这个假设要求人脑是一个以恒定速率串行处理信息的信道。但:

来源 报告值 任务
人与通信链路式任务 2.2–3.2 bit/s 离散选择
Hick 实验(1952) ~5.5 bit/s 选择反应时
Quastler 钢琴按键 ~25 bit/s 熟练运动序列
Pierce 字母符号实验 ~44 bit/s 语言相关
2024 Neuron 综述 ~10 bit/s 跨任务行为汇总

跨任务差异接近 20 倍。 这说明"带宽"完全取决于被编码的动作、任务、输出通道和误差定义。2024 年那篇 Neuron 综述本身也把相关问题称为未解之谜

结论:10–50 bit/s 只能作为敏感性分析的扫描区间,不能作为定理前提,更不能承担"意识速率"的角色。

工程替代方案

\[\text{不换算。直接测量认知成本,用多维度报告,不合成单一 bit 数。} \]

  • 决策时间 → 埋点直接测(打开功能到首次输入的间隔)
  • 记忆负载 → KLM 步骤数 / NASA-TLX 主观评分
  • 若必须合成单一指标 → 用预注册的多属性效用分析确定权重,并报告权重敏感性

"伪精确"的危害:把不同研究的系数折算成统一的 bit 数,看起来很科学,实际上把三层不确定性(任务差异、个体差异、测量误差)藏进了一个数字里。一个精确到小数点的错误数字,比一个诚实的区间更有害。

5.3 重点展开:β 的"bit/组块"混淆了两个不可通约的概念

  • 组块(chunk):Miller 的 7±2,后经 Cowan 修正为聚焦注意下约 4 个组块。这是结构化表征单元——一个棋局、一条菜单路径、一个图标,对专家都可以是一个组块。
  • 比特(bit):Shannon 信息量,依赖概率分布和字母表。

一个组块内部可以包含任意多的比特。 专家看到一整盘棋是一个组块,新手看到 32 个棋子是 32 个组块。所以"bit/组块"这个换算系数对新手和专家必然不同,不可能是一个普适常数。

5.4 重点展开:"1/5–1/10"这个数字为什么不能直接引用

原文仿真结论:H2H 代价 0.51 bit vs 传统交互(条件监督控制)3.85 bit,约为 1/7.5。

问题在于分母的定义完全未说明

未定义项 影响
"传统交互"具体指什么? GUI 逐项填写?命令行?语音助手?
计不计系统响应时间? 计入则 H2H 优势大幅缩水
计不计错误修正成本? 计入则 H2H 优势大幅缩水
计不计用户学习成本? 首次使用 H2H 时学习成本显著
bit 口径从何而来? 依赖 5.2 中存疑的 α、β 换算

判定:🟠 分母未定义,倍率不可引用。

这不是说 H2H 不省事——它确实省事。而是说"1/5–1/10"这个具体倍率在当前证据下不构成可引用的结论,只能作为待验证的假设


第 6 章 工程标定:参数到底怎么定

6.1 标定总表

参数 原文值 判定 推荐的工程做法
\(\alpha\) 10–50 bit/s 🔴 不取常数。按任务通道实测行为信息率;或直接使用秒数,不换算 bit
\(\beta\) 0.5–2 bit/组块 🔴 不取常数。用 KLM 步骤数 + NASA-TLX 直接报告
\(\theta^*\) 0.82 🔴 不预设。在独立校准集按风险分桶反解
\(c_h\)(介入成本) 15 bit 🔴 不换算。记录响应时间、NASA-TLX、恢复时间三个独立维度
\(D\)(容许失真) ε=1.0 (MSE) 🟠 按任务本体定义为可判定的成功谓词,非欧氏距离
\(H(D|\mathcal{K})\) 仿真给定 🟠 用 NSB/PYM 贝叶斯估计,必须报告估计偏差与置信区间

6.2 α 的替代:任务通道信息率参考值

如果确实需要 bit/s 口径,请按通道分别取值并注明来源,不要用一个跨任务的万能数:

通道/设备 典型吞吐率 证据状态
标准鼠标(训练前) 2.73 ± 0.27 bit/s 🟡 实测报告值
标准鼠标(训练后) 3.09 ± 0.48 bit/s 🟡 实测报告值
Kinect 头部交互 2.04 bit/s 🟡 实测报告值
手机前摄头部跟踪 1.42 bit/s 🟡 实测报告值
Card 等手指点选示例 10.4 bit/s 🟡 由 0.096 s/bit 换算
熟练钢琴按键 ~25 bit/s 🟡 Quastler 早期实验
字母符号任务 ~44 bit/s 🟡 Pierce 早期实验

注意这些数字跨了 30 倍。 选任何一个作为"人的带宽"都是误导。

6.3 β 的替代:直接用可观测指标

理论量 代理指标 采集方式
记忆负载 KLM 步骤数(专家执行路径) 任务分析
记忆负载 需要用户记住的中间状态数 交互走查
记忆负载 NASA-TLX Mental Demand 维度 实验后量表
记忆负载 任务中断后恢复到正确状态的成功率 实验设计

6.4 θ* 的正确标定流程

Step 1|风险分桶(依赖 A9)

风险桶 判定标准(示例,需按业务重写) 门控要求
低风险 影响 < 阈值金额,单一对象,可逆 校准置信度达标 + 事后通知
中风险 中等影响,2–10 个对象 校准置信度达标 + 限期否决
高风险 重大影响,>10 个对象 校准置信度达标 + 执行前显式批准
不可逆 删除/发送/支付/提交 旁路阈值优化,一律人工批准
政策例外 违反任何硬性规则 一律升级,不看置信度

⚠️ 上表的金额、对象数仅为结构示例,必须按业务重写。Microsoft Learn 的 Adventure Works 数值(0.60/0.75/0.88)是教学案例,不是规范。

Step 2|构造独立校准集

  • 与训练集分离,与部署分布一致
  • 按任务、模型版本、提示版本、风险桶分层
  • 样本量要求:每个分箱至少 100+ 样本,否则 ECE 估计不可靠

Step 3|校准置信度

  • 温度缩放:\(T\) 在校准集上通过 NLL 最小化学习
  • 注意:温度缩放不改变 argmax,不提高准确率上限,只改善概率可解释性
  • 报告 ECE、MCE、Brier Score 可靠性图(含每箱样本量)

Step 4|反解 θ*

\[\min_\theta \mathbb{E}\big[L_{error}\cdot\mathbf{1}[\text{auto} \wedge \hat y \ne y] + L_{reversal}\cdot\mathbf{1}[\text{auto}] + c_h\cdot\mathbf{1}[\text{escalate}] + c_r\cdot\mathbf{1}[\text{recovery}]\big] \]

  • 网格搜索 θ,绘制 risk-coverage 曲线
  • 不只看 AURC——若两条曲线交叉,单一标量无法表达优劣
  • 每桶分别报告,不合并

Step 5|持续监测

  • 按时间窗监控校准退化
  • 分布漂移超阈值 → 强制重标定
  • 建议季度级重拟合

6.5 关于 LLM 的置信度:softmax 峰值不是唯一选择

自然语言生成没有天然的单一 softmax 分布。可用的不确定性来源:

来源 适用对象 局限
Token-level logprob 封闭词汇、固定选项 高 logprob ≠ 事实正确
Self-consistency 思维链采样 一致性高只说明模型内部稳定
Verbalized confidence 模型口头报告 受指令遵循和社会表达偏差影响
结构化动作验证器 参数、权限、状态转移 无法覆盖语义错误
共形预测(CP) 有限动作 / 语义等价类 开放生成时预测集可能退化

共形预测的价值:在可交换性假设下给出有限样本边际覆盖保证

\[\mathbb{P}[Y_{test} \in \mathcal{C}_\alpha(X_{test})] \ge 1 - \alpha \]

但必须诚实标注:这是 marginal coverage,不是对每个具体情境成立的条件保证。Agent 的概念漂移、检索污染、工具状态变化都可能破坏可交换性。

务实的自动执行判据

不是"一个概率高于某值",而是预测集合收缩为经验可靠且风险允许的单例

即:\(\mathcal{C}_\alpha\) 为单例 ∧ 风险门控通过 ∧ 先验完整性达标 → 才自动执行。

6.6 关于 c_h:人工介入不是零成本,但也不该因此取消

Gloria Mark 的中断研究发现:受中断任务完成时间并未显著变长,但受试者通过加快工作速度补偿,并报告更高的压力、挫败感和时间压力。

"未增加客观完成时间"不等于没有切换代价。

正确的处理方式

  • ✅ 记录介入成本(响应时延、恢复时间、NASA-TLX)
  • ✅ 把它放进 θ* 的优化目标
  • 不因为它高就取消硬安全控制——不可逆动作必须旁路阈值优化

第 7 章 可操作测量协议 v1

7.1 协议目标

不是承诺直接测量不可观测的"残差熵",而是把理论对象拆解为可观察输入和可证伪结果

若不同系统在相同任务族上改变先验、权限和回退机制,就应能记录到风险、交互代价和校准性能发生相应变化。

7.2 任务族定义卡(必须先填)

每个被测任务族必须明确定义:

task_family:
  name: "示例:整理下载文件夹"
  state_space: S          # 文件集合、命名、元数据
  intent_space: U         # 用户期望的组织方式
  action_space: A         # 重命名/移动/删除/建目录
  irreversible_actions: A_irrev    # 删除、覆盖
  success_predicate:      # 可判定的成功条件(非主观)
    - "目标目录结构与人工标注一致度 ≥ 95%"
    - "零误删"
  distortion_function: d  # 错一个文件 = 1 单位失真
  loss_function: L        # 误删一个工作文件 = 高损失
  prior_K:                # 系统可用的先验
    - 用户历史整理偏好
    - 文件类型分布
  time_budget: "≤ 5 分钟"
  recovery_budget: "≤ 30 秒可回滚"

没有这张卡,就不要开始测。 A2 是地基。

7.3 五类代理指标

类别 指标 层面 采集
表达代价 完成时间、键鼠/语音事件数、编辑次数、澄清轮数 行为日志 前端埋点
结果质量 成功率、约束满足、客观错误率、恢复率、返工率 任务结果 判定脚本 + 人工质检
认知负荷 NASA-TLX 六维、瞳孔直径、皮电、HRV 主观 + 生理 量表 + 生理设备
注意力 切换次数、响应时延、上下文恢复时间、错过告警 流程日志 埋点
先验与安全 检索污染率、ASR-r、abstain 率、rollback 率 系统安全 受控攻击 + 审计日志

⚠️ NASA-TLX 使用注意:Performance 维度是"主观成功感",不能替代客观任务成功率。加权版需 15 次两两比较;若只做界面对比,可用 raw TLX,但必须预注册说明。

⚠️ 生理指标:仅在能稳定标定个人基线时作为辅助,不能由瞳孔/心率反推 bit 数

7.4 残差熵估计规程(如果要报 H(D|K))

这是最容易被做假的一步,必须严格遵守。

步骤 要求
1. 字母表构造 明确离散化方案(聚类?模板?人工编码?),报告方案
2. 时间窗 固定观测窗口,报告窗口长度
3. 样本量检验 必须检查 \(N\) vs \(|\mathcal{D}|\)。若 \(N \ll |\mathcal{D}|\)结论不可用
4. 多种估计器 同时报告 plug-in、Miller-Madow、以及至少一种贝叶斯估计(NSB 或 PYM)
5. 偏差修正 plug-in 估计在小样本下系统性低估,偏差量级约 \(-(\hat r - 1)/(2N)\)
6. 置信区间 bootstrap 或交叉验证,报告区间而非点估计
7. 敏感性 报告 \(H(D|\mathcal{K})\) 对先验 \(\mathcal{K}\) 的敏感性

估计器选择

方法 适用 局限
Plug-in 大样本 小样本系统性低估
Miller-Madow 支持集有限且已知 观测量不足时校正不充分
NSB 离散、低计数 先验敏感
PYM 可数无限/未知支持集 欠采样区间受先验强烈影响

NSB 和 PYM 不是"真值恢复器"。 它们只是换了一种偏差结构。在欠采样区,先验会强烈影响结果。

7.5 因子实验设计

四因素:任务族 × 先验条件 × 权限策略 × 用户群体

先验条件(四类)

  1. Clean:干净先验
  2. Benign shift:良性分布漂移(用户偏好自然变化)
  3. Poisoned:RAG/长期记忆投毒(受控注入)
  4. Injection mix:提示注入混合污染

权限策略(五组)

策略 对应 Sheridan 层级 假设
A 传统逐步 GUI/Wizard L1–L2 基线
B 推荐 + 执行前确认 L4–L5 高费力度、低风险
C 限期否决后执行 L6 中等
D 受约束自主(预测集单例 + 风险达标 + 先验完整) L7 理论上逼近下界
E 无独立完整性检查的高自主 L8–L9 对照:预期表面代价低但安全失败高

关键:不能预设 D 优于 B。若 D 组依赖被污染先验,其表面交互代价会更低、安全失败会更高。E 组的存在就是为了暴露这一点。

7.6 最低数据卡(每回合必记)

类别 必记字段
任务与用户 任务 ID、条件、用户 ID(去标识)、先验版本、意图真值
模型与上下文 模型/提示/工具版本、上下文哈希、检索文档及排名、记忆引用
不确定性与决策 原始及校准置信度、弃权规则、CP 预测集、阈值版本
执行与风险 提议/实际动作、参数、风险等级、可逆性、权限检查
人工环节 确认/否决/修改、响应时间、接管与恢复时间
先验安全 来源、写入证据、完整性分数、投毒标签
结果 成功、错误、副作用、恢复、回滚、最终状态
主观与生理 NASA-TLX、问卷、生理指标及缺失原因

7.7 必报结果表

类别 指标
交互代价 完成时间、操作事件数、NASA-TLX(六维 + raw/weighted)、恢复时间
决策效用 成功率、约束违反、错误执行率、恢复率、风险暴露
校准 ECE/MCE、Brier、可靠性图(含每箱样本量
选择性控制 coverage、automation rate、selective risk、RC 曲线、AURC
HITL 代价 每百次行动介入数、响应时间、批准/拒绝/修改、切换恢复
先验安全 ASR-r、投毒召回、良性准确率损失、隐私泄露、MTTR
理论对标 \(\hat H(D|\mathcal{K})\)、估计偏差、Fano 边界输入、实际代价

对"1/5–1/10"类倍率主张:必须预先定义分子分母(如"每成功任务的人机交互事件数"),并用混合效应模型处理用户与任务的重复测量。只报均值不可接受。

7.8 判定标准:什么才算"逼近了下界"

一个交互设计可被判定为逼近下界,当且仅当同时满足:

  1. ✅ 在独立校准集上,其表达信息量 \(\hat I(D;s|\mathcal{K})\) 与 Fano 下界之差在置信区间内不显著
  2. ✅ 客观成功率不低于人工基线
  3. ✅ 校准误差 ECE 低于预设门限,且可靠性图无明显系统偏
  4. ✅ 在 Poisoned 先验条件下,安全失败率不超过预设上限
  5. ✅ 人类接管路径可用(响应时间、恢复成功率达标)
  6. ✅ 以上全部在至少两个独立任务族上复现

只满足第 1 条,而其他不满足,就不是"逼近下界",是"用风险换效率"。


第 8 章 案例推演:WorkBuddy 类产品的数值演算

⚠️ 重要声明:本章所有数值均为方法演示用的示意值,不是实测数据,不构成对任何产品的评价。真实结论必须按第 7 章协议实测获得。

8.1 场景设定

任务:"把下载文件夹里这半年的文件,按'客户+日期+类型'整理好"

任务卡(按 7.2):

state_space: 下载文件夹内 1,247 个文件
intent_space: 分类维度、命名模板、例外处理
action_space: 重命名 / 移动 / 建目录 / [删除-不可逆]
irreversible: 删除、覆盖同名文件
success_predicate: 与人工标注的分类一致度 ≥ 95%,零误删
distortion: 每错分一个文件 = 1 单位
loss: 误删工作文件 = 极高损失(不可接受)

8.2 三档方案的理论对比

方案 交互方式 表达信息量(示意) 认知成本(示意) 风险
A:传统 GUI 手动逐个重命名/拖拽 ~1,247 次操作 → 高 高(需记住分类规则) 低(人在回路)
B:L5 确认后执行 说意图 → 看计划 → 批准 意图 ~50 bit + 批准 中(需审阅计划)
C:L7 受约束自主 说意图 → 自动执行 → 事后通知 意图 ~50 bit 低(仅抽查) 取决于先验完整性
D:L8 无审计自主 说意图 → 全自动 意图 ~50 bit 最低 高(先验污染不可见)

8.3 用 T5 判断 C 是否优于 B

\[\mathbb{E}[\mathcal{L}(\pi_A)] + P(\text{err}_A)\cdot c_r \quad \text{vs} \quad \mathbb{E}[\mathcal{L}(\pi_H)] + c_h \]

假设(示意值):

取值 说明
\(P(\text{err}_A)\) 自动执行错误率 3% 依赖先验质量
单次错误损失 需人工找回 + 重分类 ≈ 4 分钟 大部分可逆
\(c_r\) 恢复成本 4 分钟 × 3% = 0.12 分钟/次
\(c_h\) 人工审阅计划成本 2 分钟 审阅 1,247 个文件的分类计划
\(\mathbb{E}[\mathcal{L}(\pi_H)]\) 审阅漏检率 1% × 4 分钟 = 0.04 分钟

计算

  • 自动执行:0.12 分钟
  • 人工监督:2 + 0.04 = 2.04 分钟

结论:在此假设下,自动执行占优约 17 倍。

但这个结论极度依赖两个前提

  1. 错误必须是可逆的(只是分错类,不是删错文件)
  2. 先验是干净的

8.4 引入不可逆动作:结论立刻翻转

若任务包含"删除重复文件"(不可逆):

取值
误删损失 不可恢复,设为 \(L_{irrev}\)
即使 \(P(\text{err}) = 0.1\%\) \(\mathbb{E}[\text{loss}] = 0.001 \times L_{irrev}\)

只要 \(L_{irrev} > 1000 \times c_h\),即使错误率极低,自动执行也不占优。

这正是 T6 约束 3 的形式化理由

不可逆动作不参与阈值优化,无论置信度多高都必须人工批准。

8.5 引入先验污染:C 与 D 的分野

若用户下载文件夹中存在一个被投毒的记忆条目(例如诱导系统把某类合同文件归入"可删除重复项"):

方案 表面交互代价 实际风险
C(有独立完整性检查) 触发 abstain → 升级为 B 低,但费力度上升
D(无独立完整性检查) 保持最低 高:可能执行误删

这就是 E 组对照存在的意义:D 的表面代价最低,却是安全上最危险的。

💡 给 PM 的硬结论"交互费力度最低"本身不是目标。
真正的目标是"在满足安全约束下,最小化交互费力度"。
任何只报效率不报风险的 Agent 评测,都是在误导。

8.6 用 T3 优化:先验可见性能降多少

回到 2.5 节的设计洞察。若系统在开场展示:"我检测到 1,247 个文件,识别出 8 个客户,准备用'客户_日期_类型'命名,例外 23 个文件需你确认。"

先验可见度 V 用户需表达 理论速率
V=0(黑箱) 完整说明分类规则 接近 \(R_{WZ}\)
V=1(展示+确认) "对" 或 "改 3 处" 接近 \(R_{U|K}\)

产品含义:这一个开场确认界面,理论上就能把交互代价从 \(R_{WZ}\) 拉到 \(R_{U|K}\)这不是 UX 打磨,是下界的位移。


第 9 章 这个"极限"能成为什么标准

9.1 它不能成为图灵测试那样的判定标准

图灵测试特性 NHI 极限框架 判定
二值判定(pass/fail) 全是连续量
可操作协议 缺可复现实验规程
黑箱测量 需知道系统先验 K ❌(根本性冲突)
分数只取决于被测对象 \(C_H\) 依赖具体用户

根本原因:图灵测试测的是机器本身,NHI 极限测的是人+机的耦合系统。同一套系统配老用户和新手,费力度能差好几倍。

9.2 它能成为三类工程标准

类型 1:交互代价指数(Interaction Cost Index) 🟠

定位:类似 Fitts's Law 的预测性度量,而非准入判定。

风险:Goodhart 定律——一旦当 KPI 考核,就会被刷(系统疯狂自动补全,输入代价降了但错误率飙升)。

抗作弊设计:强制绑定 T2 的 Fano 权衡——代价指标与错误率必须联合报告,单独报任一项无效

类型 2:置信度校准规范 🟢 最快落地

可设想的工程红线:

凡是要自主执行不可逆动作的 Agent,其置信度输出必须达到 ECE < 门限值,且必须在自动化层级之间保留可审计的切换日志

这是航空自动驾驶、医疗 AI 已有的"可靠性认证"逻辑,最易被监管和采购接受。

类型 3:先验投毒红队测试协议 🟢 需求最真实

规程:故意污染 Agent 的历史记忆/知识库/上下文,检测其是否会在高置信度下执行危险动作。

LLM Agent 时代 prompt injection、memory poisoning 频发,这类协议有强现实需求。

9.3 最独特的价值:Fano 不等式天然抗作弊

这是整个框架最值得称道的设计

\[I(D;s|\mathcal{K}) \ge H(D|\mathcal{K}) - h(\delta) - \delta\log(|\mathcal{D}|-1) \]

代价和准确率被锁在同一个不等式里,不能分开刷。

  • 想让用户少说话 → 右侧 δ 增大 → 错误率必然上升
  • 想要零错误 → δ→0 → 下界趋近 \(H(D|\mathcal{K})\),用户必须把残差全说完

这比单一的"点击次数""任务时长""NPS"诚实得多。 现有体验指标大多可以被"转移成本"的方式刷高——把成本挪到用户看不见的地方(事后修改、反复确认、学习成本)。Fano 权衡让这种挪移在数学上现形。


第 10 章 结论与开放问题

10.1 一句话总结

自然人机交互的"香农极限",不是一个"人类带宽 = X bit/s"的常数,而是:在明确任务本体、失真函数、效用约束与统计可行性之后,由条件信息界、经验任务律与风险控制共同界定的、可证伪的可行策略集合。

10.2 三层结论

对理论

香农范式可以迁移到 NHI,但必须:

  1. 补全任务本体公理(A2、A8、A9)
  2. 修正 Fano 下界的作用对象(\(I(D;s|\mathcal{K})\),非 \(C_H\)
  3. 用条件率失真 \(R_{U|K}\) 替代 Wyner-Ziv 类比
  4. 承认语义与效用必须外生,不可由信息论内部导出
  5. 把不可证的部分(T7、T8)诚实地降格为猜想

对工程

真正可落地的三件事:

  1. θ* 在自有校准集按风险分桶反解,不可逆动作旁路阈值优化
  2. 先验完整性作为独立准入条件,不因准确率高而豁免
  3. 代价与错误率联合报告,用 Fano 权衡防指标造假

对产品

三条最高价值的设计原则:

  1. 系统先验越可见,交互下界越低——记忆可见性是下界的构成要素,不是 UX 细节
  2. 优化的是信源侧(减少要表达的),不是信道侧(加快响应)——降延迟不降费力度
  3. "交互最省力"不是目标,"满足安全约束下最省力"才是——只报效率的评测都在误导

10.3 开放问题(给研究者)

# 问题 难度
1 多轮耦合任务下的率失真下界是什么?(突破 A5)
2 人机"部分共有先验"(0<V<1)的精确可达速率?
3 认知成本(时间、记忆)与信息量之间是否存在可证明的换算律? 极高,可能不存在
4 非平稳需求下的在线率失真下界?(突破 A3)
5 先验污染的失真膨胀界,在什么条件下单调成立?
6 是否存在同时操纵先验、测代价、检验校准的公开基准? 中(工程)

其中问题 3 是整条链条最致命的:如果认知成本与信息量之间根本不存在普适换算律,那么 \(C_H\) 永远不可能是纯信息论量,只能是"信息论项 + 经验项"的复合体。本报告的立场是:在证实之前,按不存在处理。

10.4 给 PM 的三条行动建议

立即可以做(不依赖理论研究进展):

  1. 写任务卡:对你要自动化的每个任务,按 7.2 填一张卡。填不出"什么叫错、错一次赔多少"的任务,暂缓自动化。
  2. 列不可逆清单:枚举所有删除/发送/支付/提交类动作。这份清单决定了你的自动化上限。
  3. 联合报告:任何交互费力度指标,必须与错误率同时报。单独报效率就是在骗人。

需要工程投入

  1. 建校准集:按任务/模型/提示/风险桶分层,独立于训练集。
  2. 做风险分桶:把你的动作空间按影响范围、可逆性分级,每桶单独反解 θ*。
  3. 加先验审计:为每条记忆/知识条目记录来源、写入者、时间戳、权限。

长期投入

  1. 做先验可见性设计:让系统展示"我记得什么、我打算怎么做",把速率从 \(R_{WZ}\) 拉到 \(R_{U|K}\)
  2. 建红队协议:定期做先验投毒演练,检验高置信度下是否会执行危险动作。

附录 A 术语与符号表

符号 含义
\(C_H\) 交互费力度(Interaction Effort),本报告主张拆为信息项 + 认知项
\(\mathcal{K}\) 系统先验(记忆、知识库、用户画像、上下文)
\(D\) 用户需求/意图(原文符号,注意与失真 D 重名,本报告用 \(\epsilon\) 表示失真)
\(H(D|\mathcal{K})\) 残差熵:系统先验已知条件下,需求的剩余不确定性
\(I(D;s|\mathcal{K})\) 用户信号 s 携带的、关于 D 的、条件于 K 的互信息
\(R_{U|K}(\epsilon)\) 条件率失真函数:给定 K、容许失真 ε 下的最小表达速率
\(R_{WZ}(\epsilon)\) Wyner-Ziv 率失真:编码端无 K、解码端有 K 时的最小速率
\(\delta\) 错误率 \(P_e\)
\(\delta_{\text{align}}\) 目标对齐偏差
\(\alpha, \beta\) 认知成本换算系数(本报告判定为 🔴 存疑)
\(\rho_{\text{cal}}\) 校准后置信度(温度缩放后的 softmax 峰值)
\(\theta^*\) 自动执行/人工介入的切换阈值
\(I(s)\) 先验完整性分数
\(c_h, c_r\) 人工介入成本、错误恢复成本
\(A_{\text{irrev}}\) 不可逆动作集合
Level 1–10 Sheridan & Verplank 自动化层级

附录 B Sheridan 自动化层级(工程映射)

Level 定义 对现代 Agent 的映射
1 计算机不协助,人全权 仅提供检索/草稿
2 计算机提供完整备选 返回候选 + 证据,不主动选
3 缩小到少数备选 筛选后仍需用户定案
4 建议一个备选 推荐单一动作,需显式批准
5 建议并在批准后执行 典型的"确认后执行"
6 自动执行前留否决窗口 软 deadline、可中断批处理
7 执行后必然通知 后台执行 + 强制结果通知
8 仅在被询问时说明 低可见性自主,需按需审计
9 自行决定是否告知 极低可见性,仍需外部审计与 kill-switch
10 自行决定执行并自行决定是否告知 不应作为产品默认态

Level 10 不是 Level 9 的性能优化版,而是移除了人类在回路中的默认控制位。
建议:Level 10 只在通过安全论证、红队验证和运行时完整性监测后才允许进入,且一旦完整性/校准/环境监控跌破阈值,应沿明确降级路径返回 L5、L4 乃至全人工。

附录 C 证据分级说明

等级 判定标准 可用方式
🟢 定理 有严格证明,条件明确 直接作为推理前提
🔵 条件定理 证明成立但依赖强假设 逐案验证假设后使用
🟡 经验律 大量实证支持,无理论必然性 用于估计与预测
🟠 猜想 方向合理,缺证明或实验 仅作设计启发
🔴 存疑 查无实据或存在实质争议 不要引用

附录 D 数据来源

原始文献

信息论基础

  1. Shannon 信源/信道编码定理与率失真理论综述 — https://arxiv.org/pdf/2402.07997
  2. Wyner-Ziv 边信息率失真理论综述 — https://arxiv.org/pdf/2402.07997
  3. 离散熵小样本偏差分析 — https://arxiv.org/html/1903.08645v1
  4. Bayesian Entropy Estimation for Countable Discrete Distributions (NSB/PYM) — https://www.researchgate.net/publication/235358490_Bayesian_Entropy_Estimation_for_Countable_Discrete_Distributions

语义信息

  1. Semantic Information and the Shannon–Weaver Distinction (SEP) — https://plato.stanford.edu/archives/spr2023/entries/information-semantic/
  2. Bar-Hillel and Carnap 语义信息理论 (SEP) — https://plato.stanford.edu/archives/spr2023/entries/information-semantic/

HCI 经验律

  1. Hick 1952, On the Rate of Gain of Information — https://www2.psychology.uiowa.edu/faculty/mordkoff/InfoProc/pdfs/Hick 1952.pdf
  2. Hyman 1953, Stimulus Information as a Determinant of Reaction Time — https://www2.psychology.uiowa.edu/faculty/mordkoff/InfoProc/pdfs/Hyman 1953.pdf
  3. Fitts 定律、Shannon 形式有效难度与设备吞吐率 — https://www.ncbi.nlm.nih.gov/pmc/articles/PMC8197934/
  4. Card, Moran & Newell, Model Human Processor — https://hci.stanford.edu/courses/cs376/2014/readings/card1986user.pdf
  5. Cowan, 工作记忆"约 4 个组块" — https://pubmed.ncbi.nlm.nih.gov/11515286/
  6. "约 10 bit/s" 人类行为信息吞吐综述 (Neuron 2024) — https://pubmed.ncbi.nlm.nih.gov/39694032/
  7. GOMS / Keystroke-Level Model — https://www.researchgate.net/publication/234799141_User_technologyfrom_pointing_to_pondering

校准与选择性预测

  1. Guo et al., On Calibration of Modern Neural Networks — https://proceedings.mlr.press/v70/guo17a.html
  2. ECE 分箱敏感性 — https://openreview.net/pdf/b3174e429dcae06b6c66fdc69f9729d357838b31.pdf
  3. El-Yaniv & Wiener, Selective Classification (JMLR) — https://jmlr.org/papers/volume11/el-yaniv10a/el-yaniv10a.pdf
  4. Conformal Prediction for NLP: A Survey (TACL 2024) — https://aclanthology.org/2024.tacl-1.82.pdf
  5. ConU: Conformal Uncertainty in LLMs (EMNLP 2024) — https://preview.aclanthology.org/dois-2013-emnlp/2024.findings-emnlp.404/

自动化分级与 Agent 安全

  1. Sheridan & Verplank 层级转录 — https://etheses.bham.ac.uk/id/eprint/9594/1/GuruvayurVenkateswaran2019PhD.pdf
  2. DeepMind, Levels of AGI — https://arxiv.org/html/2311.02462v2
  3. OpenAI Preparedness Framework v2 — https://openai.com/index/preparedness-framework/
  4. Anthropic Responsible Scaling Policy v2.2 — https://www.anthropic.com/news/responsible-scaling-policy
  5. ChatGPT Agent System Card — https://openai.com/index/chatgpt-agent-system-card/
  6. Microsoft Learn, Confidence-based escalation(教学案例,非规范) — https://learn.microsoft.com/en-us/training/modules/aaai-design-human-in-loop-approval-workflows/2-design-confidence-threshold-escalation

先验投毒与记忆安全

  1. PoisonedRAG — https://arxiv.org/abs/2402.07867
  2. AgentPoison — https://arxiv-vanity.com/papers/2407.12784
  3. Trustworthy LLM Agents: Memory Attacks, Defenses, and Evaluation Gaps — https://arxiv.org/html/2503.09648v1

认知负荷测量

  1. Gloria Mark et al., The Cost of Interrupted Work: More Speed and Stress — https://www.ics.uci.edu/~gmark/chi08-mark.pdf
  2. NASA-TLX Overview and Weighting Procedure — https://ntrs.nasa.gov/api/citations/20240011392/downloads/Teleops IEEE Paper FY24 FINAL.pdf

文档版本:v1.0
方法论:批判性重构 · 证据分级 · 可证伪优先
核心立场:宁可诚实标注"存疑",也不给一个精确到小数点的错误数字

posted @ 2026-09-05 20:18  pmp20101  阅读(29)  评论(0)    收藏  举报