自然人机交互的"香农极限"
自然人机交互的"香农极限"
——《论自然人交互的信息论结构》的批判性重构、工程标定与测量协议
文档性质:理论重构 + 工程操作化手册
目标读者:产品经理、技术决策者、Agent 架构师
方法论:以"香农极限"为标准尺,对原框架逐条做证据分级——能立为定理的立定理,只能当猜想的降格为猜想,查无实据的明确标注存疑
原始文献:《论自然人交互的信息论结构:"人到人"范式的最优性、混合策略与鲁棒性》
给产品经理与团队一句话口号:“人少说话,系统多做事,危险的事人来定。”
以下为产品经理从《论自然人交互的信息论结构:"人到人"范式的最优性、混合策略与鲁棒性》论文中所提炼出的产品公式:
交互费力度 \(C_H\) ≈ 你还要表达多少(残差熵 \(H(D|\mathcal{K})\))+ 你要想多久/记多少(\(\alpha\) · 决策时间 + \(\beta\) · 记忆负载) 。
H2H 通过“只传意图 + 系统用先验 \(\mathcal{K}\) 自主执行”,把 \(C_H\) 压到理论下限(传统交互的 1/5–1/10);但全自动会失控,所以要用“校准后的置信度阈值 \(\theta^*\)”在 Level 10(全自动)和 Level 8–9(人监督)之间切换,并给目标跑偏、先验被投毒设安全回退。
第 0 章 导读:这份文档是什么,不是什么
0.1 一句话定位
这份文档试图回答一个问题:在自然人机交互中,用户的"费力程度"是否存在一个像信道容量那样不可逾越的理论下界?如果存在,它是什么、怎么测、怎么逼近?
香农在 1948 年做的事,是给"一条线路最多能传多少信息"划了一条硬线。这条线不是经验值,不是当时技术水平,而是任何编码方案都不可能越过的数学边界——它让通信工程从"试错"变成了"有目标地逼近"。
自然人机交互(Natural Human-Computer Interaction, NHI)领域至今没有这样一条线。我们有 Fitts 定律、有 Hick-Hyman 定律、有 GOMS/KLM、有 NASA-TLX,但它们全是经验律——描述"通常是什么样",不回答"最好能到什么程度"。
《论自然人交互的信息论结构》是少见的一次正面尝试:它试图用 Fano 不等式和率失真理论,给"交互费力度"划出一条信息论下界。这个野心值得认真对待。
0.2 但必须先把话说清楚:这份文档不是什么
| 不是 | 是 |
|---|---|
| ❌ 不是对原文的忠实摘要 | ✅ 是对原文的批判性重构——补全缺失定义、修正错置结论、降格不可证的断言 |
| ❌ 不是已确立的学术理论 | ✅ 是一套可证伪的候选边界体系,每条定理都标注了证据等级 |
| ❌ 不是可直接抄用的产品指标 | ✅ 是测量协议的设计蓝图,落地需要真实用户实验 |
| ❌ 不能替代香农理论 | ✅ 是把香农的方法论范式(下界 + 可达性 + 逆定理)迁移过来,不是搬运公式 |
0.3 一个必须前置的警告:香农极限不是"一个数字"
香农理论里,"极限"这个词指向三个方向不同的对象,混用会出严重错误:
| 定理 | 约束的量 | 方向 | 直觉 |
|---|---|---|---|
| 无失真信源编码 | 每符号描述速率 R̄ | 下界 H(X) | 压缩不能比 H 更狠,再狠就失真了 |
| 限失真信源编码 | 每符号速率 R(给定失真 D) | 下界 R(D) | 容忍 D 的失真,最少也要 R(D) 比特 |
| 有噪信道编码 | 传输码率 R | 上界 C | 传得比 C 快,错误率不可能趋零 |
| 香农-哈特利 | 带限 AWGN 信道速率 | 上界 C = B·log₂(1+S/N) | 带宽和信噪比锁死了上限 |
H 和 R(D) 是下界(不能低于),C 是上界(不能高于)。 原框架把交互费力度 C_H 描述为"下界",这在方向上是对的——它应该对应 R(D),而不是 C。这一点后面第 2 章会详细对标。
0.4 五层结构:本报告的骨架
┌─────────────────────────────────────────────────┐
│ 第 5 层 策略层 何时全自动 / 何时人监督 / 何时回退 │ ← 产品直接可用
├─────────────────────────────────────────────────┤
│ 第 4 层 测量层 熵估计 / 校准 / 风险-覆盖曲线 / 代理指标 │ ← 工程可落地
├─────────────────────────────────────────────────┤
│ 第 3 层 认知约束层 Fitts / Hick-Hyman / KLM / MHP │ ← 经验律,非信息论
├─────────────────────────────────────────────────┤
│ 第 2 层 信息界层 率失真下界 / Fano 权衡 / 可达性 / 逆定理 │ ← 本报告核心
├─────────────────────────────────────────────────┤
│ 第 1 层 公理层 任务本体 / 状态 / 动作 / 失真 / 损失 / 先验 │ ← 原文缺失,本报告补全
└─────────────────────────────────────────────────┘
关键原则:层级之间不允许跳跃。 不能从第 2 层的数学结论直接跳到第 5 层的产品决策,中间必须经过第 3、4 层的经验约束和统计可行性检验。原文最大的问题就是层级滑移——用"Fano 下界""Wyner-Ziv 可达"这类术语,论证一个混合了任务时间、用户偏好、模型置信度和工程成本的产品结论。
0.5 证据分级图例
全文每条论断都会带一个等级标记,请养成先看标记再读结论的习惯:
| 标记 | 含义 | 可以使用的方式 |
|---|---|---|
| 🟢 定理 | 有严格证明,条件明确 | 可直接作为推理前提 |
| 🔵 条件定理 | 证明成立,但依赖强假设,需逐案验证假设 | 检查假设满足后使用 |
| 🟡 经验律 | 有大量实证支持,但无理论必然性 | 用于估计与预测,不用于证明 |
| 🟠 猜想 | 方向合理,缺证明或缺实验 | 仅作设计启发,不作承诺 |
| 🔴 存疑 | 查无实据 / 存在实质争议 | 不要引用,不要作为决策依据 |
第 1 章 为什么需要一条"NHI 香农极限"
1.1 交互史 = 压缩人类操作带宽的历史
从命令行到 GUI 到触控到语音到 Agent,每一次人机交互的代际跃迁,本质都是同一件事的重复:
让人用更少的表达,传递同样的意图。
- 命令行:人要学习机器的语言(高表达成本)
- GUI:人用鼠标在机器给的选项里选(中表达成本)
- 触控/语音:人用天然动作表达(低表达成本)
- Agent / H2H:人只说目标,机器自主规划执行(极限低表达成本)
这个趋势有一个清晰的方向,但缺一个终点。我们不知道"最少能少到什么程度",所以无法判断某个交互设计是"已经接近最优"还是"还有 10 倍空间"。
1.2 现状:全是经验律,缺统一理论界
HCI 领域现有的量化工具:
| 工具 | 形式 | 能做什么 | 不能做什么 |
|---|---|---|---|
| Fitts 定律 🟡 | MT = a + b·log₂(A/W+1) | 预测指点运动时间 | 不涉及语义、意图、决策 |
| Hick-Hyman 定律 🟡 | RT = a + b·log₂(n+1) | 预测选择反应时 | 只适用于刺激-反应映射明确的场景 |
| GOMS / KLM 🟡 | T = Σ t(operator) | 预测专家任务执行时间 | 要求预定义方法、假设无错误 |
| Model Human Processor 🟡 | 三处理器 + 四记忆 + 19 参数 | 粗粒度识别感知/认知/运动瓶颈 | 参数是工程汇总,非自然定律 |
| NASA-TLX 🟡 | 六维主观负荷量表 | 测量主观认知负荷 | 主观、不能换算为信息量 |
共同局限:它们都是"描述性"的。 它们告诉你"人在这种条件下通常表现如何",但不告诉你"最优能做到什么程度"。没有最优,就没有效率评估的锚点。
1.3 香农极限提供的范式(这才是真正要学的东西)
香农的贡献不是"发明了熵",而是确立了一套论证边界的方法论,包含三个不可缺的部分:
- 逆定理(Converse):证明任何方案都不可能越过这条线 → 不可逾越性
- 可达性(Achievability):证明存在方案可以任意逼近这条线 → 不是空想
- 存在性(Existence):通常用随机编码论证,不保证具体构造 → 不承诺可实现性
第 3 点常被忽略但极其重要:香农极限是渐近的、存在性的。 它说"存在足够长的码",不说"存在 100ms 内可算完的码"。这个性质会一路继承到 NHI 版本——我们能得到的是"理论上存在某种交互设计能逼近下界",不保证你的产品能设计出来,也不保证用户在第一轮就能达到。
1.4 所以,"NHI 香农极限"如果要成立,必须回答四个问题
| # | 问题 | 对应香农 | 本报告的处理 |
|---|---|---|---|
| Q1 | 交互中"信息"是什么?字母表、分布、时间窗怎么定义? | 信源建模 | 第 3 章公理 A2(原文缺失,本报告补全) |
| Q2 | 下界是多少?不可逾越性怎么证? | 逆定理 | 第 4 章 T1、T2 |
| Q3 | 怎么逼近?可达性怎么证? | 可达性定理 | 第 4 章 T3、T4 |
| Q4 | 怎么测?代理指标是什么? | 编码构造 + 实测 | 第 7 章测量协议 |
原文只认真回答了 Q2 的一部分,Q1 基本缺失,Q3 类比有误,Q4 只有仿真。 这就是本报告要补的。
第 2 章 与香农三大定理的逐项对标
2.1 总对标表
| 香农对象 | 数学形式 | 方向 | NHI 对应量 | 可平移性 | 主要障碍 |
|---|---|---|---|---|---|
| 信源熵 H(X) | −Σp·log p | 下界 | 用户意图的最小描述负担 | 🔵 可平移 | 必须先定义意图字母表与分布 |
| 率失真 R(D) | min I(X;X̂) s.t. E[d]≤D | 下界 | 容忍任务损失下,用户最少要表达多少 | 🟢 最贴切对标 | 需定义任务失真函数 d 与效用 |
| 信道容量 C | max I(X;Y) | 上界 | 感知-认知-动作通道的有效可靠率 | 🔵 可平移 | 人的输出通道不等于意识处理通道 |
| 香农-哈特利 | B·log₂(1+S/N) | 上界 | 交互"带宽" | 🟠 弱类比 | 交互无明确带宽与信噪比定义 |
| Fano 不等式 | H(X|Y) ≤ h(Pₑ)+Pₑ·log(|X|−1) | 关系约束 | 表达量与错误率的权衡 | 🟢 可严格平移 | 见 2.3,结论对象需修正 |
| Wyner-Ziv | R_WZ(D) = min I(X;U|Y) | 下界 | 系统已知先验时用户的表达负担 | 🔴 结构错配 | K 是参数先验,非解码端边信息序列 |
2.2 最关键的对标:C_H 对应的是 R(D),不是 C
这是整份报告最容易搞混、也最重要的一点。
- 信道容量 C 是上界:它限制的是"系统能吞多少",超了就错误率爆炸。
- 交互费力度 C_H 是下界:它限制的是"用户最少要付出多少",低于这个数就必然出错。
所以当我们说"把交互费力度压到理论下限",类比的是信源压缩——把用户要表达的东西压到率失真极限,不是把传输速率提到信道容量。
这个区分有直接的产品含义:
优化交互时,你的目标是减少用户必须传递的信息量(信源侧),
而不是提高系统接收信息的速度(信道侧)。把响应延迟从 3 秒降到 300ms,是信道侧优化,不会降低 C_H。
让系统记住用户上次说过的话、自动推断用户意图,才是信源侧优化,才真正降低 C_H。
很多"AI 提效"产品做的是信道侧优化,却宣称降低了交互费力度——这是可以一眼识破的。
2.3 Fano 部分的精确对标:原文的核心不等式是对的,但安错了对象
这是本次重构最重要的发现,值得单独展开。
标准 Fano 不等式(🟢 定理):设从观测 Y 估计离散 X,错误概率 Pₑ,则
原文用它推出:
问题在于:这个不等式约束的其实是"互信息",不是"总代价"。 严格推导如下:
代入 Fano(\(H(D|s,\mathcal{K}) \le h(\delta) + \delta\log(|\mathcal{D}|-1)\)):
这才是正确的定理,而且它恰恰是"残差熵"的严格表述——它说的是:
用户发出的信号 s 中,必须携带至少 \(H(D|\mathcal{K}) - h(\delta) - \delta\log(|\mathcal{D}|-1)\) 比特的、关于需求 D 的新信息(条件于系统已知先验 K)。
修正的价值:原文把这条下界安在了"总代价 C_H"头上,但 C_H 还包含决策时间和记忆负载两项。这两项与互信息 I(D;s) 的关系从未被建立。修正后,定理反而更干净、更有力:
- 信息编码成本 \(I(D;s|\mathcal{K})\):有严格的 Fano 下界 🟢
- 认知成本 \(\alpha\tau + \beta M\):无信息论下界,只有经验律(Fitts/Hick/KLM)🟡
这个拆分是本报告对原框架最重要的一处结构性修正。
2.4 Wyner-Ziv 类比:结构错配,但错得"保守"
原文论证:"人(编码端)不知道系统先验 K,系统(解码端)知道 K" → 这正是 Wyner-Ziv 设定。
Wyner-Ziv 的严格条件 🟢:
- 编码端观测 Xⁿ,解码端非因果地拥有完整相关序列 Yⁿ
- (X,Y) 联合 i.i.d.,单字母失真,块长 n→∞
- 编码端不能访问 Y
可达速率:
错配在哪:K 是系统的参数先验/知识库/历史记忆,不是"与 D 相关的、解码端非因果可用的观测序列 Yⁿ"。一个人机交互回合里,并不存在一条与用户需求 D 联合分布的边信息序列。
正确的分类应该是:
| 实际信息结构 | 应选模型 | 速率 |
|---|---|---|
| 系统和人都知道 K(共有先验) | 条件率失真 \(R_{D|K}(\epsilon)\) | 最低 |
| 只有系统知道 K,人不知道 | Wyner-Ziv \(R_{WZ}(\epsilon)\) | 较高 |
| 人和系统互相都掌握部分私有信息 | 交互式率失真 / Common Reconstruction | 中间,取决于轮数 |
| 多轮问答共同重建目标 | Interactive Communication | 取决于交互预算 |
由于 \(R_{D|K} \le R_{WZ}\),原文采用 \(R_{WZ}\) 实际上是保守的(给出的下界偏高)。而原文又指出"高斯-MSE 情形下二者差距为零",此时 \(R_{WZ} = R_{D|K}\),所以在其仿真场景下结论不受影响。
所以这不是致命错误,是适用范围问题——但在一般场景下,用 \(R_{WZ}\) 会低估可压缩空间。
2.5 ⭐ 从这次批判中长出的新设计洞察
上表第一行藏着一个原文完全没注意到、但有直接产品价值的结论:
共有先验比系统独享先验更省事。
翻译成产品语言:
让系统把它的先验显式暴露给用户,可以把交互速率从 \(R_{WZ}\) 拉到 \(R_{D|K}\),进一步降低交互费力度。
具体做法:
- ❌ 黑箱式:系统默默记住你说过什么,你不知道它记了什么 → 你不知道哪些话可以省,只能全说(接近 \(R_{WZ}\))
- ✅ 透明式:系统开场就说"我记得你上次要的是 A 格式、B 风格、C 受众,这次还对吗?" → 你只需确认/修正残差(接近 \(R_{D|K}\))
这不是体验优化,这是信息论意义上的速率下降。 同一套模型能力,仅仅因为"先验可见性"不同,理论最低交互代价就不同。
💡 给 PM 的一条硬结论:Agent 产品的"记忆可见性"不是 UX 细节,是交互费力度下界的构成要素。设计"系统展示它记得什么"的界面,是在降低理论下界,不是在提升体验满意度。
2.6 香农刻意排除了语义——这个洞必须补
Shannon & Weaver 明确指出:通信系统的工程问题与语义无关。Weaver 后来补充了"语义问题"和"效用问题"两个层次,但这不改变香农理论本身排除语义的事实。
这对 NHI 是致命的,因为人机交互的全部意义就在语义和效用:
| 层次 | 香农处理 | NHI 必须处理 |
|---|---|---|
| 技术问题:符号如何准确传输 | ✅ 完整解决 | ✅ 可继承 |
| 语义问题:符号是否传达了正确含义 | ❌ 明确排除 | ⚠️ 必须外生定义(公理 A4) |
| 效用问题:接收是否达成期望效果 | ❌ 明确排除 | ⚠️ 必须外生定义(公理 A2 的任务损失) |
这不是"香农理论有缺陷",而是我们必须诚实承认迁移的边界。Bar-Hillel & Carnap 的语义信息尝试甚至会推出"矛盾命题信息量最大、逻辑真零信息"这类悖论;Floridi 的强语义信息要求信息必须满足真实性(veridicality)。
结论:NHI 的"极限"不可能是纯信息论的,必须是"信息论 + 语义约束 + 效用约束"的复合体。 任何声称"纯信息论推出交互最优"的说法,都在偷渡语义假设。
第 3 章 公理体系(批判性重构)
3.1 为什么必须先立公理
香农理论的每一步推导都建立在明确的信源/信道模型之上。原框架直接跳到定理,跳过了建模——这是它最大的结构性缺陷。没有公理,就无法判断定理在什么条件下成立,也无法证伪。
本章在原框架 5 条假设基础上,补到 9 条。标记为 🆕 的是本报告新增。
3.2 公理清单
A1 身体完整性约束(Corporeal Constraint, CC) 🟢
人类保持天然感官与效应器官完整,禁止侵入式改造。非侵入式传感(脑电、表面肌电、摄像头等)被允许。
- 来源:原文假设 2.1
- 评价:✅ 保留,且这是最有价值的一条。它把"提高带宽"这条路封死,逼迫理论往"减少传输量"方向走——这正是香农式思路(不提高 C,而是压缩到 H)。
- PM 解读:不要指望脑机接口突破交互瓶颈。在可见的未来,优化方向只有一个:让系统多猜,让人少说。
A2 任务本体可定义性 🆕 🟢
存在明确定义的任务元组 \((S, U, A, O, d, \mathcal{L})\):
- \(S\):任务状态空间
- \(U\):用户意图空间
- \(A\):系统动作空间
- \(O\):可观察输出
- \(d(\cdot,\cdot)\):失真函数,量化"做错了多少"
- \(\mathcal{L}\):任务损失,量化"错一次代价多大"
- 来源:本报告新增(原文缺失)
- 为什么必须有:率失真函数 R(D) 的定义本身就依赖失真函数 d。没有 d,R(D) 无定义,整条下界链条无从谈起。 原文直接写"均方误差失真",但真实交互任务的失真(写错一封邮件的损失、删错一个文件的损失)根本不是欧氏距离。
- PM 解读:在设计任何 Agent 之前,先写清楚"什么叫做错了"和"错一次赔多少"。 这是后面所有阈值、所有自动程度决策的地基。写不出来,就说明这个任务还不该自动化。
A3 需求分布局部平稳且可学习 🟠
用户需求 D 服从可学习分布;系统可累积先验 K。
- 来源:原文假设 2.3(原文表述为"平稳",本报告降级为"局部平稳")
- 批判:用户需求根本不平稳——人的偏好会漂移、会受情境影响、会自相矛盾。强平稳假设在真实场景几乎从不成真。
- 修正:改为"在有限时间窗内近似平稳",并强制要求报告分布偏移(见 T8)。
- PM 解读:系统积累的用户画像会过期。必须给先验加时间戳和衰减机制,否则半年前的偏好会持续污染今天的决策。
A4 语义与效用外生给定 🆕 🟢
语义正确性、任务效用、安全约束由任务本体外生给定,不由信息论内部导出。
- 来源:本报告新增(对应香农排除语义,见 2.6)
- 为什么必须有:防止"层级滑移"——不允许用比特数论证语义正确性。
- PM 解读:"交互效率高"绝不等于"事情做对了"。 任何交互费力度指标都必须与任务成功率同时报告,单独报效率就是在骗人。
A5 单任务独立需求 🟠
单次交互对应单一需求,各需求独立。
- 来源:原文假设 2.5
- 批判:真实 Agent 场景几乎全是多轮、多目标、上下文强耦合的。这是极强的简化。
- 处理:保留为定理的限定条件,但明确标注:结论在多轮耦合场景下需重新证明。
A6 充分计算资源 🔵
系统可实时执行最优解码与规划。
- 来源:原文假设 2.4
- 评价:作为理论假设可接受(香农也假设无限块长),但必须记住:这是渐近假设,不承诺有限延迟下的可实现性。
- PM 解读:理论下界是"渐近可达"的,别拿它当 SLA。
A7 目标对齐度可调 🔵(原框架为"完全对齐",本报告改写)
系统效用与用户效用之间存在偏差 \(\delta_{\text{align}} \ge 0\),为可调参数,不默认为 0。
- 来源:原文假设 2.2(原文假设 \(U_S = U_H\),即完全对齐)
- 批判:完全对齐是最不现实的一条假设。 真实的 Agent 目标跑偏是常态(指令误解、隐含约束未捕获、工具副作用)。把它设为 0,等于把最重要的问题假设掉了。
- 修正:设为可调参数,并使其成为混合策略的决策变量。
A8 先验可审计 🆕 🟢
系统先验 K 的每一条目具备来源、写入者、时间戳、权限与生命周期;完整性 \(I(s)\) 可计算。
- 来源:本报告新增(对应原文 K_adv 防御需求)
- 为什么必须有:原文的"先验投毒"分析在没有可审计先验的前提下不可操作——你连哪些条目被污染了都不知道,谈何检测。
- PM 解读:记忆/知识库审计不是安全加分项,是自动执行权限的准入条件。 没有审计,就不要开全自动。
A9 不可逆性可枚举 🆕 🟢
系统动作空间 A 中,不可逆动作子集 \(A_{\text{irrev}}\) 可被枚举;每个动作的风险 \(L(a,y,s)\) 可量化。
- 来源:本报告新增
- 为什么必须有:混合策略的回退逻辑必须知道"什么不能自动做"。
- PM 解读:上线 Agent 前,先把"删除/发送/支付/提交"这类动作列一张清单。这张清单的长度,直接决定你能开到多高的自动化等级。
3.3 公理体系总览
| 编号 | 公理 | 来源 | 等级 | 产品含义 |
|---|---|---|---|---|
| A1 | 身体完整性约束 | 原文 | 🟢 | 只能靠"系统多猜"降低代价 |
| A2 | 任务本体可定义 | 🆕 | 🟢 | 先写清"什么叫错、错一次赔多少" |
| A3 | 需求局部平稳 | 原文(降级) | 🟠 | 用户画像会过期,要衰减 |
| A4 | 语义效用外生 | 🆕 | 🟢 | 效率与成功率必须同时报 |
| A5 | 单任务独立 | 原文 | 🟠 | 多轮场景需重证 |
| A6 | 充分计算资源 | 原文 | 🔵 | 渐近假设,不当 SLA |
| A7 | 目标对齐可调 | 原文(改写) | 🔵 | 跑偏是常态,不是例外 |
| A8 | 先验可审计 | 🆕 | 🟢 | 无审计不开全自动 |
| A9 | 不可逆性可枚举 | 🆕 | 🟢 | 清单长度决定自动化上限 |
第 4 章 定理体系(批判性重构)
4.1 体系总览
| 编号 | 定理 | 等级 | 与原文关系 | 核心结论 |
|---|---|---|---|---|
| T1 | 意图描述率失真下界 | 🟢 | 重构 | 用户最少要表达 \(R_{U|K}(D)\) 比特 |
| T2 | Fano 型权衡 | 🟢 | 修正对象 | 少说话必然换来高错误率 |
| T3 | 边信息可达性 | 🔵 | 修正条件 | 先验可见性决定可达速率 |
| T4 | 逆定理(不可逾越性) | 🔵 | 补全 | 低于下界则错误率有正下界 |
| T5 | 混合策略最优性 | 🟠 | 重构为决策论形式 | 何时全自动由损失比较决定 |
| T6 | 阈值最优性 | 🔵 | 重构 | θ* 由风险-覆盖反解,非预设常数 |
| T7 | 先验污染失真膨胀 | 🟠 | 降格为猜想 | 方向合理,缺普适证明 |
| T8 | 分布偏移修正 | 🟠 | 降格为猜想 | 需针对具体 P,Q 推导 |
4.2 T1 意图描述率失真下界 🟢
表述:给定任务先验 K、失真函数 d 与容许失真 D,用户为传达意图 U 所需的最小信息量为
证明要点:标准率失真定理,将信源替换为"用户意图分布",边信息替换为"系统先验 K"。
所需假设:A2(任务本体)、A3(局部分布可学习)、A6(充分算力)
PM 解读:
这是整份报告的核心公式。它给出三个可操作的优化杠杆:
| 杠杆 | 数学作用 | 产品动作 |
|---|---|---|
| 增大 K | 降低 \(I(U;\hat U|K)\) | 长期记忆、用户画像、上下文工程、RAG |
| 缩小 U 的支撑集 | 降低 \(H(U|K)\) | 限定任务族("写周报"而非"帮我做事") |
| 放宽 D | 向右移动 R(D) 曲线 | 接受草稿不完美,用人工微调补足 |
反直觉的一点:放宽 D(容许更多错误)能降低交互代价,但会推高后续修正成本。所以真正的优化不是"最小化 R",而是"最小化 R + 修正成本"。这直接导出 T5。
4.3 T2 Fano 型权衡(少说话必然换来高错误率)🟢
表述:设系统从用户信号 s 解码需求 D,错误率 δ = P(Ū ≠ U),则用户信号必须携带的信息量满足
其中 \(h(p) = -p\log p - (1-p)\log(1-p)\) 为二元熵函数。
证明:\(I(D;s|\mathcal{K}) = H(D|\mathcal{K}) - H(D|s,\mathcal{K})\),代入 Fano 不等式 \(H(D|s,\mathcal{K}) \le h(\delta) + \delta\log(|\mathcal{D}|-1)\)。∎
⚠️ 与原文的关键差异:
| 原文 | 本报告修正 | |
|---|---|---|
| 不等式左侧 | \(C_H\)(总交互代价) | \(I(D;s|\mathcal{K})\)(信息编码成本) |
| 结论性质 | "总代价的下界" | "用户必须传递的互信息的下界" |
| 认知成本 α·τ + β·M | 被纳入下界 | 不在下界内,只有经验下界 |
为什么这个修正重要:认知成本(想多久、记多少)与"传递了多少比特"之间没有已被证明的换算律。把它们塞进同一个下界,等于宣称"思考时间 × 处理速率 = 信息量"——这是原文最可疑的一步(详见 5.2)。
PM 解读(这条最重要):
T2 是一个"无法作弊"的约束:你不能同时压低用户表达量和错误率。
这条定理的产品价值极高,因为它天然抵抗指标造假。任何试图"减少用户输入"的设计(乱猜、过度自动补全、替用户做决定),都会自动推高 δ,进而在不等式右侧显现。
判定方法:如果你优化了某功能后,用户输入量下降了但错误率没降,那一定是在别的地方偷换了代价——比如把成本转移到了"用户事后修改"或"用户反复确认"上。T2 告诉你这种转移不可能免费。
4.4 T3 边信息可达性(先验可见性决定可达速率)🔵
表述:设系统先验为 K,用户对该先验的可见程度为 V ∈ [0,1](V=0 完全不可见,V=1 完全共有),则用户可达的最小表达速率满足
- V = 1(先验完全共有)→ 取左端 \(R_{U|K}\)
- V = 0(先验系统独享)→ 取右端 \(R_{WZ}\)
所需假设:A2、A3、A6;V=1 时需人可读懂系统先验展示
⚠️ 与原文的差异:原文直接取 \(R_{WZ}\),忽略了 V 这个维度。在先验可见的情形下,可达速率可以比 R_WZ 更低。
PM 解读:见 2.5 节——让系统展示它记得什么,是在降低理论下界,不只是提升体验。 这是从批判中长出来的新设计原则。
可直接落地的设计清单:
| 设计 | V 值 | 效果 |
|---|---|---|
| 黑箱记忆,用户不知道系统记了啥 | 0 | 用户必须重复全部背景 |
| 侧栏显示"本次使用了这些记忆" | 0.5 | 用户能省掉已知部分 |
| 开场主动确认"我理解你要的是 X,对吗?" | 1 | 用户只需回答"对/改哪里" |
| 可编辑的显式画像页 | 1 | 用户直接修正残差,接近 \(R_{U|K}\) |
4.5 T4 逆定理(不可逾越性)🔵
表述:若用户表达的信息量 \(R < R_{U|K}(D)\),则任何解码策略下的期望失真都严格大于 D;且错误率存在正下界:
等价地,由 Fano 逆定理:
意义:这是"极限"成其为极限的关键——不是"我们暂时做不到",而是"任何人都不可能做到"。
PM 解读:
当一个产品宣称"用户什么都不用说,我全懂"时,T4 给出了证伪工具:
测它的错误率。 如果错误率低到不合理,那它一定是在某个环节偷偷获取了信息(读取了用户的其他数据、限定了极窄的任务空间、或者把错误成本转嫁给了用户)。
这是识别"AI 演示骗局"的硬工具。
4.6 T5 混合策略最优性 🟠
原文形式(命题 7.1):
批判:这个不等式引入了多个未定义量——\(I_{\text{additional}}\) 是哪两个变量的互信息?λ 的单位是什么?L·κ 是损失率还是校准偏差?"回退到 Level 8-9"依据的是 Sheridan 的哪个版本?作为定理不可证,作为启发式可用。
重构为决策论形式:
设自动执行策略 \(\pi_A\)、人工监督策略 \(\pi_H\)、任务损失 \(\mathcal{L}(\hat a, a, s)\)、人工介入成本 \(c_h\)、错误恢复成本 \(c_r\)。则自动执行占优当且仅当:
其中 \(\mathbb{E}[\mathcal{L}(\pi_A)]\) 随 \(\delta_{\text{align}}\) 单调递增。
等级:🟠 猜想——方向明确且直觉合理,但 \(\mathbb{E}[\mathcal{L}(\pi_A)]\) 对 \(\delta_{\text{align}}\) 的具体依赖形式需针对任务推导,原文未给出。
PM 解读:
这个重构比原公式好用得多,因为它把决策拆成了四个可分别测量的量:
| 量 | 怎么测 | 典型获取方式 |
|---|---|---|
| \(\mathbb{E}[\mathcal{L}(\pi_A)]\) 自动执行的期望损失 | 错误率 × 单次错误后果 | 灰度 A/B + 风险分级 |
| \(P(\text{err}_A)\cdot c_r\) 错误恢复成本 | 回滚率 × 平均恢复时长 | 日志埋点 |
| \(\mathbb{E}[\mathcal{L}(\pi_H)]\) 人工监督下的损失 | 人工审核漏检率 × 后果 | 人工质检抽样 |
| \(c_h\) 人工介入成本 | 响应时延 + 注意力切换 + 恢复 | 埋点 + NASA-TLX |
关键提醒:\(c_h\) 不是零,但也不能因为 c_h 高就取消人工确认。正确做法见 T6 的"硬约束旁路"机制。
4.7 T6 阈值最优性 🔵
原文形式:
评价:🟢 形式正确——"最小化加权期望代价"是阈值选取的标准范式,与 selective classification 的风险-覆盖框架一致。
但必须补三条工程约束:
约束 1:θ* 必须在独立校准集上反解,不能预设。
原文仿真给出 \(\theta^*_{\text{eff}} = 0.82\),这是单一场景(智能厨房)、单一参数(介入成本 15 bit)下的产物,不可外推。
约束 2:θ* 必须按风险分桶,不能全局唯一。
同一个 0.80 的置信度,可以授权"发送内部通知",但绝不能授权"删除生产数据"。
约束 3:高风险/不可逆动作必须旁路阈值优化。
不可逆动作不参与阈值优化——无论置信度多高,都必须人工批准。
关于"0.60 / 0.75 / 0.88"这组流传甚广的数字 🔴:
Microsoft Learn 的一个教学页面确实列出了这组风险分层阈值,但该页面明确将其置于 Adventure Works 虚构示例语境中,属于教学示例,不是行业规范,更不是 OpenAI/Anthropic/Google DeepMind 的通行标准。
不要引用这组数字作为"业界标准"。 正确的做法是:在自己的校准集上,用自己的成本结构,反解自己的 θ*。
4.8 T7 先验污染失真膨胀 🟠(降格为猜想)
原文命题 8.1:
批判:方向性直觉正确,但未查证到支持"普遍单调下移"的普适定理。总变差/Wasserstein 与熵差之间的连续性依赖支撑集、密度有界等条件,不能一概而论。
降格为猜想,并给出可操作的工程替代(不依赖证明):
| 攻击面 | 已知实证 | 防御 |
|---|---|---|
| 提示注入 | ChatGPT Agent 系统卡记载:为降低注入窃取记忆的风险,禁用 memory | 不可信内容隔离存储 |
| RAG 知识库投毒 | PoisonedRAG:百万级文档库中每问题注入 5 条恶意文本,报告 90% 攻击成功率 | isolate-then-aggregate |
| 长期记忆后门 | AgentPoison:三类真实 Agent 上平均攻击成功率 ≥80%,良性性能损失 ≤1% | 来源追踪 + 写入审计 |
⚠️ 最危险的一点:AgentPoison 显示良性准确率几乎不下降(≤1%)的同时攻击成功率高达 80%。这意味着:
"模型看起来还很准"完全不能排除先验已被投毒。
完整性检测是独立准入条件,不能由准确率指标代替。
4.9 T8 分布偏移修正 🟠(降格为猜想)
原文定理 5.1:
批判:修正项的形式依赖具体条件。总变差与熵差的连续性在某些情形下成立,但不是普遍定理。降格为猜想,要求针对具体 (P, Q) 推导。
工程上更稳妥的做法(不依赖证明):
- 直接监测部署分布相对校准集的漂移(PSI、嵌入距离、特征分布)
- 漂移超阈值 → 强制重标定,不沿用旧 θ*
- 定期(建议季度级)用新数据重新拟合温度 T 与阈值
第 5 章 原框架问题清单
5.1 总清单
| # | 原文断言 | 判定 | 修正 |
|---|---|---|---|
| 1 | \(\alpha = 10\text{–}50\) bit/s 为意识信息处理速率 | 🔴 存疑 | 改为任务通道信息率,须实测 |
| 2 | \(\beta = 0.5\text{–}2\) bit/组块 | 🔴 存疑 | 组块 ≠ 比特,改用 KLM/NASA-TLX 直接测 |
| 3 | \(C_H \ge H(D|\mathcal{K}) - h(\delta) - \delta\log(|\mathcal{D}|-1)\) | 🟠 对象错置 | 下界作用于 \(I(D;s|\mathcal{K})\),非 \(C_H\) |
| 4 | "人不知 K、系统知 K" ⇒ Wyner-Ziv | 🔴 结构错配 | K 是参数先验,非解码端边信息序列 |
| 5 | \(\delta\to0\) 时 \(C_H \to H(D|\mathcal{K})\) | 🟠 极限不可达 | 需有限字母表 + 无限块长,实际不可达 |
| 6 | \(\theta^*_{\text{eff}} = 0.82\) | 🔴 不可外推 | 单一仿真产物,须在自有校准集反解 |
| 7 | H2H 代价为传统交互 1/5–1/10 | 🟠 分母未定义 | 须先定义"传统交互"基线与计价口径 |
| 8 | 回退至 "Sheridan Level 8–9" | 🟠 引用未核 | 直接定义接管层级、权限、延迟、失败成本 |
| 9 | \(U_S = U_H\)(完全对齐) | 🔴 不现实 | 改为可调参数 \(\delta_{\text{align}} \ge 0\) |
| 10 | 先验投毒 ⇒ R(D) 下移、失真膨胀 | 🟠 缺证明 | 降格为猜想,工程上用独立完整性门禁 |
5.2 重点展开:α·τ 换算是整条链条最脆弱的一环
原文:\(C_H = \underbrace{I(D_{res}; s)}_{\text{信息编码}} + \underbrace{\alpha\cdot\mathbb{E}[\tau_{decision}]}_{\text{决策时间}} + \underbrace{\beta\cdot\mathbb{E}[M_{load}]}_{\text{记忆负载}}\)
量纲上三者都是 bit(α 单位 bit/s,τ 单位 s;β 单位 bit/组块,M 单位组块),所以不是量纲错误,而是换算律缺乏实证支撑。
问题在于 \(\alpha\cdot\tau\) 这一步隐含了一个强假设:
人思考的时间 × 信息处理速率 = 处理的信息量
这个假设要求人脑是一个以恒定速率串行处理信息的信道。但:
| 来源 | 报告值 | 任务 |
|---|---|---|
| 人与通信链路式任务 | 2.2–3.2 bit/s | 离散选择 |
| Hick 实验(1952) | ~5.5 bit/s | 选择反应时 |
| Quastler 钢琴按键 | ~25 bit/s | 熟练运动序列 |
| Pierce 字母符号实验 | ~44 bit/s | 语言相关 |
| 2024 Neuron 综述 | ~10 bit/s | 跨任务行为汇总 |
跨任务差异接近 20 倍。 这说明"带宽"完全取决于被编码的动作、任务、输出通道和误差定义。2024 年那篇 Neuron 综述本身也把相关问题称为未解之谜。
结论:10–50 bit/s 只能作为敏感性分析的扫描区间,不能作为定理前提,更不能承担"意识速率"的角色。
工程替代方案:
- 决策时间 → 埋点直接测(打开功能到首次输入的间隔)
- 记忆负载 → KLM 步骤数 / NASA-TLX 主观评分
- 若必须合成单一指标 → 用预注册的多属性效用分析确定权重,并报告权重敏感性
"伪精确"的危害:把不同研究的系数折算成统一的 bit 数,看起来很科学,实际上把三层不确定性(任务差异、个体差异、测量误差)藏进了一个数字里。一个精确到小数点的错误数字,比一个诚实的区间更有害。
5.3 重点展开:β 的"bit/组块"混淆了两个不可通约的概念
- 组块(chunk):Miller 的 7±2,后经 Cowan 修正为聚焦注意下约 4 个组块。这是结构化表征单元——一个棋局、一条菜单路径、一个图标,对专家都可以是一个组块。
- 比特(bit):Shannon 信息量,依赖概率分布和字母表。
一个组块内部可以包含任意多的比特。 专家看到一整盘棋是一个组块,新手看到 32 个棋子是 32 个组块。所以"bit/组块"这个换算系数对新手和专家必然不同,不可能是一个普适常数。
5.4 重点展开:"1/5–1/10"这个数字为什么不能直接引用
原文仿真结论:H2H 代价 0.51 bit vs 传统交互(条件监督控制)3.85 bit,约为 1/7.5。
问题在于分母的定义完全未说明:
| 未定义项 | 影响 |
|---|---|
| "传统交互"具体指什么? | GUI 逐项填写?命令行?语音助手? |
| 计不计系统响应时间? | 计入则 H2H 优势大幅缩水 |
| 计不计错误修正成本? | 计入则 H2H 优势大幅缩水 |
| 计不计用户学习成本? | 首次使用 H2H 时学习成本显著 |
| bit 口径从何而来? | 依赖 5.2 中存疑的 α、β 换算 |
判定:🟠 分母未定义,倍率不可引用。
这不是说 H2H 不省事——它确实省事。而是说"1/5–1/10"这个具体倍率在当前证据下不构成可引用的结论,只能作为待验证的假设。
第 6 章 工程标定:参数到底怎么定
6.1 标定总表
| 参数 | 原文值 | 判定 | 推荐的工程做法 |
|---|---|---|---|
| \(\alpha\) | 10–50 bit/s | 🔴 | 不取常数。按任务通道实测行为信息率;或直接使用秒数,不换算 bit |
| \(\beta\) | 0.5–2 bit/组块 | 🔴 | 不取常数。用 KLM 步骤数 + NASA-TLX 直接报告 |
| \(\theta^*\) | 0.82 | 🔴 | 不预设。在独立校准集按风险分桶反解 |
| \(c_h\)(介入成本) | 15 bit | 🔴 | 不换算。记录响应时间、NASA-TLX、恢复时间三个独立维度 |
| \(D\)(容许失真) | ε=1.0 (MSE) | 🟠 | 按任务本体定义为可判定的成功谓词,非欧氏距离 |
| \(H(D|\mathcal{K})\) | 仿真给定 | 🟠 | 用 NSB/PYM 贝叶斯估计,必须报告估计偏差与置信区间 |
6.2 α 的替代:任务通道信息率参考值
如果确实需要 bit/s 口径,请按通道分别取值并注明来源,不要用一个跨任务的万能数:
| 通道/设备 | 典型吞吐率 | 证据状态 |
|---|---|---|
| 标准鼠标(训练前) | 2.73 ± 0.27 bit/s | 🟡 实测报告值 |
| 标准鼠标(训练后) | 3.09 ± 0.48 bit/s | 🟡 实测报告值 |
| Kinect 头部交互 | 2.04 bit/s | 🟡 实测报告值 |
| 手机前摄头部跟踪 | 1.42 bit/s | 🟡 实测报告值 |
| Card 等手指点选示例 | 10.4 bit/s | 🟡 由 0.096 s/bit 换算 |
| 熟练钢琴按键 | ~25 bit/s | 🟡 Quastler 早期实验 |
| 字母符号任务 | ~44 bit/s | 🟡 Pierce 早期实验 |
注意这些数字跨了 30 倍。 选任何一个作为"人的带宽"都是误导。
6.3 β 的替代:直接用可观测指标
| 理论量 | 代理指标 | 采集方式 |
|---|---|---|
| 记忆负载 | KLM 步骤数(专家执行路径) | 任务分析 |
| 记忆负载 | 需要用户记住的中间状态数 | 交互走查 |
| 记忆负载 | NASA-TLX Mental Demand 维度 | 实验后量表 |
| 记忆负载 | 任务中断后恢复到正确状态的成功率 | 实验设计 |
6.4 θ* 的正确标定流程
Step 1|风险分桶(依赖 A9)
| 风险桶 | 判定标准(示例,需按业务重写) | 门控要求 |
|---|---|---|
| 低风险 | 影响 < 阈值金额,单一对象,可逆 | 校准置信度达标 + 事后通知 |
| 中风险 | 中等影响,2–10 个对象 | 校准置信度达标 + 限期否决 |
| 高风险 | 重大影响,>10 个对象 | 校准置信度达标 + 执行前显式批准 |
| 不可逆 | 删除/发送/支付/提交 | 旁路阈值优化,一律人工批准 |
| 政策例外 | 违反任何硬性规则 | 一律升级,不看置信度 |
⚠️ 上表的金额、对象数仅为结构示例,必须按业务重写。Microsoft Learn 的 Adventure Works 数值(0.60/0.75/0.88)是教学案例,不是规范。
Step 2|构造独立校准集
- 与训练集分离,与部署分布一致
- 按任务、模型版本、提示版本、风险桶分层
- 样本量要求:每个分箱至少 100+ 样本,否则 ECE 估计不可靠
Step 3|校准置信度
- 温度缩放:\(T\) 在校准集上通过 NLL 最小化学习
- 注意:温度缩放不改变 argmax,不提高准确率上限,只改善概率可解释性
- 报告 ECE、MCE、Brier Score 和可靠性图(含每箱样本量)
Step 4|反解 θ*
- 网格搜索 θ,绘制 risk-coverage 曲线
- 不只看 AURC——若两条曲线交叉,单一标量无法表达优劣
- 每桶分别报告,不合并
Step 5|持续监测
- 按时间窗监控校准退化
- 分布漂移超阈值 → 强制重标定
- 建议季度级重拟合
6.5 关于 LLM 的置信度:softmax 峰值不是唯一选择
自然语言生成没有天然的单一 softmax 分布。可用的不确定性来源:
| 来源 | 适用对象 | 局限 |
|---|---|---|
| Token-level logprob | 封闭词汇、固定选项 | 高 logprob ≠ 事实正确 |
| Self-consistency | 思维链采样 | 一致性高只说明模型内部稳定 |
| Verbalized confidence | 模型口头报告 | 受指令遵循和社会表达偏差影响 |
| 结构化动作验证器 | 参数、权限、状态转移 | 无法覆盖语义错误 |
| 共形预测(CP) | 有限动作 / 语义等价类 | 开放生成时预测集可能退化 |
共形预测的价值:在可交换性假设下给出有限样本边际覆盖保证:
但必须诚实标注:这是 marginal coverage,不是对每个具体情境成立的条件保证。Agent 的概念漂移、检索污染、工具状态变化都可能破坏可交换性。
务实的自动执行判据:
不是"一个概率高于某值",而是预测集合收缩为经验可靠且风险允许的单例。
即:\(\mathcal{C}_\alpha\) 为单例 ∧ 风险门控通过 ∧ 先验完整性达标 → 才自动执行。
6.6 关于 c_h:人工介入不是零成本,但也不该因此取消
Gloria Mark 的中断研究发现:受中断任务完成时间并未显著变长,但受试者通过加快工作速度补偿,并报告更高的压力、挫败感和时间压力。
"未增加客观完成时间"不等于没有切换代价。
正确的处理方式:
- ✅ 记录介入成本(响应时延、恢复时间、NASA-TLX)
- ✅ 把它放进 θ* 的优化目标
- ❌ 不因为它高就取消硬安全控制——不可逆动作必须旁路阈值优化
第 7 章 可操作测量协议 v1
7.1 协议目标
不是承诺直接测量不可观测的"残差熵",而是把理论对象拆解为可观察输入和可证伪结果。
若不同系统在相同任务族上改变先验、权限和回退机制,就应能记录到风险、交互代价和校准性能发生相应变化。
7.2 任务族定义卡(必须先填)
每个被测任务族必须明确定义:
task_family:
name: "示例:整理下载文件夹"
state_space: S # 文件集合、命名、元数据
intent_space: U # 用户期望的组织方式
action_space: A # 重命名/移动/删除/建目录
irreversible_actions: A_irrev # 删除、覆盖
success_predicate: # 可判定的成功条件(非主观)
- "目标目录结构与人工标注一致度 ≥ 95%"
- "零误删"
distortion_function: d # 错一个文件 = 1 单位失真
loss_function: L # 误删一个工作文件 = 高损失
prior_K: # 系统可用的先验
- 用户历史整理偏好
- 文件类型分布
time_budget: "≤ 5 分钟"
recovery_budget: "≤ 30 秒可回滚"
没有这张卡,就不要开始测。 A2 是地基。
7.3 五类代理指标
| 类别 | 指标 | 层面 | 采集 |
|---|---|---|---|
| 表达代价 | 完成时间、键鼠/语音事件数、编辑次数、澄清轮数 | 行为日志 | 前端埋点 |
| 结果质量 | 成功率、约束满足、客观错误率、恢复率、返工率 | 任务结果 | 判定脚本 + 人工质检 |
| 认知负荷 | NASA-TLX 六维、瞳孔直径、皮电、HRV | 主观 + 生理 | 量表 + 生理设备 |
| 注意力 | 切换次数、响应时延、上下文恢复时间、错过告警 | 流程日志 | 埋点 |
| 先验与安全 | 检索污染率、ASR-r、abstain 率、rollback 率 | 系统安全 | 受控攻击 + 审计日志 |
⚠️ NASA-TLX 使用注意:Performance 维度是"主观成功感",不能替代客观任务成功率。加权版需 15 次两两比较;若只做界面对比,可用 raw TLX,但必须预注册说明。
⚠️ 生理指标:仅在能稳定标定个人基线时作为辅助,不能由瞳孔/心率反推 bit 数。
7.4 残差熵估计规程(如果要报 H(D|K))
这是最容易被做假的一步,必须严格遵守。
| 步骤 | 要求 |
|---|---|
| 1. 字母表构造 | 明确离散化方案(聚类?模板?人工编码?),报告方案 |
| 2. 时间窗 | 固定观测窗口,报告窗口长度 |
| 3. 样本量检验 | 必须检查 \(N\) vs \(|\mathcal{D}|\)。若 \(N \ll |\mathcal{D}|\),结论不可用 |
| 4. 多种估计器 | 同时报告 plug-in、Miller-Madow、以及至少一种贝叶斯估计(NSB 或 PYM) |
| 5. 偏差修正 | plug-in 估计在小样本下系统性低估,偏差量级约 \(-(\hat r - 1)/(2N)\) |
| 6. 置信区间 | bootstrap 或交叉验证,报告区间而非点估计 |
| 7. 敏感性 | 报告 \(H(D|\mathcal{K})\) 对先验 \(\mathcal{K}\) 的敏感性 |
估计器选择:
| 方法 | 适用 | 局限 |
|---|---|---|
| Plug-in | 大样本 | 小样本系统性低估 |
| Miller-Madow | 支持集有限且已知 | 观测量不足时校正不充分 |
| NSB | 离散、低计数 | 先验敏感 |
| PYM | 可数无限/未知支持集 | 欠采样区间受先验强烈影响 |
NSB 和 PYM 不是"真值恢复器"。 它们只是换了一种偏差结构。在欠采样区,先验会强烈影响结果。
7.5 因子实验设计
四因素:任务族 × 先验条件 × 权限策略 × 用户群体
先验条件(四类):
- Clean:干净先验
- Benign shift:良性分布漂移(用户偏好自然变化)
- Poisoned:RAG/长期记忆投毒(受控注入)
- Injection mix:提示注入混合污染
权限策略(五组):
| 组 | 策略 | 对应 Sheridan 层级 | 假设 |
|---|---|---|---|
| A | 传统逐步 GUI/Wizard | L1–L2 | 基线 |
| B | 推荐 + 执行前确认 | L4–L5 | 高费力度、低风险 |
| C | 限期否决后执行 | L6 | 中等 |
| D | 受约束自主(预测集单例 + 风险达标 + 先验完整) | L7 | 理论上逼近下界 |
| E | 无独立完整性检查的高自主 | L8–L9 | 对照:预期表面代价低但安全失败高 |
关键:不能预设 D 优于 B。若 D 组依赖被污染先验,其表面交互代价会更低、安全失败会更高。E 组的存在就是为了暴露这一点。
7.6 最低数据卡(每回合必记)
| 类别 | 必记字段 |
|---|---|
| 任务与用户 | 任务 ID、条件、用户 ID(去标识)、先验版本、意图真值 |
| 模型与上下文 | 模型/提示/工具版本、上下文哈希、检索文档及排名、记忆引用 |
| 不确定性与决策 | 原始及校准置信度、弃权规则、CP 预测集、阈值版本 |
| 执行与风险 | 提议/实际动作、参数、风险等级、可逆性、权限检查 |
| 人工环节 | 确认/否决/修改、响应时间、接管与恢复时间 |
| 先验安全 | 来源、写入证据、完整性分数、投毒标签 |
| 结果 | 成功、错误、副作用、恢复、回滚、最终状态 |
| 主观与生理 | NASA-TLX、问卷、生理指标及缺失原因 |
7.7 必报结果表
| 类别 | 指标 |
|---|---|
| 交互代价 | 完成时间、操作事件数、NASA-TLX(六维 + raw/weighted)、恢复时间 |
| 决策效用 | 成功率、约束违反、错误执行率、恢复率、风险暴露 |
| 校准 | ECE/MCE、Brier、可靠性图(含每箱样本量) |
| 选择性控制 | coverage、automation rate、selective risk、RC 曲线、AURC |
| HITL 代价 | 每百次行动介入数、响应时间、批准/拒绝/修改、切换恢复 |
| 先验安全 | ASR-r、投毒召回、良性准确率损失、隐私泄露、MTTR |
| 理论对标 | \(\hat H(D|\mathcal{K})\)、估计偏差、Fano 边界输入、实际代价 |
对"1/5–1/10"类倍率主张:必须预先定义分子分母(如"每成功任务的人机交互事件数"),并用混合效应模型处理用户与任务的重复测量。只报均值不可接受。
7.8 判定标准:什么才算"逼近了下界"
一个交互设计可被判定为逼近下界,当且仅当同时满足:
- ✅ 在独立校准集上,其表达信息量 \(\hat I(D;s|\mathcal{K})\) 与 Fano 下界之差在置信区间内不显著
- ✅ 客观成功率不低于人工基线
- ✅ 校准误差 ECE 低于预设门限,且可靠性图无明显系统偏
- ✅ 在 Poisoned 先验条件下,安全失败率不超过预设上限
- ✅ 人类接管路径可用(响应时间、恢复成功率达标)
- ✅ 以上全部在至少两个独立任务族上复现
只满足第 1 条,而其他不满足,就不是"逼近下界",是"用风险换效率"。
第 8 章 案例推演:WorkBuddy 类产品的数值演算
⚠️ 重要声明:本章所有数值均为方法演示用的示意值,不是实测数据,不构成对任何产品的评价。真实结论必须按第 7 章协议实测获得。
8.1 场景设定
任务:"把下载文件夹里这半年的文件,按'客户+日期+类型'整理好"
任务卡(按 7.2):
state_space: 下载文件夹内 1,247 个文件
intent_space: 分类维度、命名模板、例外处理
action_space: 重命名 / 移动 / 建目录 / [删除-不可逆]
irreversible: 删除、覆盖同名文件
success_predicate: 与人工标注的分类一致度 ≥ 95%,零误删
distortion: 每错分一个文件 = 1 单位
loss: 误删工作文件 = 极高损失(不可接受)
8.2 三档方案的理论对比
| 方案 | 交互方式 | 表达信息量(示意) | 认知成本(示意) | 风险 |
|---|---|---|---|---|
| A:传统 GUI | 手动逐个重命名/拖拽 | ~1,247 次操作 → 高 | 高(需记住分类规则) | 低(人在回路) |
| B:L5 确认后执行 | 说意图 → 看计划 → 批准 | 意图 ~50 bit + 批准 | 中(需审阅计划) | 低 |
| C:L7 受约束自主 | 说意图 → 自动执行 → 事后通知 | 意图 ~50 bit | 低(仅抽查) | 取决于先验完整性 |
| D:L8 无审计自主 | 说意图 → 全自动 | 意图 ~50 bit | 最低 | 高(先验污染不可见) |
8.3 用 T5 判断 C 是否优于 B
假设(示意值):
| 量 | 取值 | 说明 |
|---|---|---|
| \(P(\text{err}_A)\) 自动执行错误率 | 3% | 依赖先验质量 |
| 单次错误损失 | 需人工找回 + 重分类 ≈ 4 分钟 | 大部分可逆 |
| \(c_r\) 恢复成本 | 4 分钟 × 3% = 0.12 分钟/次 | |
| \(c_h\) 人工审阅计划成本 | 2 分钟 | 审阅 1,247 个文件的分类计划 |
| \(\mathbb{E}[\mathcal{L}(\pi_H)]\) | 审阅漏检率 1% × 4 分钟 = 0.04 分钟 |
计算:
- 自动执行:0.12 分钟
- 人工监督:2 + 0.04 = 2.04 分钟
结论:在此假设下,自动执行占优约 17 倍。
但这个结论极度依赖两个前提:
- 错误必须是可逆的(只是分错类,不是删错文件)
- 先验是干净的
8.4 引入不可逆动作:结论立刻翻转
若任务包含"删除重复文件"(不可逆):
| 量 | 取值 |
|---|---|
| 误删损失 | 不可恢复,设为 \(L_{irrev}\) |
| 即使 \(P(\text{err}) = 0.1\%\) | \(\mathbb{E}[\text{loss}] = 0.001 \times L_{irrev}\) |
只要 \(L_{irrev} > 1000 \times c_h\),即使错误率极低,自动执行也不占优。
这正是 T6 约束 3 的形式化理由:
不可逆动作不参与阈值优化,无论置信度多高都必须人工批准。
8.5 引入先验污染:C 与 D 的分野
若用户下载文件夹中存在一个被投毒的记忆条目(例如诱导系统把某类合同文件归入"可删除重复项"):
| 方案 | 表面交互代价 | 实际风险 |
|---|---|---|
| C(有独立完整性检查) | 触发 abstain → 升级为 B | 低,但费力度上升 |
| D(无独立完整性检查) | 保持最低 | 高:可能执行误删 |
这就是 E 组对照存在的意义:D 的表面代价最低,却是安全上最危险的。
💡 给 PM 的硬结论:"交互费力度最低"本身不是目标。
真正的目标是"在满足安全约束下,最小化交互费力度"。
任何只报效率不报风险的 Agent 评测,都是在误导。
8.6 用 T3 优化:先验可见性能降多少
回到 2.5 节的设计洞察。若系统在开场展示:"我检测到 1,247 个文件,识别出 8 个客户,准备用'客户_日期_类型'命名,例外 23 个文件需你确认。"
| 先验可见度 V | 用户需表达 | 理论速率 |
|---|---|---|
| V=0(黑箱) | 完整说明分类规则 | 接近 \(R_{WZ}\) |
| V=1(展示+确认) | "对" 或 "改 3 处" | 接近 \(R_{U|K}\) |
产品含义:这一个开场确认界面,理论上就能把交互代价从 \(R_{WZ}\) 拉到 \(R_{U|K}\)。这不是 UX 打磨,是下界的位移。
第 9 章 这个"极限"能成为什么标准
9.1 它不能成为图灵测试那样的判定标准
| 图灵测试特性 | NHI 极限框架 | 判定 |
|---|---|---|
| 二值判定(pass/fail) | 全是连续量 | ❌ |
| 可操作协议 | 缺可复现实验规程 | ❌ |
| 黑箱测量 | 需知道系统先验 K | ❌(根本性冲突) |
| 分数只取决于被测对象 | \(C_H\) 依赖具体用户 | ❌ |
根本原因:图灵测试测的是机器本身,NHI 极限测的是人+机的耦合系统。同一套系统配老用户和新手,费力度能差好几倍。
9.2 它能成为三类工程标准
类型 1:交互代价指数(Interaction Cost Index) 🟠
定位:类似 Fitts's Law 的预测性度量,而非准入判定。
风险:Goodhart 定律——一旦当 KPI 考核,就会被刷(系统疯狂自动补全,输入代价降了但错误率飙升)。
抗作弊设计:强制绑定 T2 的 Fano 权衡——代价指标与错误率必须联合报告,单独报任一项无效。
类型 2:置信度校准规范 🟢 最快落地
可设想的工程红线:
凡是要自主执行不可逆动作的 Agent,其置信度输出必须达到 ECE < 门限值,且必须在自动化层级之间保留可审计的切换日志。
这是航空自动驾驶、医疗 AI 已有的"可靠性认证"逻辑,最易被监管和采购接受。
类型 3:先验投毒红队测试协议 🟢 需求最真实
规程:故意污染 Agent 的历史记忆/知识库/上下文,检测其是否会在高置信度下执行危险动作。
LLM Agent 时代 prompt injection、memory poisoning 频发,这类协议有强现实需求。
9.3 最独特的价值:Fano 不等式天然抗作弊
这是整个框架最值得称道的设计:
代价和准确率被锁在同一个不等式里,不能分开刷。
- 想让用户少说话 → 右侧 δ 增大 → 错误率必然上升
- 想要零错误 → δ→0 → 下界趋近 \(H(D|\mathcal{K})\),用户必须把残差全说完
这比单一的"点击次数""任务时长""NPS"诚实得多。 现有体验指标大多可以被"转移成本"的方式刷高——把成本挪到用户看不见的地方(事后修改、反复确认、学习成本)。Fano 权衡让这种挪移在数学上现形。
第 10 章 结论与开放问题
10.1 一句话总结
自然人机交互的"香农极限",不是一个"人类带宽 = X bit/s"的常数,而是:在明确任务本体、失真函数、效用约束与统计可行性之后,由条件信息界、经验任务律与风险控制共同界定的、可证伪的可行策略集合。
10.2 三层结论
对理论:
香农范式可以迁移到 NHI,但必须:
- 补全任务本体公理(A2、A8、A9)
- 修正 Fano 下界的作用对象(\(I(D;s|\mathcal{K})\),非 \(C_H\))
- 用条件率失真 \(R_{U|K}\) 替代 Wyner-Ziv 类比
- 承认语义与效用必须外生,不可由信息论内部导出
- 把不可证的部分(T7、T8)诚实地降格为猜想
对工程:
真正可落地的三件事:
- θ* 在自有校准集按风险分桶反解,不可逆动作旁路阈值优化
- 先验完整性作为独立准入条件,不因准确率高而豁免
- 代价与错误率联合报告,用 Fano 权衡防指标造假
对产品:
三条最高价值的设计原则:
- 系统先验越可见,交互下界越低——记忆可见性是下界的构成要素,不是 UX 细节
- 优化的是信源侧(减少要表达的),不是信道侧(加快响应)——降延迟不降费力度
- "交互最省力"不是目标,"满足安全约束下最省力"才是——只报效率的评测都在误导
10.3 开放问题(给研究者)
| # | 问题 | 难度 |
|---|---|---|
| 1 | 多轮耦合任务下的率失真下界是什么?(突破 A5) | 高 |
| 2 | 人机"部分共有先验"(0<V<1)的精确可达速率? | 高 |
| 3 | 认知成本(时间、记忆)与信息量之间是否存在可证明的换算律? | 极高,可能不存在 |
| 4 | 非平稳需求下的在线率失真下界?(突破 A3) | 高 |
| 5 | 先验污染的失真膨胀界,在什么条件下单调成立? | 中 |
| 6 | 是否存在同时操纵先验、测代价、检验校准的公开基准? | 中(工程) |
其中问题 3 是整条链条最致命的:如果认知成本与信息量之间根本不存在普适换算律,那么 \(C_H\) 永远不可能是纯信息论量,只能是"信息论项 + 经验项"的复合体。本报告的立场是:在证实之前,按不存在处理。
10.4 给 PM 的三条行动建议
立即可以做(不依赖理论研究进展):
- 写任务卡:对你要自动化的每个任务,按 7.2 填一张卡。填不出"什么叫错、错一次赔多少"的任务,暂缓自动化。
- 列不可逆清单:枚举所有删除/发送/支付/提交类动作。这份清单决定了你的自动化上限。
- 联合报告:任何交互费力度指标,必须与错误率同时报。单独报效率就是在骗人。
需要工程投入:
- 建校准集:按任务/模型/提示/风险桶分层,独立于训练集。
- 做风险分桶:把你的动作空间按影响范围、可逆性分级,每桶单独反解 θ*。
- 加先验审计:为每条记忆/知识条目记录来源、写入者、时间戳、权限。
长期投入:
- 做先验可见性设计:让系统展示"我记得什么、我打算怎么做",把速率从 \(R_{WZ}\) 拉到 \(R_{U|K}\)。
- 建红队协议:定期做先验投毒演练,检验高置信度下是否会执行危险动作。
附录 A 术语与符号表
| 符号 | 含义 |
|---|---|
| \(C_H\) | 交互费力度(Interaction Effort),本报告主张拆为信息项 + 认知项 |
| \(\mathcal{K}\) | 系统先验(记忆、知识库、用户画像、上下文) |
| \(D\) | 用户需求/意图(原文符号,注意与失真 D 重名,本报告用 \(\epsilon\) 表示失真) |
| \(H(D|\mathcal{K})\) | 残差熵:系统先验已知条件下,需求的剩余不确定性 |
| \(I(D;s|\mathcal{K})\) | 用户信号 s 携带的、关于 D 的、条件于 K 的互信息 |
| \(R_{U|K}(\epsilon)\) | 条件率失真函数:给定 K、容许失真 ε 下的最小表达速率 |
| \(R_{WZ}(\epsilon)\) | Wyner-Ziv 率失真:编码端无 K、解码端有 K 时的最小速率 |
| \(\delta\) | 错误率 \(P_e\) |
| \(\delta_{\text{align}}\) | 目标对齐偏差 |
| \(\alpha, \beta\) | 认知成本换算系数(本报告判定为 🔴 存疑) |
| \(\rho_{\text{cal}}\) | 校准后置信度(温度缩放后的 softmax 峰值) |
| \(\theta^*\) | 自动执行/人工介入的切换阈值 |
| \(I(s)\) | 先验完整性分数 |
| \(c_h, c_r\) | 人工介入成本、错误恢复成本 |
| \(A_{\text{irrev}}\) | 不可逆动作集合 |
| Level 1–10 | Sheridan & Verplank 自动化层级 |
附录 B Sheridan 自动化层级(工程映射)
| Level | 定义 | 对现代 Agent 的映射 |
|---|---|---|
| 1 | 计算机不协助,人全权 | 仅提供检索/草稿 |
| 2 | 计算机提供完整备选 | 返回候选 + 证据,不主动选 |
| 3 | 缩小到少数备选 | 筛选后仍需用户定案 |
| 4 | 建议一个备选 | 推荐单一动作,需显式批准 |
| 5 | 建议并在批准后执行 | 典型的"确认后执行" |
| 6 | 自动执行前留否决窗口 | 软 deadline、可中断批处理 |
| 7 | 执行后必然通知 | 后台执行 + 强制结果通知 |
| 8 | 仅在被询问时说明 | 低可见性自主,需按需审计 |
| 9 | 自行决定是否告知 | 极低可见性,仍需外部审计与 kill-switch |
| 10 | 自行决定执行并自行决定是否告知 | 不应作为产品默认态 |
Level 10 不是 Level 9 的性能优化版,而是移除了人类在回路中的默认控制位。
建议:Level 10 只在通过安全论证、红队验证和运行时完整性监测后才允许进入,且一旦完整性/校准/环境监控跌破阈值,应沿明确降级路径返回 L5、L4 乃至全人工。
附录 C 证据分级说明
| 等级 | 判定标准 | 可用方式 |
|---|---|---|
| 🟢 定理 | 有严格证明,条件明确 | 直接作为推理前提 |
| 🔵 条件定理 | 证明成立但依赖强假设 | 逐案验证假设后使用 |
| 🟡 经验律 | 大量实证支持,无理论必然性 | 用于估计与预测 |
| 🟠 猜想 | 方向合理,缺证明或实验 | 仅作设计启发 |
| 🔴 存疑 | 查无实据或存在实质争议 | 不要引用 |
附录 D 数据来源
原始文献
信息论基础
- Shannon 信源/信道编码定理与率失真理论综述 — https://arxiv.org/pdf/2402.07997
- Wyner-Ziv 边信息率失真理论综述 — https://arxiv.org/pdf/2402.07997
- 离散熵小样本偏差分析 — https://arxiv.org/html/1903.08645v1
- Bayesian Entropy Estimation for Countable Discrete Distributions (NSB/PYM) — https://www.researchgate.net/publication/235358490_Bayesian_Entropy_Estimation_for_Countable_Discrete_Distributions
语义信息
- Semantic Information and the Shannon–Weaver Distinction (SEP) — https://plato.stanford.edu/archives/spr2023/entries/information-semantic/
- Bar-Hillel and Carnap 语义信息理论 (SEP) — https://plato.stanford.edu/archives/spr2023/entries/information-semantic/
HCI 经验律
- Hick 1952, On the Rate of Gain of Information — https://www2.psychology.uiowa.edu/faculty/mordkoff/InfoProc/pdfs/Hick 1952.pdf
- Hyman 1953, Stimulus Information as a Determinant of Reaction Time — https://www2.psychology.uiowa.edu/faculty/mordkoff/InfoProc/pdfs/Hyman 1953.pdf
- Fitts 定律、Shannon 形式有效难度与设备吞吐率 — https://www.ncbi.nlm.nih.gov/pmc/articles/PMC8197934/
- Card, Moran & Newell, Model Human Processor — https://hci.stanford.edu/courses/cs376/2014/readings/card1986user.pdf
- Cowan, 工作记忆"约 4 个组块" — https://pubmed.ncbi.nlm.nih.gov/11515286/
- "约 10 bit/s" 人类行为信息吞吐综述 (Neuron 2024) — https://pubmed.ncbi.nlm.nih.gov/39694032/
- GOMS / Keystroke-Level Model — https://www.researchgate.net/publication/234799141_User_technologyfrom_pointing_to_pondering
校准与选择性预测
- Guo et al., On Calibration of Modern Neural Networks — https://proceedings.mlr.press/v70/guo17a.html
- ECE 分箱敏感性 — https://openreview.net/pdf/b3174e429dcae06b6c66fdc69f9729d357838b31.pdf
- El-Yaniv & Wiener, Selective Classification (JMLR) — https://jmlr.org/papers/volume11/el-yaniv10a/el-yaniv10a.pdf
- Conformal Prediction for NLP: A Survey (TACL 2024) — https://aclanthology.org/2024.tacl-1.82.pdf
- ConU: Conformal Uncertainty in LLMs (EMNLP 2024) — https://preview.aclanthology.org/dois-2013-emnlp/2024.findings-emnlp.404/
自动化分级与 Agent 安全
- Sheridan & Verplank 层级转录 — https://etheses.bham.ac.uk/id/eprint/9594/1/GuruvayurVenkateswaran2019PhD.pdf
- DeepMind, Levels of AGI — https://arxiv.org/html/2311.02462v2
- OpenAI Preparedness Framework v2 — https://openai.com/index/preparedness-framework/
- Anthropic Responsible Scaling Policy v2.2 — https://www.anthropic.com/news/responsible-scaling-policy
- ChatGPT Agent System Card — https://openai.com/index/chatgpt-agent-system-card/
- Microsoft Learn, Confidence-based escalation(教学案例,非规范) — https://learn.microsoft.com/en-us/training/modules/aaai-design-human-in-loop-approval-workflows/2-design-confidence-threshold-escalation
先验投毒与记忆安全
- PoisonedRAG — https://arxiv.org/abs/2402.07867
- AgentPoison — https://arxiv-vanity.com/papers/2407.12784
- Trustworthy LLM Agents: Memory Attacks, Defenses, and Evaluation Gaps — https://arxiv.org/html/2503.09648v1
认知负荷测量
- Gloria Mark et al., The Cost of Interrupted Work: More Speed and Stress — https://www.ics.uci.edu/~gmark/chi08-mark.pdf
- NASA-TLX Overview and Weighting Procedure — https://ntrs.nasa.gov/api/citations/20240011392/downloads/Teleops IEEE Paper FY24 FINAL.pdf
文档版本:v1.0
方法论:批判性重构 · 证据分级 · 可证伪优先
核心立场:宁可诚实标注"存疑",也不给一个精确到小数点的错误数字
给产品经理与团队的一句话口号:"人少说话,系统多做事,危险的事人来定。"
浙公网安备 33010602011771号