我有个同事,所有 AI 工具都开顶配套餐。就这样,额度还是不够烧——他的用量曲线,比我们业务的增长曲线都陡。
他在干嘛呢?
日夜不停地让 AI 优化我们的系统。 白天让它批判架构,晚上让它批判自己白天改过的架构。人歇了,任务不歇,第二天早上收一批"优化建议",继续投喂。
我问他图什么。他说了一句听起来特别有道理的话:
"有位大师说过——不断批判它,它最终能达到最优。"
哪位大师?他也想不起来了。但这句话本身,我承认,第一次听是有杀伤力的。批判驱动进步,这不就是科学方法吗?何况 AI 不知疲倦、批判成本几乎为零——用无限的批判逼近最优解,听上去像永动机一样美。
而永动机的问题从来不是"听上去"那一步。
两周后,我看了看他的"最优系统"
三个现象,每一个都值得裱起来。
第一,反复横跳。 周一,AI 批判某个模块耦合太重,建议拆;周三,AI 批判拆得太散,建议合;周五,又批判合得太死,建议拆。同一段代码,两周里被"优化"出了一个轮回。为什么?因为没有外部基准的批判,只是换个角度的偏好。你让它批判,它就给你批判——要多深刻有多深刻,要多犀利有多犀利。犀利不等于对。
第二,复杂度通胀。 每一轮优化,系统都会多一层抽象:加个接口、抽个基类、引入一个新模式。两周下来,原来三层的结构变成了七层。这是 AI 批判的一个隐蔽倾向:"加东西"显得深刻,"删东西"不显功力——批判的产出物天然偏向复杂化,因为复杂看起来更像"优化过了"。
第三,也是最致命的:指标真空。 我问他,优化了这么多轮,快了多少?稳了多少?省了多少?
他答不出一个数字。
没有记分牌的比赛,打得再热闹,也没有比分。
那句话到底错在哪
我后来想明白了,那句"不断批判它,它最终能达到最优",不是错在批判——批判确实是进步的引擎,这一点哲学家们早就说透了(这套思想最像的出处是波普尔的"猜想与反驳":知识靠批判生长)。
它错在悄悄偷换了一个前提:批判要有效,必须能被检验;而检验,需要外部的现实。
科学家的猜想被实验检验,实验室不归猜想的人管。而我同事的 AI 呢?它自己提批判、自己评好坏、自己宣布"这版更优"——运动员、裁判、记分员,全是它一个人。这种批判循环不会收敛到最优,只会收敛到"AI 自己觉得顺眼",而它每天觉得顺眼的东西还不一样。
我干了二十年研发,见过人肉版的同款故事:没有验收标准的重构,永远在重构。AI 只是把这个循环的转速提高了一百倍——方向不对的时候,转速越快,烧钱越快。
让 AI 优化真正收敛的四件事
我自己也重度让 AI 优化系统——我的几个自动化机器人每周都在被 AI 批判和改进。区别只在四件事:
① 先立记分牌,再放它跑。 一套评测集(真实场景的问题+期望结果)、几个硬指标(延迟、成本、错误率)。"优化"之前先跑一遍留底,优化之后再跑一遍——变好变坏,数字说话,不听 AI 自评。
② 目标函数必须人来定。 "帮我优化一下"是全世界最贵的提示词——优化什么?延迟、成本、可读性还是扩展性?这些目标经常互相打架。你不定目标,AI 就自己发明一个,而它发明的目标通常是"看起来更高级"。
③ 每轮留档,输了回滚。 版本 n 和版本 n+1 用同一套评测对打,赢了才留下。听起来笨,但这是防"越改越差"的唯一手段——没有对照的迭代,不叫迭代,叫漂移。
④ 批判可以外包,裁决不能。 让 AI 生成一百条批判,没问题,这是它的强项;但哪条批判值得听、这一版算不算更好,拍板的必须是人。裁判下场踢球的比赛,比分没有意义。
你看,这四件事没有一件是新发明——评测、目标、对照、终审,工程学的老规矩而已。AI 没有推翻这些规矩,它只是把违反规矩的代价变得更贵了:以前瞎折腾浪费的是自己的时间,现在瞎折腾,是按 token 计费的。
最后
那位同事的额度这个月又烧光了。这篇文章发出去之后我打算转给他——我赌他的回复是:"有道理,我让 AI 批判一下你这篇文章。"
真要是这样,我竟无法反驳。
但我想把那句话补完整,送给所有在用 AI 干活的人:
"不断批判它,它最终能达到最优"——成立的前提是:批判有记分牌,裁决有人。
没有裁判的批判,只是昂贵的原地打转。AI 时代最贵的从来不是顶配额度,是没有方向的勤奋。
浙公网安备 33010602011771号