AIGC标识 AI 评测的盲区:当基准测试追不上模型进步

新模型发布后,社交平台上很快会出现两种声音:一种惊叹能力又变强了,另一种立刻担心开发岗位要消失。这两种反应都太急了。能力提升和职业消亡之间隔着很长的逻辑链。更值得先弄清楚的问题是:我们凭什么知道一个模型变强了?

大多数人会看基准测试分数。这没有错,基准测试提供了一个公共的起跑线,让不同模型可以在同一套规则下比较。但测试分数是一个测量工具给出的结果,不是能力本身。温度计显示的温度不等于温度本身,基准测试的分数也不等于模型在真实工作中的全部表现。

一个测试用久了会老化。早期能区分模型优劣的题目,随着模型整体水平提高,可能绝大多数强模型都能拿到接近满分。当分数集中在顶部,那一两个百分点的差距还能说明什么?这时候不是测试变差了,而是它已经完成了在低水平阶段的区分任务,不再适合区分高水平模型。厂商的系统文档里会明确提到某些旧评测已经饱和,正在考虑退役,同时引入更贴近真实场景或实验数据的新评测。测试被替换,往往说明技术往前走了,而不是测评失败。

看到 92% 这个数字时,应该多问一句:92% 是按什么算出来的?数学题有唯一答案,代码题可以跑测试,事实性问题能对照可靠来源。但科学推理、生物预测、长流程任务往往没有唯一正确答案。这时候需要确定参考答案,也就是基准真相。它可能来自专家判断、实验数据、模拟结果或其他来源。当某个能力无法直接测量时,人们会找一个代理指标。比如用病毒衣壳包装效率的预测任务来代表更广泛的生物设计能力。代理指标本身不是问题,问题在于把“预测得分提高了”直接说成“真实能力提高了”。两者相关,但不完全等同。

更隐蔽的情况是参考答案本身带有误差。如果用来当参考的旧模型预测包含系统性偏差,新模型可能只是更擅长复现这些偏差,而不是更接近真实的生物规律。分数是真实的,进步也可能是真实的,但它代表什么,需要打一个问号。使用未发表的实验数据和湿实验验证过的证据做评测,能让测试更贴近真实行为,原因就在这里。

测试本身也会变。一个基准分数背后有数据集、提示词、评分方式、打分模型、工具配置等环节。其中任何一项调整,都会改变最终数字的含义。旧结果和新结果不能直接比较,除非确认测试设置一致。还有一个容易被忽略的细节:在开放式评测中,较长的回答有更多机会命中评分标准关注的要点,模型可能仅仅因为说得更多而得分更高,哪怕简短回答对用户更有用。有些评测会额外报告长度调整后的分数来抵消这种影响。

另一方面,我们使用 AI 的方式正在从单轮问答转向多步骤任务、调用工具、处理不完整指令、在需求变化时调整方向。新模型的发布材料会强调它在模糊需求下主动提问、等待回复期间继续处理其他工作的能力。但传统的单答案评测很难覆盖这些行为。一次回答的准确率,测不出一个模型在长流程中保持方向、知道何时该停下来确认、以及判断自己是否真的完成了任务的能力。

面对一个基准分数,可以按顺序问几个问题。这个测试测量的是什么具体行为?参考答案从哪来,可靠性如何?测试是否已经接近饱和?两个被比较的分数是否来自同一套设置?分数有没有做长度调整?这个能力在真实工作中以什么形式出现,测试覆盖了多少?这些问题不需要全部有答案,但问过之后,对数字的信任程度会更合理。

对开发者来说,写代码变快不等于软件工程消失。需求梳理、架构决策、安全与可靠性设计、验证产出、权衡取舍、维护,以及判断 AI 给出的方案在什么情况下是错的,这些工作不会因为生成代码变便宜而变得不重要。它们反而可能因为代码产出速度加快而成为更关键的约束环节。

模型在变,测量模型的方式也必须跟着变。把每一个基准分数当成最终结论,和把每一次模型发布当成职业终局,是同一种思维习惯。更有用的做法是:接受测试会过时,关注测试背后的具体测量对象,然后自己判断这个数字对自己手头的工作意味着什么。

posted on 2026-09-22 01:24  朋友圈自动点赞工具  阅读(9)  评论(0)    收藏  举报