实践与方法

麦睿菱AI实践

从现场问题出发,讨论员工赋能、专家经验、Agent 维护与合格交付。

按序阅读 →
行业观察

小睿聊AI

从 AI 产品新动向切入,思考企业怎样选择、怎样用起来、怎样留下经验。

进入合集 →
测量与现场

小睿说测量

从测量原理出发,理解误差、方法与仪器选择,连接真实的现场应用。

进入合集 →

旧文重读

微前端实战 · 2025团队创造力 · 2011开源控件 · 2010

AIGC标识 麦睿菱AI实践 08|AI生成更快,交付为何没跟上

AI 让初稿更快出现,也可能让专家更晚下班。如果复核、返工和协作等待增加,前面省下的时间就会被后面的工作吃掉。企业要算的,是同样质量下能否完成更多合格交付,以及新增负担落在谁身上。计时要到合格结果交出去,复核和返工的人力也要算进去。

配图

先看图1这笔算例:如果一个工程服务团队使用 AI 后,技术方案初稿的准备时间从4小时降到了2小时,是不是就节省了一半时间?

还要接着看专家复核。如果复核从2小时变成4小时,修改仍需1小时,两种方法的总人工投入都是7人时。

员工更快交出初稿,工作却转移给了更稀缺的专家。若专家本来就排满,团队甚至可能更晚完成交付。

配图

图1|教学算例,非项目实测:初稿省2人时,复核增加2人时,总人工投入仍为7人时。

专家可能成为新的瓶颈

初稿增多以后,专家需要核对的参数、来源和解释也可能增多。若每份材料都必须重新查证,前端生成越快,后端待审材料反而越容易堆积。

评估团队产出,需要继续看:增加的复核能否被消化,交付排队有没有缩短,专家是否把精力从重复查证转向了需要专业判断的问题?

也存在相反情况:总工时没有明显下降,但专家重复解释的时间减少了,关键判断更早发生,客户等待变短。只要质量不降低,这也可以有业务价值。

人的实际投入工时与客户经历的等待,需要分别记录。几个人同时工作,工时可以相加,交付周期不能照着相加;员工等待模型时处理了别的任务,也不应把整段等待都记作人工劳动。

先说清什么叫完成

仍以技术方案为例。一项工作从正式接收客户需求开始,经过查资料、澄清限制、调用计算工具、写方案、审核与修改,直到达到约定的交付标准才结束。

初稿是其中一个节点。验收时,需要检查文件是否存在、能否打开、是否用了正确参数,以及是否通过专业审核。Anthropic 的智能体评估说明[1]区分执行记录与最终结果,也强调对实际产物和环境结果的检查。

试用前,先确定主要目标与质量底线。例如,以缩短合格方案的交付周期为目标,同时要求关键参数来源齐全、重大错误不增加。试用结束后,按同一组目标检查结果。

质量标准尽量沿用已有业务要求。条件允许时,隐去材料所用的工具,让审核人根据正确性和证据评分。

客户后来新增的范围单独记录;原有缺陷造成的返工,则继续算回本次任务。比较时按这条边界计时和归集投入。

失败的尝试也属于这笔投入

如果一项方案先由 AI 整理资料,后来发现型号引用错误,最后改由专家重做,前面的输入、检查和重做时间,都要计入这项任务。

评价一批任务时,应覆盖全部符合试用条件的工作,逐项记录是否采用新方法、是否退回原流程,以及截至观察日是否完成;符合条件但未采用的也保留记录。按唯一任务归集投入,再按使用路径和完成状态分别比较,避免重复计算。入口难找、权限不足、现场来不及核验,都会影响实际使用;未采用者的工作不能全记成 AI 使用成本。

可以同时看这批任务的合格交付数量、总投入和未完成积压。若需要计算单位交付成本,应统一观察范围,并说明未完成工作已经消耗了什么资源。只拿成功案例的费用去除以成功次数,会把试错和恢复藏起来。

严重错误需要单列,不能由大量顺利的小任务抵消。如果模型步骤重复运行后才得到合格结果,前面的失败同样属于成本,重复次数也应记录下来。

小规模试用可以先用简单记录表,保留任务、去向、实际工时、交付日期和最终结果,逐步补齐评价需要的数据。

分清收益来自哪项改进

上月慢、这个月快,可能还有其他原因:资料版本统一了,计算工具补齐了,员工更熟练了,或者这批需求更容易。

比较时,尽量选择难度接近的任务,区分人员经验、资料完整度和需求复杂度,并记录工具与支持安排。若这些因素同时变化、难以分开,可以先评价整套工作改进的效果,再通过后续试用识别各项贡献。

除原有合格做法外,还值得保留一种参照:资料和流程已经改善,但暂时没有加入 AI。一个确定程序就能完成的计算,也应参与比较。这样才能知道新增的模型成本和复核劳动换来了什么。

人员差异尤其值得看。2025 年发表的《Generative AI at Work》[2]研究了 5,172 名客服人员,报告的效果随经验和技能而异。企业在自己的任务中,也应按人员经验和技能分组观察,再据此估算投入与收益。

同样的工具,可能让经验较少但具备资格的员工更容易完成任务,也可能给熟手增加确认负担。一个平均数会把这些不同的工作体验混在一起。

公司持续提供能力也有成本

把助手提供给员工,只是投入的开始。资料整理、工具接入、首次验证和培训需要资源;日常复核、错误处置、版本维护以及新员工支持,同样需要资源。没有采购单的专家时间,也是一项成本。

枢策 Orchelm[3]这类企业智能体治理与协同平台,可以组织和发布模型、工具及助手配置,管理身份、记录调用用量并执行相应额度规则。这些记录能帮助企业了解向谁提供了哪些支持、使用了哪些资源。业务团队再把它们与复核工时、失败恢复和合格交付关联起来,才能判断收益。

模型、方法或资料变更后的回归测试,也计入维护投入,包括正常、缺条件、工具失败和必须停止的场景。

下一位员工能接手才有扩大的依据

收益还可以表现为更多合格员工能够承接任务。可以请未参与开发、具备相应资格的同事,借助企业提供的助手、资料和工具处理一个相近的新需求,记录他能否形成合格方案,以及原作者还需支持多久。若仍须全程陪同,就把这段工时计入成本,不能仅凭新增使用者认定可承接任务的人已经增加。

这项检验考察的是员工在公司支持下能完成哪些工作,可以使用提供给他的 AI、资料和工具。若还要评价员工自身判断力的变化,可以另设独立练习和观察。

省下的时间也应记录实际去向:减少加班、缩短排队、提高交付量,或让专家处理过去来不及处理的问题。释放了多少工时、减少了多少现金支出、带来了多少新增收入,应分别记录,并用对应的业务事实支持。

预算评审应该能作出不同决定

合格交付确有改善,新增支持和维护也承受得起,才考虑扩大范围。若收益只存在于部分任务,就保留这部分;若资料整理已经解决主要问题,AI 增加的复核超过帮助,就保留基础改进、调整用法。

若突破质量底线、无人维护或需求消失,应暂停相关使用。证据还不充分,也可以继续试,但下一轮应回答明确的问题,并写清什么结果会改变决定。

下一笔预算应看未来需求和新增投入,现有可用的资料、代码与验证成果继续保留。

最终,一份有用的收益报告应该说清:员工多做成了什么,客户更早或更可靠地得到了什么,维持这种改善还需付出多少。下一笔预算,就按这些结果决定。

参考阅读

[1] Anthropic:智能体评估说明

[2] Brynjolfsson、Li、Raymond:Generative AI at Work,2025

[3] MEASIX:枢策 Orchelm

posted on 2026-10-05 21:27  华磊  阅读(3)  评论(0)    收藏  举报

导航