智能体什么该记什么不该记?openKylin专家来答
2026年,大模型智能体正从实验室走进办公、研发和个人助理场景。它要长期陪着用户干活,就得记住用户的偏好、常用的路径、习惯用的模板。记不住,每次对话都从头开始,用户很快就失去耐心;记太死,临时信息、敏感内容又一直留在系统里,成了隐患。
什么该记、什么不该记,没有统一答案,却直接决定智能体好不好用。2026上海开源软件应用创新大赛的「开源Al工具赛道」里,openKylin 提出了一道赛题,全称是《面向openKylin 操作系统的智能体长期记忆自动化评测Benchmark设计》,要求参赛者给智能体的记忆能力装一把标尺。

OpenAtomopenKylin是由开放原子开源基金会孵化及运营的开源操作系统项目,由麒麟软件发起,联合基础软硬件企业、非营利组织、高校、科研机构与个人开发者共同创立。2026年6月,国防科技大学、哈工大(深圳)、麒麟软件等单位共建的 AgentOS SIG 发布了基于openKylin 的开源智能体操作系统。目前openKylin 里已经跑着 KylinBot、kylin-agent、OpenClaw、Hermes Agent 等多个智能体框架,框架不缺,缺一套系统级的自动化工具,把不同智能体在记忆能力上的表现量化出来。
命题的背景来自三个现实问题。目前的评测往往依赖人工检查,难以规模化;简单问答式验证项覆盖不到真实使用中的冲突更新、相似干扰和行动复用;自动评分容易出现语义偏移,很难稳定判断模型到底是记住了、误记了,还是不该记却记了。

这道题要求参赛者基于openKylin 环境,设计一套自动化、低人工介入、可复现、可扩展的评测方案,把对话、记忆记录、行动轨迹、文件统一组织为证据,自动评估智能体的长期记忆能力,重点覆盖长期保持、记忆调用、动态更新、相近区分、边界识别、任务复用六项能力。
交付的要求方案文档要写清测试目标、数据生成方式、验证用例与自动评分流程;数据集要给出可扩展的数据结构;样例数据与结果、可复现材料要一并提供,代码须能在openKylin上编译运行;评测流程要封装成一键运行的CLI工具,建议产出.deb 软件包;演示要在openKylin桌面环境下对至少两款智能体跑完评测,录一段3到5分钟、带多维对比雷达图的完整视频。
评审按六个维度打分。自动评分能力和数据设计质量各占 25% ,权重最高,稳定性与可复现性、任务定义与通用性各占 15% ,指标完整性和创新性与工程可落地性各占 10% 。
命题怎么解,专家来直播间讲透
赛题的边界,光看文字容易拿不准。自动化评测算不算做到位、数据集要覆盖到什么程度、代码在openKylin上跑通有没有坑,这些都需要出题人来讲。
9月16日19:00,openKylin AISubsystem SIG Maintainer、麒麟软件研发工程师杜雨霏将做客「OSC开源社区」视频号直播间,围绕这道赛题做一次现场解读,讲命题背景、讲解题思路、讲备赛要点,并在线回答选手提问。
杜雨霏是本次上海开源软件应用创新大赛的赛题命题成员,负责智能体模型记忆模块评测相关工作,参与了这道赛题的设计与打磨。评分标准怎么定、什么样的方案算真正把问题解决了,她会在直播间里给大家讲清楚。
如果你正在准备这道题,或者还在犹豫要不要报名,都可以带着问题来直播间。
大赛报名截止10月11日,总奖池100万元,总决赛10月29日在上海张江人工智能创新小镇举办,听完直播再动手,时间来得及。
欢迎关注视频号“OSC开源社区”预约直播。
大赛官网:https://www.oschina.net/os2026/

浙公网安备 33010602011771号