摘要: 我会不时上传一些自己的笔记,如果有理解错误的地方请在评论区指出,我会及时回复的! 如果我的笔记有帮助到你的话,可以动动小手登录一下,你的点赞评论和关注是我持续更新的动力!(成就感↑↑↑) 我的联系方式:sunmianman@163.com 阅读全文
posted @ 2025-03-07 21:49 绵满 阅读(320) 评论(0) 推荐(1)
摘要: 这份笔记按发表时间梳理七篇 LLM 多智能体协作(LLM-based Multi-Agent)的代表工作 CAMEL、AutoGen、AgentVerse、DyLAN、MacNet、AgentNet、MACE。它们大致勾勒出一条主线:从固定双智能体的自动对话,到通用的会话编程基础设施,再到动态组队、 阅读全文
posted @ 2026-09-24 18:45 绵满 阅读(145) 评论(0) 推荐(1)
摘要: 清华、浙大与美团 LongCat 团队合作的 AgentOPSD,目前挂在 Arxiv 26.08 上,做的是长程多轮 Agentic RL 里的回合级信用分配。可验证奖励的 RL 只在整条轨迹结束时给一个稀疏的 0/1 信号,GRPO 这类方法把轨迹级优势均匀广播到每个 token,无法把成败真正 阅读全文
posted @ 2026-09-01 14:14 绵满 阅读(124) 评论(0) 推荐(0)
摘要: 北航的工作 Mem2Evolve 发表于 ACL 2026,提出了一种全新的智能体自我进化范式,把"能力扩展"与"经验蒸馏"两个过程耦合起来,实现更稳定、更高效的智能体持续进化 背景 LLM 智能体在各类应用中已取得显著成功,研究者们不再满足于静态的任务特定系统,而是开始追求能够自我进化的智能体。然 阅读全文
posted @ 2026-08-30 15:43 绵满 阅读(132) 评论(0) 推荐(0)
摘要: 阿里巴巴集团联合上海交大、中科大的工作 CoEvo-Mem,目前挂在 Arxiv 26.08 上,研究的是长期 LLM Agent 的记忆系统。它指出检索策略和记忆库其实是相互耦合的,但过去的方法总是固定其中一个、只优化另一个,于是提出一个闭环框架让二者协同进化,同时保持负责回答问题的 LLM 冻结 阅读全文
posted @ 2026-08-27 21:37 绵满 阅读(105) 评论(0) 推荐(0)
摘要: 华东师范大学 ICALK 实验室联合上海人工智能实验室的工作 AutoMem,目前挂在 Arxiv 26.07 上,把 LLM Agent 的长期记忆设计重新表述成一个任务自适应的记忆架构搜索问题,本质上就是给每个 task 找一个现有方法的最佳组合 这篇工作可以看成是紧接着 MemEvolve 的 阅读全文
posted @ 2026-08-26 19:48 绵满 阅读(125) 评论(0) 推荐(0)
摘要: 同济 + 上海 AI Lab + 港中文 + 南大 + 上交的工作,目前挂在 Arxiv 26.03 上。当前多智能体系统(MAS)的记忆设计普遍存在两个瓶颈:记忆同质化(缺乏角色感知的定制)和信息过载(记忆条目过于细碎冗长)。本文提出 LatentMem,一个可学习的隐空间多智能体记忆框架:用一个 阅读全文
posted @ 2026-08-21 02:20 绵满 阅读(100) 评论(0) 推荐(0)
摘要: LV-NUS Lab + 复旦 + 北大 + 字节的工作,目前挂在 Arxiv 26.06 上。当前的自进化 Agent 都把记忆当成自进化的定义,但存下经验 ≠ 学会怎么从经验里进化。本文提出 OPD-Evolver,一个慢-快协同进化框架:快环里 Agent 与四级记忆层级交互做 test-ti 阅读全文
posted @ 2026-08-13 21:01 绵满 阅读(124) 评论(0) 推荐(0)
摘要: OPPO AI Agent Team 与 LV-NUS lab 的工作,发表于 ICML 2026。当前的自进化记忆系统都停留在用固定的记忆架构去积累经验这一层,本文提出 MemEvolve,一个同时进化「经验知识」与「记忆架构本身」的元进化框架,让 Agent 不仅能积累经验,还能不断改进它是怎么 阅读全文
posted @ 2026-08-12 16:36 绵满 阅读(125) 评论(0) 推荐(0)
摘要: 一篇 LLM Agent 多用户协作记忆管理工作,目前挂在 Arxiv 25.05 上,针对多用户、多 Agent 场景下信息不对称和动态权限问题,提出了 Collaborative Memory 框架 背景 现有的 LLM Agent 记忆系统(如 MemGPT、MemTree、GraphRAG) 阅读全文
posted @ 2026-08-11 23:52 绵满 阅读(125) 评论(0) 推荐(0)
摘要: 快手的 MLE Agent 优化工作,目前挂在 Arxiv 26.07 上,提出了一种将 Bandit 算法与 LLM 智能体相结合的推荐模型自动化优化框架 RecHarness 背景 推荐系统优化天然适合 MLE Agent,但直接应用通用 MLE Agent 存在一个关键的系统挑战:每个候选修改 阅读全文
posted @ 2026-08-09 14:26 绵满 阅读(117) 评论(0) 推荐(0)
摘要: 快手发布的一篇技术报告 AgentX,提出了一个可以自我迭代的 MAS 把工业推荐的 idea-to-launch 闭环整体自动化,推荐领域的 Loop Engineering 背景 工业推荐系统的算法迭代长期依赖算法工程师的持续介入。一次完整的算法迭代通常需要经历数据分析、特征工程、模型开发、在线 阅读全文
posted @ 2026-08-08 10:30 绵满 阅读(148) 评论(0) 推荐(0)
摘要: 背景 用户终身行为建模(ULBM) 是指在严格的工业效率约束下,对超长且异构的用户行为序列进行建模的问题。在真实工业推荐系统中,用户终身行为序列呈现两个显著特征: 超长序列(Ultra-long Sequences):在快手等大型视频平台上,用户每天可能产生数百次交互,终身行为序列长度可达 10⁵ 阅读全文
posted @ 2026-08-03 16:35 绵满 阅读(108) 评论(0) 推荐(0)
摘要: LLMA-Mem 目前挂在 Arxiv 26.04 上,探讨了 LLM 多智能体系统中 "横向扩展团队规模" 与 "纵向积累时间经验" 两种扩展维度之间的交互关系,提出通过记忆设计实现更高效的终身学习 背景 LLM 多智能体系统(Multi-Agent Systems, MAS)可以通过两个不同维度 阅读全文
posted @ 2026-07-28 19:53 绵满 阅读(108) 评论(0) 推荐(0)
摘要: MetaGPT 发表于 ICLR 2024(Oral),首次将标准化操作流程(SOP)引入多智能体系统,实现了多智能体系统解决复杂任务的能力 背景 当前基于 LLM 的多智能体系统已经能够解决简单对话任务,但在处理复杂任务(如软件开发)时面临严峻挑战。现在的问题是简单的串联 LLMs 容易导致 "级 阅读全文
posted @ 2026-07-27 02:01 绵满 阅读(74) 评论(0) 推荐(0)
摘要: 腾讯推荐模型 Scaling 的工作 TokenFormer,目前挂在 Arxiv 26.04 上,主要提出了顺序坍塌传播(SCP)问题,挑战和动机很有亮点但是模型架构方面感觉不够有说服力,很难评的是没有 A/B 实验... 背景 对于序列建模和特征交叉,尽管最近的工作如 InterFormer、O 阅读全文
posted @ 2026-06-01 20:23 绵满 阅读(189) 评论(0) 推荐(0)