AI 新闻日报 - 2026年8月29日
AI 新闻日报 - 2026年8月29日
今日共收录 14 条 AI 相关资讯
最新论文 (arXiv)
- CritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes(CritICL:从小语言模型失败模式中实现推理时弱到强泛化)
Yufan Wu, Yinghui He, Zhengyi Hu et al. | 提出 CritICL 推理时框架,无需重复生成或外部验证,利用小模型失败模式实现弱到强泛化。 - WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution(WikiSkill:将智能体经验编译为持久知识以实现技能进化)
Liyan Tang, Cyrus Rashtchian, Chun-Sung Ferng et al. | 提出一个系统,将智能体在交互中获得的技能洞察编译为可复用的持久知识库。 - SWE-Prime: Fewer Trajectories, Better Performance(SWE-Prime:更少的轨迹,更好的性能)
Dewu Zheng, Ruizhe Ye, Yanlin Wang et al. | 揭示任务成功并不保证监督质量,提出用更少量高质轨迹优化软件工程智能体的方法。 - TTPO: Test-Time Policy Optimization(TTPO:测试时策略优化)
Aozhe Wang, Zhengxi Lu, Jianze Wang et al. | 提出测试时策略优化方法,摆脱对决策真值标签的依赖,推动数学推理模型的测试时训练。 - From Static to Dynamic: Benchmarking Real-World Code Review with MCR-Bench(从静态到动态:用 MCR-Bench 基准测试真实世界代码评审)
Dewu Zheng, Yanlin Wang, Xiwen Wang et al. | 针对真实开发中开发者与评审者迭代交互场景,推出动态代码评审基准 MCR-Bench。 - RedEvoAgent: Automatic Red-Teaming Agent with Experience-Driven Skill Evolution(RedEvoAgent:具备经验驱动技能进化的自动红队智能体)
Junjie Zhang, Hui Liu, Kecheng Chen et al. | 提出经验驱动的自动红队智能体,应对产品级环境中越狱引发的有害工具调用与持久状态风险。 - UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City(UrbanGround:从局部感知到真实规模城市中的空间智能体)
Tianjie Ju, Zheng Wu, Yueqing Sun et al. | 探讨多模态大语言模型智能体如何在复杂城市环境中将局部城市感知转化为可靠行动。
海外讨论 (Hacker News)
- Luanti removed from Google Play due to baseless AI copyright notice(Luanti 因毫无根据的 AI 版权通知被下架谷歌商店)
487 | 148 - I accidentally turned LLM memory into program analysis(我意外地把 LLM 记忆变成了程序分析)
136 | 28 - Terminal-Bench-Science: Evaluating AI agents on scientific research workflows(Terminal-Bench-Science:评测科研工作流中的 AI 智能体)
115 | 35 - Autonomous Mathematical Discovery in an Open-World Multi-Agent Environment(开放世界多智能体环境中的自主数学发现)
103 | 26 - StemDeck, a free, open-source and local AI stem separator(StemDeck:免费开源的本地 AI 音轨分离工具)
90 | 19 - Identifying fake cosmetics using AI(用 AI 识别假冒化妆品)
53 | 21
今日 AI 要闻速览
今日资讯聚焦于智能体技术的深度演进与安全性。arXiv 上多篇论文围绕"智能体技能进化"展开,如 WikiSkill 将交互经验固化为持久知识、RedEvoAgent 用经验驱动技能进化强化自动红队测试,显示业界正从单点任务智能走向可持续进化的智能体系统。推理侧优化同样成为热点,CritICL 与 TTPO 分别从弱到强泛化和测试时策略优化切入,探索不依赖真值标签的推理改进路径。海外社区方面,开源项目 Luanti 因无根据的 AI 版权投诉被谷歌商店下架引发大量讨论(487 点赞、148 评论),凸显 AI 版权通知滥用对开源生态的冲击;同时科研工作流评测基准(Terminal-Bench-Science)与自主数学发现等方向也备受关注。整体来看,智能体的可靠进化、安全评测与开源 AI 权益保护是今日最值得跟踪的三大主线。

浙公网安备 33010602011771号