07 2026 档案
摘要:
本文用人类学习类比AI训练,通俗解析大模型如何通过预训练、监督微调与强化学习掌握新技能;详解Model Spec、宪法等行为规范如何引导AI成为可靠协作者,并介绍评测与持续对齐的关键作用。
阅读全文
本文用人类学习类比AI训练,通俗解析大模型如何通过预训练、监督微调与强化学习掌握新技能;详解Model Spec、宪法等行为规范如何引导AI成为可靠协作者,并介绍评测与持续对齐的关键作用。
阅读全文
摘要:
本文详解Agent工具调用的输入输出契约:输入契约规范工具名称、描述、参数Schema与使用边界,确保模型准确调用;输出契约定义结构化结果、状态码与错误反馈,支撑模型可靠决策。二者共同保障Agent“思考→行动→判断”闭环的稳定性与可解释性。
阅读全文
本文详解Agent工具调用的输入输出契约:输入契约规范工具名称、描述、参数Schema与使用边界,确保模型准确调用;输出契约定义结构化结果、状态码与错误反馈,支撑模型可靠决策。二者共同保障Agent“思考→行动→判断”闭环的稳定性与可解释性。
阅读全文
摘要:
本文深度解析Kimi K3技术演进路径:从GPT-2出发,历经Linear Attention、DeltaNet、Gated DeltaNet、Kimi Linear,最终抵达2.8万亿参数的Kimi K3。全文以“状态管理”为主线,揭示架构迭代本质
阅读全文
本文深度解析Kimi K3技术演进路径:从GPT-2出发,历经Linear Attention、DeltaNet、Gated DeltaNet、Kimi Linear,最终抵达2.8万亿参数的Kimi K3。全文以“状态管理”为主线,揭示架构迭代本质
阅读全文
摘要:
Anthropic团队近期利用Claude系列模型,将Bun等百万行级项目从Zig、Python等语言高效迁至Rust/TypeScript:Jarred 11天完成Bun百万行迁移,Mike一个周末重构16.5万行Python为TS。AI驱动六步流程大幅压缩周期与成本,同时保障功能一致性和性能提升。
阅读全文
Anthropic团队近期利用Claude系列模型,将Bun等百万行级项目从Zig、Python等语言高效迁至Rust/TypeScript:Jarred 11天完成Bun百万行迁移,Mike一个周末重构16.5万行Python为TS。AI驱动六步流程大幅压缩周期与成本,同时保障功能一致性和性能提升。
阅读全文
摘要:
写在前面:如果你做过 RAG,大概率遇到过这样一个问题:同一批文档,系统回答第 10 个问题时,并不比回答第 1 个问题时更聪明。每次查询都从原始分块重新推导一遍,前 9 次积累的理解,没有沉淀下来。 近一年中,几个团队从不同方向给出了相似的答案——不要在查询时重新推导,而要在资料导入时完成编译。这
阅读全文
写在前面:如果你做过 RAG,大概率遇到过这样一个问题:同一批文档,系统回答第 10 个问题时,并不比回答第 1 个问题时更聪明。每次查询都从原始分块重新推导一遍,前 9 次积累的理解,没有沉淀下来。 近一年中,几个团队从不同方向给出了相似的答案——不要在查询时重新推导,而要在资料导入时完成编译。这
阅读全文
摘要:
本文提出Harness Handbook,一种从代码库自动生成的、以运行时行为为中心的三级文档体系,解决Agent Harness中“行为定位”难题。它将分散的实现按执行阶段、状态流和源码位置组织,显著提升研发与Coding Agent理解、导航和修改复杂Agent系统的能力。
阅读全文
本文提出Harness Handbook,一种从代码库自动生成的、以运行时行为为中心的三级文档体系,解决Agent Harness中“行为定位”难题。它将分散的实现按执行阶段、状态流和源码位置组织,显著提升研发与Coding Agent理解、导航和修改复杂Agent系统的能力。
阅读全文
摘要:
Codex手机端不仅是任务查看器,更是移动工程指挥中心:可启动任务、选环境、补上下文、审代码、发意见。电脑负责执行,手机专注决策——无需装开发环境,轻松掌控关键环节。
阅读全文
Codex手机端不仅是任务查看器,更是移动工程指挥中心:可启动任务、选环境、补上下文、审代码、发意见。电脑负责执行,手机专注决策——无需装开发环境,轻松掌控关键环节。
阅读全文
摘要:
本期「周一上线」聚焦AI前沿动态:Qwen发布图像/语音3.0模型,Claude Opus 5强化任务推进能力,Cursor Router实现智能模型路由,ACP v2支持长时Agent会话;Hugging Face披露自主Agent入侵事件,OpenAI遭遇31组件大规模故障。技术跃进与风险并存。
阅读全文
本期「周一上线」聚焦AI前沿动态:Qwen发布图像/语音3.0模型,Claude Opus 5强化任务推进能力,Cursor Router实现智能模型路由,ACP v2支持长时Agent会话;Hugging Face披露自主Agent入侵事件,OpenAI遭遇31组件大规模故障。技术跃进与风险并存。
阅读全文
摘要:
“合历”是一款趣味AI Coding实践项目,为GitHub仓库智能推荐代码合并与发布的“良辰吉时”,通过这款趣味实践项目,一篇带你走完AI从零开始写的完整工程实践
阅读全文
“合历”是一款趣味AI Coding实践项目,为GitHub仓库智能推荐代码合并与发布的“良辰吉时”,通过这款趣味实践项目,一篇带你走完AI从零开始写的完整工程实践
阅读全文
摘要:
本文系统解读“Loop Engineering”AI协作新范式:工作单元正从“一句Prompt”升级为“一个可自主运行的Loop”。文章以四阶段、二十步实操路线图,详解如何设计含验证、终止、状态与人工检查点的可靠循环系统,助你从手动提示者蜕变为AI系统架构师。
阅读全文
本文系统解读“Loop Engineering”AI协作新范式:工作单元正从“一句Prompt”升级为“一个可自主运行的Loop”。文章以四阶段、二十步实操路线图,详解如何设计含验证、终止、状态与人工检查点的可靠循环系统,助你从手动提示者蜕变为AI系统架构师。
阅读全文
摘要:
本文详解Agent时代Prompt的范式升级:从静态文本迈向动态拼装。它将Prompt拆解为稳定、任务、状态、外部四类信息,按执行阶段实时组合,兼顾上下文精简与关键信息聚焦,是支撑ReAct循环、保障Agent稳定性的核心工程能力。
阅读全文
本文详解Agent时代Prompt的范式升级:从静态文本迈向动态拼装。它将Prompt拆解为稳定、任务、状态、外部四类信息,按执行阶段实时组合,兼顾上下文精简与关键信息聚焦,是支撑ReAct循环、保障Agent稳定性的核心工程能力。
阅读全文
摘要:本文系统梳理自建生产级Agent的五大核心设计决策:模型路由、循环编排、工具接入、闭环落地与安全约束,以Coding Agent为实例,详解每层架构选型、权衡与可落地代码。强调“设计需被实践修正”,直击成本可控、数据不出域、业务真闭环三大自建动因。
阅读全文
摘要:
本文介绍Agent图编排(Agent Graph Engineering)的核心思想:摒弃简单串行流程,以数据依赖关系构建节点(Agent/代码)与边(数据流)组成的有向图。强调清晰输入输出约定、并行执行、故障隔离、验证机制与动态循环设计,提升系统可组合性、稳定性与成本效率。
阅读全文
本文介绍Agent图编排(Agent Graph Engineering)的核心思想:摒弃简单串行流程,以数据依赖关系构建节点(Agent/代码)与边(数据流)组成的有向图。强调清晰输入输出约定、并行执行、故障隔离、验证机制与动态循环设计,提升系统可组合性、稳定性与成本效率。
阅读全文
摘要:
上海交大与抖音团队提出Dockerless:首个无需执行环境的代码修复验证器。它摒弃传统Docker测试,让Verifier像人类审阅者一样主动探索代码库、搜集证据并裁决patch有效性,在SWE-bench等基准上AUC达81.0,显著提升SFT/RL训练效率与泛化性。
阅读全文
上海交大与抖音团队提出Dockerless:首个无需执行环境的代码修复验证器。它摒弃传统Docker测试,让Verifier像人类审阅者一样主动探索代码库、搜集证据并裁决patch有效性,在SWE-bench等基准上AUC达81.0,显著提升SFT/RL训练效率与泛化性。
阅读全文
摘要:
RIT研究团队分析25,264个真实Agent PR发现:AI编程代理已广泛落地(覆盖2361个热门仓库),但应用极浅——中位数项目3个月仅提交1–2个PR;仅1%项目产出超人类基准;78.9%的PR由同一开发者审、改、合,凸显当前“人机协作”实为“单人+Agent”模式。
阅读全文
RIT研究团队分析25,264个真实Agent PR发现:AI编程代理已广泛落地(覆盖2361个热门仓库),但应用极浅——中位数项目3个月仅提交1–2个PR;仅1%项目产出超人类基准;78.9%的PR由同一开发者审、改、合,凸显当前“人机协作”实为“单人+Agent”模式。
阅读全文
摘要:本文详解Coding Agent中Model与Effort的核心差异:Model决定能力上限(换权重),Effort控制工作深度(调思考量)。二者协同影响质量与成本——简单任务宜用小模型+默认Effort,复杂问题需大模型+高Effort。调试时应先优化上下文,再按“能力不足换Model,验证不足提Effort”原则调整。
阅读全文
摘要:
本期「周一上线」聚焦AI圈鲜活实践:开发者玩转Codex实体指挥台、用球员名织国旗、5个prompt搭3D选座;Kimi K3(2.8T)、Inkling、Monolith-1.0等大模型密集发布;Qwen3.8预告2.4T参数;Grok Build开源、Claude Fable 5权益调整;Sutton再创业成立Oak Lab。
阅读全文
本期「周一上线」聚焦AI圈鲜活实践:开发者玩转Codex实体指挥台、用球员名织国旗、5个prompt搭3D选座;Kimi K3(2.8T)、Inkling、Monolith-1.0等大模型密集发布;Qwen3.8预告2.4T参数;Grok Build开源、Claude Fable 5权益调整;Sutton再创业成立Oak Lab。
阅读全文
摘要:
NetsGo 是张硕开发的轻量级内网穿透与节点管理平台,专注解决多设备(NAS、树莓派、PVE等)场景下的配置分散、状态难查、变更难管问题。单文件二进制+Web控制台,不替代frp,而是补足其管理短板。v0.1.11已支持P2P隧道与AI驱动的真实环境测试。
阅读全文
NetsGo 是张硕开发的轻量级内网穿透与节点管理平台,专注解决多设备(NAS、树莓派、PVE等)场景下的配置分散、状态难查、变更难管问题。单文件二进制+Web控制台,不替代frp,而是补足其管理短板。v0.1.11已支持P2P隧道与AI驱动的真实环境测试。
阅读全文
摘要:
本文为 macOS 用户提供的 Codex Desktop 换肤实践指南,基于开源项目 Codex Dream Skin,教你用 ChatGPT 生成像素风“Dario”主题背景图,并完成一键定制与还原。非官方教程,适配 Windows 可参考流程。需 ChatGPT 会员及基础操作经验。
阅读全文
本文为 macOS 用户提供的 Codex Desktop 换肤实践指南,基于开源项目 Codex Dream Skin,教你用 ChatGPT 生成像素风“Dario”主题背景图,并完成一键定制与还原。非官方教程,适配 Windows 可参考流程。需 ChatGPT 会员及基础操作经验。
阅读全文
摘要:
本文详解Agent系统中关键的“上下文预算”概念:区别于Chatbot的静态对话,Agent需动态管理有限上下文窗口,科学分配目标、规则、工具、记忆与历史等信息。通过固定保留、最近保留、压缩摘要、按需加载四类策略,平衡信息完整性与模型效率,保障长任务稳定执行。
阅读全文
本文详解Agent系统中关键的“上下文预算”概念:区别于Chatbot的静态对话,Agent需动态管理有限上下文窗口,科学分配目标、规则、工具、记忆与历史等信息。通过固定保留、最近保留、压缩摘要、按需加载四类策略,平衡信息完整性与模型效率,保障长任务稳定执行。
阅读全文
摘要:
Anthropic 提出的“unknowns”概念,精准揭示了Coding Agent协作中的核心挑战:任务中未明说、未察觉或未意识到的潜在问题。本文系统解析四类unknowns(已知/可知/隐性/未知),并提供实战方法,助开发者与Claude高效协同。
阅读全文
Anthropic 提出的“unknowns”概念,精准揭示了Coding Agent协作中的核心挑战:任务中未明说、未察觉或未意识到的潜在问题。本文系统解析四类unknowns(已知/可知/隐性/未知),并提供实战方法,助开发者与Claude高效协同。
阅读全文
摘要:
Kapa提出“上下文剪枝”新范式:在Reranker与Generator间插入轻量小模型(Pruner),基于五档评分(Essential至Unrelated)全局评估候选chunk,兼顾互补性与必要性。实测剪枝68%冗余内容,保留96%关键召回,单次查询成本降34%,特别适配Agent等多步推理场景。
阅读全文
Kapa提出“上下文剪枝”新范式:在Reranker与Generator间插入轻量小模型(Pruner),基于五档评分(Essential至Unrelated)全局评估候选chunk,兼顾互补性与必要性。实测剪枝68%冗余内容,保留96%关键召回,单次查询成本降34%,特别适配Agent等多步推理场景。
阅读全文
摘要:
本文介绍七牛云工程师张之阳基于OpenClaw+Home Assistant打造的智能家居Agent实践:让AI理解“朋友来家调灯”等模糊指令,自动补全设备、参数与上下文,完成从对话到执行、状态回查的完整闭环,并严守权限隔离、最小权限、内网部署等安全边界。
阅读全文
本文介绍七牛云工程师张之阳基于OpenClaw+Home Assistant打造的智能家居Agent实践:让AI理解“朋友来家调灯”等模糊指令,自动补全设备、参数与上下文,完成从对话到执行、状态回查的完整闭环,并严守权限隔离、最小权限、内网部署等安全边界。
阅读全文
摘要:
Amazon提出SynthAVE方案,用7个LLM+3类Prompt构建21种评审配置,通过多数投票形成机器共识,仅对原始标签与共识冲突的样本触发人工复核,在可控成本下将电商合成标签准确率从92.6%提升至95.0%,破解大规模标签质检瓶颈。
阅读全文
Amazon提出SynthAVE方案,用7个LLM+3类Prompt构建21种评审配置,通过多数投票形成机器共识,仅对原始标签与共识冲突的样本触发人工复核,在可控成本下将电商合成标签准确率从92.6%提升至95.0%,破解大规模标签质检瓶颈。
阅读全文
摘要:
论文《The Harness Effect》指出:企业级Agent成本主要由编排层决定,而非模型单价。Harness通过优化上下文组织、历史压缩、工具调用与重试机制,将单任务Token消耗降低38%成本下降33%–61%,CPM提升68%。优化本质是将成本问题从“选模型”转向“精设计”。
阅读全文
论文《The Harness Effect》指出:企业级Agent成本主要由编排层决定,而非模型单价。Harness通过优化上下文组织、历史压缩、工具调用与重试机制,将单任务Token消耗降低38%成本下降33%–61%,CPM提升68%。优化本质是将成本问题从“选模型”转向“精设计”。
阅读全文
摘要:
本文是Codex系列第三篇,聚焦真实项目协作:以AI志愿填报Demo为案例,详解`/status`、`/goal`、`/plan`等核心slash命令的实战用法——从确认环境、设定目标、规划修改,到聚焦文件、审查diff、复查逻辑、压缩长对话,系统提升AI编程的可控性与工程规范性。
阅读全文
本文是Codex系列第三篇,聚焦真实项目协作:以AI志愿填报Demo为案例,详解`/status`、`/goal`、`/plan`等核心slash命令的实战用法——从确认环境、设定目标、规划修改,到聚焦文件、审查diff、复查逻辑、压缩长对话,系统提升AI编程的可控性与工程规范性。
阅读全文
摘要:
本文介绍如何用工程化 Loop 自动调优 RAG 参数:通过定义搜索空间、构建自动评估函数(recall@k)、设置最小提升阈值与 train/holdout 拆分防过拟合,并集成运行次数与预算双熔断机制,实现目标驱动、可复现、可审计的智能调参闭环。
阅读全文
本文介绍如何用工程化 Loop 自动调优 RAG 参数:通过定义搜索空间、构建自动评估函数(recall@k)、设置最小提升阈值与 train/holdout 拆分防过拟合,并集成运行次数与预算双熔断机制,实现目标驱动、可复现、可审计的智能调参闭环。
阅读全文
摘要:
本期「周一上线」聚焦AI圈新鲜事:社区创意频出——AI slop图鉴、反AI字体Ghost Font、桌面AI小电视;大厂密集发版——GPT-Live语音模型、Grok 4.5、SWE-1.7、Muse Spark 1.1、TypeScript 7;开源新锐涌现,涵盖多Agent工作站、安全技能路由、3D建模插件等。
阅读全文
本期「周一上线」聚焦AI圈新鲜事:社区创意频出——AI slop图鉴、反AI字体Ghost Font、桌面AI小电视;大厂密集发版——GPT-Live语音模型、Grok 4.5、SWE-1.7、Muse Spark 1.1、TypeScript 7;开源新锐涌现,涵盖多Agent工作站、安全技能路由、3D建模插件等。
阅读全文
摘要:
DeepChat 是一款本地优先的开源 AI Agent 桌面客户端,支持 MCP、Computer Use、Skills 与 Agent Memory 等前沿能力。它从轻量 Chatbot 演进而来,坚持数据留本地、端到端加密,兼顾隐私与强大功能,是探索下一代 AI 工作台的理想开源平台。
阅读全文
DeepChat 是一款本地优先的开源 AI Agent 桌面客户端,支持 MCP、Computer Use、Skills 与 Agent Memory 等前沿能力。它从轻量 Chatbot 演进而来,坚持数据留本地、端到端加密,兼顾隐私与强大功能,是探索下一代 AI 工作台的理想开源平台。
阅读全文
摘要:
本文详解Coding Agent的四种核心循环模式:基于轮次(人工驱动)、目标导向(/goal)、时间触发(/loop与/schedule)及主动循环,强调Agent工程的关键在于明确“谁触发、何时停、如何验”,而非仅优化Prompt。
阅读全文
本文详解Coding Agent的四种核心循环模式:基于轮次(人工驱动)、目标导向(/goal)、时间触发(/loop与/schedule)及主动循环,强调Agent工程的关键在于明确“谁触发、何时停、如何验”,而非仅优化Prompt。
阅读全文
摘要:
本文深入剖析AI从Chatbot到Agent的范式跃迁:不再停留于“请求-响应”,而是转向“目标驱动的自主控制循环”(ReAct)。通过对比交互逻辑、系统架构五大演进(任务编排、环境反馈、结构化动作、状态记忆、安全边界),揭示Agent作为可控智能体的工程本质——聊天框只是入口,背后是复杂后端系统的硬核支撑。
阅读全文
本文深入剖析AI从Chatbot到Agent的范式跃迁:不再停留于“请求-响应”,而是转向“目标驱动的自主控制循环”(ReAct)。通过对比交互逻辑、系统架构五大演进(任务编排、环境反馈、结构化动作、状态记忆、安全边界),揭示Agent作为可控智能体的工程本质——聊天框只是入口,背后是复杂后端系统的硬核支撑。
阅读全文
摘要:
Thinkroom 提出“知识复用”替代传统“代码复用”,将每次问题解决沉淀为结构化、机器可读的 `Learning`(Markdown 文档),嵌入研发全流程:调试后自动捕获、规划前智能检索、编码时强制遵循、审查中实时校验。知识按持久性分级存储,辅以防腐机制与毫秒级 Grep-First 检索,让历史经验真正驱动下一次开发——知识不再沉睡于 Wiki,而活在工作流中。
阅读全文
Thinkroom 提出“知识复用”替代传统“代码复用”,将每次问题解决沉淀为结构化、机器可读的 `Learning`(Markdown 文档),嵌入研发全流程:调试后自动捕获、规划前智能检索、编码时强制遵循、审查中实时校验。知识按持久性分级存储,辅以防腐机制与毫秒级 Grep-First 检索,让历史经验真正驱动下一次开发——知识不再沉睡于 Wiki,而活在工作流中。
阅读全文
摘要:
tap论文提出轻量级文件协议,解决多厂商、异构LLM Agent协作难题:以本地文件系统与Git为基座,通过“消息即文件、仓库即现场”实现可靠通信;双层机制(落盘存证+事件通知)兼顾鲁棒性与实时性;借助worktree隔离、配置自动化与外部记忆体(Operational Artifacts),支撑跨代接力开发。让AI专注分工,人回归决策。
阅读全文
tap论文提出轻量级文件协议,解决多厂商、异构LLM Agent协作难题:以本地文件系统与Git为基座,通过“消息即文件、仓库即现场”实现可靠通信;双层机制(落盘存证+事件通知)兼顾鲁棒性与实时性;借助worktree隔离、配置自动化与外部记忆体(Operational Artifacts),支撑跨代接力开发。让AI专注分工,人回归决策。
阅读全文
摘要:
AutoMem是斯坦福提出的创新框架,将记忆管理视为可学习的认知技能:通过双层外循环(结构优化+能力训练),让LLM自主决定“记什么、何时记、如何组织”,显著提升长任务表现与记忆效率。
阅读全文
AutoMem是斯坦福提出的创新框架,将记忆管理视为可学习的认知技能:通过双层外循环(结构优化+能力训练),让LLM自主决定“记什么、何时记、如何组织”,显著提升长任务表现与记忆效率。
阅读全文
摘要:
Addy Osmani提出“Agent自主等级”框架,从agency(单Agent行动力)与orchestration(多Agent编排力)双维度,系统划分0–5级自主性。
阅读全文
Addy Osmani提出“Agent自主等级”框架,从agency(单Agent行动力)与orchestration(多Agent编排力)双维度,系统划分0–5级自主性。
阅读全文
摘要:
账号被封、Prompt 被降级,这周你又摸鱼了吗?
阅读全文
账号被封、Prompt 被降级,这周你又摸鱼了吗?
阅读全文
摘要:
系统真正的瓶颈不是 I/O,而是CPU 在扫内存时的地址翻译成本
阅读全文
系统真正的瓶颈不是 I/O,而是CPU 在扫内存时的地址翻译成本
阅读全文
摘要:
讲解大模型推理中的 Prefill 与 Decode 两个阶段,分析 AI 回答变慢的根源
阅读全文
讲解大模型推理中的 Prefill 与 Decode 两个阶段,分析 AI 回答变慢的根源
阅读全文
摘要:
Claude Code 用分层设计把 Coding Agent 的规则拆成多种机制,让约束在合适的时机生效
阅读全文
Claude Code 用分层设计把 Coding Agent 的规则拆成多种机制,让约束在合适的时机生效
阅读全文
摘要:
OpenAI 让 Agent 能安全调用企业内网 MCP Server,同时不暴露任何公网入口。
阅读全文
OpenAI 让 Agent 能安全调用企业内网 MCP Server,同时不暴露任何公网入口。
阅读全文
浙公网安备 33010602011771号