华东师范大学 ICALK 实验室联合上海人工智能实验室的工作 AutoMem,目前挂在 Arxiv 26.07 上,把 LLM Agent 的长期记忆设计重新表述成一个任务自适应的记忆架构搜索问题,本质上就是给每个 task 找一个现有方法的最佳组合 这篇工作可以看成是紧接着 MemEvolve 的 ...
普通语言模型训练关注“下一段话像不像正确答案”,Agentic-RL 更关心模型在多步环境中能否选择合适动作、使用工具、处理反馈并完成目标。奖励来自整条轨迹,而不只是最后一句话。 先看几种训练方法各自解决什么 SFT 用高质量示范教会基本格式和行为;DPO 利用偏好对让模型倾向更好的回答;PPO 与 ...
LangChain 是目前大模型应用开发领域最主流、最成熟的开源框架之一,广泛应用于私有化部署、智能体开发、工具调用、流式交互等各类场景。本文基于 LangChain 最新稳定版接口,适配本地私有化 GGUF 模型部署环境,拆解框架四大核心基础能力,标准化消息机制、闭环工具调用链路、多场景流式传输、... ...
AI标书审查怎么防大模型幻觉?拆解证据溯源的4道工程防线:无出处不入库、轨迹锚定、逐字比对校验、状态代码派生,让每条审查结论都能定位回原文页码。 ...
工具解决的是“调用一次能力”,Skill 解决的是“复用一套完成任务的方法”。当 Agent 不只需要一个函数,而是需要步骤、资源、判断标准和验证方式时,技能系统就比不断扩充工具列表更合适。 Tool、Skill 和 Sub Agent 的边界 Tool 通常是原子动作,例如读文件、查订单;Skil ...
单次 Demo 能跑,不代表 Agent 可以交给真实用户。模型输出、工具调用、状态恢复、权限控制和人工介入之间,还需要一个稳定的运行外壳,这就是我理解的 Harness Engineering。 Harness 管的是整个运行环境 它通常包括明确的项目指令、上下文策略、工具契约、状态机、结构化输出 ...
大模型在代码工程里能聊天却难干活,关键在于上下文管理、工具调用与结果校验。奇摩解析WorkBuddy如何让大模型真正落地。 ...
上下文窗口是有限且昂贵的资源。Context Builder 要在每次模型调用前做一次认真取舍:什么必须带上,什么先摘要,什么此刻根本不该出现。 把上下文元素结构化 候选内容可以统一表示为 {kind, content, tokens, priority, source, expires_at, a ...
本文以通义千问Qwen量化GGUF模型为案例,基于Llama.cpp框架展示本地大模型调用与功能开发的完整实现原理及流程。全文采用原生Python编写代码案例,无需依赖重型AI框架,依次实现模型元数据解析、本地接口单次对话调用、多轮对话持久化记忆、自定义工具调用拓展等功能实现逻辑,针对直接调用大模型... ...
摘要: 很多乐清外贸企业会陷入一个误区:把出口退税全部交给代办,就觉得万事大吉。实际退税是企业与财税服务商双向配合的工作,权责划分模糊,是很多退税纠纷、退税受阻的根源。本文梳理企业经常遇到的权责相关难题,对比乐清四家主流代办机构的服务模式与客观边界,企业结合自身情况选择,合作前务必落实合同条款。 乐 ...
大模型落地企业,难点不在模型而在上下文。本文拆解上下文工程的价值,以及WorkBuddy如何管理项目上下文提升产出质量。 ...
Prompt 写得再漂亮,也解决不了上下文被无关聊天、过期资料和冗长工具返回淹没的问题。Agent 复杂到一定程度后,核心能力从“会提问”变成“会供给上下文”。 Prompt 是指令,Context 是工作台 上下文里不仅有用户问题和系统 Prompt,还包括当前目标、任务状态、历史摘要、记忆、工具 ...
企业文档问答最常被追问的并不是“回答像不像人”,而是“这句话依据哪份文档、哪个版本、我是否有权限看到”。所以它更像一套证据产品,而不是在知识库前面放一个聊天框。 先把索引做成可治理的数据层 文档进入系统时应保留业务域、版本、作者、更新时间、访问控制和原始位置。删除或更新文档后,索引也要同步失效。否则 ...
很多 RAG 原型把“文档切块、向量检索、拼到 Prompt”当作终点。但真实问答的质量更取决于:检索材料是否相关、是否最新、是否有权限,以及它们能不能真正支持回答。 RAG 是一条信息供应链 文档加载、文本分块、Embedding、向量索引、查询改写、召回、重排序和生成,每一环都会影响最终答案。向 ...
本文讲解基于 LangGraph Server 服务搭建本地离线 AI Agent 的完整部署流程,适配 Windows 开发环境,全程无需调用公有大模型接口,实现纯本地化 AI 推理与工作流编排,帮助开发者快速搭建可调试、可复用的本地私有化 AI Agent 服务,适用于个人开发、本地功能调试、轻... ...
研究助手最容易制造一种“它查了很多网页,所以结论可靠”的错觉。真正有价值的自动化研究,应该把研究问题、来源、证据、推断和最终建议连成一条可以回看的链路。 先写研究协议,再开始搜索 开始前要明确研究对象、时间范围、地域、交付形式、可接受来源以及哪些问题不在范围内。Plan-and-Execute 的价 ...
结论 apim中rest实现的mcp,不需要更新2.0,它是不为2.0取决于客户端和后端服务 apim中mcp实现的mcp-server,需要有版本控制,版本不对,会出现问题 apim中的服务,如果中间走了聚合mcp服务,它返回的mcp版本取决于聚合服务的mcp版本 name: MCP Dual E ...
面对“调研三家竞品并给出上线建议”这类任务,如果让模型一次性生成答案,很容易得到一篇结构完整、证据却松散的作文。规划的作用,是把模糊目标变成一组能执行、能检查、能恢复的步骤。 ReAct:边观察边决定下一步 ReAct 把推理与行动交替组织。Agent 先判断当前缺少什么,再调用搜索、数据库或代码工 ...
Advanced‑RAG 是基于 Naive RAG 演化而来的高级检索增强生成方案,针对朴素RAG检索不准、上下文相关性差、召回噪声多等缺陷进行多层优化。该方案完全沿用朴素RAG的基础流水线模式、不改动核心架构,仅在各流程节点嵌入预处理、后处理增强模块,精细化优化检索环节。通过引入查询改写、重排序... ...
这是一个用来快速提取文档关键值的脚本,可以用来批量提取一批相同类型,但是不同型号的公共参数值,可以避免人工大量重复性的搜索和来回翻阅工作: 例如快速提取esp32_datasheet_cn.pdf的以下字段 | **型号** | **封装类型** | **工作温度(°C)** | **CPU 架构* ...