[置顶] openclaw 思考

摘要: 一些建议 GUI or CLI 内部对龙虾的引入和使用,主要是 GUI的方式:绑定美信,安全可控。这种对话的使用方式限制了龙虾的应用场景。这是典型的员工提效思维。 外部公司已经趋向CLI:钉钉已经彻底 CLI 化了、一键接入OpenClaw,谷歌开源CLI狂揽15k Stars,智能体接管Works 阅读全文

posted @ 2026-04-10 11:36 limingqi 阅读(288) 评论(0) 推荐(0)

[置顶] 自我博弈偏好优化(Self-Play Preference Optimization,SPO)能否奖励模型?

摘要: 自我博弈偏好优化(Self-Play Preference Optimization, SPO)是一种通过自我博弈机制直接优化策略的方法,其核心特点是无需显式奖励模型,也不依赖对抗性训练。从技术本质来看,SPO 确实在特定场景下取代了奖励模型,但这一取代并非绝对,而是取决于任务类型和优化目标。以下从 阅读全文

posted @ 2025-08-22 11:07 limingqi 阅读(275) 评论(0) 推荐(0)

[置顶] POLAR 的无监督预训练

摘要: POLAR 的无监督预训练过程可以拆解为 “数据构建逻辑” 和 “对比学习目标” 两部分,结合具体例子会更易理解: 一、核心目标 让奖励模型(RM)像 “策略侦探” 一样,学会判断两条轨迹(模型输出)是否来自同一个 “政策”(即同一个模型或相似行为模式的模型)。如果来自同一政策,就给它们更高的 “相 阅读全文

posted @ 2025-07-26 12:48 limingqi 阅读(96) 评论(0) 推荐(0)

[置顶] Pre-Trained Policy Discriminators are General Reward Models 论文概述

摘要: 一、研究背景 强化学习(RL)在大型语言模型(LLMs)的训练中至关重要,其成功取决于奖励模型(RM)提供精确稳定反馈的能力。 传统奖励模型依赖标注的偏好对训练,存在可扩展性和泛化性问题,前者受限于获取大量高质量标注对的难度,后者因建模人类偏好的主观性易受奖励攻击。 规则基验证器虽能提供准确奖励信号 阅读全文

posted @ 2025-07-26 12:47 limingqi 阅读(161) 评论(0) 推荐(0)

2026年8月5日

ABRA: Agentic Benchmark for Radiology Assistant

摘要: 一、论文核心内容 1. 研究背景痛点 现有放射学智能体评测基准存在根本性缺陷: 全部提前人工筛选、裁剪好单张影像切片输入模型,无法模拟放射科医生完整操作 DICOM 工作站; 缺少交互式工具操作评测维度,不考核调窗宽、滑动切片、多序列切换、病灶标注等真实阅片动作; 仅评测最终文字报告,忽略任务规划、 阅读全文

posted @ 2026-08-05 17:52 limingqi 阅读(3) 评论(0) 推荐(0)

Detecting Clinical Discrepancies in Health Coaching Agents with Dual-Stream Memory

摘要: 一、论文核心内容 1. 研究背景痛点 健康随访辅导智能体存在两类信息源天然冲突的安全隐患: 1)患者自述记忆:时效性强,但存在记忆偏差、主观夸大、口误、AI 幻觉; 2)标准化电子病历 EHR(FHIR 规范):具备医学权威验证,但数据更新滞后,无法实时反映患者当下状态。 传统通用记忆架构会直接用最 阅读全文

posted @ 2026-08-05 17:40 limingqi 阅读(8) 评论(0) 推荐(0)

ClinicalAgents: Clinical Trial Multi-Agent System with Longitudinal Memory

摘要: 一、论文核心内容 1. 研究背景痛点 现有临床试验智能体存在三大缺陷: 1)仅单次静态读取试验方案,无法留存纵向时序患者数据、多轮随访演变信息,不能跟踪受试者长期健康变化; 2)单智能体包揽全部任务,临床试验流程拆分粗糙,无法专业化分工(招募、药效、安全、方案规划); 3)记忆无分层隔离,试验方案、 阅读全文

posted @ 2026-08-05 16:36 limingqi 阅读(13) 评论(0) 推荐(0)

A-MEM: Agentic Memory for LLM Agents

摘要: 一、研究背景与现存缺陷 现有大模型智能体外部记忆方案仅实现存储 + 向量检索基础功能,存在三点核心局限: 存储结构静态固化,依赖人工预设存储字段、固定检索规则,无法随任务自主调整记忆组织形式; 记忆相互独立孤立,仅做相似度匹配,不会自动建立记忆间关联关系,无法形成链式推理; 记忆只读不更新,新增交互 阅读全文

posted @ 2026-08-05 14:52 limingqi 阅读(19) 评论(0) 推荐(0)

VLM 接口全档位并发压测报告

摘要: 测试环境 项目 配置 接口地址 https://aimpapi.midea.com/t-aigc/mat-vlm/v1/chat/completions 模型 Qwen3.6-35B-A3B-FP8 测试图片 139 张(8D 报告缺陷图片) 每档持续时长 60 秒 档位间冷却 5 秒 单请求超时 阅读全文

posted @ 2026-08-05 09:24 limingqi 阅读(11) 评论(0) 推荐(0)

2026年8月4日

qwen-vl-max 模型压测

摘要: import asyncio import aiohttp import json import time import sys from pathlib import Path def log(msg): print(msg) sys.stdout.flush() PROJECT_ROOT = P 阅读全文

posted @ 2026-08-04 18:11 limingqi 阅读(8) 评论(0) 推荐(0)

Experience Makes Skillful: Enabling Generalizable Medical Agent Reasoning via Self-Evolving Skill Memory

摘要: 1. 研究问题 面向交互式临床诊疗医疗智能体,现有记忆模块存在四点缺陷: 1)直接存储完整原始交互轨迹,存储冗余、混杂无效噪声,无法区分经验对推理任务的增益; 2)病例间推理流程相互隔离,缺少可复用标准化诊疗流程,跨病种泛化能力弱; 3)模型性能迭代依赖大模型权重微调,算力成本高,易出现灾难性遗忘; 阅读全文

posted @ 2026-08-04 14:46 limingqi 阅读(10) 评论(0) 推荐(0)

2026年8月3日

Dialectic-Med: Mitigating Diagnostic Hallucinations via Counterfactual Adversarial Multi-Agent Debate

摘要: 一、研究背景与痛点 面向医疗多模态大模型(Medical VLM)影像诊断,核心解决诊断幻觉(Diagnostic Hallucination) 问题arXiv: 模型存在确认偏误:一旦生成初步诊断假设,会主动编造影像里不存在的病灶、特征来佐证自己,出现流畅但完全虚假的诊断结论,存在临床安全风险; 阅读全文

posted @ 2026-08-03 18:23 limingqi 阅读(14) 评论(0) 推荐(0)

MedEyes: Learning Dynamic Visual Focus for Medical Progressive Diagnosis

摘要: MedEyes(AAAI 2026)论文完整解读 一、核心背景(现有医疗 VLM 痛点) 现有医疗多模态大模型 + 思维链 CoT + 强化学习 RLVR 存在明显缺陷: 模型一次性读取整张医学影像,没有模拟医生 “先全局扫视、再聚焦病灶细查” 的渐进诊断流程; 纯在线策略强化学习只会重复表面通顺、 阅读全文

posted @ 2026-08-03 18:08 limingqi 阅读(15) 评论(0) 推荐(0)

2026年8月1日

Agent记忆及实现

摘要: 核心概念 记忆的类型 https://arxiv.org/pdf/2504.01990 Agent的记忆类型 记忆内容 记忆窗口 适用场景 可能的实现方案(个人理解) short-term working memory 单次run 长程+信息密集型的推理任务 reason & observation 阅读全文

posted @ 2026-08-01 21:49 limingqi 阅读(12) 评论(0) 推荐(0)

导航