[置顶] openclaw 思考

摘要: 一些建议 GUI or CLI 内部对龙虾的引入和使用,主要是 GUI的方式:绑定美信,安全可控。这种对话的使用方式限制了龙虾的应用场景。这是典型的员工提效思维。 外部公司已经趋向CLI:钉钉已经彻底 CLI 化了、一键接入OpenClaw,谷歌开源CLI狂揽15k Stars,智能体接管Works 阅读全文

posted @ 2026-04-10 11:36 limingqi 阅读(319) 评论(0) 推荐(0)

[置顶] 自我博弈偏好优化(Self-Play Preference Optimization,SPO)能否奖励模型?

摘要: 自我博弈偏好优化(Self-Play Preference Optimization, SPO)是一种通过自我博弈机制直接优化策略的方法,其核心特点是无需显式奖励模型,也不依赖对抗性训练。从技术本质来看,SPO 确实在特定场景下取代了奖励模型,但这一取代并非绝对,而是取决于任务类型和优化目标。以下从 阅读全文

posted @ 2025-08-22 11:07 limingqi 阅读(298) 评论(0) 推荐(0)

[置顶] POLAR 的无监督预训练

摘要: POLAR 的无监督预训练过程可以拆解为 “数据构建逻辑” 和 “对比学习目标” 两部分,结合具体例子会更易理解: 一、核心目标 让奖励模型(RM)像 “策略侦探” 一样,学会判断两条轨迹(模型输出)是否来自同一个 “政策”(即同一个模型或相似行为模式的模型)。如果来自同一政策,就给它们更高的 “相 阅读全文

posted @ 2025-07-26 12:48 limingqi 阅读(101) 评论(0) 推荐(0)

[置顶] Pre-Trained Policy Discriminators are General Reward Models 论文概述

摘要: 一、研究背景 强化学习(RL)在大型语言模型(LLMs)的训练中至关重要,其成功取决于奖励模型(RM)提供精确稳定反馈的能力。 传统奖励模型依赖标注的偏好对训练,存在可扩展性和泛化性问题,前者受限于获取大量高质量标注对的难度,后者因建模人类偏好的主观性易受奖励攻击。 规则基验证器虽能提供准确奖励信号 阅读全文

posted @ 2025-07-26 12:47 limingqi 阅读(167) 评论(0) 推荐(0)

2026年9月28日

多模态文档解析

摘要: 阅读全文

posted @ 2026-09-28 11:31 limingqi 阅读(6) 评论(0) 推荐(0)

2026年9月24日

计算机硕士培养计划

摘要: 一、培养目标 立足于计算机学科培养要求,兼顾工程实践能力与科研创新能力,同步强化综合软素质。通过课程学习、科研训练、工程项目实践、学术成果产出,掌握计算机领域基础理论与前沿技术;具备问题分析、系统设计开发、工程落地的工程意识;拥有文献调研、实验论证、撰写学术论文的科研素养;同时锻炼逻辑思维、沟通协作 阅读全文

posted @ 2026-09-24 17:25 limingqi 阅读(25) 评论(0) 推荐(0)

Qwen2.5-VL-32B-Instruct

摘要: VLM 图片解析增强问题描述评估报告(50条样本) 一、测试概况 指标 数值 测试样本数 50 成功解析 37 (74.0%) 解析失败 13 (26.0%) 测试报告来源 14份不同的8D整改报告 测试耗时 约14分钟 VLM接口 Qwen2.5-VL-32B-Instruct API端点 aim 阅读全文

posted @ 2026-09-24 15:56 limingqi 阅读(6) 评论(0) 推荐(0)

AI 驱动论文全链路自动化系统

摘要: 目标:把「系统方案设计→数据集导入→实验运行→论文初稿生成→多轮修改润色→格式排版」尽量自动化;但无法做到 100% 全自动产出可直接投稿 SCI 论文,只能做高效辅助,人类必须做科研把关、实验真实性、创新点把控。 适合方向:AI + 医学、计算机 CV/Agent 类研究,就是你前面关注的腹腔镜视 阅读全文

posted @ 2026-09-24 11:16 limingqi 阅读(12) 评论(0) 推荐(0)

AI + 医学 / AI + 计算机相对好投 SCI 期刊清单

摘要: 重要说明 免费逻辑:下面绝大多数为混合期刊,投稿录用时选择「订阅 / Traditional 非 OA 模式」,作者不交 APC 版面费;如果选 OA 开源则要付费。没有投稿费;部分 IEEE/Elsevier 有超页费(超过规定页数才收,控制篇幅可规避)。 “好投 / 还好中” 指:接收应用型创新 阅读全文

posted @ 2026-09-24 10:20 limingqi 阅读(36) 评论(0) 推荐(0)

2026年9月8日

审核风险等级划分

摘要: 风险等级判定逻辑 风险等级不是单纯只看模型输出分数,是「模型风险分 + 业务场景标签 + 高危实体 / 关键词命中」的组合判定;模型风险分数仅作为内部输入特征,对外不会披露固定的分数切割阈值。 一条会话如果多轮出现不同风险,整条会话取本轮所有轮次里面最高风险等级;风险判定对象支持两种粒度:单轮 AI 阅读全文

posted @ 2026-09-08 15:36 limingqi 阅读(86) 评论(0) 推荐(0)

2026年9月4日

江同学|AI 产品经理秋招面试拆解 & 模拟面试题库

摘要: 候选人背景:港大数据科学硕士|智谱 AI(高教 Agent 中台、AutoResearch 科研助手)|小 i 机器人 AI 眼镜 C 端|教育商业化项目|EasyEat 独立项目|有论文产出。 简历核心标签:ToB Agent 中台 0‑1 搭建、科研 Agent 产品、政企客户调研、GTM 商业 阅读全文

posted @ 2026-09-04 10:20 limingqi 阅读(107) 评论(0) 推荐(0)

2026年9月3日

DocAgent技术架构

摘要: 请求处理链路 从用户发起请求到系统内部最终处理完成的完整路径,从外向内分别是:API Gateway -> Router -> Service 架构设计 为了适应多任务、高精度、高并发、易扩展的文档解析需求,设计如下架构 整体架构 备注:右边流程图中带背景色的表示“GPU模型” 并发设计 当处理单个 阅读全文

posted @ 2026-09-03 15:29 limingqi 阅读(23) 评论(0) 推荐(0)

Agent 算法校招冲刺 S 计划

摘要: 学员概况:22 岁|2026.12.31 港硕毕业|985 本科计算机|两段 AI 相关实习 + 开源项目|求职方向 Agent 算法|意向地点上海 / 杭州;实习繁忙,不硬卷大厂,冲刺大厂、主力 AI 独角兽、国央企兜底;单节课60 分钟,共 6 节课。 课次课程主题课时核心目标课程核心内容课后作 阅读全文

posted @ 2026-09-03 15:04 limingqi 阅读(42) 评论(0) 推荐(0)

搞定offer · AI 求职导师平台

摘要: 项目介绍 · 功能方案 · 开发报价 版本:v1.0日期:2026-09-03 一、项目概述 1.1 项目背景 当前求职市场竞争激烈,求职者在简历制作、面试准备、岗位匹配等环节面临诸多痛点。传统求职服务(如培训班、1v1 导师)价格高昂且效率有限。 搞定offer 旨在通过 AI 技术,为求职者提供 阅读全文

posted @ 2026-09-03 12:35 limingqi 阅读(53) 评论(0) 推荐(0)

导航