1 2 3 4 5 ··· 25 下一页

[置顶] openclaw 思考

摘要: 一些建议 GUI or CLI 内部对龙虾的引入和使用,主要是 GUI的方式:绑定美信,安全可控。这种对话的使用方式限制了龙虾的应用场景。这是典型的员工提效思维。 外部公司已经趋向CLI:钉钉已经彻底 CLI 化了、一键接入OpenClaw,谷歌开源CLI狂揽15k Stars,智能体接管Works 阅读全文

posted @ 2026-04-10 11:36 limingqi 阅读(305) 评论(0) 推荐(0)

[置顶] 自我博弈偏好优化(Self-Play Preference Optimization,SPO)能否奖励模型?

摘要: 自我博弈偏好优化(Self-Play Preference Optimization, SPO)是一种通过自我博弈机制直接优化策略的方法,其核心特点是无需显式奖励模型,也不依赖对抗性训练。从技术本质来看,SPO 确实在特定场景下取代了奖励模型,但这一取代并非绝对,而是取决于任务类型和优化目标。以下从 阅读全文

posted @ 2025-08-22 11:07 limingqi 阅读(286) 评论(0) 推荐(0)

[置顶] POLAR 的无监督预训练

摘要: POLAR 的无监督预训练过程可以拆解为 “数据构建逻辑” 和 “对比学习目标” 两部分,结合具体例子会更易理解: 一、核心目标 让奖励模型(RM)像 “策略侦探” 一样,学会判断两条轨迹(模型输出)是否来自同一个 “政策”(即同一个模型或相似行为模式的模型)。如果来自同一政策,就给它们更高的 “相 阅读全文

posted @ 2025-07-26 12:48 limingqi 阅读(98) 评论(0) 推荐(0)

[置顶] Pre-Trained Policy Discriminators are General Reward Models 论文概述

摘要: 一、研究背景 强化学习(RL)在大型语言模型(LLMs)的训练中至关重要,其成功取决于奖励模型(RM)提供精确稳定反馈的能力。 传统奖励模型依赖标注的偏好对训练,存在可扩展性和泛化性问题,前者受限于获取大量高质量标注对的难度,后者因建模人类偏好的主观性易受奖励攻击。 规则基验证器虽能提供准确奖励信号 阅读全文

posted @ 2025-07-26 12:47 limingqi 阅读(162) 评论(0) 推荐(0)

2026年9月8日

审核风险等级划分

摘要: 风险等级判定逻辑 风险等级不是单纯只看模型输出分数,是「模型风险分 + 业务场景标签 + 高危实体 / 关键词命中」的组合判定;模型风险分数仅作为内部输入特征,对外不会披露固定的分数切割阈值。 一条会话如果多轮出现不同风险,整条会话取本轮所有轮次里面最高风险等级;风险判定对象支持两种粒度:单轮 AI 阅读全文

posted @ 2026-09-08 15:36 limingqi 阅读(36) 评论(0) 推荐(0)

2026年9月6日

阿里内容审核

摘要: 标的:淘天集团 9月7日 21:00 形式:电话入会 访谈核心方向:商品 / 商家资质 / 直播间治理机审,聚焦机审召回、机审驳回两大环节大模型应用,覆盖 few‑shot 小模型、主干大模型、规则引擎、传统判别模型;完整审核链路、模型编排、分流策略、角色分工边界。 一、候选人简历(对外访谈版,最小 阅读全文

posted @ 2026-09-06 21:55 limingqi 阅读(26) 评论(0) 推荐(0)

头部 AI 智能体 / Claw 类产品上线测评闸门与指标体系

摘要: 访谈身份:腾讯云与智慧事业群,混元大模型部,测试架构师;负责 WorkBuddy‑Bench 评测套件,支撑 WorkBuddy、CodeBuddy、元宝等 Agent/Claw 类产品的版本测评、上线质量门禁;参与内部 Agent 从研发到灰度上线完整测评流程。 背景说明:以下为腾讯内部 Agen 阅读全文

posted @ 2026-09-06 20:19 limingqi 阅读(25) 评论(0) 推荐(0)

2026年9月4日

腾讯混元大模型梳理

摘要: 提纲:见文档 【岗位】测试架构师 【归属事业群】腾讯云与智慧产业事业群(CSIG)‑混元大模型部 【部门】混元大模型质量与评测部(对外公开业务部门名称) 【团队职能】集团 AI 大模型 & Agent 工具评测架构团队 【汇报关系】向质量测试总监汇报(不写领导真实姓名) 【负责产品】 混元大模型底座 阅读全文

posted @ 2026-09-04 20:53 limingqi 阅读(27) 评论(0) 推荐(0)

江同学|AI 产品经理秋招面试拆解 & 模拟面试题库

摘要: 候选人背景:港大数据科学硕士|智谱 AI(高教 Agent 中台、AutoResearch 科研助手)|小 i 机器人 AI 眼镜 C 端|教育商业化项目|EasyEat 独立项目|有论文产出。 简历核心标签:ToB Agent 中台 0‑1 搭建、科研 Agent 产品、政企客户调研、GTM 商业 阅读全文

posted @ 2026-09-04 10:20 limingqi 阅读(32) 评论(0) 推荐(0)

2026年9月3日

DocAgent技术架构

摘要: 请求处理链路 从用户发起请求到系统内部最终处理完成的完整路径,从外向内分别是:API Gateway -> Router -> Service 架构设计 为了适应多任务、高精度、高并发、易扩展的文档解析需求,设计如下架构 整体架构 备注:右边流程图中带背景色的表示“GPU模型” 并发设计 当处理单个 阅读全文

posted @ 2026-09-03 15:29 limingqi 阅读(12) 评论(0) 推荐(0)

Agent 算法校招冲刺 S 计划

摘要: 学员概况:22 岁|2026.12.31 港硕毕业|985 本科计算机|两段 AI 相关实习 + 开源项目|求职方向 Agent 算法|意向地点上海 / 杭州;实习繁忙,不硬卷大厂,冲刺大厂、主力 AI 独角兽、国央企兜底;单节课60 分钟,共 6 节课。 课次课程主题课时核心目标课程核心内容课后作 阅读全文

posted @ 2026-09-03 15:04 limingqi 阅读(27) 评论(0) 推荐(0)

搞定offer · AI 求职导师平台

摘要: 项目介绍 · 功能方案 · 开发报价 版本:v1.0日期:2026-09-03 一、项目概述 1.1 项目背景 当前求职市场竞争激烈,求职者在简历制作、面试准备、岗位匹配等环节面临诸多痛点。传统求职服务(如培训班、1v1 导师)价格高昂且效率有限。 搞定offer 旨在通过 AI 技术,为求职者提供 阅读全文

posted @ 2026-09-03 12:35 limingqi 阅读(29) 评论(0) 推荐(0)

搞定 offer 学员平台|新增功能模块方案与报价

摘要: 搞定 offer 学员平台|新增功能模块方案与报价 基于现有学员网页平台,新增:模拟面试、面试表达训练、岗位模块、飞书资料存档;简历模块、笔试刷题训练为二期后续交付,本次暂不开发。 现有系统已有:测评模块(MBTI、霍兰德、综合能力笔试、简历上传解析)。 终端:PC 网页端,沿用现有 UI 设计风格 阅读全文

posted @ 2026-09-03 11:50 limingqi 阅读(15) 评论(0) 推荐(0)

2026年9月2日

kimi模型梳理

摘要: 话题: 聊一下模型训练数据生产产线成熟度, 合营/自营/采购 体量+比例+人员配置 这些信息。 详细提纲如下,提纲内容较多,如果专家只能聊部分的话请专家在提纲内标黄可聊部分 题纲:题纲较多详见文档 TQ:1. 大模型训练数据生产为例,目前数据自有正式员工、自营/内包团队、BPO、领域专家以及第三方供 阅读全文

posted @ 2026-09-02 18:12 limingqi 阅读(13) 评论(0) 推荐(0)

1 2 3 4 5 ··· 25 下一页

导航