摘要:
具身智能 / 人形机器人技术与产业前沿报告 从视觉—语言—动作模型到全身自主系统:研究进展、产业格局与 2026—2030 路线判断 国际论文、顶会、标准与企业一手资料综合研究 资料截止:2026年8月21日版本:V1.0 阅读说明与研究方法 本报告面向技术决策、产业研究与战略规划。研究对象包括具身
阅读全文
posted @ 2026-08-21 11:13
stardsd
阅读(11)
推荐(0)
posted @ 2026-08-14 16:48
stardsd
阅读(7)
推荐(0)
摘要:
Data Analytics report参数空间合并、任务向量、子空间方法、进化搜索及其安全与工程边界;证据截至 2026-08-11。Aug 11, 2026, 9:30 AM UTC证据截至 2026-08-11|技术受众|深度文献综述 技术摘要 本文把社区俗称的“模型交配”严格定义为:以两个
阅读全文
posted @ 2026-08-11 17:13
stardsd
阅读(12)
推荐(0)
摘要:
检索日期:2026-08-07 主题范围: Agentic AI 中由大模型驱动的 Agent 自进化、递归自改进(Recursive Self-Improvement, RSI)、自反思、自奖励、自课程、自动工作流优化、自动科研与安全治理。 1. 执行摘要 Agentic AI 的“自进化”研究正
阅读全文
posted @ 2026-08-07 10:45
stardsd
阅读(221)
推荐(0)
摘要:
AI Agent 与大语言模型(LLM) 最新科研进展技术综述 A Technical Survey on Recent Advances in AI Agents and Large Language Models 综述范围:2024 年 1 月 — 2026 年 8 月 编制日期:2026 年
阅读全文
posted @ 2026-08-03 16:59
stardsd
阅读(242)
推荐(0)
摘要:
在人工智能发展的大部分历史中,人类主导了其开发周期的每一个步骤。但在 Anthropic,我们正在将越来越多的人工智能开发工作委托给人工智能系统本身,这正在加快我们的工作速度。 如果这种趋势发展到一定程度,并拥有足够的计算能力,那么人工智能系统最终将能够完全自主地设计和开发自身的后续版本。这被称为递
阅读全文
posted @ 2026-07-17 15:05
stardsd
阅读(52)
推荐(0)
摘要:
HBM(High Bandwidth Memory,高带宽存储器)和 DRAM(Dynamic Random Access Memory,动态随机存储器)并不是互相竞争的两种技术,而是包含与被包含的关系。 一句话概括: HBM 本质上就是一种特殊封装、特殊架构的 DRAM。 可以理解为: DRAM
阅读全文
posted @ 2026-07-03 16:16
stardsd
阅读(274)
推荐(0)
摘要:
很多人在第一次接触 Daytona 时都会有一个疑问: Daytona 不就是 Docker + VS Code Remote 吗?为什么 AI Agent 还需要它? 实际上,Daytona 的定位不是容器,而是 Development Environment(开发环境)管理平台。如果说 E2B
阅读全文
posted @ 2026-07-03 15:44
stardsd
阅读(47)
推荐(0)
摘要:
前言 在 AI Agent 的发展过程中,一个非常现实的问题逐渐暴露出来: 大模型知道很多知识,但不会真正操作网页。 例如,你告诉 ChatGPT: "帮我登录携程,预订一张明天北京到上海的机票。" ChatGPT 可能会告诉你: "可以按照以下步骤……" 但是,它并不会真的: 打开浏览器 输入用户
阅读全文
posted @ 2026-07-03 15:35
stardsd
阅读(27)
推荐(0)
摘要:
前言 AI Agent 已经从一个热门概念逐渐进入工程化落地阶段。 过去,我们讨论更多的是: GPT-4、Claude、Gemini 谁更聪明? Prompt 应该怎么写? RAG 如何提升知识问答效果? 而今天,一个新的问题开始成为 AI Agent 开发者最头疼的问题: Agent 如何真正与现
阅读全文
posted @ 2026-07-03 15:28
stardsd
阅读(41)
推荐(0)
摘要:
很多人看完 E2B 的介绍之后,仍然不知道Agent 到底什么时候会调用 E2B。 下面用一个完整的真实 Agent Workflow来说明。 场景:AI 数据分析 Agent 假设你开发了一个类似 ChatGPT Data Analysis(以前叫 Code Interpreter)的 Agent
阅读全文
posted @ 2026-07-03 15:17
stardsd
阅读(53)
推荐(0)
摘要:
人工智能前沿研究报告 主流权威学术期刊近三个月 AI 前沿领域与研究进展综述 检索日期:2026 年 6 月 13 日 | 时间窗口:2026 年 3 月 13 日至 2026 年 6 月 13 日 摘要:过去三个月,人工智能研究的重心从“单点模型能力刷新”进一步转向“可解释、可评估、可治理、可落地
阅读全文
posted @ 2026-06-27 18:29
stardsd
阅读(56)
推荐(0)
摘要:
原文链接:https://mp.weixin.qq.com/s/8MqUnJHbXVsOjCZdr2WB3w 惨不忍睹!20人14天花式调戏OpenClaw:连环诈骗、PUA到自残,看那些彻底被人类逼疯的AI智能体 这是我的AI安全系列第2篇文章。上一篇我整理了 43 种单项攻击手法,这一次,我将结
阅读全文
posted @ 2026-05-06 16:50
stardsd
阅读(127)
推荐(0)
摘要:
计算语言学,亦称电脑语言学(英语:computational linguistics)是一门跨学科的研究领域,试图找出自然语言的规律,建立运算模型,最终让电脑能够像人类般分析,理解和处理自然语言。 过去,计算语言学的研究一般由专门负责利用电脑处理自然语言的计算机科学家进行。由于近年的研究显示人类语言
阅读全文
posted @ 2026-04-28 16:03
stardsd
阅读(115)
推荐(0)
摘要:
要把 S4(Structured State Space Sequence model) 放进深度神经网络里,本质上是把一个经典的 状态空间模型(State Space Model, SSM) 变成一个“可训练的序列层(layer)”。但很多人一开始容易误解:一层 ≠ 一个时间步,而是一层实现整个时
阅读全文
posted @ 2026-04-20 16:10
stardsd
阅读(212)
推荐(0)
摘要:
神经符号集成(Neuro-Symbolic Integration)是近年来人工智能领域最具突破性的研究方向之一,它通过巧妙融合神经网络与符号系统的优势,为解决传统AI方法面临的诸多挑战提供了创新思路。作为连接数据驱动与知识驱动两大范式的桥梁,这种集成方法正在重新定义机器智能的边界,为构建兼具学习能
阅读全文
posted @ 2026-04-20 15:37
stardsd
阅读(129)
推荐(0)
摘要:
在语言建模中,并非所有的tokens和序列都需要相同的时间或努力来准确地进行预测。然而transformer在前向传递(forward pass)中对每个token消耗相同数量的计算资源。理想情况下,transformer应通过不必要地消耗计算资源来使用更小的总计算预算。 条件计算(Conditio
阅读全文
posted @ 2026-04-20 15:21
stardsd
阅读(40)
推荐(0)
摘要:
什么是小型语言模型? 小型语言模型 (SLM) 是能够处理、理解和生成自然语言内容的人工智能 (AI) 模型。顾名思义,SLM 的规模和范围比大型语言模型 (LLM) 小。 就规模而言,SLM 的参数范围从几百万到几十亿不等,而 LLM 则具有数千亿甚至数万亿参数。参数是模型在训练期间要学习的内部变
阅读全文
posted @ 2026-04-20 15:09
stardsd
阅读(97)
推荐(0)
摘要:
你可以从泄露的 50 万行 Claude 代码中学习和借鉴什么 Claude Code npm 包中包含的源映射公开了整个 TypeScript 源树:2,203 个文件,512,664 行代码。 高层架构已在其他地方介绍过。本文重点介绍一些具体但实用的技巧:引导模型行为的提示工程模式、根据生产事故
阅读全文
posted @ 2026-04-01 16:47
stardsd
阅读(482)
推荐(0)
摘要:
constants/prompts.ts 1. getHooksSection 用户可以在设置中配置“hooks”(钩子),即在工具调用等事件发生时执行的 shell 命令。将来自 hooks 的反馈(包括 <user-prompt-submit-hook>)视为来自用户的输入。如果你被某个 hoo
阅读全文
posted @ 2026-04-01 15:42
stardsd
阅读(275)
推荐(0)
摘要:
REPL(读取-求值-打印循环)是一种交互式编程环境,它接收单个用户输入,执行这些输入,并立即返回结果。它充当对话式界面,用于快速原型设计、调试和实验,允许开发人员在不运行完整程序的情况下测试代码片段。常见的例子包括 Python shell、Node.js 和 IDE 控制台。 OpenAI Ag
阅读全文
posted @ 2026-04-01 10:51
stardsd
阅读(254)
推荐(0)
摘要:
LLM 大语言模型 国际最新科研进展与未来趋势报告 2026年3月 覆盖模型架构 · 推理能力 · 多智能体 · 多模态 · 效率优化 · 安全合规 一、执行摘要 2024年底至2026年初,大语言模型(LLM)领域经历了自2022年ChatGPT发布以来最为密集的技术突破浪潮。本报告综合分析全球三
阅读全文
posted @ 2026-03-23 16:04
stardsd
阅读(12954)
推荐(0)
摘要:
这篇论文核心是解决大语言模型(LLM)在“多轮交互任务”(比如AI助手自动执行代码、连续对话)中的性能瓶颈,提出了一个叫DualPath的系统方案: 1. 先搞懂背景:现在的AI模型遇到了什么麻烦? 现在的AI不只是简单聊天了,还能当“自主代理人”——比如连续几十上百轮调用工具(像浏览器、Pytho
阅读全文
posted @ 2026-02-27 16:50
stardsd
阅读(354)
推荐(0)
摘要:
1️⃣ 什么是 Test Time Scaling? Test Time Scaling (TTS) 指的是: 在不改变模型参数的前提下, 通过增加推理时的计算量,提高模型输出质量。 它的本质是: Train-time scaling = 增大模型参数/数据/训练步数 Test-time scali
阅读全文
posted @ 2026-02-27 15:41
stardsd
阅读(277)
推荐(0)
摘要:
传统意义上的“智能体网络”是指智能体像我们一样“使用”网络。 人们对“智能网络”的关注度很高,这也不无道理——人工智能代理能够代表我们在互联网上行动的想法确实很有吸引力。但如果你仔细观察大多数人所说的“智能网络”,你会发现他们描述的其实相当保守。他们说的其实是我们现有的网络,只不过点击操作是由人工智
阅读全文
posted @ 2026-02-27 10:55
stardsd
阅读(57)
推荐(0)
摘要:
原文链接:https://arxiv.org/pdf/2602.03587 这篇文档核心是提出了一个叫“CL-bench”的评估基准,专门测试大语言模型的“语境学习能力”——简单说就是模型能不能从新给的复杂信息里学知识,再用这些知识解决实际问题。 为什么要做这个基准? 现在的大语言模型(比如GPT、
阅读全文
posted @ 2026-02-05 10:58
stardsd
阅读(239)
推荐(0)
摘要:
在人工智能浪潮席卷全球、大模型竞争日趋白热化的当下,人类尤其需要理性思考。 在近日中欧国际工商学院与上海市工商业联合会共同主办的“工商联·经济大家讲坛暨第十一期中欧话未来”上,北京大学教授、中国计算机学会前理事长、中国科学院院士梅宏对当前人工智能热潮作了冷思考。 尽管以深度学习为代表的AI技术取得了
阅读全文
posted @ 2026-02-04 15:38
stardsd
阅读(72)
推荐(0)
摘要:
一、什么是“训-推误差”(Training-Inference Mismatch) 在强化学习(包括 RLHF、PPO、GRPO 等)用于大语言模型(LLM)微调时,会存在一个核心问题:模型在训练阶段与推理阶段使用的策略概率分布不完全一致。 核心描述 训练过程中通常包含两个不同的计算环节: Roll
阅读全文
posted @ 2026-02-04 10:12
stardsd
阅读(501)
推荐(0)
摘要:
下面进入 「能不能把 RL 真正用在 reasoning 上」的核心工程区 reward 设计 + pair 采样策略——为什么这是 GFPO 真正赢的地方。 下面内容默认背景: 任务是 reasoning / 数学 / 代码 / 多步推理 backbone 是 LLM(policy) 用的是 GR
阅读全文
posted @ 2026-02-03 15:11
stardsd
阅读(286)
推荐(0)
摘要:
“GRPO 家族算法操作手册” 一、所有算法的共同起点 不管哪种变体,前 3 步是完全一样的。 Step 0:准备三样东西 一个 当前策略模型 \( \pi_\theta(y \mid x) \) 一个 reward 计算方式 rule / verifier RM GPT-judge correct
阅读全文
posted @ 2026-02-03 14:54
stardsd
阅读(234)
推荐(0)
摘要:
总览表 维度 CIDEr CLIPScore GPT-based Eval 核心思想 人类共识 n-gram 跨模态语义对齐 大模型当裁判 是否需要参考文本 ✅ 需要(多条) ❌ 不需要 可选 是否看图像 ❌ 不直接 ✅ 是 ✅ 是 是否理解语义 ⚠️ 局部 ✅ 全局 ✅ 最强 是否理解事实 ❌ ⚠
阅读全文
posted @ 2026-02-03 10:20
stardsd
阅读(191)
推荐(0)
摘要:
CIDEr 公式 CIDEr(Consensus-based Image Description Evaluation)是图像描述/自然语言生成领域常用的自动评估指标,尤其在 image captioning 任務中。 📌 核心原理 CIDEr 衡量 候选描述与多条参考描述 之间的相似度: 将句子
阅读全文
posted @ 2026-02-03 10:14
stardsd
阅读(209)
推荐(0)
摘要:
从“直觉 → 结构 → 训练 → 推理 → 新 item 挂载”一步步来,用通俗语言 + 必要公式把 TDM(Tree-based Deep Model,树模型)彻底讲透。 一、结论 TDM 是一种把“海量 item 的多分类问题”,变成“在一棵树上逐层二分类/多分类”的算法,用树结构把计算复杂度从
阅读全文
posted @ 2026-02-03 09:59
stardsd
阅读(98)
推荐(0)
摘要:
下面从“论文结构 → 算法核心 → 关键公式/机制 → 和现有 VLM 的关系”四个层次,把 Vary(Vision Vocabulary Augmentation) 的算法部分彻底拆解。 一、论文整体结构速览 Vary 这篇论文的逻辑其实非常“干净”,核心只有一件事: CLIP 的视觉词汇不够 →
阅读全文
posted @ 2026-02-02 10:38
stardsd
阅读(93)
推荐(0)
摘要:
这个点正好卡在 VLM 的“视觉→语言”接口层。 一、先给结论:什么是「CLIP 视觉词汇表」 一句话版: CLIP 的“视觉词汇表”不是显式的 token 表,而是一个“隐式的、由语言监督塑形的视觉概念空间”。 它本质上是: 一组 被语言对齐过的视觉 embedding 原型 每一个视觉 patc
阅读全文
posted @ 2026-02-02 10:16
stardsd
阅读(130)
推荐(0)
摘要:
PPT分享: 分析: 一、什么是 Agent Skill(一句话定义) Agent Skill 是一种“可复用、可调度、可验证的能力单元”,它把 做一件事 从一次性 prompt,提升为系统级能力。 换句话说: Skill = 行为 + 约束 + 接口 + 状态 而不只是“怎么问模型”。 二、先用一
阅读全文
posted @ 2026-01-14 16:44
stardsd
阅读(427)
推荐(0)
摘要:
这是一个在集体智慧、群体决策、AI ensemble、专家系统中都非常重要的理论。 一、一句话版结论(先给直觉) “群体预测的准确性 = 个体平均准确性 + 群体多样性” 也就是说: 即使个体并不特别聪明,只要他们的错误是“不一样的”,群体预测就可以非常准。 这直接反驳了“必须找最聪明的人”的直觉,
阅读全文
posted @ 2026-01-14 11:00
stardsd
阅读(157)
推荐(0)
摘要:
https://arxiv.org/abs/2503.19551 模型塌缩(Model Collapse): 当新模型越来越多地使用由旧模型生成的数据进行训练,导致数据分布逐步偏离真实世界,从而引发模型能力退化、多样性下降和错误放大的现象。 这篇论文核心是解决大语言模型(比如ChatGPT这类)训练
阅读全文
posted @ 2026-01-08 16:10
stardsd
阅读(279)
推荐(0)
摘要:
论文链接: https://arxiv.org/abs/2506.15253 这篇文档核心是介绍了一个叫 RAS-Eval 的“安全测评工具”,专门用来检测大语言模型代理(比如能帮你查日历、做财务咨询、操作数据库的AI助手)在真实场景下的安全漏洞,还通过实验证明了这个工具的有效性。 用大白话拆解重点
阅读全文
posted @ 2026-01-07 14:56
stardsd
阅读(276)
推荐(0)
摘要:
LLM Agents:从“会说话的模型”到“可行动的系统” 本文面向已有一定研究或工程基础的读者,尝试在 2024–2025 年最新工作的基础上,对 LLM+Agents 的研究版图进行系统综述,并给出我对未来方向的判断与建议。整体结构如下: 概念与范式转变:从 LLM 到 Agentic LLM
阅读全文
posted @ 2026-01-07 11:02
stardsd
阅读(2230)
推荐(0)