AI 技术日报 - 2026-08-22

AI 技术日报 - 2026-08-22

Top 10 AI 技术要闻

  1. OpenAI 全面开源 Codex Harness,AI 编程智能体底层能力进一步开放
    OpenAI 进一步开放了 Codex Harness 的核心能力,将 Codex 不同产品形态的智能体运行框架提供给开发者。Codex Harness 是 Codex 背后的核心 Agent 运行时环境,负责连接模型、用户和工具,管理任务执行、上下文、会话和代码操作等流程。从架构角度看,它不仅是代码生成工具,更是完整的 Agent 执行框架,核心包括 Agent Loop、线程生命周期与持久化、配置与认证、工具执行和扩展机制。通过 Codex App Server,开发者可以使用双向 JSON-RPC 协议集成 Harness 与不同客户端,获取实时事件流,构建 IDE、桌面应用等定制化 Agent 产品。此前 OpenAI 已开源 Codex CLI 和相关核心代码,并在 Harness 中实践了"代码完全由 Codex 编写"的工程理念:一个内部产品在约 5 个月内生成约 100 万行代码,完成约 1500 个 Pull Request,团队核心理念从"手写代码"转向"人设目标、Agent 执行"。此次 Harness 的进一步开源标志着 AI 编程竞争正从模型能力延伸到 Agent 运行时、工具调用、上下文管理和工程反馈循环。

链接:https://www.aibase.com/news/30531

  1. DeepSeek Harness 一周三更:把 Claude Code 和 Codex 收编成子代理
    DeepSeek Harness 近期密集更新,一周内发布多个版本,将 Claude Code 和 Codex 收编为子代理,试图成为 Agent 时代的"调度层"。DeepSeek Harness 是 DeepSeek 推出的 AI 编程智能体运行框架,定位类似于 OpenAI 的 Codex Harness,但更强调跨模型调度能力。通过将主流编程 Agent(如 Claude Code、Codex)作为子代理纳入统一调度,开发者可以在单一框架内灵活切换不同模型和工具链,根据任务类型自动选择最优 Agent 执行。此外,DeepSeek 同步更新了工具链至 0.1.1-rc.1 版本,新增 V4-Flash-Vision-Exp 视觉模型体验版,在 V4-Flash 和 V4-Pro 基础上扩展了多模态能力,支持原生图片请求和图文混合输入。社区反响热烈,掘金等技术社区涌现大量使用教程和插件推荐。这一系列更新表明 DeepSeek 正在构建以 Harness 为核心的 Agent 生态,与 OpenAI Codex Harness 形成直接竞争。

链接:https://www.36kr.com/p/3947852851664512

  1. NVIDIA 通用编程 Agent 系统 AVO 在 ARC-AGI-3 公开测试集上取得 100% 满分
    NVIDIA 宣布其通用编程 Agent 系统 AVO(Agent for Visual Operations)在 ARC-AGI-3 公开测试集的全部 25 个环境中取得 100% 满分,完成了所有 183 个关卡。ARC-AGI 是目前最具挑战性的通用智能基准测试之一,旨在评估 AI 系统的抽象推理和模式识别能力。AVO 的满分成绩标志着 NVIDIA 在 Agent 工程领域取得重大突破。值得关注的是,TechCrunch 在评论中指出"NVIDIA 证明了 Harness(运行框架)而非 AI 模型本身才是真正的英雄"——这一观点与 OpenAI 开源 Codex Harness、DeepSeek Harness 周更等动态相呼应,表明行业共识正在形成:Agent 的核心竞争力已从底层模型能力转移到运行时架构、工具调用编排和上下文管理。AVO 的成功为 NVIDIA 在 AI Agent 领域的技术布局增添了重要筹码,也推动了 Agent 工程标准化的进程。

链接:https://www.techmeme.com/260821/p24

  1. Claude Platform 正式上线 Computer Use、Skills API 与 Files API
    Anthropic 正式宣布 Claude Platform 上的 Computer Use、Skills API 和 Files API 全面可用(Generally Available)。此次更新不仅推出了全新的 Browser Use 工具,还对底层能力进行了深度优化。Computer Use 功能取得显著突破:更新后的工具允许 Claude 在单次模型调用中执行多个连续操作,大幅减少任务完成时间和调用次数,同时达到 HIPAA 合规标准,可用于受监管的医疗健康工作负载。全新的 Browser Use 工具是本次发布的绝对亮点,它继承了多轮操作的优势并创新引入网页结构解析能力,能直接识别和交互网页上的特定输入框或按钮,比传统的截图点击方式更精准高效。Skills API 允许企业上传和管理专有技能文件夹(包含行业指令、脚本和模板),在 Claude 的代码执行沙箱中安全运行,无需企业自行托管。Files API 提供稳定的文档存储空间,支持 PDF、表格等文件上传,通过 ID 在后续请求中引用,并实现了自动文件过期机制,速率限制提升 5 倍,每个组织可享 1TB 专用存储。

链接:https://www.aibase.com/news/30522

  1. 千问 AI 平台模型矩阵持续扩容,GLM-5.3、DeepSeek-V4-Pro 正式上线
    阿里云千问 AI 平台(MaaS)近期更新模型服务矩阵,正式接入智谱的旗舰大模型 GLM-5.3 和 DeepSeek-V4-Pro 官方版本,对应 API 服务已向公众开放。两款模型均聚焦于编程和智能体核心应用场景:GLM-5.3 基于智谱最新技术迭代,显著增强了编程能力、长周期任务执行能力和网络安全能力,编码和 Agent 能力接近 Claude Fable5,编码体验优于其他国产模型;DeepSeek-V4-Pro 则在推理和复杂任务处理方面表现突出。目前千问平台已聚合多种主流模型,覆盖文本生成、代码开发、语音处理、图像生成和视频生成五大领域,集成了通义千问 Qwen3.8-Max、Qwen3.8 开源模型、Qwen-Audio3.0 等。平台还推出了 Token Plan 订阅套餐,DeepSeek-V4-Pro、Qwen3.8-Max 和 Qwen-Audio 系列模型已开通订阅渠道,购买后可在 Qoder、Codex 等 AI 开发工具中自由切换模型。此举进一步丰富了千问平台的全场景模型供给。

链接:https://www.aibase.com/news/30523

  1. Mistral 推出 Agentic Search,多步检索将复杂文档准确率提升至 86%
    Mistral AI 正式推出 Agentic Search 升级版,通过引入多步检索循环机制,打破传统 RAG"检索即回答"的局限,将复杂文档查询准确率提升至 86%。传统 RAG 的核心弱点在于"检索无推理、无迭代"——模型只能基于初始找到的文本片段作答。Agentic Search 建立在现有企业搜索索引之上,为模型提供五类类似文件系统操作的核心工具,使模型不再受限于传统分块粒度,可以主动检查检索内容、优化搜索策略、深入底层证据,甚至跨多文档比对验证。在行业基准测试中,Agentic Search 展现了强大的实用能力和数据可扩展性。此外,该方案完美适配云端和本地部署需求,既可嵌入 Studio 和 Vibe 的 Libraries 中,也可通过 Mistral Search Toolkit 集成到客户自建工作流。这一技术突破为企业解锁敏感领域数据价值、构建高精度检索系统提供了强有力的基础设施支撑。

链接:https://www.aibase.com/news/30529

  1. 阿里开源 Qwen-UI-Agent:真机多模态 GUI 智能体基座模型登场
    阿里正式推出 Qwen-UI-Agent,一款以真实世界为中心的 GUI 智能体基座模型。该模型全面覆盖移动端、桌面端、网页端和深度搜索环境,旨在突破传统模拟测试的局限,使模型能在复杂真实设备上无缝运行。为弥合"模拟与现实"的鸿沟,Qwen-UI-Agent 构建了覆盖 100+ 真机、150+ 应用的真实移动环境,用于任务构建、轨迹收集和模型训练,并推出包含 400+ 任务的 MobileWorld-Real 真机基准。在功能特性上,模型不仅支持常规 GUI 界面操作,还能直接执行命令行操作,单次决策输出批量动作以显著缩短执行轨迹。同时具备完整的安全判断机制:面对违法或高风险请求直接拒绝并终止任务,涉及支付、数据删除、隐私授权等敏感场景时在关键步骤暂停等待用户确认。模型还支持 100 步以上轨迹的在线强化学习训练,结合自适应课程学习,持续攻克具有挑战性的长周期任务。

链接:https://www.aibase.com/news/30530

  1. 商汤科技开源 8B 轻量多模态大模型 SenseNova U1.5Lite
    商汤科技开源了 8B 参数的轻量统一多模态大模型 SenseNova U1.5Lite。该模型在核心视觉任务中表现出色,在处理复杂布局和文本渲染方面可媲美大规模商用模型。模型原生支持 3-4K 上下文长度,能够处理高分辨率图像输入并实现 4K 输出,覆盖文档理解、OCR、图表分析、视觉编辑等多种视觉任务。作为 8B 级别的轻量模型,SenseNova U1.5Lite 在保持较强性能的同时大幅降低了部署门槛,适合在边缘设备和资源受限环境中运行。此次开源为研究者和开发者提供了一个高质量的多模态基座模型,可用于构建文档分析、内容审核、智能问答等应用。商汤同步开源了模型权重,体现了其在开源生态建设上的持续投入,也为国产多模态大模型生态增添了重要一员。

链接:https://www.aibase.com/news/30527

  1. 字节 Seed 再调整:预训练、强化学习与 Agent 研发全面重构
    字节跳动大模型部门 Seed 完成了新一轮组织架构调整。Seed 基础模型新设四个一级部门,均向吴永辉汇报。Pretrain Data 由李成钢负责,整合此前分散在文本模型、编程、视觉理解、语音等团队的预训练数据团队,负责新 Omni 模型的多模态数据和超大模型预训练数据。Horizon RL 由唐某某负责,专注于强化学习方向。Product Posttrain-Work 由秦雨佳负责,主要面向 B 端应用,负责 Agentic 模型的集成和发布,优化办公场景的 Agent 能力,为豆包和 Dola 等产品的任务模式提供支持。此外,字节 Seed 团队与清华 AIR 联合发布了 CUDA Agent,一个使用大模型训练的智能强化学习系统,用于编写高性能 GPU 内核,解决了大模型生成 GPU 代码效率低和难以超越传统编译器的痛点。此次调整显示 Seed 正在强化从数据、预训练到强化学习和产品后训练的完整管线,并为企业办公 Agent 和消费对话场景建立差异化模型体系,有传闻称下一代模型参数将超过 5T。

链接:https://www.aibase.com/news/30537

  1. OpenAI 将前沿 GPT-5.6 Sol 模型的开发者价格下调 20% 以上
    OpenAI 宣布将其前沿 GPT-5.6 Sol 模型的开发者 API 价格下调超过 20%。GPT-5.6 Sol 是 OpenAI 当前最先进的模型之一,此次降价直接降低了开发者和企业使用顶级 AI 模型的成本门槛。这一举措发生在 AI 模型市场竞争加剧的背景下——DeepSeek-V4-Pro 和 GLM-5.3 等国产模型在编程和 Agent 场景中表现逼近顶级商用模型,千问 AI 平台等聚合平台也降低了多模型调用成本。降价策略有望加速 GPT-5.6 Sol 在企业级应用中的普及,推动更多中小开发者和创业团队构建基于前沿模型的 AI 应用。同时,这也反映出随着模型训练成本下降和推理效率提升,顶级 AI 模型的定价正在趋于合理化,API 价格战可能成为行业常态。

    链接:https://www.reuters.com/technology/openai-cuts-developer-pricing-frontier-gpt-56-sol-model-by-more-than-20-2026-08-21


数据来源:TheAIEra News Hub
生成时间:2026-08-22 07:14:13

posted @ 2026-08-22 07:15  iTech  阅读(0)  评论(0)    收藏  举报