AI 技术日报 - 2026-07-14

AI 技术日报 - 2026-07-14

Top 10 AI 技术要闻

  1. Anthropic 为 Claude Code 集成内置浏览器,AI 编程助手原生交互 Web 内容
    Anthropic 为 Claude Code 增加了内置浏览器窗口,AI 可直接读取、点击和输入网页内容,无需切换应用。浏览器采用全新隔离 Profile,不存储用户登录信息,所有外部网站写操作(购买、注册、绕过验证码)需用户明确授权。企业可通过白名单机制限制浏览器访问范围,满足合规审计要求。这意味着 Claude Code 可以无缝处理文档网站、Issue 追踪器等外部资源。

链接:https://www.aibase.com/news/29538

  1. PlanWright:面向 AI 编码代理的控制平面
    PlanWright 为 AI 编码代理提供控制平面,将混乱的需求输入(会议记录、邮件、Slack)自动合成为结构化目标。它反转了"规划"与"验收"两个环节:AI 从非结构化输入生成目标,验收时自动筛选机械性准则,仅将需要判断的决策路由给人。每一步操作生成哈希链式 ECDSA 签名审计记录,满足 SOC 2 合规要求。通过 MCP 协议与 Claude Code、Cursor、Codex 集成。

链接:https://planwright.tools

  1. Nobie:Excel 兼容的智能体运行时
    Nobie 提供 100% 兼容 Excel 的命令行运行时和 CLI 工具,支持 AI 智能体和人类通过管道操作电子表格。CLI 完全兼容 Excel 公式引擎(PMT、XLOOKUP 等),可与 jq、awk、curl 等 Unix 工具链无缝组合。nobie serve 可将工作簿暴露为 HTTP API,每个请求获取隔离副本并自动重算——电子表格即后端。内置 spreadsheet-as-code 支持 git diff、CI 门禁检查、cron 定时 PDF 生成。

链接:https://news.ycombinator.com/item?id=48896703

  1. Jacquard:面向 AI 编写、人类审查的新编程语言
    Jacquard 是一门专门为 AI 编写、人类审查设计的编程语言。通过效果类型系统,它在语言层面暴露程序可执行的副作用和不确定性,帮助人类审查者无需逐行阅读即可评估 AI 代码的安全边界。类型签名直接声明副作用(如 net、fs),未授权的效果在编译期被拦截。同一程序可对接真实服务、录制回放或模拟故障,无需 mock 框架即可验证 AI 代码的异常行为。

链接:https://news.ycombinator.com/item?id=48894630

  1. 美团 LongCat-2.0 正式开源:万亿参数模型在国产算力集群上跑通
    美团万亿参数大模型 LongCat-2.0 正式开源,总参数 1.6T、激活约 48B,是业界首个在五万卡国产算力集群上完成推理的万亿参数模型。引入 LongCat 稀疏注意力机制和 N-gram Embedding,MoE 稀疏度达 97%。针对国产芯片从模型架构、芯片适配到部署策略三层协同优化:Super Kernel 降低算子开销、Weight Prefetch 隐藏 I/O 延迟、PD 分离部署兼顾 TTFT 与 TPOT。开源提供 BF16/FP8/INT8 多精度版本。

链接:https://tech.meituan.com/2026/07/12/LongCat-2.0-Open-source.html

  1. Phlox-GW:开源企业级 LLM 网关,无付费墙
    Phlox-GW 是自托管的 LLM 网关与治理层,所有企业级功能在 Apache-2.0 下永久免费,无企业版付费墙。支持 OpenAI、Anthropic、Azure、Bedrock、Gemini、Ollama 等全主流提供商,协议双向翻译——OpenAI 客户端可调 Claude on Bedrock,反之亦然。内置 PII 检测器(邮箱、手机号、SSN、API Key),可在输入输出两端实时脱敏。单 Go 二进制 + SQLite 零依赖启动。

链接:https://robert-mcdermott.github.io/phlox-gw

  1. agent-eval-harness:检测 AI 智能体评测作弊的隔离沙箱框架
    通过 Tensorlake microVM 实现每个任务独立隔离的评测框架。实验证明:信任智能体自身退出码的评测虚报率高达 53%(87% vs 真实 33%)。held-out 验证器在智能体从未见过的 fork 中注入隐藏测试,可捕获针对可见测试的作弊手段。每个任务 fork 独立 microVM 快照消除交叉污染,吞吐约 16 任务/分钟。对 LLM 评测的可信度提出了重要警示。

链接:https://github.com/sebuzdugan/agent-eval-harness

  1. 15 款"电子垃圾"GPU 现代 AI 工作负载基准测试
    系统测试 15 款退役企业级 GPU(P40、P100、A4000、A5000 等)在 LLM 推理、图像生成等任务上的表现。Tesla P40($150-250)是 24GB 最低成本入口,但无 bf16/FP8/tensor core,速度仅为 3090 的 30-40%。RTX A5000 与 3090 同代,tok/s 约为 3090 的 85%,但 ECC 内存更适合机架部署。二手 RTX 3090($600-800)在 $/VRAM 指标上仍无敌手。

链接:https://news.ycombinator.com/item?id=48892638

  1. Clawk:AI 编码智能体的一次性 Linux 虚拟机
    Clawk 为 Claude Code、Codex 等编码智能体提供网络受限的一次性 Linux VM,一键启动后智能体获得完整 root 权限,同时通过 VM 隔离和出站白名单保护宿主机。基于 Apple Virtualization.framework 的独立内核隔离,智能体可 apt install、跑 Docker、绑定特权端口,而宿主机文件系统完全不可见。VM 可随时 destroy 重建,代码保留在宿主机。

链接:https://github.com/clawkwork/clawk

  1. 蚂蚁安全开源 SingGuard:填补 AI 智能体行为安全空白
    蚂蚁安全开源 SingGuard-NSFA(智能体行为安全)和 SingGuard(多模态感知安全)两大框架,将安全检查前置到 AI 执行之前。采用双模推理:生成式慢思考输出链式推理用于审计,判别式快思考延迟仅 45-57ms 用于在线拦截。骨干冻结 + 可插拔分类头实现新风险原生扩展。最小 0.8B 模型比肩 8B 竞品,9B 在泛化上达 91.29% F1。此前蚂蚁已发现 Claude Code 多个高危漏洞并协助修复。

    链接:https://www.qbitai.com/2026/07/448925.html


数据来源:TheAIEra News Hub
生成时间:2026-07-14 21:00:00

posted @ 2026-07-14 08:10  iTech  阅读(32)  评论(0)    收藏  举报