摘要: GLM-5.3 于 2026 年 8 月 14 日中午正式发布,是智谱 AI GLM-5 系列的最新版本;与 GLM-5.2 的核心差异在于技术路线——基座模型参数量(约 7430 亿,MoE 架构)完全未变,所有能力提升来自后训练阶段的极致 Scaling:任务环境规模扩展数十倍、环境类型更丰富、后训练时长显著延长;整体性能较 GLM-5.2 提升约 50%,在 Z.ai Code Bench 高难度档以 31.4%(耗 ~5 万 token)超越 Claude Opus 4.8 的 29.5%(耗 ~12 万 token),DeepSWE v1.1 从 46.2 跃升至 66.9,Terminal-Bench 3.0 从 4.6 跃升至 28.3(开源第一);网络安全能力新增披露:CyberGym 以 84.5% 排第一(Mythos 5 为 83.8%),实际在 269 个项目中发现 2436 个漏洞;模型权重将在发布两周内开源(宽松许可证),API 同步上线,具体定价尚未公布。 阅读全文
posted @ 2026-08-14 15:08 vibecoding患者 阅读(755) 评论(0) 推荐(0)
摘要: DeepSeek Harness(命令行名 dsh)是 DeepSeek AI 于 2026 年 8 月 13 日与 V4 Pro 同日开源的 AI Agent 框架,MIT 协议,开源不足 24 小时 GitHub Stars 突破 5 万;其架构核心是"一切皆插件"——模型、工具、沙箱策略、多 Agent 协调、会话存储均以插件形式挂载,由 Cordis 微内核驱动组合;提供四种启动方式(Web UI / TUI / Headless / Python SDK),最快部署路径是安装 Node.js 后执行 npx @deepseek-ai/dsh web,浏览器访问 http://127.0.0.1:3080 即可开始使用;自定义模型接入通过 Web UI 图形化配置或 $DSH_HOME/settings.yaml 写入 OpenAI 兼容端点实现;Python SDK(pip install deepseek-harness-sdk)提供程序化接入,内置运行时无需单独安装 Node.js;当前处于开发者预览阶段,官方明确警告将有破坏性变更。 阅读全文
posted @ 2026-08-14 10:26 vibecoding患者 阅读(5148) 评论(0) 推荐(0)
摘要: DeepSeek-V4-Pro-0813 于 2026 年 8 月 13 日凌晨无预告发布,是 V4 系列旗舰模型的首个正式版本,承接 4 月 24 日上线的预览版;核心变化是 Agent 能力的大幅跃升——DeepSWE 从 12.8 跳至 62.7(+390%)、NL2Repo 从 38.5 升至 61.5、DSBench-Hard 升至 67.2——架构与参数量未变(1.6T MoE、激活 ~49B),改变来自针对性后训练;定价维持 ¥3 元/百万 token(输入)、¥6 元/百万 token(输出),官方同步宣告"近期将大幅涨价";API 新增 Responses API 与 Anthropic API 双协议支持,已兼容 Codex 和 Claude Code 等主流编程工具;同期 DeepSeek Harness 极简模式亦随文档首次亮相。 阅读全文
posted @ 2026-08-13 09:51 vibecoding患者 阅读(314) 评论(0) 推荐(0)
摘要: Kimi K3 是月之暗面于 2026 年 7 月 16 日发布的旗舰模型,拥有 2.8 万亿参数、100 万 token 上下文、原生视觉理解,基于 KDA(Kimi Delta Attention)混合线性注意力机制构建,是目前规模最大的开放权重模型之一;其 API 在月之暗面官方、阿里云百炼、七牛云 MaaS 等多个平台均有上线,但标价完全相同——输出 ¥100/百万 token、非缓存输入 ¥20、缓存命中输入 ¥2——真正影响你实际账单的,是缓存命中率、平台限流上限和免费额度这三个维度,而非标价差异。 阅读全文
posted @ 2026-08-11 15:00 vibecoding患者 阅读(23) 评论(0) 推荐(0)
摘要: 国产大模型企业套餐(Token Plan)是各平台面向企业和团队的 API 预付费订阅服务,相比按量计费通常便宜 40%–90%,并附带多模型统一接入、团队 Key 管理等企业级权益;目前主流选项有四家:七牛云 Token Plan(4 厂商 25 模型统一接入,最低 ¥2,999/月,额度每周刷新)、腾讯云 Token Plan 企业版(最低 ¥1,000/月起、自定义积分)、阿里云百炼 Token Plan(¥150/座席/月起,与阿里云生态打通)和火山方舟 Coding Plan(¥40/月起,约 1 折折扣,聚焦编程场景);选型的核心变量不是"谁更便宜",而是你的主力模型范围、团队规模和调用场景是否匹配某家的产品设计。 阅读全文
posted @ 2026-08-11 14:37 vibecoding患者 阅读(10) 评论(0) 推荐(0)
摘要: DeepSeek V4-Flash 正式版于 2026 年 7 月 31 日开放公测,与此前预览版最关键的区别是:原生支持 Responses API——Codex 使用的正是这套协议,V4-Flash 正式版让 Codex 终于可以直连 DeepSeek,不再需要本地代理或协议降级适配。DeepSeek 官方同步提供了一键配置脚本,从安装到跑通只需一条命令。本文覆盖官方脚本方法和完整手动配置方案,包括 config.toml 和 models.json 的逐字段解释,以及跨平台(macOS/Linux/Windows)的配置差异。 阅读全文
posted @ 2026-08-10 14:02 vibecoding患者 阅读(130) 评论(0) 推荐(0)
摘要: Codex 插件系统由 OpenAI 于 2026 年 3 月 27 日正式推出,是一种将可复用 AI 工作流打包为可安装、可分发单元的机制;与仅作用于单一仓库的 Skill 不同,插件能同时捆绑 Skills、App 集成连接器和 MCP 服务器配置,实现跨项目、跨团队的能力共享。截至 2026 年 7 月 9 日,插件已成为 ChatGPT 和 Codex 跨产品发现工作流能力的主要方式,Cisco、NVIDIA、Ramp、Rakuten 等企业均已在生产环境中部署。本文完整覆盖从第一行配置到公共市场发布的全流程,包括 plugin.json 字段规范、marketplace.json 三种模式、@plugin-creator 快速脚手架、Hooks 与 MCP 集成,以及常见开发问题解答。 阅读全文
posted @ 2026-08-10 13:12 vibecoding患者 阅读(8) 评论(0) 推荐(0)
摘要: Kimi K3 本地部署的第一个现实是权重体积:Hugging Face 仓库的 96 个 safetensors 分片实测合计 1,560,936,091,448 字节,即约 1560.9 GB(1453.7 GiB),vLLM 官方 recipe 标注最小显存需求为 1680 GB。这意味着单卡、单机 8×80GB 配置均无法承载完整权重——vLLM 官方前置条件明确写的是"至少 8× GB300,生产流量需多机"。官方已验证的硬件为 H200、B300、GB300、MI355X 四种,并行策略上 TP 与 TEP 最低 8 卡、DEP 最低 16 卡。技术上值得注意的是这个 MXFP4 检查点并非全量 4bit:config.json 的 quantization_config 设有 ignore 列表,注意力层、共享专家、mlp 投影、lm_head 与视觉塔均保持高精度,group_size 为 32。对绝大多数团队而言,务实路径是官方 API 或社区 GGUF 量化版本(已有 unsloth、GrEarl 等多个版本,含 IQ1_S 极限量化),而非自建集群。 阅读全文
posted @ 2026-08-07 19:02 vibecoding患者 阅读(35) 评论(0) 推荐(0)
摘要: 2026 年 8 月第一周,GitHub Trending 周榜由五个方向主导:多人 Agent 协作框架(yc-software/qm,12,104 星)、文档格式通吃型 Markdown 转换器(firecrawl/anydoc,9,091 星)、Agent 原生 CRM(trycompai/crm,7,270 星)、纯 C 单 CPU 推理 2.78T 参数 Kimi K3(FareedKhan-dev/kimi-k3-in-c,2,924 星)、微软开源的操作录制转 Skill 工具(microsoft/skill-recorder,2,171 星);整体趋势是 AI Agent 从个人助手走向"组织级基础设施"——权限隔离、多人共享、自动化调度正在成为新上榜项目的标配特征,而不是某一个项目的特色亮点。 阅读全文
posted @ 2026-08-07 14:12 vibecoding患者 阅读(12) 评论(0) 推荐(0)
摘要: 2026 年 8 月 7 日,OpenAI 宣布对 ChatGPT 全系产品进行重要调整:免费版和 Go 档用户的默认模型升级为 GPT-5.6 Luna,并获得无限量文本聊天权限;GPT-5.6 Sol 同步推出 Instant 与 Thinking 模式合并、五档思考滑块下放和更简洁的回答风格三项改进,其在金融、医疗、法律等高敏感领域的错误率相比 GPT-5.5 降低 68%;三档模型的最大价格差距在 7 月 30 日一轮降价后已从 5 倍扩大至 25 倍(Sol $5/$30 不变,Luna 降至 $0.20/$1.20),Luna 的成本大幅降低但其擅长场景定位不变;下一代超大规模模型 Astra 据悉已进入 RC 阶段,预计近期发布,定位于长时程、多智能体协作任务。 阅读全文
posted @ 2026-08-07 10:11 vibecoding患者 阅读(1520) 评论(0) 推荐(0)