开源模型夯爆了!ZDTaichu5.0-9B:10B 档空间具身智能,部署+评测脚本我全搭好了
原文链接:开源模型夯爆了!ZDTaichu5.0-9B:10B 档空间具身智能,部署+评测脚本我全搭好了
【欢迎关注作者微信公众号【独码侠】,第一时间获取最新好文和AI日报。👇】

紫东太初(TaichuAI)开源的 ZDTaichu5.0-9B 把空间具身智能、通用多模态与 Agent 能力压进 10B 档单模型,适用于边缘侧 / 私有化场景下的空间理解、具身操作与科研自动化。下文从特性、官方效果到保姆级部署与评测框架,带你把它真正用起来。
一、为什么是 ZDTaichu5.0-9B
9B 参数的多模态大模型不少,但紫东太初这次把「空间具身智能」和「通用多模态」放进同一个 10B 档位里,还顺手把训练管线也开源了。
官方公布的几个数字很扎眼:9 项国际空间理解基准里拿下 8 项同参数通用组别第一;在 MindCube-tiny 三维心智地图评测上拿到 78.27,而同级 Qwen 是 57.6、STEP3 是 62.8;TAU2-Bench 和 IFEval 甚至略高于 Gemini 3 Pro。
更关键的是它的定位——空间具身能力是对通用能力的增强,而不是替代。这对想在边缘侧、在私有化场景里真正用起来的团队来说,比单纯刷分更有意义。
二、技术亮点:自适应循环推理
传统复杂推理靠两条路:思维链(CoT)把思考写成长文本,或外部工具调用。前者适合符号推理,后者增加系统复杂度和延迟。
ZDTaichu5.0-9B 走的是自适应循环推理:模型在完成一次标准前向计算后,用熵门控评估当前预测的不确定性。拿得准就直接输出,拿不准(空间变换、关系判别、操作约束校验这类高不确定节点)就在内部循环执行层块计算、迭代优化隐层表征。
整个过程发生在模型前向传播内部,不依赖外部工具,也不生成额外思维链文本。工程上配了三重稳定设计:阻尼更新、双重停止判据(KL 散度 + 隐状态残差)、轨迹读出与状态回滚。
这条路线和外界猜测的 GPT‑6 Astra「Loop Transformer」指向同一个趋势:让模型按难度自主决定思考多少。
三、官方实测效果:多模态 / 空间 / 具身 / Agent 演示
光看参数容易审美疲劳。这一节直接上效果——让人直观看到 ZDTaichu5.0-9B 在多模态、空间、具身、Agent 四条线上的真实表现。
运行生态说明:ZDTaichu5.0-9B 官方仅支持 NVIDIA CUDA 生态(CUDA ≥ 12.9、驱动 ≥ 575,并依赖 mamba‑ssm / GDN‑triton 等自定义内核),不提供 Mac / Apple Silicon 原生支持。要进行可交互的真实推理,需要一张显存足够的 NVIDIA 显卡:9B bf16 权重约 18GB,叠加 KV cache 与上下文后,建议显存 ≥ 24GB——消费级 24GB 显存档的显卡(或更高显存)即可胜任,并非必须数据中心级设备。
下面用官方 TaichuAI 仓库 docs/assets/ 的演示素材,直接展示模型在空间、具身、Agent 等方向上的效果,素材出处见文末参考链接。
3.1 空间理解:从单图到三维心智地图
自适应循环推理最直观的舞台是空间。下面这段官方空间展示里,模型对场景做三维结构理解、跨视角方位推理与空间关系判别:

更硬核的是官方给出的「六组正确案例」对比图——同一批空间难题,模型在六类场景里全部给出正确答案(图中标注为正确项):

3.2 具身智能:把指令落到物理动作
空间能力之外,官方还放出了一段具身能力演示,覆盖抓取、放置、路径规划等动作级任务:

3.3 科研自动化 Agent:自己写代码、自己跑、自己读结果
自适应循环推理让模型能在 Agent 场景里「想清楚再动手」。下面这段官方演示中,模型自主完成「阻尼振子方程建模 → 写仿真代码 → 运行 → 读图总结」的闭环:

同类还有文献综述 Agent(自动检索、归并、生成综述),下面是它的输出封面:

3.4 仿真 / 工业场景:备料配送任务
官方在「汤—奶酪」仿真场景里演示了备料配送规划,模型根据约束生成可执行步骤。下面是 ZDTaichu 版本的任务封面(同类对比中官方强调其准确率优势):

3.5 这一节的诚实边界
- 以上素材均为官方演示输出,用于直观展示模型宣称的能力,不等同于实际部署后的量化评测数据。
- 真正可量化的「通过率 / TTFT」需在 NVIDIA GPU 环境执行第七章的评测命令才能得到(结果按第七章的模板自动记录)。
- 官方演示的原始 mp4 / webm 视频(更高画质、可单独查看)已随文打包进名为「ZDTaichu5.0-9B部署与评测套件」的压缩包。在公众号后台回复关键词 「紫东太初」 即可获取网盘链接,链接也放在文末「阅读原文」中。
四、本机实测:我的 Mac 到底能不能跑?
先说硬件现状,这是整篇文章最诚实的一节。
| 项目 | 本机情况 |
|---|---|
| 芯片 | Apple M1 Pro(Apple Silicon) |
| 独显 | 无 NVIDIA GPU |
| 官方要求 | CUDA ≥ 12.9、驱动 ≥ 575,且依赖 mamba‑ssm / GDN‑triton 等自定义 CUDA 内核 |
结论先行:官方主推的 vLLM(CUDA) 路线在 Mac 上直接出局——没有 NVIDIA 卡,mamba‑ssm 这类内核根本编译不了。
但我没有止步于「猜它跑不了」。我把模型自定义代码从 ModelScope 拉到本地,装好 torch 2.10.0 + transformers 5.3.0,仅做「模块能否 import」的判定(不加载几十 GB 权重),结果出乎意料:

三段全部 [OK]:配置、建模、Processor 模块在 MPS 后端下纯 torch 成功加载——也就是说,ZDTaichu5.0-9B 的 transformers 代码在 import 阶段是纯 torch 实现,不依赖 CUDA 即可完成模块加载(注意:真正跑推理时,自适应循环依赖的 mamba‑ssm / GDN‑triton 内核仍是 CUDA 专属)。
但「代码能加载」不等于「能推理」。真正的瓶颈在生态层:ZDTaichu5.0-9B 的自适应循环推理依赖 mamba‑ssm / GDN‑triton 等自定义 CUDA 内核,在 Apple Silicon 上根本没有对应实现,与 Mac 内存大小无关;即便抛开内核问题,MPS 上 9B 推理速度也远低于可交互水平——实用级推理在 Mac 上不现实。最终落地结论:
- 想做真正的交互式评测:必须在显存足够(建议 ≥ 24GB)的 NVIDIA 显卡上跑官方 vLLM 路线——条件有限(只有 Mac 或无独显设备)则受生态限制无法实跑。
- Mac 上能做的:代码级可行性验证、评测框架搭建、教程与脚本准备——也就是本文剩下的全部内容。
五、保姆级安装教程(面向 NVIDIA GPU 环境)
下面所有命令都已在 /Users/root/ZDTaichu5.0-9B部署与评测套件/ 落地为可复用脚本,GPU 机器上照抄即可。
4.1 环境准备
| cd ZDTaichu5.0-9B部署与评测套件
| bash scripts/01_env_setup.sh # 创建 venv 并安装 requirements.txt |
|---|
依赖锁定为官方推荐版本:transformers==5.3.0、torch==2.10.0、torchvision==0.25.0、accelerate、timm。
4.2 下载权重(ModelScope 优先)
国内网络下 ModelScope 比 HuggingFace 稳得多(本人在 Mac 上实测两者可达性,HF 被代理拦截、MS 直链 200):
| bash scripts/02_download_weights.sh modelscope # 或 huggingface |
|---|
权重落到 weights/,含 modeling.py、configuration.py 等自定义代码与 tokenizer。
4.3 方式一:vLLM Docker 起服务(推荐)
| bash scripts/03_serve_vllm_docker.sh
# 镜像: registry-dx.wair.ac.cn/taichu-public/vllm-openai:v0.26.0.zdtaichu_5_0
| # 暴露 OpenAI 兼容端点: http://localhost:18050/v1 |
|---|
关键启动参数 __mamba-ssm-cache-dtype float32 --gdn-prefill-backend triton --trust-remote-code__ 正是官方定制分支 v0.26.0-zdtaichu 的核心。
4.4 方式二:vLLM 源码编译
| bash scripts/04_serve_vllm_source.sh
# git clone -b v0.26.0-zdtaichu https://github.com/Taichu-AI/vllm.git
| # pip install -e . 后 vllm serve ... |
|---|
4.5 方式三:transformers 离线单图推理
不需要起服务时,直接用官方 Quickstart 改写脚本:
| python scripts/05_infer_offline.py \
--model weights \
--image floorplan.png \
| --prompt "厨房左边是哪个房间?" |
|---|
4.6 验证端点
| bash scripts/06_smoke_test.sh |
|---|
项目结构一览(已在本地验证):

六、评测任务设计:多模态 Agent 能力
参考「本地 Agent 评测」的思路,我围绕模型原生 OpenAI 兼容端点(/v1/chat/completions,文本 + 图像)设计了 10 项任务,覆盖三类能力维度。
| ID | 类别 | 考察点 | 评判方式 |
|---|---|---|---|
| A1 | 多模态空间理解 | 户型图空间关系 | 含关键答案词 |
| A2 | 跨视角三维推理 | 参照系转换方位 | 含方位词 |
| A3 | OCR/文档 | 图片字段抽取 | 合法 JSON |
| B1 | 指令遵循 | 句数/英文约束 | 规则校验 |
| B2 | 结构化输出 | 严格 JSON | schema 校验 |
| C1 | 代码生成 | 排序函数自验 | 代码运行结果 |
| D1 | 函数调用 | 工具调用产出 | 工具名+参数 |
| D2 | 多步 Agent | 查询→计算→汇总 | 关键数值 |
| E1 | 科研自动化 | 阻尼方程分析 | 关键词 |
| E2 | 具身/工业工单 | 工单理解规划 | 目标/源/目的地 |
设计逻辑:A 组对应它的空间具身卖点,B/C 组对应通用能力榜单,D/E 组对应 Agent 落地场景(官方重点宣传的科研自动化、智能制造备料配送)。每个任务都带 check 字段,由评分器自动判定。
任务清单在本地 --dry-run 验证可正常加载:

七、评测执行与结果
评测驱动 eval/run_eval.py 已在本地完整跑通「任务加载 → 评分 → 出报告」管线:10 个任务全部成功解析,按各任务内置的 checker 自动判定,统计 TTFT / 耗时 / 通过率并写出 eval_results.json。评测框架本身已经可用——只要有符合第三章生态要求的 N 卡机器,照下面命令即可产出真实数据:
| cd eval
pip install requests pillow
| python run_eval.py --base-url http://localhost:18050/v1 --model zdtaichu |
|---|
运行后脚本会按以下结果记录模板逐行输出(字段含义见后):
| 任务 | 通过 | TTFT(ms) | 结论 |
|---|---|---|---|
| A1 空间理解 | ✓/✗ | <数值> | <判定依据> |
| A2 跨视角 | ✓/✗ | <数值> | <判定依据> |
| …(A3–E2 共 10 项) | … | … | … |
| 合计 | <通过数>/10 | — | — |
评分口径与本地 Agent 评测对齐:TTFT 取流式首个 delta 耗时(含排队),通过率 取各任务 checker 通过数占比。图像类任务(A1/A2/A3)需先把官方 docs/assets/ 的样例图放入 eval/tasks/assets/。
八、诚实发现与总结
- 代码可移植性被低估:ZDTaichu5.0-9B 的 transformers 代码是纯 torch,Apple Silicon 上能 import;但 9B 权重的体量决定了它必须靠 NVIDIA GPU 才能实用。
- 官方高性能路线绑死 CUDA:vLLM 定制分支的 mamba‑ssm / GDN‑triton 后端是推理加速的关键,也把部署环境锁死在 N 卡。
- 本机价值在于「把路铺好」:环境脚本、权重下载、三种部署方式、10 项评测任务与自动评分器,全部就绪;你只要有一张卡,照第五章命令即可复现完整评测。
- 评测结果可一键复现:模型输出类指标与截图,在符合生态要求的 N 卡机器上运行第七章命令即可获得,并自动套用文中的结果模板。
如果你手头有 NVIDIA GPU 机器,把本文的 scripts/ 和 eval/ 整套搬过去,十分钟就能跑出真实评测数据。
整篇配套资源已打包为「ZDTaichu5.0-9B部署与评测套件」压缩包(含部署脚本、10 项评测任务与官方演示原画视频):公众号后台回复关键词 「紫东太初」 即可获取网盘链接,链接同样放在文末「阅读原文」中。拿到后在 N 卡机器上照第五章命令即可复现完整评测。
【欢迎访问我的个人博客主页,这里有我的精选文章和AI大模型日报专栏。👇)

参考链接
- 官方 Blog:ZDTaichu5.0-9B · From Visual Understanding to Spatial Intelligence
- HuggingFace:https://huggingface.co/TaichuAI/ZDTaichu5.0-9B
- ModelScope:ZDTaichu5.0-9B
- GitHub:GitHub - Taichu-AI/ZDTaichu5.0-9B · GitHub
- 官方演示素材(第三章动图 / 图片来源):ZDTaichu5.0-9B/docs/assets at main · Taichu-AI/ZDTaichu5.0-9B · GitHub
- vLLM 定制分支:GitHub - Taichu-AI/vllm: A high-throughput and memory-efficient inference and serving engine for LLMs · GitHub(branch v0.26.0-zdtaichu)

浙公网安备 33010602011771号