MODEL RELEASE

ZDTaichu5.0-9B

从视觉理解到空间智能

MULTIMODAL FOUNDATION MODEL

ZDTaichu5.0-9BVisual · Spatial · Embodied · Agent
9B128K CONTEXTTEXT · IMAGE · VIDEO

模型介绍#

ZDTaichu5.0-9B 是面向通用视觉理解、空间推理、Agent 工具使用及具身智能研究的多模态基础模型。它结合 Qwen3.5-9B 语言骨干与 C-RADIOv4-H 视觉编码器,支持文本、图像和视频,并支持任意分辨率视觉输入。

在本发布 Blog 对比的 9B 规模通用视觉语言模型(VLM)中,ZDTaichu5.0-9B 的通用视觉理解能力保持在第一梯队,并展现出最强的综合空间推理、高层具身 VLM 推理及 Agent 表现。在强大的通用视觉基础之上,模型进一步具备更全面的空间、具身和 Agent 能力,而非以牺牲通用视觉能力为代价进行专项优化。

模型支持文本、单张或多张图像及视频输入,主要面向以下任务:

  • 通用图像、文档、图表、示意图理解及 OCR;
  • 视觉数学与结合知识的视觉问答;
  • 精细二维关系、多视角关联、三维场景理解、视角转换及心智变换;
  • 多步骤、多轮工具使用;
  • 面向视觉—语言—动作(VLA)及具身智能适配的空间感知、可供性理解和规划。

核心亮点#

  • 通用视觉理解与全面能力: 在图像、文档、图表、示意图、OCR、视觉数学、多图和视频等任务上,保持 9B 规模通用 VLM 第一梯队水平,并进一步覆盖空间推理、高层具身理解与多步骤 Agent 任务。
  • 空间推理与具身理解优势: 在所对比的 9B 规模通用 VLM 中,空间能力领先,在 SparBench、ViewSpatial、MMSI-Bench 和 MindCube-tiny 上表现突出;ERQA 与 RoboSpatial 分别达到 48 和 56,覆盖场景推理、可供性及交互理解。
  • 在所对比的 9B 规模通用 VLM 中,通用 Agent 能力最强: 在已报告的 TAU2-Bench(87.7)和Claw-Eval(71.4) 对比中领先,IFEval 达到 93.7。
  • 熵门控自适应循环推理: 根据输出不确定性动态调整推理深度,为困难 token 分配更多计算,并自适应停止。

模型概览#

项目 规格
模型类型 带视觉编码器的多模态因果语言模型
语言骨干 Qwen3.5-9B LLM 解码器
视觉骨干 C-RADIOv4-H
上下文长度 最长 128K tokens
视觉分辨率 任意分辨率视觉输入
输入模态 文本、单图、多图及视频

自适应循环推理#

ZDTaichu5.0-9B 通过熵门控动态分配推理计算:根据当前 token 的输出不确定性,决定是否在潜在空间中继续细化隐藏状态,使推理深度随生成过程自适应调整。

  1. 按不确定性触发循环: 完成一次标准前向传播后,使用输出熵衡量当前 token 的不确定性。低熵 token 直接输出,高熵 token 触发中间层块的重复计算。
  2. 在潜在空间迭代: 通过带阻尼和锚定的更新,逐步细化隐藏状态,为较难的 token 分配额外计算。
  3. 根据收敛信号停止: 结合 KL 散度与隐藏状态残差判断停止时机,动态控制循环推理的深度。
  4. 从循环轨迹选择输出: 轨迹读出选择风险最低的状态,并在必要时回滚。

基准评测结果#

与开源模型对比

ZDTaichu5.0-9B 与开源模型的榜单分数对比SVG ↓

与闭源模型对比

ZDTaichu5.0-9B 与闭源模型的榜单分数对比SVG ↓

两张图分别展示 ZDTaichu5.0-9B 与开源模型、闭源模型的榜单分数对比,覆盖通用视觉理解、空间与具身能力,以及 Agent 与文本能力。

空间与具身推理

Area Benchmark ZDTaichu5.0-9B Qwen3.5-9B STEP3-VL-10B gemma4-8B-E4B Gemini 3 Pro Grok 4 GPT-5.2
基础空间感知 CV-Bench 86.82 87.19 83.49 68.10 90.07 86.84
3DSRBench 60.96 56.78 55.01 53.62 68.92 54.93 60.20
SparBench 51.82 50.79 45.68 28.50 48.74 44.76 55.07
复杂空间推理 ViewSpatial 62.50 48.20 46.14 41.68 50.36 43.23 47.30
MMSI-Bench 47.20 38.70 32.18 29.20 45.20 37.80 41.30
MindCube-tiny 78.27 57.60 62.81 48.85 70.87 63.56 60.38
具身交互 ERQA 48.00 41.50 47.75 30.20 66.00 59.80
RoboSpatial 56.00 54.10 52.86 49.43 57.40 43.78
VSI-Bench 59.69 55.68 42.42 32.91 52.51 47.92 54.49

横向滑动查看全部模型 ↔

通用视觉理解

Area Benchmark ZDTaichu5.0-9B Qwen3.5-9B STEP3-VL-10B gemma4-8B-E4B Gemini 3 Pro Grok 4 GPT-5.2
多模态推理 MathVista Mini 84.50 85.70 83.97 65.30 87.90 72.50 83.10
WeMath 75.90 75.20 73.03 50.19 86.90 79.00
MathVerse Mini Vision Only 76.40 84.14 74.60 53.55
通用问答 MMStar 76.80 79.70 77.48 62.00 83.10 69.60 77.10
AI2D 91.48 90.20 89.35 79.15 94.10 92.20
RealWorldQA 76.99 80.30 74.44 59.08 83.30 83.30
OCR OCRBench 85.50 89.20 86.75 76.90 90.40 80.70

横向滑动查看全部模型 ↔

语言、推理与 Agent

Area Benchmark ZDTaichu5.0-9B Qwen3.5-9B STEP3-VL-10B gemma4-8B-E4B Gemini 3 Pro Grok 4 GPT-5.2
知识 MMLU-Pro 77.20 82.50 76.02 69.40 89.80 85.90 87.40
MMLU-Redux 88.40 91.10 86.50 85.30 95.90 86.22 95.00
指令遵循 IFEval 93.70 88.72 82.16 87.80 93.50 92.80 94.80
IFBench 69.00 64.50 41.49 34.70 70.40 53.70 75.40
推理与编程 AIME 2025 86.70 83.75 87.66 41.30 95.00 91.70 100.00
AIME 2026 89.20 87.92 88.75 42.50 90.60 96.70
HMMT Feb 2025 84.20 83.20 78.18 26.70 97.30 90.00 99.40
HMMT Feb 2026 72.70 73.48 63.64 33.70 86.36 96.97
LiveCodeBench v6 73.40 65.60 58.86 52.00 90.70 87.70
通用 Agent TAU2-Bench† 87.70 79.10 81.70 42.40 85.40 87.10
Claw-Evalgeneral Avg† 71.40 66.50 66.60 52.10

横向滑动查看全部模型 ↔

粗体表示所列开源模型中的最高分;下划线表示所有列出模型中的最高分。同时在两类比较中领先的分数将以粗体并加下划线标示。并列最高分采用相同标记。缺失分数不参与比较。

† 本地 TAU2-Bench 和 Claw-Eval 通用任务评测使用 DeepSeek-V4-Flash-0731 作为模拟用户和/或裁判;外部公开分数沿用其引用来源所采用的评测设置。

‡ 外部公开报告的分数。EASI 结果采用提供的、于 2026-09-08 审核的导出数据,分数四舍五入至小数点后两位。

对于 ViewSpatial、MMSI-Bench、MindCube-tiny 和 VSI-Bench 等多图空间推理评测,在评测提示词中加入了以下输出格式要求:You FIRST think about the reasoning process as an internal monologue and then provide the final answer. The reasoning process MUST BE enclosed within <think> </think> tags. The final answer MUST BE put in \boxed{}.

模型能力与示例展示#

结合具体任务,展示通用视觉、空间推理、多图与视频理解、Agent 工具使用及具身行动规划能力。

通用视觉理解

识别物体、属性和场景,读取图像与文档中的文字,理解图表和示意图,并结合视觉证据进行计算与问答。

空间感知与推理

从目标定位、计数与相对位置判断,延伸到跨视角关联、深度与布局理解、参照系转换、心理旋转、截面推理及高层操作规划。

多图与视频理解

整合连续画面中的物体与场景线索,跟踪事件和空间关系,并在指定观察位置与朝向下回答问题。

Agent 工具使用

围绕研究或计算目标拆解任务,在多轮交互中组织检索、工具调用、结果校验与文档生成。工具由外部应用执行。

这些录屏展示了 ZDTaichu5.0-9B 在 ScienceClaw Agent 界面中的工作过程,对话旁可见工具执行轨迹及生成的文件。

具身理解与行动规划

结合可见场景、任务目标与执行状态,识别操作对象和空间约束,安排多步骤动作,并检查放置、收纳及导航进度。

以下示例包含具身任务录像,以及同初始状态下的 LIBERO 操作对比;各示例分别说明任务设置与记录结果。

训练#

训练方案

ZDTaichu5.0-9B 采用分阶段 BF16 混合精度训练方案:

  1. 8K 视觉语言预训练: 建立广泛的感知与语言对齐。
  2. 16K 持续预训练: 引入更丰富、结构化程度更高的多模态数据。
  3. 32K 监督微调: 学习复杂多模态指令与逐步推理。
  4. 上下文扩展至 128K: 支持长文档与长视频。
  5. 128K 高质量退火训练: 使用精选指令数据和面向目标能力的数据。
  6. 基于可验证奖励的强化学习: 采用基于 GRPO 的目标函数,奖励信号包括答案正确性、空间定位准确性及输出格式检查,并过滤过于简单或无法求解的提示。

分阶段训练数据

五个阶段的数据总量约为 1.28T tokens:

阶段 Token 数量 重点内容
阶段 1 364B 双语图文数据、富含 OCR 的语料、短视频描述
阶段 2 737B 文档、PDF/OCR、中文长尾视觉数据、图像描述及视频
阶段 3 136B 图像推理、视频问答、空间与物理感知任务、CAD 类问题
阶段 4 28B 长视频及高难度专家指令数据
阶段 5 10B 经筛选、采样及合成的空间、OCR 和结构化视觉任务

致谢#

本模型基于 Qwen3.5 语言架构与 NVIDIA C-RADIO 视觉编码器系列构建。除最终模型许可证外,请同时引用上游项目并遵守其许可证。

引用#

请使用以下项目级引用。

@misc{zdtaichu_5_0_9b,
  title  = {ZDTaichu5.0-9B: A Multimodal Foundation Model for Visual and Spatial Reasoning, Agents, and Embodied AI},
  author = {{ZDTaichu5.0-9B Contributors}},
  year   = {2026},
  note   = {Open-weight model and open inference implementation}
}
下载 ↗