先看结果

看到 Astra 的 Blender 演示后,我想知道:这种空间能力,有多少能迁移到真实的地方?一个通用模型,能否看一段房间漫游视频,就理解这个空间是如何组织起来的?

我用 VSI-Bench 和 VSTI-Bench 的 10,866 道题评测了 GPT-6-Astra,涵盖距离、布局、导航和相机运动。我在 3D 领域工作了多年,看到通用模型达到这个水平,还是有些意外。

VSI-Bench73.055,130 题 · 八类宏平均
VSTI-Bench70.335,736 题 · 五类宏平均同一批答案,九个子类等权平均为 78.84;这里按五大类等权汇总。

分数均为百分制。VSTI 使用修正标签和五类汇总,与历史论文分数不能直接比较。

VSI 的 73.05 已接近我们选取的强空间专用模型;路线规划 87.63 是这份对照中已报告分项的最高值。VSTI 的 70.33 在所选表格里数值最高,但标签版本的差异意味着它不能被解释为同条件胜出。

分项比总分更能说明问题:路线规划和物体关系判断尤其突出,房间尺度与相机位移仍是明显短板。

这两套 benchmark 在测什么?

VSI-Bench 要求模型从视频中理解真实室内空间。八类任务覆盖物体数量、物体和房间大小、绝对与相对距离、相对方向、路线规划,以及物体出现的顺序。[1]

可以把它想成这些问题:两个物体相隔多远?房间有多大?怎样从一个位置走到另一个位置?这些是帮助理解任务的例子,并非原题。回答它们需要综合不同视角的信息,包括已经离开画面的东西。

VSTI-Bench 加入了移动中的观察者:相机与物体的距离、相机位移、相机运动方向、物体相对位置,以及相机与物体的相对距离。场景是静态的,移动的是相机。[2]

前者更强调场景布局,后者把视角变化明确地放进问题。这些能力与导航、机器人和 AR 有关,但两套问答评测并不等价于对完整系统能力的验证。

看看真实题目

这里共有 38 个样本:VSI 的 10 个子类别、VSTI 的 9 个子类别,每类各 2 题,分别保留方向题的难度,以及相对位置和距离题的细分题型。每组包含一个满分回答,以及一个未得分或部分得分的回答。可以选择子类别、逐帧查看输入,并对照 Astra 与 benchmark 的答案。这些例子用于说明任务,不是另一份性能估计。

38 个样本 · 19 个子类别 · 每类 2 题

1 / 38

VSI-Bench / 物体数量

数一数房间里的物体

满分

How many bed(s) are in this room?

17 / 330:16.0
Astra 的答案2
Benchmark 答案2
此题得分100 / 100 MRA

数值题按相对误差阈值计算 MRA,可以获得部分分;这里的分数不是置信度。

查看保存的完整回答
2

VSI-Bench · 样本 4587 · ScanNet / scene0221_01

所有采样输入帧均保留原始顺序;图像压缩为适合网页展示的尺寸。题目、选项与保存的回答保持原文。

为什么这件事值得测?

视频给出的是一连串视图,而空间问题往往需要更稳定的场景理解:不同帧里的哪些物体是同一个?它们在哪里?什么被遮挡了?相机又移动到了哪里?

Cambrian-S 把其中一部分挑战概括为从像素背后推断世界。它的实验促使我们把注意力从视频语义描述,移向持续的空间理解。Cambrian-P 则研究相机位姿这个训练信号:它可以把变化的视角联系到共同的三维空间。[3][4]

最初的 VSI-Bench 研究发现,在其测试的模型和设置下,包括思维链在内的常见语言推理方法,没有改善空间任务表现。这不是一个永远不变的上限,但能解释为什么今天通用模型的强结果值得关注。[1]

本次测的是 VSI-Bench 和 VSTI-Bench,没有评测 Cambrian-S 另外提出的长时程 VSI-Super 任务。

把通用模型放进空间专用模型的对照中

下图分别列出通用模型,以及接受过空间、具身专项训练或结构增强的模型。其他模型采用论文原报结果,我们没有重跑它们。点击模型名可以查看这一行的来源。

本次评测与精选论文原报成绩。输入、训练与推理设置因来源而异。

VSI-Bench: 精选模型原报总分
模型 / 来源得分 / 100
通用模型
GPT-6-Astra本次评测
73.05
Qwen3.5-122B-A10B分数 [14] · 模型 [28]
66.6
Qwen3.5-9B分数 [16] · 模型 [29]
57.9
InternVL3.5-8B分数 [17] · 模型 [30]
56.1
Gemini-3-Pro分数 [15] · 模型 [26]
56.0
GPT-5.4分数 [14] · 模型 [25]
49.2
Claude Sonnet 4.6分数 [14] · 模型 [27]
44.4
空间 / 具身增强模型
ConsiSpace UC-SSRL分数 [18]
76.6
RynnBrain 1.1-122B-A10B分数 [14]
75.0
Molmo2-ER-5B分数 [14] · 模型 [31]
74.5
Cambrian-P分数 [4]
73.7
SpatioLM (SenseNova-SI-8B)分数 [17]
71.6
LLaVA-OneVision-2-8B分数 [16] · 模型 [32]
70.9
SpaceMind分数 [15]
70.2
Cambrian-S-7B分数 [3]
67.5
VLM-3R-7B分数 [2]
60.9
Spatial-MLLM-4B分数 [19]
47.0
图 1. 按类型分组的精选报告,组内按原报总分排序。模型名链接到分数原始来源,编号跳转至文末参考资料;“模型”另列原论文或官方介绍。不将不同协议下的结果合并为统一名次。

在 VSI 上,Astra 接近 Cambrian-P 原报的 73.7,仍有几个专用模型的总分更高。相比之下,路线规划的优势更突出。这正是分项值得看的原因:相近的总分背后,可能是很不一样的能力。

VSTI 还需要一条背景说明。官方于 2026 年 7 月 13 日修复了相机位置计算的错误,影响距离与位移标签。Astra 使用修正后的 5,736 题版本;表中的专用模型和通用模型文献行,保留历史报告。官方明确指出,修正前后的结果不能直接比较。[5]

路线规划突出,房间尺度与相机位移仍是短板

分项结果让我们能更具体地拆解空间推理的不同要求。Astra 在路线与物体关系推理上表现出色,但当问题要求恢复整个房间的尺度,或相机自身位置的变化时,估计就不那么可靠了。

点击图例突出模型;悬停或点击坐标轴、数据点查看精确分数。

选择模型 7 / 7

选择 1–7 个模型。达到上限后,先取消一个已选模型。

雷达图模型
VSI-Bench · 8 维能力雷达图各轴为 0–100。选择轴标签或数据点查看精确值。缺失分项不补零,不跨缺失轴连线。GPT-6-Astra · 物体数量: 61.82 MRAGPT-6-Astra · 绝对距离: 61.53 MRAGPT-6-Astra · 物体大小: 78.43 MRAGPT-6-Astra · 房间大小: 56.49 MRAGPT-6-Astra · 相对距离: 76.06 AccuracyGPT-6-Astra · 相对方向: 82.48 AccuracyGPT-6-Astra · 路线规划: 87.63 AccuracyGPT-6-Astra · 出现顺序: 79.94 AccuracyCambrian-S-7B · 物体数量: 73.2 MRACambrian-S-7B · 绝对距离: 50.5 MRACambrian-S-7B · 物体大小: 74.9 MRACambrian-S-7B · 房间大小: 72.2 MRACambrian-S-7B · 相对距离: 71.1 AccuracyCambrian-S-7B · 相对方向: 76.2 AccuracyCambrian-S-7B · 路线规划: 41.8 AccuracyCambrian-S-7B · 出现顺序: 80.1 AccuracyGemini-3-Pro · 物体数量: 49.0 MRAGemini-3-Pro · 绝对距离: 42.8 MRAGemini-3-Pro · 物体大小: 71.5 MRAGemini-3-Pro · 房间大小: 41.8 MRAGemini-3-Pro · 相对距离: 56.6 AccuracyGemini-3-Pro · 相对方向: 57.5 AccuracyGemini-3-Pro · 路线规划: 61.9 AccuracyGemini-3-Pro · 出现顺序: 60.0 AccuracyConsiSpace UC-SSRL · 物体数量: 77.9 MRAConsiSpace UC-SSRL · 绝对距离: 78.9 MRAConsiSpace UC-SSRL · 物体大小: 82.2 MRAConsiSpace UC-SSRL · 房间大小: 76.3 MRAConsiSpace UC-SSRL · 相对距离: 72.1 AccuracyConsiSpace UC-SSRL · 相对方向: 90.1 AccuracyConsiSpace UC-SSRL · 路线规划: 54.7 AccuracyConsiSpace UC-SSRL · 出现顺序: 79.9 AccuracyCambrian-P · 物体数量: 74.9 MRACambrian-P · 绝对距离: 60.1 MRACambrian-P · 物体大小: 76.0 MRACambrian-P · 房间大小: 76.9 MRACambrian-P · 相对距离: 74.8 AccuracyCambrian-P · 相对方向: 89.5 AccuracyCambrian-P · 路线规划: 52.6 AccuracyCambrian-P · 出现顺序: 85.0 AccuracySpatioLM (SenseNova-SI-8B) · 物体数量: 81.9 MRASpatioLM (SenseNova-SI-8B) · 绝对距离: 55.7 MRASpatioLM (SenseNova-SI-8B) · 物体大小: 75.2 MRASpatioLM (SenseNova-SI-8B) · 房间大小: 71.5 MRASpatioLM (SenseNova-SI-8B) · 相对距离: 78.2 AccuracySpatioLM (SenseNova-SI-8B) · 相对方向: 74.4 AccuracySpatioLM (SenseNova-SI-8B) · 路线规划: 47.9 AccuracySpatioLM (SenseNova-SI-8B) · 出现顺序: 87.8 AccuracyQwen3.5-9B · 物体数量: 62.0 MRAQwen3.5-9B · 绝对距离: 44.0 MRAQwen3.5-9B · 物体大小: 73.6 MRAQwen3.5-9B · 房间大小: 61.9 MRAQwen3.5-9B · 相对距离: 69.7 AccuracyQwen3.5-9B · 相对方向: 79.9 AccuracyQwen3.5-9B · 路线规划: 45.4 AccuracyQwen3.5-9B · 出现顺序: 26.7 Accuracy物体数量MRA绝对距离MRA物体大小MRA房间大小MRA相对距离Acc.相对方向Acc.路线规划Acc.出现顺序Acc.
GPT-6-Astra
61.82
Cambrian-S-7B
73.2
Gemini-3-Pro
49.0
ConsiSpace UC-SSRL
77.9
Cambrian-P
74.9
SpatioLM (SenseNova-SI-8B)
81.9
Qwen3.5-9B
62.0

本次评测与精选论文原报结果;输入、训练与推理设置因来源而异。

图 2. 与原始 dashboard 相同的默认七模型雷达图。各轴固定为 0–100;MRA 与准确率是不同指标。缺失分项不补零,多边形面积不代表总分。

VSI:走对路线与量准房间,依赖的能力并不相同。Astra 的路线规划准确率为 87.63,是这份对照中已报告的最高值,明显高于 Cambrian-P 的 52.6。但在房间大小估计上,排序反了过来:Astra 为 56.49 MRA,Cambrian-P 为 76.9。相近的总分,掩盖了两者具体能力上的显著差异。

路线题要求从指定朝向出发,判断经过地标时该如何转弯。只要这些关系正确,即使尺度感比较粗略,也可能答对。房间大小题则要求用平方米给出面积,需要把局部视图联系起来,判断空间的完整范围。[1]另一个关键细节是,Astra 的物体大小估计达到 78.43 MRA:并非所有数值任务都同样困难。我的理解是,对布局的推理比对整个房间几何尺度的估计更容易迁移。熟悉的物体或许能提供尺寸线索,但把这些线索扩展到整个空间,仍有额外的难度。

VSTI:物体距离与关系很强,相机位移明显更弱。最突出的两项是物体相对位置 94.59 准确率,以及相机–物体相对距离 86.81 准确率。绝对相机–物体距离达到 68.83 MRA,相机位移则降到 42.52 MRA。后两项使用相同指标,因此是本次评测中很值得看的对照。相机运动方向也相对较弱,准确率为 58.93

这里的区别在于:判断物体相对观察者的位置,与恢复观察者自身的位置变化,是不同的问题。位移题要求估计两帧之间相机位置的距离。[2]这需要跨视角保持一致的几何判断:画面变化很大,可能来自相机旋转、平移,或两者共同作用。我的假设是,对 Astra 而言,分清旋转、平移与尺度,比判断物体关系更困难。能较好地估计相机到物体的距离,并不自动意味着能准确估计相机自身的位移。

GPT-6-AstraCambrian-P
物体数量MRA
GPT-6-Astra: 61.82
Cambrian-P: 74.9
绝对距离MRA
GPT-6-Astra: 61.53
Cambrian-P: 60.1
物体大小MRA
GPT-6-Astra: 78.43
Cambrian-P: 76.0
房间大小MRA
GPT-6-Astra: 56.49
Cambrian-P: 76.9
相对距离Accuracy
GPT-6-Astra: 76.06
Cambrian-P: 74.8
相对方向Accuracy
GPT-6-Astra: 82.48
Cambrian-P: 89.5
路线规划Accuracy
GPT-6-Astra: 87.63
Cambrian-P: 52.6
出现顺序Accuracy
GPT-6-Astra: 79.94
Cambrian-P: 85.0

各条形均为 0–100。数值题使用 MRA,选择题使用准确率,不能把两者当成同一种正确率。

图 3. 按任务查看模型的能力轮廓。选择一个对照模型,观察总分之下的差异。只有报告了分项的模型才出现在选择列表中。

路线规划和物体关系上的强表现,说明 Astra 已经能较好地理解场景是如何组织起来的。物体大小与相机到物体距离的较强结果,也表明它具备一定的尺度估计能力。更明显的差距出现在问题涉及整个房间的范围,或跨视角的相机位置变化时。因此,一个模型可以很好地判断路线怎么走,同时仍难以准确估计这个空间有多大、相机在其中移动了多远。

我是怎么评测的?

设置VSI-BenchVSTI-Bench
题目数5,1305,736
输入帧1 FPS,完整视频,不设帧数上限均匀采样 32 帧,保留原始帧号
模型 / 推理gpt-6-astra / high
图像原生尺寸,JPEG 质量 85,high detail
文章总分八类等权;方向难度先等权合并家族内按题合并,再对五类等权

输入包含采样后的视频帧和评测问题,不包含标准答案、三维标注或历史问题答案。数据 revision 固定,答案解析与评分沿用 benchmark 的约定。[6][7]

选择题使用准确率。数值题使用 MRA(平均相对准确率),即在一组相对误差阈值下,计算预测落入容差范围的比例。总分汇总这些任务指标,因此不能简单理解为“有多少题完全答对”。[1]

为什么还会看到 VSTI 的 78.84 分?

两个分数使用同一批 5,736 个回答,区别在于每种任务在总分中占多大权重。

公开评测器对九个子类等权平均,得到 78.84。Astra 最强的两类任务——物体相对位置、相机–物体相对距离——各包含三个子类,因此合计占九份权重中的六份,也就是总分的三分之二

顶部的 70.33 则先在五大类内部按题汇总,再对五类分数等权平均。每大类各占 20%,上述两类关系题合计占 40%。这样,相对较弱的相机运动任务在总分中的权重增加,总分也随之降低。本文采用这一口径,是为了让五种空间能力在总分中同等重要。

五类展示更便于对照论文中的任务分项,但它并不能解决历史标签与修正标签的可比性问题。

这里报告的是本次全量评测,不是经同行评审的结论,也不是对所有对照模型的统一重跑。可下载的记录包含精确分项、数据版本和生成设置。

从 CAD 能力到真实世界的空间推理

路线规划和关系判断的强结果,让我重新想到最初促使我做这次评测的 Blender 演示。我的假设是:CAD 或其他 3D 工具任务上的 RL,可能形成能迁移到真实视频理解的空间能力。这把“构建一个自洽的三维场景”与“从不完整视图推断一个三维场景”联系了起来。Astra 是否接受过这类 CAD/RL 训练,目前仍未确认。

公开演示让这个联系值得考虑。Sharif Shameem 展示了 Astra 用 Blender 重建旧金山艺术宫;Yunfan Ye 报告从房源照片生成 3D 房屋,尽管仍有部分细节错误。[8][9]Thomas Ricouard 记录了通过反复渲染、检查和修正几何,持续完善可编辑房屋的过程。[10]在 SolidWorks 中,MecAgent 报告生成了 41 个零件的涡喷发动机和 11 个零件的机械臂,带有可编辑特征树和可运动装配,但距离可制造仍需完善约束等问题。[11][12]

可能迁移的是一套关于几何的推理方式。摆放物体、旋转零件、改变相机视角,或满足装配约束,都要求在发生变化时维持空间关系的一致性。这类任务上的 RL,可能奖励跟踪相对位置、在坐标系之间推理,以及预判从另一视角会看到什么。同样的操作,也可能帮助模型判断真实房间里哪个物体更近、给定朝向下什么在左边,或经过哪些转弯能连接两个地标。

这个想法带有 sim-to-real 的意味。机器人领域一个熟悉的例子,是在仿真中学到控制策略,再部署到实体机器人。[13]这里设想的迁移,同时跨越了领域和任务:从构建、操控合成几何,转向理解真实场景的录像。可能被复用的是空间推理能力,而目标任务变成了视频理解。

这一视角也能把前面的分项差异联系起来。对相对几何关系的理解,可能在这些不同场景中支撑路线规划和物体关系判断。但估计整个房间的面积或相机位移,还多了一步:在无法直接读取场景坐标的情况下,从局部、不断变化的图像中恢复一致的尺度与位置。这两项较弱的结果,可能反映了迁移变得不那么可靠的地方;与此同时,物体大小和相机到物体距离的估计仍然相对更强。

一种值得关注的可能性是:学习构建、操控三维空间,也形成了理解那些只能观察的真实空间所需的能力。

数据与参考资料

两套评测中每项文献分数的报告论文、版本与对应模型均列在下方。如果分数来自另一篇论文的对照表,还另列模型原论文或官方介绍。Astra 的分数来自本次评测。列表也保留正文引用的评测、数据与 3D 演示来源。

下载结果与来源(JSON)↓

下载样本题目、答案与帧信息(JSON)↓

  1. Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces
  2. VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction
    VSI-Bench · 2505.20279v5 · 2026-04-21分数来源:VLM-3R-7B
    VSTI-Bench · arXiv:2505.20279分数来源:VLM-3R-7B
  3. Cambrian-S: Towards Spatial Supersensing in Video
    VSI-Bench · 2511.04670v1 · 2025-11-06分数来源:Cambrian-S-7B
  4. Cambrian-P: Pose-Grounded Video Understanding
    VSI-Bench · 2605.22819v2 · 2026-07-23分数来源:Cambrian-P
    VSTI-Bench · v1 · 2026-05-21(v2 Table 2 数值相同)分数来源:Cambrian-P
  5. VSTI-Bench label correction · July 13, 2026
  6. VSI-Bench · pinned dataset revision
  7. VSTI-Bench · pinned corrected dataset revision
  8. Sharif Shameem · Astra recreates the Palace of Fine Arts in Blender · X, September 3, 2026
  9. Yunfan Ye · Listing photos to a 3D house and video · X, September 3, 2026
  10. Thomas Ricouard · Architectural visualization with Astra · OpenAI Developers
  11. Alexandre Senet / MecAgent · Astra turbojet assembly in SolidWorks
  12. Alexandre Senet / MecAgent · Astra robot-arm assembly in SolidWorks
  13. Peng et al. · Sim-to-Real Transfer of Robotic Control with Dynamics Randomization · ICRA 2018
  14. RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model
    VSI-Bench · 2607.17977v2 · 2026-07-31分数来源:GPT-5.4, Claude Sonnet 4.6, Qwen3.5-122B-A10B, RynnBrain 1.1-122B-A10B
    VSI-Bench · 2607.17977v2 · 2026-07-31分数来源:Molmo2-ER-5B
  15. SpaceMind: Camera-Guided Modality Fusion for Spatial Reasoning in Vision-Language Models
    VSI-Bench · CVPR 2026 正式论文集 · pp. 16811–16822分数来源:Gemini-3-Pro, SpaceMind
  16. Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs
    VSI-Bench · 2608.20492v1 · 2026-08-20分数来源:Qwen3.5-9B, LLaVA-OneVision-2-8B
  17. SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models
    VSI-Bench · 2608.01899v1 · 2026-08-03分数来源:InternVL3.5-8B, SpatioLM (SenseNova-SI-8B)
  18. ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning
    VSI-Bench · 2607.17599v1 · 2026-07-20分数来源:ConsiSpace UC-SSRL
  19. Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence
    VSI-Bench · 2505.23747v2 · 2026-05-19分数来源:Spatial-MLLM-4B
  20. Vision-Language Memory for Spatial Reasoning
    VSTI-Bench · v2 · 2026-07-09分数来源:GPT-5, Gemini-3-Pro, Qwen3-VL-8B, VLM²-7B
  21. Q-GeoMem: Question-Guided Geometric Memory for Video Spatial Reasoning
    VSTI-Bench · v2 · 2026-07-06分数来源:Q-GeoMem-7B
  22. Cog3DMap: Multi-View Vision-Language Reasoning with 3D Cognitive Maps
    VSTI-Bench · v1 · 2026-03-24分数来源:Cog3DMap-8B
  23. Thinking with Geometry: Active Geometry Integration for Spatial Reasoning
    VSTI-Bench · v1 · 2026-02-05分数来源:GeoThinker
  24. 4D-RGPT: Toward Region-level 4D Understanding via Perceptual Distillation
    VSTI-Bench · v4 · 2026-06-02分数来源:4D-RGPT-8B
  25. OpenAI · Introducing GPT-5.4
    模型论文或官方介绍:GPT-5.4
  26. Google · Gemini 3 Pro: the frontier of vision AI
    模型论文或官方介绍:Gemini-3-Pro
  27. Anthropic · Introducing Claude Sonnet 4.6
    模型论文或官方介绍:Claude Sonnet 4.6
  28. Qwen3.5-122B-A10B · official model card
    模型论文或官方介绍:Qwen3.5-122B-A10B
  29. Qwen3.5-9B · official model card
    模型论文或官方介绍:Qwen3.5-9B
  30. InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency
    模型论文或官方介绍:InternVL3.5-8B
  31. MolmoAct2: Action Reasoning Models for Real-World Deployment (Molmo2-ER)
    模型论文或官方介绍:Molmo2-ER-5B
  32. LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence
    模型论文或官方介绍:LLaVA-OneVision-2-8B
  33. OpenAI · Introducing GPT-5
    模型论文或官方介绍:GPT-5
  34. Qwen3-VL Technical Report
    模型论文或官方介绍:Qwen3-VL-8B

引用本文

BibTeX
@misc{wang2026astraspatial,
  title        = {How well does {Astra} understand real-world space?},
  author       = {Wang, Yipeng},
  year         = {2026},
  howpublished = {Blog post},
  url          = {https://www.yipeng.dev/blog/astra-spatial-intelligence}
}
回到顶部 ↑