尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

ScanNet、ScanNet++与ARKitScenes:VSI-Bench背后的三大3D场景数据源深度解析

ScanNet、ScanNet++与ARKitScenes:VSI-Bench背后的三大3D场景数据源深度解析 ScanNet、ScanNet与ARKitScenesVSI-Bench背后的三大3D场景数据源深度解析【免费下载链接】thinking-in-spaceOfficial repo and evaluation implementation of VSI-Bench项目地址: https://gitcode.com/gh_mirrors/th/thinking-in-space想知道多模态大模型MLLM到底有没有空间感VSI-Bench 给出了答案。这个由 NYU 团队推出的视觉空间智能评测基准用 288 段第一人称室内视频、5000 个问答对系统性检验模型看懂房间的能力。而支撑这一切的正是三大公开 3D 场景数据集——ScanNet、ScanNet 和 ARKitScenes。本文带你一文看懂这三大数据源各自的特点、区别以及它们在 VSI-Bench 评测中的分工。为什么 3D 场景数据集是 VSI-Bench 的基石VSI-Bench 的核心思想很简单让模型看一段在真实房间中拍摄的视频然后回答关于空间布局、物体位置、距离大小的问题。这意味着它需要一个足够真实的室内场景数据源而 ScanNet、ScanNet、ARKitScenes 正是目前学术界最主流的三个室内 3D 重建数据集。三大数据集各有侧重有的以规模著称有的以精度见长还有的贴近真实消费级设备。把它们组合起来VSI-Bench 就同时获得了场景多样性、数据质量和实用性三方面的保障。ScanNet室内3D重建的经典之作ScanNet 发布于 2017 年可以说是室内 3D 场景理解领域的老大哥。它用 iPad 搭配深度传感器扫描了超过 1500 个真实室内场景覆盖办公室、卧室、客厅、卫生间等常见空间。它的核心优势在于配套标注极其丰富每个场景都有完整的 3D 重建网格、语义分割标签椅子、桌子、窗户……、相机位姿和实例级标注。正因为如此大量 3D 视觉和 SLAM 研究都以 ScanNet 为测试场。在 VSI-Bench 中ScanNet 贡献了88 个评测场景其元数据文件 scannet_meta_info_val.json 中记录了每个场景的房间尺寸、物体类别统计共 33 类和物体三维包围盒等信息。ScanNet更高精度、更真实纹理如果说 ScanNet 是够用那 ScanNet 就是极致。作为 2023 年发布的升级版ScanNet 用 iPhone 13 Pro 的激光雷达配合专业相机采集重建精度和纹理真实度都大幅提升。它的亮点在于多视角真彩色纹理和更复杂的场景内容从元数据来看ScanNet 的 50 个评测场景平均房间尺寸达到 25.9 平方米最大超 128 平方米对象类别多达 43 类远超前两者包含白板、显示器、电源插排、咖啡壶等更细粒度的物品。这些细节让模型面对的视觉信号更接近真实生活也让 scannetpp_meta_info_val.json 成为研究复杂空间理解的理想材料。ARKitScenes来自苹果的消费级数据集ARKitScenes 由 Apple 发布最大特点是全部使用消费级 iPad Pro 的 LiDAR 传感器采集覆盖了 504 个家庭、超过 1661 个房间是三者中规模最大的卧室类数据集。它的房间尺寸波动非常大从 5.4 到 73 平方米而且包含冰箱、炉灶、浴缸、洗碗机等大量厨房卫浴设施——这与 ScanNet 系列偏办公室/公共空间的风格形成了很好的互补。VSI-Bench 中 ARKitScenes 提供了150 个评测场景是三大数据源中贡献最多的其详细元数据见 arkitscenes_meta_info_val.json。三大数据源如何支撑 VSI-Bench 的 8 大任务VSI-Bench 将空间智能拆解为 8 个具体任务分为三类构型类Configurational物体相对方向易/中/难三档、物体相对距离、物体出现顺序测量估计类Measurement物体绝对距离、物体计数、物体尺寸估计、房间尺寸估计时空类Spatiotemporal路线规划其中选择题任务用准确率Accuracy评估数值类任务则采用项目提出的平均相对准确率MRA指标。整个任务定义、评测提示词和指标计算逻辑都封装在 vsibench.yaml 与 utils.py 中方便复现。如何用这些数据跑一次 VSI-Bench 评测想亲手体验也很简单。仓库提供了开箱即用的评测脚本一条命令即可启动bash evaluate_all_in_one.sh --model all --num_processes 8 --benchmark vsibench评测会调用视频加载与问答生成逻辑对每个场景的视频提问最后自动汇总各类任务的得分。三大数据源的元数据均已开源在data/meta_info目录下你可以直接用load_dataset(nyu-visionx/VSI-Bench)拉取基准数据复现论文中的全部结果。总结三种数据源一套空间智能试金石简单来说ScanNet 提供了经典基准ScanNet 提供了高精度升级ARKitScenes 提供了消费级规模。三者各司其职共同构成了 VSI-Bench 评测多模态大模型空间智能的坚实基础。如果你正在研究 3D 场景理解或视频问答这套组合值得深入研究。【免费下载链接】thinking-in-spaceOfficial repo and evaluation implementation of VSI-Bench项目地址: https://gitcode.com/gh_mirrors/th/thinking-in-space创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表