尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

【arXiv 2026】HSImul3R 论文解读:物理在环重建仿真就绪人-场景交互|从物理AI具身智能视角

【arXiv 2026】HSImul3R 论文解读:物理在环重建仿真就绪人-场景交互|从物理AI具身智能视角 摘要本文解读 arXiv 2026 论文《HSImul3R: Physics-in-the-Loop Reconstruction of Simulation-Ready Human–Scene Interactions》。该论文提出物理在环的人-场景交互仿真就绪重建框架 HSImul3R通过融合场景定向强化学习、直接仿真奖励优化DSRO与显式 3D 生成先验把物理仿真器从事后检验者变成主动监督者双向优化人体运动与场景几何目标是让重建结果真正能放进物理引擎、直接支撑具身智能应用。其特别之处在于首次闭合了重建→仿真→反馈→再重建的回路并配套发布包含 300 个交互实例的HSIBench基准。实验表明交互稳定率从 HSfM 的 10.52% 提升到 53.68%、场景穿透率从 69.51% 降至 22.9%优化后的运动还能重定向到 Unitree G1 人形机器人真机部署为物理 AI 与机器人学习提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节实验设计与结果结果对比总结关键发现局限性常见问题FAQHSImul3R 解决了什么问题什么是物理在环双向优化HSIBench 数据集有多大HSImul3R 效果比 HSfM 好多少重建结果能直接用于机器人吗需要多少输入视角参考链接论文基本信息项目内容标题英文HSImul3R: Physics-in-the-Loop Reconstruction of Simulation-Ready Human–Scene Interactions标题中文物理在环的人-场景交互仿真就绪重建作者Yukang Cao, Haozhe Xie, Fangzhou Hong, Long Zhuo, Zhaoxi Chen, Liang Pan, Ziwei Liu机构S-Lab, 南洋理工大学 (NTU) · 上海人工智能实验室 · ACE Robotics会议arXiv 2026arXivhttps://arxiv.org/abs/2603.15612项目网站https://yukangcao.github.io/HSImul3R/背景与动机具身智能要把智能体放进真实世界而人-场景交互HSI重建是连接被动观察与主动部署的关键一环从稀疏视图或单目视频重建出高保真的人与场景可以为仿真训练提供可规模化、仿真就绪的数据。然而现有方法普遍存在感知-仿真鸿沟perception-simulation gap——视觉上合理的三维重建一旦放入物理引擎就会失稳机器人把物体踢开、场景坍塌根本无法支撑下游任务。这一鸿沟源于三条技术路线的割裂3D 场景重建NeRF、3D Gaussian Splatting、DUSt3R优先环境几何忽略人体动力学人体运动估计4DHumans、ViTPose在遮挡下鲁棒但不建模物理接触与环境约束交互建模BEHAVE、SMPLOlympics 等数据集驱动规模有限且缺乏物理验证。最近出现 HOSNeRF、HSfM 等统一框架但都在2D 图像空间优化对齐几何与物理有效性仍然缺失。HSImul3R 的核心差异是把优化目标从图像对齐换成仿真稳定性这个 3D 物理量让仿真器全程参与重建。研究主线从问题到结论图 1HSImul3R 研究主线——从感知-仿真鸿沟出发经物理在环双向优化到 HSIBench 基准与真机部署。基准/方法设计HSImul3R 的第一阶段是重建与显式 3D 对齐DUSt3R 恢复场景结构SAM2 4DHumans ViTPose 估计人体运动与 2D 关键点再通过人体中心束调整与全局对齐统一坐标系。针对重建中的结构伪影断连组件、缺失表面、非水密拓扑与遮挡问题作者引入显式 3D 结构先验用 SAM 分割物体、预训练图像转 3D 生成模型MIDI合成高保真物体并以接触/非接触两类损失精修人体与物体的相对位置把穿透从源头压掉。图 2HSImul3R 流程与真实世界人形机器人部署——casual 拍摄 → 双向物理优化重建 → 迁移到 Unitree G1 人形机器人。分类全景图 3HSImul3R 方法分类全景——前向场景定向 RL、反向 DSRO、HSIBench 数据三足支撑。方法细节前向优化Scene-targeted RL在 IsaacGym 等物理仿真器中用基于运动跟踪的强化学习优化人体运动并加入场景定向监督信号——人体接触关键点 $k_j^h$ 到最近物体表面点 $\mu_i^o$ 的平均欧氏距离$\ell_{\text{scene}} \frac{1}{N_{\text{contact}} N_{\text{surf}}} \sum_j \sum_i \lVert \mu_i^o - k_j^h \rVert_2^2$这迫使仿真中的人形与物体保持物理上合理的接触而不是把物体踢开。若物体与人体未接触则用非接触损失拉近两者重心投影接触时用带符号距离函数惩罚穿透深度。反向优化DSRO即便前向优化到位残缺几何如缺腿的桌子仍会让仿真失败。DSRO 把仿真反馈转成扩散模型的训练奖励$\ell_{\text{DSRO}} -T \cdot \mathbb{E}[\, w(t)\,(1-2\,l(x_0))\,\lVert \epsilon - \epsilon_\theta(x_t, t) \rVert_2^2\,]$稳定性标签 $l(x_0) \in {0, 1}$ 由三个判据决定物体在重力下保持直立、场景达到稳定终态、交互产生真实接触。稳定样本获得负权重强化不稳定样本正权重弱化从而让生成模型学会站得住的几何。实现上以 LoRA rank 64、batch 1、学习率 $10^{-5}$、1800 步在 4 张 A100 上微调 MIDI。图 4HSImul3R 物理在环优化管线——显式 3D 生成先验注入对齐前向场景定向 RL 优化人体运动反向 DSRO 用仿真反馈微调场景几何。实验设计与结果HSIBench 基准3 名志愿者两男一女、19 个物体8 椅 3 桌 3 沙发、300 个交互实例每例 16 视角同步采集多视角 2DGS 重建物体伪真值、SMPL 估计运动伪真值按交互复杂度分为 Easy / Medium / Hard 三档。图 5HSIBench 数据集概览与仿真结果——覆盖 Easy/Medium/Hard 三档难度的稳定交互状态。评测指标穿透率 SP-3D越低越好、Stability-HSI重力稳定 场景稳态 有效接触越高越好、仿真后运动质量 W-MPJPE / PA-MPJPE越低越好。主结果表HSI 重建与仿真方法Stability Easy ↑Stability Medium ↑Stability Hard ↑SP-3D ↓HSfM10.524.502.6669.51V1HSfMMIDI13.968.814.1777.12V2无场景损失39.5622.717.05—V3中心点距离42.5723.8410.18—V4无 DSRO29.5616.625.17—HSImul3ROurs53.6830.5613.9222.90图像转 3D 生成质量表DSRO 微调对比方法Stability Easy ↑Stability Medium ↑Stability Hard ↑SG ↑CD ↓F-Score ↑MIDI29.5616.625.1779.190.19881.95DSO*38.7525.917.8887.230.19186.26Ours53.6830.5613.9291.500.17388.25图 6与 HSfM 的仿真定性对比——HSfM 重建常把物体踢开、人独立站立HSImul3R 保持稳定交互。图 7图像转 3D 生成对比Ours vs DSO vs MIDI——DSRO 修正桌腿缺失与遮挡导致的表面畸变。图 8场景定向仿真损失消融——移除距离最小化项后人形动作夸张、踢开物体加入后稳定接触。图 9真实世界部署——优化后的运动经 GMR 重定向到 Unitree G1配合扩散引导强化学习训练全身控制策略并真机部署。附录补充输入视角数分析视角数Stability Easy ↑Stability Medium ↑Stability Hard ↑SP-3D ↓16 视角55.1629.5113.5921.8110 视角52.9332.1713.0321.004 视角53.6830.5613.9222.90结果对比总结图 10结果对比总结——HSImul3R 在稳定率、穿透率、重力稳定性全面领先并支撑真机部署。关键发现稳定率提升 5 倍以上Easy 难度 Stability-HSI 从 HSfM 的 10.52% 提升到 53.68%Medium/Hard 分别达到 30.56% 与 13.92%。穿透率大幅下降SP-3D 从 HSfM 的 69.51% 降至 22.90%下降近 47 个百分点。每个组件都有贡献V2无场景损失39.56%、V3中心点距离42.57%、V4无 DSRO29.56%均显著低于完整方法的 53.68%。物体生成更稳更准重力稳定性 SG 达 91.50%MIDI 79.19%Chamfer 距离 0.173、F-Score 88.25。运动质量同步提升W-MPJPE 4.09HSfM 5.02、PA-MPJPE 2.17HSfM 2.79。稀疏视角即可用4 视角与 16 视角的稳定性几乎持平53.68% vs 55.16%穿透率差异很小。局限性复杂场景成功率不高多物体超过 3 个或复杂交互下稳定率明显下降Hard 档仅 13.92%。失败模式集中失败时人形机器人与物体常各自独立静止未形成有效交互。域外泛化受限DSRO 微调继承了 MIDI 预训练数据与 HSIBench 采集的偏差。场景假设单目视频扩展目前假设静态场景、人体是唯一运动实体。作者展望提升复杂交互成功率、覆盖可形变物体与动态场景并把管线接入大规模网络视频数据为具身智能模型提供训练数据。常见问题FAQHSImul3R 解决了什么问题解决了感知-仿真鸿沟视觉上合理的 3D 重建放进物理引擎会失稳。HSImul3R 让物理仿真器作为主动监督者参与重建双向优化人体运动与场景几何产出仿真就绪simulation-ready的人-场景交互重建。什么是物理在环双向优化前向用场景定向强化学习优化人体运动接触距离奖励保证交互稳定反向用直接仿真奖励优化DSRO把仿真反馈转成扩散模型奖励微调图像转 3D 生成模型修正残缺几何。两个方向互为监督形成闭环。HSIBench 数据集有多大19 个物体8 椅、3 桌、3 沙发、3 名志愿者、300 个交互实例每例 16 视角同步采集按交互复杂度分为 Easy/Medium/Hard 三档每例以 15 个随机种子重复运行仿真管线收集训练信号。HSImul3R 效果比 HSfM 好多少Easy 难度交互稳定率从 10.52% 提升到 53.68%约 5 倍场景穿透率从 69.51% 降至 22.9%运动质量 W-MPJPE 从 5.02 改善到 4.09。重建结果能直接用于机器人吗能。优化后的运动经 GMR 重定向到 Unitree G1 人形机器人配合扩散引导强化学习在 IsaacGym 中训练全身控制策略并通过 Unitree SDK 成功部署到真实硬件。需要多少输入视角4 个稀疏视角即可4/10/16 视角下稳定性几乎持平53.68% / 52.93% / 55.16%更多视角只轻微改善运动质量对稳定性与穿透影响很小。参考链接arXiv 论文页HSImul3R: Physics-in-the-Loop Reconstruction of Simulation-Ready Human–Scene Interactions项目网站https://yukangcao.github.io/HSImul3R/基线 HSfMReconstructing 3D Human-Scene Interactions from Sparse Views (CVPR 2025)生成模型 MIDIImage-to-3D Generation with Explicit 3D Priors (CVPR 2025)重建基座 DUSt3RDUSt3R: Geometric 3D Vision Made Easy (CVPR 2024)给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件
返回列表