
DUSt3R 三维重建交互 Demo 完整指南双张照片到稠密点云【免费下载链接】dust3rDUSt3R: Geometric 3D Vision Made Easy项目地址: https://gitcode.com/GitHub_Trending/du/dust3rDUSt3R 是一个照片进、三维出的重建框架上传同一场景的若干张未标定照片它直接输出稠密点云、相机位姿与深度图不需要任何相机参数。适合想快速验证三维重建效果、或需要轻量场景数字化管线的开发者用 Docker 一条命令就能在本机浏览器里跑起交互 Demo从部署到看到第一份点云通常不到五分钟。没有 GPU 也能先跑通 CPU 版本这一点下面会给出具体命令。项目定位传统几何视觉管线特征匹配、SfM、MVS步骤多、依赖标定先验而 DUSt3R 把整条链路压缩成两步网络前向推理 可微分全局优化。给定两张或多张未标定图像模型逐像素预测三维点及其置信度再由优化器把所有视图对齐进同一坐标系。架构采用非对称设计编码器 ViT-L解码器 ViT-B。官方提供三个权重224 线性头、512 线性头、512 DPT 头后者精度最高、体积也最大。上手能做什么能力使用方式场景重建demo 页上传同一场景 2 张及以上照片选定配对策略后点 Run得到可旋转的三维场景实时调参推理完成后可拖动 min_conf_thr 滑块即时过滤低置信度区域无需重新推理配对策略Scenegraph 下拉框切换 complete / swin / oneref控制推理开销模型导出结果以 GLB 形式导出可导入任何支持 glTF 的三维软件深度与置信度检查输出区同步展示每张图的 RGB、深度、置信度三张图方便排查重建质量五分钟跑起来Docker 一条命令启动本地 Demogit clone https://gitcode.com/GitHub_Trending/du/dust3r cd dust3r/docker bash run.sh --model_nameDUSt3R_ViTLarge_BaseDecoder_512_dpt有 NVIDIA GPU 时加一个参数即可启用 CUDA 加速bash run.sh --with-cuda --model_nameDUSt3R_ViTLarge_BaseDecoder_512_dpt。成功标志浏览器打开http://localhost:7860出现 Gradio 界面上传 2 张同场景照片、点 Run等全局对齐收敛后即可在三维视口中旋转查看重建结果页面下方同时给出每张图的 RGB / 深度 / 置信度图。min_conf_thr 与全局对齐迭代数怎么调min_conf_thr置信度阈值取值 1.0~20默认 3.0。拉高会逐步剔除天空、玻璃等不确定区域点云更干净但更稀疏拉低则保留全部像素点噪声一起进来。拖动即时生效scene 状态被缓存不用重跑推理。num_iterations全局对齐优化的迭代数0~5000默认 300。图片多、配对方多时提高步数能收敛更充分降到 0 会跳过优化直接输出原始预测的粗略拼接。schedule学习率衰减策略可选 linear 或 cosine默认 linear。图片数量较多时 cosine 衰减通常更稳。Scenegraph决定图像如何两两配对。complete 生成所有两两配对结果最完整但显存和推理开销最大swin 用滑动窗口只配对相邻窗口适合长序列oneref 固定一张参考图与其余所有图配对是开销最小的方式。图片超过 6 张时后两者更实用。界面还有几个开关As pointcloud 在点云与三角网格之间切换输出形态Mask sky 用分割剔除天空点Clean-up depthmaps 默认开启负责清理深度图中的离群点。核心模块速览图像两两配对的策略生成complete / swin / onerefdust3r/image_pairs.py非对称双视图网络主干定义dust3r/model.py批量推理接口输出每对图的三维点预测与置信度dust3r/inference.py全局对齐优化器把各视图点云拟合到统一坐标系并估计位姿与焦距dust3r/cloud_opt/Gradio 交互界面参数与导出逻辑都在这里dust3r/demo.py训练入口与 CO3D、MegaDepth 等九类数据集的预处理脚本train.py、datasets_preprocess/真实落地方向室内空间重建输入 8~12 张围绕房间多视角拍摄的照片选 swin 策略控制开销重建出的网格和点云经 min_conf_thr 过滤后导出 GLB导入三维建模软件即可量尺寸、摆家具省去激光扫描仪的采购成本。文物与建筑现状记录输入手机围绕文物或建筑立面环拍的一组照片输出稠密点云与深度图供修复工程做现状记录和前后形变比对全程不需要专业设备。视觉定位仓库内 dust3r_visloc/ 提供定位管线配合 COLMAP 基线重建和 kapture 格式查询图像可评估单张照片在已知场景中的位姿精度。适合与不适合适合的场景照片数量 2~6 张的室内或文物拍摄需要免标定、免手动的三维点云和位姿或想把重建结果作为下游 3D 软件输入。事实层面的优势完全不需要相机内参和位姿先验2 张图即可运行全局对齐默认 300 步迭代收敛属于分钟级流程224 与 512 两档分辨率权重可按精度/速度取舍。需要留意的限制complete 配对图的开销随图片数平方增长6 张以上建议改用 swin 或 oneref模型输出为相对尺度不是米制深度无法直接用于测量仅 2 张图时会跳过全局对齐结果完全依赖单对预测质量许可证为 CC BY-NC-SA 4.0仅限非商业用途512 分辨率权重显存占用明显高于 224 版CPU 模式可运行但逐对推理耗时上升明显。资源索引安装、权重下载与训练超参README.mdWeb 交互入口demo.py训练脚本train.py视觉定位模块dust3r_visloc/许可条款LICENSE本文依据 DUSt3R v1.0CVPR 2024 版本的仓库 README、demo.py 与 cloud_opt 源码整理。项目代码遵循 CC BY-NC-SA 4.0 许可仅限非商业使用。【免费下载链接】dust3rDUSt3R: Geometric 3D Vision Made Easy项目地址: https://gitcode.com/GitHub_Trending/du/dust3r创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考