尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

零样本立体深度估计实战指南:FoundationStereo 从环境搭建到三维重建的完整流程

零样本立体深度估计实战指南:FoundationStereo 从环境搭建到三维重建的完整流程 零样本立体深度估计实战指南FoundationStereo 从环境搭建到三维重建的完整流程【免费下载链接】FoundationStereo[CVPR 2025 Best Paper Nomination] FoundationStereo: Zero-Shot Stereo Matching项目地址: https://gitcode.com/gh_mirrors/fo/FoundationStereo提到深度估计很多人第一反应是单目方案——只用一张图猜深度。但真正能在无人驾驶、机器人抓取这类任务中稳定输出带真实尺度的三维信息的往往是立体视觉路线用左右两个摄像头同时拍摄利用视角差异推算出场景中每个像素的远近。传统立体匹配模型有个通病——换一个场景就得重新微调泛化能力差。而 FoundationStereo 正是冲着这个痛点来的它是一款面向零样本立体深度估计的基础模型输入一对双目图像即可直接输出稠密视差图进而转换为带真实尺度的深度图与三维点云无需任何场景定制。这项来自 NVIDIA 的工作拿下了 CVPR 2025 的口头报告席位并获最佳论文提名是目前零样本立体匹配领域绕不开的标杆。先认识它一双经过大规模训练的眼睛视差是什么不妨用两只眼睛来理解当你用双眼看前方左右眼接收到的画面其实略有差异——手指放近一点两眼看到的错位就越明显。这种同一物体在左右画面中的横向位置差就叫视差disparity。视差越大物体离你越近视差趋近于零说明物体在无穷远处。立体匹配算法所做的就是逐像素地把左图和右图对齐找出每一个点的视差值最终拼成一张完整的视差图。零样本的底气从哪来绝大多数立体模型只在特定数据集上表现良好换个拍摄风格就水土不服。FoundationStereo 之所以能直接泛化到新场景靠的是三件事大规模合成训练集FSD 数据集构建了约 100 万对高真实感、高多样性的合成立体图像对覆盖室内、桌面、道路等大量场景为模型提供了足够丰富的见识。自动自校准管道合成数据里难免有遮挡、模糊等歧义样本团队用一套自动化的自筛选流程把它们剔除避免模型学到错误信号。架构上的精心设计引入侧调优side-tuning特征骨干把 DINOv2 等视觉基础模型里丰富的单目先验嫁接到立体任务上缩小合成域到真实域的差距同时用长程上下文推理对成本体积做有效过滤让视差估计在纹理稀疏的区域也足够稳健。图 1FSD 数据集样例左图为左视图中图为右视图右图为模型输出的视差可视化颜色越暖代表距离越近这套组合拳的成效也直接反映在榜单上项目目前位居 Middlebury 与 ETH3D 两个国际立体匹配排行榜的首位这在不做场景微调的情况下尤为难得。动手前如何配置运行环境并准备预训练模型硬件需求先对齐FoundationStereo 需要 GPU 才能高效推理官方在 3090、4090、A100、V100 以及 Jetson Orin 上都做过测试。显存是主要瓶颈——大分辨率图像会更吃显存如果遇到显存不足先试试降低输入分辨率而不是直接放弃。另外模型依赖 FlashAttention 加速记得单独安装。三步装好环境环境安装走 conda 比较省心按下面的顺序执行即可git clone https://gitcode.com/gh_mirrors/fo/FoundationStereo conda env create -f environment.yml conda run -n foundation_stereo pip install flash-attn conda activate foundation_stereo这里有个小提示flash-attn必须单独安装否则在创建环境的过程中可能报错中断这也是官方 FAQ 里被问得最多的问题之一。下载权重并放到约定位置项目提供两套零样本推理权重按需二选一权重骨干网络特点23-51-11ViT-Large精度最高通用场景首选11-33-40ViT-Small精度略降但推理更快下载后把整个文件夹例如23-51-11放进./pretrained_models/目录即可。如果你有商用需求官方还提供基于小模型的商业授权版本NVIDIA TAO可以按需评估。第一次运行一对图像、一条命令、三份输出先检查输入图像是否合规输入是一对经过校正rectified的立体图像即左右图像之间不能有鱼眼类畸变极线应当保持水平。一般从 Zed、RealSense 这类双目相机直接导出的画面已经做过这步处理。另外请注意左右图像分辨率要一致推荐用无损压缩的 PNG 格式不要调换左右图左图必须来自左侧相机否则视差方向会整体反掉模型对 RGB 彩色图效果最佳但官方也验证过它在单目灰度或红外立体图上如 RealSense D4XX 系列同样可用。图 2项目自带的示例输入左视图对应的右视图位于assets/right.png二者构成一对已校正的立体图像跑通官方 demo环境就绪、权重就位后一条命令即可完成推理python scripts/run_demo.py --left_file ./assets/left.png --right_file ./assets/right.png --ckpt_dir ./pretrained_models/23-51-11/model_best_bp2.pth --out_dir ./test_outputs/运行结束后--out_dir目录下会出现三类产物理解它们有助于你快速判断结果好坏vis.png左图与视差可视化的横向拼接图直观看到每帧的深度分布depth_meter.npy以米为单位的稠密深度图可直接用于后续几何计算cloud.ply由深度图反投影生成的三维点云可用 Open3D 打开。命令行里还有大量可调参数全部参数说明可以通过python scripts/run_demo.py --help查看。如果你的图像分辨率很高超过 1000px建议开启--hiera 1分层推理以保留全分辨率深度若更看重速度则可用--scale 0.5降采样输入。看懂结果视差、深度与三维点云的一次换算视差不是深度但它离深度只差一个公式很多初学者会混淆视差图和深度图。简单说视差是模型的原生输出描述左右画面的错位量深度则是物体到相机的真实距离。两者呈反比关系深度 相机焦距 × 双目基线 ÷ 视差其中焦距来自相机内参矩阵 K基线baseline是左右相机光心之间的距离。这就是为什么演示脚本里需要传入一个内参文件——assets/K.txt第一行是展平后的 3×3 内参矩阵第二行是以米为单位的基线长度。拿到你自己的相机标定结果后照这个格式写即可。从深度图到三维点云只差一次反投影有了深度图和相机内参每个像素都能被还原为三维空间中的一个点从而得到点云。项目在 demo 中已把这套逻辑封装好并顺带做了两步优化一是剔除左右视图无重叠区域的不可靠点--remove_invisible二是用半径离群点去除算法做去噪--denoise_cloud。如果你的点云出现空洞或飞点优先从这两个参数入手排查。图 3Open3D 中展示的桌面场景三维点云来自assets/left.png与assets/right.png这对示例输入点云文件cloud.ply是通用格式可无缝导入 Open3D、MeshLab 等工具做后续处理也可以直接在 demo 运行结束后弹窗预览。对机器人抓取、环境重建这类需要看得见物体形状的任务来说这一步输出的正是下游系统最需要的几何数据。让它更快、更准分辨率、迭代次数与 TensorRT 的取舍精度与速度的常用调节旋钮推理脚本暴露了几个直接影响精度/速度比对的参数调参时可以按先调分辨率再调迭代的思路来--scale 0.5输入图像减半显存占用和耗时都明显下降代价是深度分辨率随之降低--valid_iters 16减少前向推理中视差场更新的迭代次数这是最直接的减档方式--hiera 1针对超高清输入的层次化推理拿速度换全分辨率精度适合离线处理大图。想要 6 倍加速试试 TensorRT如果对推理速度有更高要求例如接近实时应用官方推荐的路线是把模型导出为 ONNX再转成 TensorRT FP16 引擎。实测在同样的 RTX 3090 上可以拿到约 6 倍加速具体收益因模型与输入而异。需要提醒的是ONNX/TRT 版本目前只支持 Docker 部署需要先构建镜像再在容器内完成导出与推理具体步骤可参考docker/目录下的构建脚本与readme_jetson.md。Jetson 平台的用户同样可以借助容器方案部署在 Isaac ROS 的开发容器里安装 onnxruntime-gpu 与 onnx-tensorrt再编译或直接使用预编译的 FP16 engine 跑推理边缘设备的实时深度估计由此成为可能。从桌面到道路零样本能力能带你去哪零样本意味着拿到就能用这正好切中了许多场景对深度数据的迫切需求自动驾驶与移动机器人用双目相机实时感知障碍物距离为避障与路径规划提供稠密几何输入机械臂抓取点云级别的三维信息帮助机械臂估计物体的位姿与形状提升抓取成功率增强现实把虚拟物体按真实深度嵌入画面实现更自然的遮挡与交互遥感与测绘从无人机或卫星的立体影像中恢复地表高程生成数字表面模型。如果你手上正好有一对双目相机最直接的上手方式是用相机标定结果生成内参文件把左右视图存成 PNG然后跑一遍上面的 demo看看自己的场景里零样本深度估计的极限在哪里。项目仓库git clone https://gitcode.com/gh_mirrors/fo/FoundationStereo中既有完整的推理与导出脚本也附带可视化数据集的工具从复现到二次开发都有现成的起点。FoundationStereo 用事实证明立体匹配不必再被一场景一模型束缚。无论你是刚接触立体视觉的研究者还是正在为产品寻找稳定深度方案工程师这套开箱即用的零样本立体深度估计工具都值得放进你的工具箱——下一次面对新场景时不必再从头训练。【免费下载链接】FoundationStereo[CVPR 2025 Best Paper Nomination] FoundationStereo: Zero-Shot Stereo Matching项目地址: https://gitcode.com/gh_mirrors/fo/FoundationStereo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表