
一张照片快速生成6个一致视角Zero123 多视角图像生成通关指南【免费下载链接】zero123plusCode repository for Zero123: a Single Image to Consistent Multi-view Diffusion Base Model.项目地址: https://gitcode.com/gh_mirrors/ze/zero123plus给一只汉堡拍一张照片几分钟后拿到它环绕一圈的 6 个视角角度之间形状、光影完全对得上——这是 Zero123 最核心的本事单图到一致多视角图像生成multi-view image generation。它把拍一张到转一圈看的距离压缩到几分钟也是后续 3D 重建、法线估计、自动抠图流程公认的入口模型。本文按闯关的方式带你从装环境一路打到把输出接进真实项目。过去想拿到一个物体的多个视角通常只有两条路打开建模软件手动转模型、逐角度渲染耗时且门槛高或者用扩散模型逐张生成但每张独立采样视角之间的形状、配色常常互相打架根本拼不成一个完整物体。Zero123 换了个思路一次扩散直接输出一张 2×3 的 6 视图网格相机位姿写死在模型里视角一致性由架构保证不需要你事后对齐。第一关先认路——搞懂固定机位意味着什么这关不打代码先把模型想让你怎么用弄清楚后面会省很多试错。Zero123 的输出是固定相机位姿集合方位角相对输入视图分别为 30、90、150、210、270、330 度也就是绕物体转一圈v1.1 的仰角是 30° 与 -20° 交替v1.2 调整为 20° 与 -10°并把输出视场角统一为 30°更贴近真实近景拍摄的观感。v1.2 还重做了相机内参处理对输入图的视场角、裁剪方式更鲁棒。注意一个容易误会的点它不是传统新视角合成模型——那种模型会根据输入物体的远近缩放视角。Zero123 始终按归一化物体尺寸输出一组固定视角这个设计是刻意为之因为它定位是 3D 生成的基座下游重建流程需要的是确定性的、可对齐的输入。第二关把它跑起来——从 clone 到第一张多视角图最省事的启动方式克隆仓库、装依赖、跑一个最小脚本。仓库里的requirements.txt会装好 torch、diffusers、transformers 等依赖官方推荐diffusers0.20.2。git clone https://gitcode.com/gh_mirrors/ze/zero123plus cd zero123plus pip install -r requirements.txt然后准备一张正方形图片建议分辨率不低于 320×320运行下面这段最小代码仓库中已有现成版本 examples/img_to_mv.pyimport torch from PIL import Image from diffusers import DiffusionPipeline, EulerAncestralDiscreteScheduler pipeline DiffusionPipeline.from_pretrained( sudo-ai/zero123plus-v1.1, custom_pipelinesudo-ai/zero123plus-pipeline, torch_dtypetorch.float16, ) pipeline.scheduler EulerAncestralDiscreteScheduler.from_config( pipeline.scheduler.config, timestep_spacingtrailing ) pipeline.to(cuda:0) cond Image.open(my_photo.jpg) result pipeline(cond, num_inference_steps75).images[0] result.save(output.png)跑完你会得到一张 2×3 的网格图里面就是 6 个一致视角。基础模型约需 5GB 显存75 步在消费级显卡上也就一两分钟的事。第三关把效果调到能用——3 个参数和 1 个输入习惯第一张图能出后就该对付效果差口气的问题。下面是速查表来自仓库 README 的实测建议参数建议值什么时候调它推理步数普通物体约 28 步人脸等细节图像 75~100 步细节糊、纹理没长出来就往上加引导尺度 guidance_scale默认 4可在 1~10 间试探想更贴输入风格调高想更放飞调低随机种子固定可复现换种子探索变体同一张图想多出几个候选方案时输入习惯只有一条给正方形、干净的主体。默认输出是灰色背景Stable Diffusion VAE 的零值直接拿去用不美观官方推荐用 rembg 补一次抠图两行代码import rembg result rembg.remove(result) result.save(output_clean.png)第四关加装深度与法线——把输出喂给 3D 重建流程多视角图本身是看图要真正进 3D 流程还得带几何信息。这关装两个插件。深度 ControlNet给生成加上深度约束让视角变化更符合几何关系。照着 examples/depth_controlnet.py 加一行pipeline.add_controlnet(...)权重用sudo-ai/controlnet-zp11-depth-v1conditioning_scale建议 0.75显存约 5.7GB。法线生成器v1.2 新增输出视图空间法线图官方验证集上 alpha IoU 达 98.81%、平均法线角度误差仅 10.75°比基于 SAM 的抠图遮罩更准。用法在 examples/normal_gen.py配合 examples/matting_postprocess.py 还能从法线反推高质量透明遮罩。看下面对比左边是汉堡的 6 视角右边是同机位的法线图最后一关接进真实场景——把 6 个视角变成作品打通前面四关后你会发现它几乎能嵌进任何需要多角度展示的地方电商详情页一张产品照片生成 6 视角顾客不用靠想象脑补侧面和背面游戏资产原型角色设计图或道具草图秒变多角度预览原型评审不再等建模3D 打印预检打印前先转一圈检查缺陷省下报废材料的钱教学与创意把二维插图变三维展示或者干脆玩点脑洞——像官方示例那样让幽灵捧着汉堡开吃想再进一步可以关注 One-2-3-45、One-2-3-45 和 Zero123 这些同源项目它们正是把 Zero123 的多视角输出重建成真正 3D 网格的下一站。排查问题时README.md 是唯一权威文档examples/ 里的四个示例覆盖了基础生成、深度、法线和抠图的全部官方姿势想研究原理可以读 diffusers-support/pipeline.py 的自定义管道源码不想写代码就直接streamlit run app.py或python gradio_app.py打开本地界面。最后提醒一句许可证代码是 Apache 2.0但模型权重是 CC-BY-NC 4.0不能放进商业产品管线不过用模型产出的图片本身可以自由使用。现在回到开头那个汉堡——挑一张你手边最想转一圈的照片克隆仓库跑一遍第二关的脚本6 个一致视角几分钟后就躺在本地的 output.png 里了。【免费下载链接】zero123plusCode repository for Zero123: a Single Image to Consistent Multi-view Diffusion Base Model.项目地址: https://gitcode.com/gh_mirrors/ze/zero123plus创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考