尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Vesuvius-Grandprize-Winner夺冠方案的未来启示:3D视觉Transformer如何重塑文化遗产AI考古新纪元

Vesuvius-Grandprize-Winner夺冠方案的未来启示:3D视觉Transformer如何重塑文化遗产AI考古新纪元 Vesuvius-Grandprize-Winner夺冠方案的未来启示3D视觉Transformer如何重塑文化遗产AI考古新纪元【免费下载链接】Vesuvius-Grandprize-Winner项目地址: https://gitcode.com/gh_mirrors/ve/Vesuvius-Grandprize-WinnerVesuvius-Grandprize-Winner 是火山纸卷挑战赛Vesuvius Challenge2023 年 Grand Prize 的完整开源夺冠方案它用3D 视觉 Transformer从 X 射线断层扫描数据中检测碳化古卷上的墨迹为文化遗产 AI 考古研究树立了一座里程碑。2024 年维苏威火山脚下那些 2000 年前被火山灰碳化的希罗多德手稿第一次有希望被读出来——而这份代码正是读懂它们的核心钥匙 碳化的纸卷与一场AI 考古竞赛公元 79 年维苏威火山爆发将赫库兰尼姆城的图书馆埋入地下。千年以后现代学者获得了这些碳化的纸卷——但卷子一碰就碎打开即毁灭。Vesuvius Challenge 给出了不打开也能读的方案对纸卷做 X 射线 CT 扫描用 AI 从三维断层中找出碳墨的吸收信号。本项目的三位作者Youssef Nader、Luke Farritor、Julian Schilliger凭借该方案夺得大奖仓库中完整保留了冠军管线主流水线模型TimeSformer-small时空注意力分离的 3D 视觉 Transformer训练脚本见 train_timesformer_og.py备选架构带预训练权重的 ResNet3D-101models/resnetall.py与带 Non-Local 块的 I3Dmodels/i3dallnl.py、models/non_local_helper.py数据工程约 15 轮数据集扩充与清洗人工标注墨迹汇总在 all_labels/ 目录冠军技术拆解3D 视觉 Transformer 为何胜出这套方案的巧妙之处不在单点模型而在数据—模型—工程三者的闭环 1. 把 3D 卷体切成视频来喂给 TransformerCT 数据本质是一叠 2D 断层图。方案将纸卷切成 64×64 的体素块取中段约 26 层作为输入通道in_chans 26让 TimeSformer 像理解视频帧一样理解纸卷的深度方向——这正是 3D 视觉 Transformer 相对 2D CNN 的关键优势同时建模平面纹理与纵深墨迹形变。2. 激进的数据增强 严谨的训练调度训练配置中使用了随机翻转、旋转、高斯噪声、运动模糊等增强基于albumentations配合GradualWarmupScheduler学习率预热与混合精度AMP训练单批 256 体块。细节可见 train_timesformer_deduped.py 的CFG配置类。3. 可复现的 Docker 环境冠军权重直接打包进镜像新手无需从零复现这是研究级项目少见的工程素养。如何快速上手Docker 一键启动指南 复现路径只需三步# 1. 克隆仓库并构建镜像镜像会自动拉取冠军权重 git clone https://gitcode.com/gh_mirrors/ve/Vesuvius-Grandprize-Winner cd Vesuvius-Grandprize-Winner docker build -t youssef_gp . docker run --gpus all --shm-size150g -it -v /你的数据路径/train_scrolls:/workspace/train_scrolls youssef_gp # 2. 容器内下载并准备训练数据 ./download.sh python prepare.py # 3. 推理或训练 python inference_timesformer.py --model_path timesformer_weights.ckpt --segment_path train_scrolls --segment_id 20231005123336 python train_timesformer_og.py依赖清单见 requirements.txtPyTorch、PyTorch-Lightning、TIMM 等环境基础为 CUDA 11.7脚本定义于 Dockerfile。从墨迹到全文推理与卷片拼接流程检测出单个卷片fragment的墨迹只是第一步。真正震撼的是 compose.py 的拼接流程它对十几个卷片依次推理再按手工标定的坐标与旋转角度把结果拼回整卷纸的虚拟展开图——相当于给千年前的书重新装订 而 all_labels/ 目录下每一张高分辨率标注图都是模型输出的墨水概率图白亮处即古人笔迹所在。未来启示AI 考古将走向何方从这份夺冠方案中我们能看到技术扩散的三条清晰路径3D 视觉 Transformer 的迁移性纸卷墨迹检测本质是从体数据中分割细弱高对比信号同样的范式可直接迁移至文物锈蚀检测、医学 CT 病灶分割、地质体相分析等任务——冠军代码是最好的教科书数据清洗轮次的方法论约 15 轮标注迭代证明在难数据上模型架构的收益常常小于数据质量。这对所有文化遗产数字化项目都是普适经验可复现科学Docker 一键复现冠军权重让任何研究团队都能站在同一基线上做增量创新这是开源竞赛文化对学术界的最大馈赠当算法能读懂碳化的纸AI 考古就不再是概念——它正在把失落的图书馆一页一页带回人间 ✨结语Vesuvius-Grandprize-Winner 不仅是一份竞赛代码更示范了 3D 视觉 Transformer 在极端条件成像任务中的完整落地路径。对于想进入 AI 与文化遗产交叉领域的开发者这里是起点也是蓝图。【免费下载链接】Vesuvius-Grandprize-Winner项目地址: https://gitcode.com/gh_mirrors/ve/Vesuvius-Grandprize-Winner创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表