一文读懂HPD-Parsing架构:InternVL3.5-1B backbone与P-MTP预测技术深度解析
一文读懂HPD-Parsing架构InternVL3.5-1B backbone与P-MTP预测技术深度解析【免费下载链接】HPD-Parsing项目地址: https://ai.gitcode.com/paddlepaddle/HPD-ParsingHPD-Parsing是由飞桨PaddlePaddle开发的轻量级1B参数高吞吐量文档解析模型基于分层并行解码Hierarchical Parallel Decoding范式构建。该模型以InternVL3.5-1B为基础骨干网络创新性地引入了P-MTPProgressive Multi-Token Prediction预测技术在保持解析精度的同时实现了吞吐量的显著提升。HPD-Parsing核心技术架构解析InternVL3.5-1B骨干网络的优势HPD-Parsing采用OpenGVLab/InternVL3_5-1B作为基础模型通过动态分块裁剪技术最多24个448×448大小的图像块保留文档的高分辨率细节。这种架构选择使得模型在处理复杂文档布局时能够兼顾全局结构感知与局部内容理解为后续的分层并行解码奠定了基础。革命性的分层并行解码机制HPD-Parsing的核心创新在于其分层并行解码HPD范式该机制将传统的整页自回归生成重构为全局协调、局部并行的解码过程主布局分支负责全局结构协调动态将单一解码轨迹分解为多个并发的内容分支内容分支每个分支负责特定文档区域的局部内容生成共享前缀KV缓存复用显著缩短分支和 token 维度上的有效顺序解码路径这种架构设计基于文档解析的关键特性页面结构需要全局协调而内容生成则主要在各个区域内局部进行。P-MTP预测技术工作原理Progressive Multi-Token Prediction (P-MTP)是HPD-Parsing中另一项关键技术它通过在每个解码步骤预测多个未来token来减少解码步骤单块预测头设计在modeling_internvl_chat.py中实现了专门的P-MTP头结构推测性解码当启用use_mtp参数时P-MTP头会在每步草稿生成k个token权重加载机制通过load_mtp_weights()方法加载P-MTP权重支持从主检查点或独立的P-MTP目录加载P-MTP技术与分层并行解码相结合使得HPD-Parsing在处理长文档时能显著减少解码步骤在最长输出长度区间可实现高达18.04倍的解码步骤减少。HPD-Parsing性能表现与优势行业领先的吞吐量指标HPD-Parsing在OmniDocBench v1.6上实现了4,752 Tokens Per Second (TPS)的峰值吞吐量相比现有最快的文档解析模型提升1.62倍较其自回归基线提升3.06倍以上。在NVIDIA A800 80GB显卡上批处理大小为512时页面处理速度PPS从1.02提升至2.682.62倍提升令牌吞吐量TPS从1,554.8提升至4,752.13.06倍提升出色的解析精度尽管专注于提升吞吐量HPD-Parsing仍保持了竞争力的解析精度在OmniDocBench v1.6上总体达到94.91%的准确率成为端到端统一解析器中的新标杆。实际应用与部署指南模型加载与使用HPD-Parsing可通过以下方式加载和使用from transformers import AutoModelForCausalLM model AutoModelForCausalLM.from_pretrained(PaddlePaddle/HPD-Parsing) model.load_mtp_weights() # 启用P-MTP推测解码核心生成函数model.generate_hpd(...)实现了分层并行解码逻辑主要参数包括use_mtp是否启用P-MTP推测解码默认Falsenum_speculative_tokens每次推测的token数量默认6评估与基准测试项目提供了完整的评估脚本位于eval/目录下eval/benchmark_tps.py用于复现吞吐量TPS测试结果eval/hpd_to_markdown.py将HPD-Parsing预测结果转换为markdown格式基准测试默认配置使用批处理大小512和P-MTP推测配置num_speculative_tokens6预测结果将保存为batch_512_pred_HPD-Parsing.json。总结重新定义文档解析效率HPD-Parsing通过InternVL3.5-1B骨干网络与P-MTP预测技术的创新结合证明了文档解析可以通过全局布局协调和局部并行解码而非单一顺序生成轨迹来高效执行。其1B参数的轻量级设计、4,752 TPS的高吞吐量和94.91%的解析精度为文档理解与处理领域树立了新的效率标准。无论是企业级文档处理系统还是个人开发者项目HPD-Parsing都提供了一种平衡精度与性能的理想解决方案特别适合处理长文档和大规模文档解析任务。随着后续版本的迭代我们有理由相信这一架构将在更多场景中展现其潜力。要开始使用HPD-Parsing可通过以下命令克隆项目仓库git clone https://gitcode.com/paddlepaddle/HPD-Parsing【免费下载链接】HPD-Parsing项目地址: https://ai.gitcode.com/paddlepaddle/HPD-Parsing创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考