尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

终极文档解析革命:NVIDIA-Nemotron-Parse-v1.1-TC如何让复杂文档处理提速20%?

终极文档解析革命:NVIDIA-Nemotron-Parse-v1.1-TC如何让复杂文档处理提速20%? 终极文档解析革命NVIDIA-Nemotron-Parse-v1.1-TC如何让复杂文档处理提速20%【免费下载链接】NVIDIA-Nemotron-Parse-v1.1-TC项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/NVIDIA-Nemotron-Parse-v1.1-TCNVIDIA-Nemotron-Parse-v1.1-TC是一款基于Transformer的视觉编码器-解码器模型专为理解文档语义并提取具有空间定位的文本和表格元素而设计。它能将非结构化文档转换为可操作的机器可用表示克服了传统OCR技术在处理具有结构可变性的复杂文档布局时的不足让复杂文档处理效率提升20%。 核心优势为何选择NVIDIA-Nemotron-Parse-v1.1-TC 20%速度提升的秘密该版本在NVIDIA Nemotron Parse v1.1基础上通过在视觉编码器表示之上应用额外的4倍视觉令牌长度压缩TC实现了20%的速度提升。同时它还能保留表格、标题、图片、脚注等无序元素的页面顺序让文档处理更高效、更准确。 强大的文档理解能力它能够对给定文档中的对象标题、章节、标题、索引、脚注、列表、表格、参考文献、图像进行分类并提供带坐标的边界框。支持从PDF和PPT文档中提取文本为文档理解 pipelines 提供强大支持。️ 快速开始轻松上手使用 安装依赖首先你需要安装项目所需的依赖。打开终端执行以下命令pip install -r requirements.txt其中包含了albumentations、einops、numpy、opencv_python、Pillow、torch、torchvision、transformers等必要库。 使用示例以下是一个简单的使用示例展示了如何加载模型、处理图像并获取解析结果import torch from PIL import Image from transformers import AutoModel, AutoProcessor from postprocessing import extract_classes_bboxes, transform_bbox_to_original, postprocess_text # 加载模型和处理器 model_path nvidia/NVIDIA-Nemotron-Parse-v1.1-TC # 或使用本地路径 device cuda:0 model AutoModel.from_pretrained( model_path, trust_remote_codeTrue, torch_dtypetorch.bfloat16 ).to(device).eval() processor AutoProcessor.from_pretrained(model_path, trust_remote_codeTrue) # 加载图像 image Image.open(path/to/your/image.jpg) task_prompt /sspredict_bboxpredict_classesoutput_markdown # 处理图像 inputs processor(images[image], texttask_prompt, return_tensorspt).to(device) # 生成文本 generation_config GenerationConfig.from_pretrained(model_path, trust_remote_codeTrue) outputs model.generate(**inputs, generation_configgeneration_config) # 解码生成的文本 generated_text processor.batch_decode(outputs, skip_special_tokensTrue)[0] 后处理获取生成文本后还可以进行后处理以提取更详细的信息classes, bboxes, texts extract_classes_bboxes(generated_text) bboxes [transform_bbox_to_original(bbox, image.width, image.height) for bbox in bboxes] # 指定后处理的输出格式 table_format latex # latex | HTML | markdown text_format markdown # markdown | plain blank_text_in_figures False # 移除Picture类中的文本 texts [postprocess_text(text, clscls, table_formattable_format, text_formattext_format, blank_text_in_figuresblank_text_in_figures) for text, cls in zip(texts, classes)] for cl, bb, txt in zip(classes, bboxes, texts): print(cl, : , txt) 模型架构解析️ 架构类型Transformer-based vision-encoder-decoder model 网络架构Vision Encoder: ViT-H modelAdapter Layer: 1D convolutions norms用于压缩潜在空间的维度和序列长度从13184 tokens压缩到833 tokensDecoder: mBart 10 blocksTokenizer: 使用的tokenizer受CC-BY-4.0 license管辖Number of Parameters: 1B 实际应用场景 文档内容提取无论是学术论文、商业报告还是技术文档NVIDIA-Nemotron-Parse-v1.1-TC都能快速准确地提取其中的文本、表格、公式等内容为信息整理和分析提供便利。 训练数据准备它提取的文本数据集和能力有助于LLM和VLM的训练提高模型的性能和准确性。 智能文档理解通过对文档结构和内容的深入理解可应用于智能检索、自动摘要、内容分类等领域提升文档处理的智能化水平。 获取项目要开始使用NVIDIA-Nemotron-Parse-v1.1-TC你可以克隆仓库git clone https://gitcode.com/hf_mirrors/nvidia/NVIDIA-Nemotron-Parse-v1.1-TCNVIDIA-Nemotron-Parse-v1.1-TC为文档解析领域带来了革命性的变化凭借其高效的处理速度和强大的功能为用户提供了全新的文档处理体验。无论是新手还是专业用户都能轻松上手并从中受益。赶紧尝试一下感受文档解析的新效率吧【免费下载链接】NVIDIA-Nemotron-Parse-v1.1-TC项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/NVIDIA-Nemotron-Parse-v1.1-TC创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表