
摘要面向虚假招聘信息识别的多模态数据集可视为对 EMSCAD 招聘欺诈数据集的增强版本。数据集概述面向虚假招聘信息识别的多模态数据集可视为对 EMSCAD 招聘欺诈数据集的增强版本。数据集包含约 18,000 条招聘信息其中约 800 条为虚假招聘信息。除传统的职位描述文本外还加入了职位相关元数据以及对应公司的主页截图使模型能够同时利用文本信息与视觉信息判断招聘信息的真实性适合开展多模态欺诈检测与分类研究。数据结构与关键特征数据集的核心数据包括职位描述文本、职位相关元信息、真实性标签以及公司主页截图等多个模态。文本部分可以包含职位名称、公司描述、工作要求、岗位职责等信息元数据用于补充职位与企业属性而网页截图则提供企业官网的视觉风格、页面结构和品牌展示等信息。样本可通过 job_id 与对应截图关联图像路径形式为 images/{fraudulent}/{job_id}.png。这种文本、结构化属性和图像相结合的数据结构有利于提取单一模态难以发现的欺诈特征。应用价值与研究方向该数据集可用于虚假招聘识别、在线招聘平台内容审核、网络欺诈检测以及多模态机器学习研究。研究者可以分别使用 BERT、Transformer 等模型处理招聘文本利用 CNN、ResNet、Vision Transformer 等模型分析企业主页截图再通过特征融合或多模态 Transformer 构建联合分类模型。进一步还可研究类别不平衡处理、跨模态特征融合、模型可解释性以及虚假企业网站视觉特征分析为招聘平台风险预警和智能审核系统提供数据支持。数据集来源由张家梁(Bob)整理并于2026年在7zcode平台公开发布。数据集信息免责声明与引用数据仅用于科研与教学用途。若用于商业场景请自行核验数据许可。如需引用请在论文或报告中注明数据集名称与版本号。作者信息作者Bob (张家梁)项目编号Datasets-374文件大小5.4G原创声明本数据集为整理作品