
摘要AI Generated Text DatasetAI生成文本数据集 是一个用于人工智能生成文本检测与真实性识别研究的数据集包含人工撰写文本与大语言模型生成文本样本。。数据集概述AI Generated Text DatasetAI生成文本数据集 是一个用于人工智能生成文本检测与真实性识别研究的数据集包含人工撰写文本与大语言模型生成文本样本。数据集旨在帮助研究人员、教育机构和开发者研究文本来源判别问题支持机器学习模型对人工生成内容与真实人类文本进行分类识别。数据结构与关键特征数据集以 CSV 格式存储包含 text 和 generated 两个字段共 1460 条文本样本。其中 text 表示完整文本内容generated 表示文本来源标签1 表示 AI 生成0 表示人工撰写。数据具有明显类别不平衡特点包括约 85 条 AI 生成文本和 1375 条人类文本文本长度约为 200 个 token适用于研究文本语义特征、语言模式、句式复杂度和生成痕迹等特征。应用价值与研究方向该数据集可用于构建 AI 文本检测系统应用于学术论文查重、新闻真实性验证、内容审核和合成媒体检测等领域。研究方向包括基于 TF-IDF 与传统机器学习的文本分类、深度学习模型Transformer、BERT 等微调、类别不平衡学习、可解释人工智能SHAP/LIME分析以及大语言模型生成文本特征研究。数据集来源由张家梁(Bob)整理并于2026年在7zcode平台公开发布。数据集信息免责声明与引用数据仅用于科研与教学用途。若用于商业场景请自行核验数据许可。如需引用请在论文或报告中注明数据集名称与版本号。作者信息作者Bob (张家梁)项目编号Datasets-362文件大小1M原创声明本数据集为整理作品