数据集

LLM生成文本检测竞赛数据集

LLM生成文本检测竞赛数据集数据来源：互联网公开数据标签：LLM生成文本,人工智能检测,竞赛数据,自然语言处理,文本分析该数据集专为 “LLM - Detect AI Generated Text” Kaggle 竞赛而构建，内容由大型语言模型（LLMs）生成的英文文章组成。数据基于公开可用的外部语料改写生成，但其原始数据并未包含在 DAIGT V2 训练集内，确保了训练数据的新颖性与代表性。

数据内容：该数据集主要用于训练和评估检测AI生成文本的模型。所有文本为机器生成（无人工创作样本），但具有较高的可读性和多样性，挑战在于从自然语言特征中识别其非人类来源。

字段定义（依据常见格式）：

id：文本唯一标识符

text：LLM生成的完整英文文章（通常为短文或段落）

label：（如在其他阶段提供）AI生成标签（训练/验证集中可能用于对比）

时间范围：文本生成时间与模型版本未具体说明，但数据反映出当前主流 LLM（如 ChatGPT、Claude、Gemini 等）的生成风格与能力。

数据格式：结构化 CSV 格式，包含 id 与 text 字段。纯文本型数据，适合输入至分类器、特征提取器或语言模型中进行进一步处理。

更新频率：本数据集为竞赛发布版本，版本稳定，更新以比赛平台发布为准。

适用场景：

人工智能生成内容（AIGC）识别模型开发

文本可解释性分析与语言风格研究

大语言模型输出语体特征提取

AI生成内容与人类文本的对比分析

数据安全、学术诚信检测工具建模

数据与资源

LLM生成文本检测竞赛数据集.zipZIP
0.72 MiB

下载

附加信息

字段	值
版本	1.0
数据集大小	0.72 MiB
最后更新	2025年4月15日
创建于	2025年4月15日
声明	当前数据集部分源数据来源于公开互联网，如果有侵权，请24小时联系删除(400-600-6816)。

LLM生成文本检测竞赛数据集

数据与资源

附加信息

注册成功！