全球新闻话题分类数据集-2004至2005年-vrindakallu

全球新闻话题分类数据集-2004至2005年-vrindakallu 数据来源:互联网公开数据 标签:新闻分类,话题分类,新闻源,文本分类,机器学习,学术数据,AG数据集

数据概述: 本数据集包含超过100万篇新闻文章的标题,这些文章来自超过2000个新闻来源,由ComeToMyHead学术新闻搜索引擎在超过一年的时间内收集整理。ComeToMyHead自2004年7月起运行,提供了一个广泛的新闻资源库。数据集中的新闻标题被标记为四种类别:0(世界)、1(体育)、2(商业)、3(科技/科学)。

数据用途概述: 该数据集适用于新闻分类、文本分类、机器学习模型训练和评估等多种场景。研究人员可以利用此数据集进行文本分类算法的开发和优化;媒体机构可借此识别和分类新闻内容;教育领域则可以将此数据用于自然语言处理课程的教学和实践。此外,该数据集也是学术研究中用于评估字符级别卷积神经网络等文本分类方法的重要基准。

packageimg

数据与资源

附加信息

字段
版本 1.0
数据集大小 10.45 MiB
最后更新 2025年4月22日
创建于 2025年4月22日
声明 当前数据集部分源数据来源于公开互联网,如果有侵权,请24小时联系删除(400-600-6816)。