数据集

太空船泰坦尼克号准备数据集

太空船泰坦尼克号准备数据集数据来源：互联网公开数据标签：太空船,泰坦尼克号,竞赛数据,特征工程,数据预处理,交叉验证,机器学习数据概述：本数据集是专门为太空船泰坦尼克号竞赛准备的数据集，包含了原始数据经过预处理后的结果。数据集中新增了CabinDeck和GroupSize等特征，并对所有缺失值进行了填补，同时对所有类别特征进行了编码。此外，数据集还包含了5折交叉验证所需的分组信息。用户可以直接加载数据集进行模型训练，无需额外的数据预处理。数据用途概述：该数据集适用于机器学习竞赛、模型训练和验证等场景。研究人员和参赛者可以利用此数据集快速构建和评估预测模型，分析乘客生存情况的影响因素。数据集中的交叉验证分组信息也有助于提高模型的泛化能力。此外，数据集还适合用于教育培训，帮助学习者掌握数据预处理和特征工程的基本技能。举例：本数据集包含以下特征： - GroupId: 乘客组的唯一标识符 - GroupSize: 每个组中乘客的数量 - CabinDeck: 客舱所在甲板 - CabinNum: 客舱编号 - CabinSide: 客舱所在船舷（端或星） - TotalExpense: 乘客在各个消费项目上的总花费 - RoomService_missing, FoodCourt_missing, ShoppingMall_missing, Cabin_missing, VIP_missing, TotalExpense_missing: 各消费项目是否有缺失值的标记列数据集中的文件分为四对，每对包括训练集和测试集文件： - train_prepared.csv 和 test_prepared.csv: 不包含可以从Cabin和PassengerId中提取的CabinNum和GroupId特征。 - train_prepared_cabinnum_le.csv 和 test_prepared_cabinnum_le.csv: 包含CabinNum特征的标签编码，以及前两对文件中的所有特征。 - train_prepared_groupid_le.csv 和 test_prepared_groupid_le.csv: 包含GroupId特征的标签编码，以及前两对文件中的所有特征。 - train_prepared_both_le.csv 和 test_prepared_both_le.csv: 包含CabinNum和GroupId特征的标签编码，以及前两对文件中的所有特征。

数据与资源

太空船泰坦尼克号准备数据集.zipZIP
1.96 MiB

下载

附加信息

字段	值
版本	1.0
数据集大小	1.96 MiB
最后更新	2025年4月14日
创建于	2025年4月14日
声明	当前数据集部分源数据来源于公开互联网，如果有侵权，请24小时联系删除(400-600-6816)。

太空船泰坦尼克号准备数据集

数据与资源

附加信息

注册成功！