数据集

医疗文本PHI受保护健康信息标注数据集-vijayakashv03

医疗文本PHI受保护健康信息标注数据集-vijayakashv03 数据来源：互联网公开数据标签：PHI,医疗文本,数据标注,隐私保护,NLP,自然语言处理,文本处理,数据安全,敏感信息,信息脱敏数据概述：本数据集专为敏感信息脱敏设计，特别是受保护健康信息（PHI, Protected Health Information）的识别与处理。数据集包含三列：sentence_id（句子ID，用于唯一标识句子）、words（包含描述性文本的单词）和labels（标签，指示哪些敏感信息需要替换）。标签用于标识文本中需要进行保护的PHI内容，例如姓名、联系方式、医疗记录等。

数据用途概述：该数据集适用于训练自然语言处理（NLP, Natural Language Processing）模型，以实现PHI的自动识别和脱敏。研究人员和实践者可以利用此数据开发创新的解决方案，用于自动化PHI脱敏，从而提高处理敏感文本信息的应用程序的隐私和安全性。具体应用包括：构建医疗记录脱敏工具、保护患者隐私的文本分析系统、开发安全可靠的医疗信息共享平台等。本数据集的应用旨在促进负责任和合乎道德的使用，以保障个人隐私。

数据与资源

versions_20250408065145.zipZIP
0.09 MiB

下载

附加信息

字段	值
版本	1.0
数据集大小	0.09 MiB
最后更新	2025年4月22日
创建于	2025年4月22日
声明	当前数据集部分源数据来源于公开互联网，如果有侵权，请24小时联系删除(400-600-6816)。