医疗文本PHI受保护健康信息标注数据集-vijayakashv03

医疗文本PHI受保护健康信息标注数据集-vijayakashv03 数据来源:互联网公开数据 标签:PHI,医疗文本,数据标注,隐私保护,NLP,自然语言处理,文本处理,数据安全,敏感信息,信息脱敏 数据概述: 本数据集专为敏感信息脱敏设计,特别是受保护健康信息(PHI, Protected Health Information)的识别与处理。数据集包含三列:sentence_id(句子ID,用于唯一标识句子)、words(包含描述性文本的单词)和labels(标签,指示哪些敏感信息需要替换)。标签用于标识文本中需要进行保护的PHI内容,例如姓名、联系方式、医疗记录等。

数据用途概述: 该数据集适用于训练自然语言处理(NLP, Natural Language Processing)模型,以实现PHI的自动识别和脱敏。研究人员和实践者可以利用此数据开发创新的解决方案,用于自动化PHI脱敏,从而提高处理敏感文本信息的应用程序的隐私和安全性。 具体应用包括:构建医疗记录脱敏工具、保护患者隐私的文本分析系统、开发安全可靠的医疗信息共享平台等。本数据集的应用旨在促进负责任和合乎道德的使用,以保障个人隐私。

packageimg

数据与资源

附加信息

字段
版本 1.0
数据集大小 0.09 MiB
最后更新 2025年4月22日
创建于 2025年4月22日
声明 当前数据集部分源数据来源于公开互联网,如果有侵权,请24小时联系删除(400-600-6816)。