中文|English
本数据集使用上市企业公开的个人简历作为原始数据,旨在识别人物简历中的毕业院校、毕业时间和所学专业。本数据集共有14487条数据,均为中文数据。数据集样本长度较长,平均长度为216.74,其中最长样本为1285,最短样本为10。原始数据见 data.txt。
本数据集对全部14487条原始数据进行了人工标注,标注后的数据见 data_label.json。本数据集中允许单个实体存在多种类别标签,例如某学校即是本科毕业院校,同时也是研究生毕业院校,此时该实体在labels中会有多种类别属性。标注后的数据格式如下:
[
{
"data":数据文本1,
"label":
[
{"start":实体1开始下标,"end":实体1结束下标,"text":实体1文本,"labels":[类别1,类别2]},
{"start":实体2开始下标,"end":实体2结束下标,"text":实体2文本,"labels":[类别3,...]}
]
},
{
"data":数据文本2,
"label":[
{"start":实体3开始下标,"end":实体3结束下标,"text":实体3文本,"labels":[类别1,...]},
{"start":实体4开始下标,"end":实体4结束下标,"text":实体4文本,"labels":[类别2]}
]
},
...
]
本数据集中将实体类别共分成3大类38小类。3大类别中包括毕业院校、毕业时间和专业,小类中又进一步将各类别依据学历等信息进行精细化拆分,细分为学校-本科,学校-硕士,毕业时间-本科,毕业时间-硕士等,具体类别分类如下表。
| 标签大类 | 标签小类 |
|---|---|
| 毕业院校 | 学校-EMBA,学校-MBA,学校-博士后,学校-博士,学校-硕士,学校-本科,学校-大专,学校-高中,学校-初中,学校-小学,学校-函授,学校-中专,学校-高职,学校-总裁班 |
| 毕业时间 | 毕业时间-EMBA,毕业时间-MBA,毕业时间-博士后,毕业时间-博士,毕业时间-硕士,毕业时间-本科,毕业时间-大专,毕业时间-高中,毕业时间-初中,毕业时间-小学,毕业时间-函授,毕业时间-中专,毕业时间-高职,毕业时间-总裁班 |
| 专业 | 专业-EMBA,专业-MBA,专业-博士后,专业-博士,专业-硕士,专业-本科,专业-大专,专业-函授,专业-中专,专业-高职 |
本数据集还针对标注后的数据进一步进行了 Bert 相关的数据标注和处理。在原数据标注中,数据标注站在字符的维度进行标注,如果使用Bert处理数据,会因Bert分词的原因导致标注数据出现偏差,故本文在字符标注的基础之上,先对文本进行bert分词,然后通过标注映射,得到了一份适合Bert使用的数据标注,见 data_label_bert.json。标注后数据格式如下:
[
{
"data":"罗 英 武 先 生 : 1969 年 出 生, 中 国 国 籍, 无 境 外 永 久 居 留 权, 浙 江 大 学 化 学 工 程 与 技 术 博 士 。 2013 年 至 今 担 任 浙 江 大 学 化 学 工 程 与 生 物 工 程 学 院 教 授 、 博 士 生 导 师",
"label":"[1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 21, 20, 20, 20, 25, 24, 24, 24, 24, 24, 24, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1]"
},
...
]
Bert数据采用的标注方式为BIO标注法,先对文本进行Bert分词,然后将分词后的数据与原数据进行比对。如果分词后的token只对应原始数据的一个字符,则使用原字符的标签类别。如果分词后的token对应原始字符的多个类别,则使用具有高代表性的类别,例如BIII,则标注为B,IIIO则标注为I。依据实体类别分类,Bert数据集的类别共有78个标签类别,其中38个实体类别分别对应38*2=76个标签类别,剩余两个标签类别分别用于非实体类标签O和填充性标签0。标签类别见 label_schema.json。文件中只标记了对应实体的B标签数值,实体类别的I标签数值为B-1,例如 "学校-EMBA":3 代表实体类别 “学校-EMBA” 的B类别标签为3,即 “学校-EMBA-B”:3,其对应的I类别标签为2,即 “学校-EMBA-I”:2。