如何从TensorFlow Datasets的xtreme_pos数据集中获取UPOS标签的整数与词性映射关系?
如何从TensorFlow Datasets的xtreme_pos数据集中获取UPOS标签的整数与词性映射关系?
嗨,这个问题我之前也碰到过,其实完全不用手动折腾映射表——TensorFlow Datasets在返回的ds_info里已经自带了这个对应关系啦!
你只需要从ds_info的特征元数据里提取就行,具体步骤很简单:
- 从加载数据集时拿到的
ds_info里,定位到POS标签对应的特征信息; - 这个特征对象的
class_names属性,就是按整数标签顺序排列的UPOS词性列表,把它转成字典就能直接得到「整数→词性」的映射。
给你写个现成的代码片段,接在你现有的加载代码后面就行:
# 从ds_info中提取POS标签的特征元数据 pos_feature = ds_info.features['pos_tags'] # 生成整数标签到UPOS词性的映射字典 pos_label_map = {idx: tag for idx, tag in enumerate(pos_feature.class_names)} # 可以打印出来验证一下结果 print(pos_label_map)
要是你不确定特征字段名,也可以先打印ds_info.features看看所有特征的结构,xtreme_pos数据集里这个字段就是pos_tags,不会错的。
这样你就能直接用数据集自带的标准映射,不用自己手动对应啦~
备注:内容来源于stack exchange,提问作者RodP
相关产品推荐
相关产品推荐

