使用Stanford CoreNLP v3.9.1做NER标注时遇TokensRegexNER读取异常
这个问题我之前帮人排查过,本质是你加载的english.muc.7class.distsim.crf.ser.gz模型默认依赖了KBP的TokensRegexNER配置文件,但要么你的模型包缺了这个文件,要么初始化配置没处理好。给你几个靠谱的解决办法:
检查模型包完整性与版本匹配
首先确认你下载的KBP模型包是和CoreNLP v3.9.1完全对应的版本,不同版本的模型资源路径或内容可能有差异。打开KBP模型jar包,看看里面是否存在edu/stanford/nlp/models/kbp/regexner_caseless.tab这个文件。如果没有,重新下载对应版本的KBP模型包,别混用其他版本的资源。关闭不必要的TokensRegexNER功能
如果你不需要TokensRegexNER的额外标注能力,可以在初始化CoreNLP管道时直接关闭它,避免加载这个缺失的文件。示例代码如下:Properties props = new Properties(); props.setProperty("annotators", "tokenize,ssplit,pos,lemma,ner"); // 关闭TokensRegexNER相关功能 props.setProperty("ner.useRegexner", "false"); props.setProperty("ner.applyNumericClassifiers", "false"); props.setProperty("ner.useSUTime", "false"); StanfordCoreNLP pipeline = new StanfordCoreNLP(props);指定正确的配置文件路径
如果你确实需要用到TokensRegexNER,那就手动指定这个tab文件的路径。如果文件在你的项目resources目录下,或者模型jar包已经包含它,可以直接配置:props.setProperty("ner.regexner.mapping", "edu/stanford/nlp/models/kbp/regexner_caseless.tab");如果是本地文件路径,就写绝对路径或者相对项目的路径,比如
file:/path/to/your/regexner_caseless.tab。手动添加缺失的配置文件
如果模型包里确实没有这个文件,可以从CoreNLP v3.9.1的官方资源仓库中找到对应的regexner_caseless.tab文件,然后放到你的项目resources目录下的edu/stanford/nlp/models/kbp/路径中,确保程序能通过类路径找到它。
内容的提问来源于stack exchange,提问作者kolam

