如何获取Stanford NLP的english-left3words-distsim.tagger训练文件?
获取Stanford NLP english-left3words-distsim.tagger训练文件的方法
直接从CoreNLP模型包提取
你列出的所有训练标注文件,都包含在对应版本的CoreNLP英文模型压缩包里。下载4.1.1版本的英文模型包后,解压即可找到路径english-left3words-distsim-4.1.1-v5/data/,里面就有你需要的wsj-train.tagged.txt、ewt-train.tagged.txt等所有文件。
训练数据的公开语料库来源
如果不想下载完整模型包,部分训练数据可从对应公开语料库获取:
wsj-train.tagged.txt:来自Penn Treebank的WSJ子语料库,需通过语言数据联盟(LDC)获取授权后下载ewt-train.tagged.txt:对应Universal Dependencies的English Web Treebank语料ontonotes-train.tagged.txt:来自OntoNotes语料库,同样需通过LDC获取craft-train.tagged.txt:可从CRAFT语料库的官方公开渠道获取english-handparsed-train.tagged.txt:来自Penn Treebank的手动解析语料部分questionbank-train.taggedtxt:对应QuestionBank语料库
训练自定义标注器的实用提示
如果你的目标是复现english-left3words-distsim.tagger的训练流程,直接使用模型包内的训练文件是最省心的方式,不需要单独去各个语料库找原始文件再处理。
内容的提问来源于stack exchange,提问作者Dave Anthony
相关产品推荐
相关产品推荐

