初始化Spacy PhraseMatcher时触发长度限制ValueError问题求助
解决PhraseMatcher初始化时的Pattern长度超限错误
嘿,这个问题我之前处理过,其实就是PhraseMatcher的长度限制在搞鬼!
为啥会报错?
你看到的ValueError: Pattern length (11) >= phrase_matcher.max_length (10),意思是你的术语列表里有个短语被spaCy解析成了11个token,但PhraseMatcher默认只支持最长10个token的短语——超过这个长度就会触发这个报错。
怎么解决?
很简单,初始化PhraseMatcher的时候,显式把max_length参数设得比你最长的短语token数大就行。比如你的最长短语是11个token,那把参数设成11就ok了,修改后的代码如下:
patterns = [nlp(org) for org in fields] # 这里把max_length设为11,适配你最长的术语 self.matcher = PhraseMatcher(nlp.vocab, max_length=11) self.matcher.add('FIELD', None, *patterns)
更灵活的写法
如果怕以后新增术语又超过长度,还可以动态计算最长短语的token数,再设置max_length,这样就不用每次手动改数值了:
patterns = [nlp(org) for org in fields] # 找出所有术语里最长的token长度 max_token_count = max(len(pattern) for pattern in patterns) # 动态设置max_length self.matcher = PhraseMatcher(nlp.vocab, max_length=max_token_count) self.matcher.add('FIELD', None, *patterns)
这样不管以后加多长的术语,都能自动适配啦~
内容的提问来源于stack exchange,提问作者Atti
相关产品推荐
相关产品推荐

