使用quanteda的tokens_compound合并多词表达式不生效如何解决
quanteda tokens_compound 多词合并失效解决方案
失效原因
你调用时没有指定匹配模式和大小写匹配规则,导致短语无法被精准识别。
正确调用代码
library(quanteda) multiword <- c('Mohammed Fisher', 'M Fisher') comp_toks <- tokens_compound( x = tokens, # 替换为你自己的原始tokens对象 pattern = phrase(multiword), valuetype = "fixed", case_insensitive = FALSE )
参数说明
valuetype = "fixed":指定使用精确字符串匹配模式,避免默认glob模式把短语里的特殊字符解析为通配符,匹配你定义的短语内容更精准case_insensitive = FALSE:关闭大小写不敏感匹配,严格按照你给定短语的大小写匹配,避免误匹配其他大小写组合的内容
运行上述代码后即可得到你预期的输出效果。
内容的提问来源于stack exchange,提问作者ab0rt
相关产品推荐
相关产品推荐

