You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用quanteda的tokens_compound合并多词表达式不生效如何解决

quanteda tokens_compound 多词合并失效解决方案

失效原因

你调用时没有指定匹配模式和大小写匹配规则,导致短语无法被精准识别。

正确调用代码

library(quanteda)

multiword <- c('Mohammed Fisher', 'M Fisher')
comp_toks <- tokens_compound(
  x = tokens, # 替换为你自己的原始tokens对象
  pattern = phrase(multiword),
  valuetype = "fixed",
  case_insensitive = FALSE
)

参数说明

  • valuetype = "fixed":指定使用精确字符串匹配模式,避免默认glob模式把短语里的特殊字符解析为通配符,匹配你定义的短语内容更精准
  • case_insensitive = FALSE:关闭大小写不敏感匹配,严格按照你给定短语的大小写匹配,避免误匹配其他大小写组合的内容

运行上述代码后即可得到你预期的输出效果。

内容的提问来源于stack exchange,提问作者ab0rt

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.02 21:54:03