使用str_count统计间隔1-30词的目标词组出现次数遇问题求助
问题解决方法
- 核心问题:正则表达式的优先级错误,
|(或运算符)的优先级远低于括号和其他匹配符号,导致原正则没有正确限定「起始关键词」和「目标关键词」的范围,{1,30}只作用在部分分支上,修改数值自然不会有变化。
原正则的实际匹配逻辑被拆成了4个独立分支:
\buncertaintyunclear(?:\W+\w+){1,30} ?\W+globaldecrease in demandfall in demand\b
完全偏离了你原本要统计「uncertainty/unclear」和「global/decrease in demand/fall in demand」间隔1-30个词的需求。
- 修正后的正则:
需要把起始关键词组和目标关键词组分别用括号包裹,明确匹配范围,同时修正R中转义符的写法:
str_count(texttw, "\\b(uncertainty|unclear)(?:\\W+\\w+){1,30}\\W+(global|decrease in demand|fall in demand)\\b")
关键修正点:
- 用
(uncertainty|unclear)把起始关键词括起来,确保{1,30}的间隔规则作用在起始关键词之后 - 用
(global|decrease in demand|fall in demand)把目标关键词括起来,明确只有起始词后间隔1-30个词出现这些目标词时才会被统计 - R中字符串里的
\b需要写成\\b,否则会被当成退格符解析(原代码的\b本身就是错误写法) - 去掉多余的
?,避免匹配间隔词时出现无意义的可选空格
- 用
额外说明:如果需要支持双向匹配(目标词出现在起始词之前,间隔1-30个词),可以调整正则为:
str_count(texttw, "\\b(?:(uncertainty|unclear)(?:\\W+\\w+){1,30}\\W+(global|decrease in demand|fall in demand)|(global|decrease in demand|fall in demand)(?:\\W+\\w+){1,30}\\W+(uncertainty|unclear))\\b")
内容的提问来源于stack exchange,提问作者Mohsin
相关产品推荐
相关产品推荐

