R语言处理PDF文本:仅替换连续多空格为指定字符、保留单个空格
解决方案
你只需要调整正则匹配规则,仅匹配连续出现2次及以上的空白字符即可,不会影响单词之间的单个空格,R语言实现代码如下:
# 匹配连续2个及以上的空白字符,替换为下划线 result <- gsub("\\s{2,}", "_", str_trim(PDF))
规则说明
- 正则表达式中
{2,}表示匹配前面的规则至少2次,\\s{2,}只会命中连续2个及以上的空白(包含空格、制表符等),完美符合你的需求 - 如果你只想匹配纯空格(排除制表符、换行等其他空白符),可以修改规则为:
gsub(" {2,}", "_", str_trim(PDF))
运行上述代码后,输出结果和你期望的效果完全一致:
"[1]This is the first address_This is the second one [2]This is the third one_ [3]This is the fourth one_This is the fifth"
内容的提问来源于stack exchange,提问作者BillyBouw
相关产品推荐
相关产品推荐

