使用stringr预处理字符串:正确提取以' - '分隔的球队名称
解决球队名称提取的正则修正问题
原正则仅匹配字母、空格和连字符,遇到.、&这类球队名里的常见符号时会拆分名称,只需把这些允许的符号加入正则的字符集合即可解决:
修改后的代码:
# 将.和&加入匹配字符类,同时保留首尾为字母的规则,避免提取无效符号串 pattern <- "[[:alpha:]][[:alpha:] .&-]*[[:alpha:]]" matches <- str_extract_all(clean_text, pattern)[[1]]
补充说明:
- 字符类
[[:alpha:] .&-]新增了.和&,能完整匹配包含这类符号的球队名(比如U.S.A、Brazil & Argentina) - 首尾的
[[:alpha:]]确保提取内容以字母开头和结尾,过滤掉纯符号或空格组成的无效内容 - 如果球队名还涉及其他特殊字符(比如
',像Côte d'Ivoire),可以继续把对应字符加入字符类,例如改成[[:alpha:] .&'-]
内容的提问来源于stack exchange,提问作者cd21
相关产品推荐
相关产品推荐

