如何按非字母字符拆分字符串以提取纯字母单词?
按非字母字符拆分字符串提取纯字母单词
最直接的方法是使用正则表达式匹配所有纯字母组成的片段,Python里可以用re模块的findall函数实现:
- 核心思路:用正则规则匹配一个或多个连续的大小写字母,自动跳过所有非字母字符。
代码示例:
import re s = "(This# is an5example!)" what_i_want = re.findall(r'[a-zA-Z]+', s) print(what_i_want)
运行后输出结果就是:['This', 'is', 'an', 'example']
如果需要支持其他语言的Unicode字母(比如带重音的欧洲语言字母、中文等),可以改用\p{L}规则匹配所有Unicode字母,代码如下:
import re s = "Café# 中文test123!" what_i_want = re.findall(r'\p{L}+', s) print(what_i_want) # 输出: ['Café', '中文', 'test']
内容的提问来源于stack exchange,提问作者user19273
相关产品推荐
相关产品推荐

