You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Python中提取变量内波斯语文本(禁用正则表达式)

提取混合字符串中的波斯语文本(非正则实现)

你之前逐个替换英文字母的方法根本不现实——毕竟要处理的非波斯语字符可能五花八门,没法全部枚举替换。正确的思路是利用波斯语字符的Unicode范围来筛选,直接保留符合条件的字符。

波斯语使用的字符(字母、数字、常用标点)基本都集中在Unicode的U+0600到U+06FF区间内,我们可以遍历字符串的每个字符,只保留落在这个区间里的内容:

test = "Hello World سلام دنیا"
# 筛选并拼接波斯语字符
persian_content = ''.join(char for char in test if '\u0600' <= char <= '\u06FF')
print(persian_content)  # 输出:سلام دنیا

这个方法不需要关心混入的其他语言是什么,不管是英文、中文还是其他语言,只要字符不在波斯语的Unicode区间内就会被过滤掉,完美解决你说的“文本内容随机、单词数量不确定”的问题。

内容的提问来源于stack exchange,提问作者Mahyar Mortezaei

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.02 22:35:31