You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在R的sub函数中用ASCII字符匹配非ASCII短横线以通过R CMD CHECK

解决R中用ASCII字符匹配非ASCII短横线的问题

要解决这个问题,核心是用纯ASCII的正则表达式语法匹配那个非ASCII短横线(EN DASH,Unicode编码U+2013),避免R CMD CHECK的非ASCII字符警告,以下是两种可靠方法:

方法1:使用Unicode转义序列

R的正则表达式支持Unicode转义,直接用\u2013(注意在R字符串中需写成双反斜杠\\u2013),这是纯ASCII写法,不会触发警告:

sub("\\u2013", "to", x = "–")

方法2:使用UTF-8字节的ASCII表示

非ASCII的EN DASH在UTF-8编码中对应三个字节:0xe2 0x80 0x93,可以用转义的十六进制字节串匹配,同样是纯ASCII格式:

sub("\\xe2\\x80\\x93", "to", x = "–")

为什么你之前的方法无效?

stringi::stri_enc_toascii("–")的作用是将非ASCII字符转换为ASCII的替代控制字符(这里得到的\032是ASCII的SUB字符),并不是原字符的编码表示,因此无法匹配原有的EN DASH。

内容的提问来源于stack exchange,提问作者Patrik_P

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.26 03:02:05