Spark SQL中能否使用Locate函数通过正则表达式定位字符位置的技术咨询
解决Spark SQL中用正则匹配字符位置的问题
嘿,这个问题我之前也踩过坑!先直接给结论:locate函数没法实现正则匹配的字符位置查找,你得用regexp_instr才行。
为什么你的locate调用返回0?
locate(substr, str)的第一个参数是固定子串,不是正则表达式。你写的locate([a-z], 'SM_12456_abc'),Spark会把[a-z]当成一个字面量字符串去搜索——而你的目标字符串里根本没有[a-z]这个子串,所以自然返回0啦。
正确的解决方案:regexp_instr函数
Spark SQL提供了regexp_instr函数,专门用来定位正则表达式匹配的字符位置。针对你的场景,正确的查询语句应该是:
select regexp_instr('SM_12456_abc', '[a-z]') as lower_case_presence
执行这个语句就会返回你期望的10,也就是第一个小写字母a的位置。
额外小技巧:regexp_instr的进阶用法
这个函数还有几个可选参数,能满足更多场景:
- 第三个参数:指定从字符串的第几个位置开始搜索(默认是1)
- 第四个参数:指定匹配第几次出现的结果(默认是1,也就是第一个匹配项)
- 第五个参数:指定返回匹配的起始位置(0)还是结束位置(1,默认是0)
举个例子,如果你想找第二个小写字母的位置,可以这么写:
select regexp_instr('SM_12456_abc', '[a-z]', 1, 2) as second_lower_case_pos
返回结果会是11,对应字母b的位置。
内容的提问来源于stack exchange,提问作者Ajay Patil
相关产品推荐
相关产品推荐

