Impala如何筛选仅含数字和特殊字符的行并统计缺失值
解决Impala中筛选非字母行并统计缺失值的问题
问题原因
你原SQL里用的LIKE '%[a-zA-Z]%'在Impala中不生效——Impala的LIKE语法不支持[a-zA-Z]这类正则字符范围匹配,只有部分数据库(比如SQL Server)支持该写法。这导致你的WHERE条件根本没过滤掉含字母的行,结果自然不符合预期。
正确SQL写法
Impala支持REGEXP_LIKE函数做正则匹配,用它来判断字段是否包含字母,取反后就能筛选出仅含数字、特殊字符或两者组合的行,再分组统计次数:
SELECT firstname, COUNT(*) AS occurrence_count FROM dataset WHERE NOT REGEXP_LIKE(firstname, '[a-zA-Z]') GROUP BY firstname ORDER BY occurrence_count DESC;
说明
REGEXP_LIKE(firstname, '[a-zA-Z]'):检测firstname是否包含任意大小写字母,返回TRUE代表包含。- 加
NOT取反后,仅保留不含字母的目标行。 - 最后按
firstname分组统计,ORDER BY可以让结果按出现次数从多到少排列,方便查看高频缺失值。
可选优化
如果只想统计你提到的-1、*、--、#####这类特定缺失值,可额外加筛选条件:
SELECT firstname, COUNT(*) AS occurrence_count FROM dataset WHERE NOT REGEXP_LIKE(firstname, '[a-zA-Z]') AND firstname IN ('-1', '*', '--', '#####') GROUP BY firstname ORDER BY occurrence_count DESC;
内容的提问来源于stack exchange,提问作者mushroom_grl
相关产品推荐
相关产品推荐

