求助:使用Sed处理含引号及多引号的逗号分割数据问题
我明白你遇到的头疼问题了——处理这种带嵌套双引号和内部逗号的CSV数据,旧版Awk又用不了FPAT特性,Sed瞎折腾半天也搞不定引号里的内容。这里给你两个靠谱的解决方案,都能完美输出你想要的结果:
方案一:用Awk手动追踪引号状态(兼容旧版本)
因为旧版Awk没有FPAT,我们可以自己手动遍历每个字符,追踪是否处于双引号内部,以此判断要不要把逗号替换成空格,同时还能正确处理转义的双引号(比如""格式)。
把下面的脚本保存为csv_split.awk,或者直接在命令行运行:
awk '{ in_quote = 0 len = length($0) result = "" for (i=1; i<=len; i++) { c = substr($0, i, 1) if (c == "\"") { # 检查是否是转义的双引号(连续两个") if (substr($0, i+1, 1) == "\"") { result = result c i++ # 跳过下一个",避免重复处理 } else { in_quote = !in_quote # 切换引号状态 result = result c } } else if (c == "," && !in_quote) { result = result " " # 非引号内的逗号替换为空格 } else { result = result c # 其他字符直接保留 } } print result }'
使用方法:
如果数据在文件input.txt里,直接运行:
awk -f csv_split.awk input.txt
或者直接处理单行输入:
echo '123,"john,test",John"test,""john"",345' | awk -f csv_split.awk
运行后就能得到你想要的输出:123 "john,test" John"test ""john"" 345
方案二:用Sed脚本处理
如果你更倾向于用Sed,这个复杂的Sed脚本也能实现需求——它会优先处理引号内的内容,只替换引号外的逗号:
:loop # 替换引号块后面的逗号为空格,循环直到没有可替换的 s/\("\([^"]\|""\)*"\),/\1 /g t loop # 处理末尾的引号块前面的逗号 s/^\(.*\),\("\([^"]\|""\)*"\)$/\1 \2/g # 替换剩下的非引号内的逗号为空格 s/,\([^",]*\)/ \1/g
使用方法:
处理文件或单行输入:
sed -f csv_split.sed input.txt # 或者单行直接执行 echo '123,"john,test",John"test,""john"",345' | sed -e ':loop' -e 's/\("\([^"]\|""\)*"\),/\1 /g' -e 't loop' -e 's/^\(.*\),\("\([^"]\|""\)*"\)$/\1 \2/g' -e 's/,\([^",]*\)/ \1/g'
这个脚本会先循环处理所有跟在引号块后的逗号,再处理末尾的特殊情况,最后替换剩下的普通逗号,同样能得到正确结果。
内容的提问来源于stack exchange,提问作者user2616467
相关产品推荐
相关产品推荐

