如何用GNU Parallel结合sed/awk批量为CSV新增filename列并压缩
sed 报错原因及解决方法
报错核心原因
- 变量未展开:你用单引号包裹了sed的第二个表达式,单引号内的shell变量
${fname}不会被解析,会直接作为字符串写入文件。 - 分隔符冲突:你的文件路径包含
/字符,和sed默认的替换分隔符/冲突,导致sed解析表达式出错。 - 多余转义错误:单引号内不需要对
$加反斜杠转义,多余的转义符会被sed识别为无效命令的一部分,直接抛出语法错误。
sed 正确单文件测试写法
GNU sed环境下的测试命令:
fname="./1929/csv_filename_1.csv" && \ sed -E \ -e '1s/$/,filename/' \ -e "2,\$s#\$#,$fname#" "$fname" > "$fname.tmp" && mv "$fname.tmp" "$fname"
要点说明:
- 把需要变量展开的表达式用双引号包裹,让shell可以正确解析
$fname变量 - 替换分隔符换成
#,避免和路径里的/冲突 - 用临时文件中转输出,避免直接读取修改同一个文件导致内容损坏
整合 GNU Parallel + sed + gzip 批量执行命令
建议先进入dataset目录执行,生成的路径就是你需要的相对路径格式:
cd ~/dataset && find . -iname "*.csv" -print0 | parallel -0 -j0 ' sed -E \ -e "1s/\$/,filename/" \ -e "2,\$s#\$#,{}#" {} | gzip > {}.gz && rm -f {} '
执行完成后每个原CSV会被处理后压缩为xxx.csv.gz格式,相对路径会正确写入filename列。
更稳妥的awk版本批量命令
如果你的CSV存在转义逗号、带引号等复杂格式,awk比sed适配性更好,完整批量命令如下:
cd ~/dataset && find . -iname "*.csv" -print0 | parallel -0 -j0 ' awk -v fname="{}" -F"," '\'' FNR == 1 {print $0",filename"} FNR > 1 {print $0","fname} '\'' {} | gzip > {}.gz && rm -f {} '
内容的提问来源于stack exchange,提问作者paulochf
相关产品推荐
相关产品推荐

