You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

按Category值拆分CSV数据集并批量赋值变量的技术需求

按Category分组提取首行赋值变量的解决方案

数据集示例

Category;Name;email;Functions;Owner_ID;Backup_ID
A;Bos;user1@mail.com;Driver;123;321
A;Bos;user1@mail.com;Driver;123;321
A;Bos;user1@mail.com;Driver;123;321
B;Nos;user2@mail.com;Builder;456;654
C;Kos;user2@mail.com;Engineer;789;987
C;Kos;user2@mail.com;Engineer;789;987
D;Los;user3@mail.com;Architect;100;1

需求说明

  • 遍历CSV文件(分隔符为分号),按Category字段进行分组
  • 每个分组仅提取首行数据,将表头与对应值拼接成变量赋值格式(如Category=A)
  • 完成当前分组的分析操作后,再处理下一个分组(Category数量不固定)

现有代码问题

原代码会逐行输出所有行的变量赋值,无法实现按分组取首行的逻辑:

for file in ${outputfolder}*.csv
do  
    awk -F';' 'FNR==1{split($0, a); next}{for (i=1;i<=NF;i++)print a[i] "=" $i; print ""}' $file
done

修改后的代码实现

调整后的脚本会按Category分组,仅输出每个分组首行的变量赋值,同时保留多文件遍历逻辑:

for file in "${outputfolder}"*.csv
do  
    awk -F';' '
        FNR == 1 {
            split($0, headers, ";")  # 读取表头到headers数组
            next
        }
        !seen[$1]++ {  # 仅处理每个Category的首行
            for (i=1; i<=NF; i++) {
                print headers[i] "=" $i
            }
            print ""  # 分组间空行分隔
            # 在这里添加当前分组的自定义分析操作代码
        }
    ' "$file"
done

代码逻辑说明

  1. 读取表头:处理文件第一行时,将表头拆分到headers数组,用于后续拼接变量名
  2. 分组去重:用seen[$1]数组记录已处理的Category($1对应Category字段),!seen[$1]++确保仅处理每个分组的第一行
  3. 变量赋值输出:遍历当前行所有字段,拼接表头与对应值,输出变量赋值格式
  4. 扩展分析:在注释标记位置,可添加针对当前分组的自定义分析代码(比如统计分组行数、写入结果文件等)

内容的提问来源于stack exchange,提问作者Almosino

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.21 02:54:54