You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Julia中如何基于DataFrame列值生成字符串列表列与计数列

Julia实现方案

你可以直接使用DataFrames.jl的原生操作完成需求,无需额外依赖第三方包,实现逻辑简洁且执行效率高。

实现步骤

  1. 首先导入DataFrames包(首次使用需先执行安装命令):

    # 安装命令,已安装可注释
    # using Pkg; Pkg.add("DataFrames")
    using DataFrames
    
  2. 构造示例源数据(可替换为实际业务数据):

    df = DataFrame(
        Text = ["string1", "string2", "string3"],
        feat1 = [1, 0, 0],
        feat2 = [1, 0, 0],
        feat3 = [0, 0, 0],
        feat4 = [0, 1, 0]
    )
    
  3. 执行新增列逻辑:

    # 正则匹配所有feat开头的特征列名,后续新增特征列无需修改此处逻辑
    feat_cols = names(df, r"^feat")
    # 逐行收集值为1的特征列名,生成all_feat列
    df.all_feat = [collect(feat_cols[Bool.(row)]) for row in eachrow(df[:, feat_cols])]
    # 直接基于all_feat列计算长度,避免重复遍历判断,性能更优
    df.count_feat = length.(df.all_feat)
    

效果验证

执行上述代码后得到的DataFrame完全匹配目标效果:

3×6 DataFrame
 Row │ Text     feat1  feat2  feat3  feat4           all_feat            count_feat 
     │ String   Int64  Int64  Int64  Int64           Array…              Int64
─────┼──────────────────────────────────────────────────────────────────────────────
   1 │ string1      1      1      0      0  ["feat1", "feat2"]           2
   2 │ string2      0      0      0      1  ["feat4"]                    1
   3 │ string3      0      0      0      0  String[]                     0

补充说明

  • 如果特征列不是统一以feat开头,可以手动指定特征列列表,例如feat_cols = ["feat1", "feat2", "feat3", "feat4"]即可。
  • 如果特征列的取值是布尔值而非0/1整数,直接去掉代码里的Bool.()转换即可正常运行。

内容的提问来源于stack exchange,提问作者merchmallow

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.26 23:36:35