Julia中如何基于DataFrame列值生成字符串列表列与计数列
Julia实现方案
你可以直接使用DataFrames.jl的原生操作完成需求,无需额外依赖第三方包,实现逻辑简洁且执行效率高。
实现步骤
首先导入DataFrames包(首次使用需先执行安装命令):
# 安装命令,已安装可注释 # using Pkg; Pkg.add("DataFrames") using DataFrames构造示例源数据(可替换为实际业务数据):
df = DataFrame( Text = ["string1", "string2", "string3"], feat1 = [1, 0, 0], feat2 = [1, 0, 0], feat3 = [0, 0, 0], feat4 = [0, 1, 0] )执行新增列逻辑:
# 正则匹配所有feat开头的特征列名,后续新增特征列无需修改此处逻辑 feat_cols = names(df, r"^feat") # 逐行收集值为1的特征列名,生成all_feat列 df.all_feat = [collect(feat_cols[Bool.(row)]) for row in eachrow(df[:, feat_cols])] # 直接基于all_feat列计算长度,避免重复遍历判断,性能更优 df.count_feat = length.(df.all_feat)
效果验证
执行上述代码后得到的DataFrame完全匹配目标效果:
3×6 DataFrame Row │ Text feat1 feat2 feat3 feat4 all_feat count_feat │ String Int64 Int64 Int64 Int64 Array… Int64 ─────┼────────────────────────────────────────────────────────────────────────────── 1 │ string1 1 1 0 0 ["feat1", "feat2"] 2 2 │ string2 0 0 0 1 ["feat4"] 1 3 │ string3 0 0 0 0 String[] 0
补充说明
- 如果特征列不是统一以
feat开头,可以手动指定特征列列表,例如feat_cols = ["feat1", "feat2", "feat3", "feat4"]即可。 - 如果特征列的取值是布尔值而非0/1整数,直接去掉代码里的
Bool.()转换即可正常运行。
内容的提问来源于stack exchange,提问作者merchmallow
相关产品推荐
相关产品推荐

