You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何为DataFrame每行生成动态命名的Top20分位数列头列表

解决DataFrame每行前20百分位列标题提取与存储问题

核心方案:用字典替代动态变量名

别费劲生成top_2017、top_2018这类独立变量——Python里不推荐动态创建变量,用字典统一存储才是更规范、易维护的做法。字典的键可以设为"top_2017"这类字符串,对应值就是该行前20百分位的列标题列表。

具体代码实现

假设你的DataFrame名为df,行索引是年份(如2017、2018),或你有自定义的行标识:

1. 计算每行的前20%阈值

这里默认取值最大的前20%,所以需要计算每行的80百分位(大于等于该值的即为前20%):

# 按行计算80百分位阈值
row_quantiles = df.quantile(q=0.8, axis=1)

2. 循环提取并存储结果

# 初始化存储结果的字典
top_col_dict = {}

# 遍历DataFrame的每一行
for idx, row in df.iterrows():
    # 获取当前行的前20%阈值
    threshold = row_quantiles[idx]
    # 筛选值大于等于阈值的列,提取列标题转成列表
    top_cols = row[row >= threshold].index.tolist()
    # 生成字典键(如"top_2017")并存储结果
    key_name = f"top_{idx}"
    top_col_dict[key_name] = top_cols

3. 访问结果

后续可通过字典键直接获取对应行的列标题列表:

# 查看2017年对应的前20百分位列标题
print(top_col_dict["top_2017"])

为什么不推荐动态变量名?

  • 动态创建变量(比如用exec或globals())会导致命名混乱,代码可读性差
  • 字典能统一管理所有结果,方便遍历、修改和维护
  • 避免变量名冲突的潜在风险

内容的提问来源于stack exchange,提问作者lorenzo panetta

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.29 06:29:55