You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在Pandas中按列名批量选列(类似R dplyr::select高效语法)

解决Pandas中类似dplyr风格的列范围选择/排除问题

嘿,我太懂你这种痛点了——当要处理上百列数据时,一个个列名敲drop效率低到爆炸,而Pandas默认的语法又不像dplyr那样支持直观的范围选择。下面给你几个实用的方法,完美替代R里select(df, age:color, score:state)或者select(df, -(food:height))的操作:

方法1:纯Pandas原生实现(无需额外库)

利用列名的索引位置来构建范围,核心是用columns.get_loc()拿到列的位置,再做切片:

选择指定列范围(age到color + score到state)

# 获取所有列名的索引对象
cols = df.columns

# 拿到"age"到"color"的列范围(注意切片左闭右开,所以要+1包含color)
range1 = cols[cols.get_loc("age") : cols.get_loc("color") + 1]
# 拿到"score"到"state"的列范围
range2 = cols[cols.get_loc("score") : cols.get_loc("state") + 1]

# 合并两个范围并选择列
df_selected = df[list(range1) + list(range2)]

排除指定列范围(food到height)

对应R里的-(food:height),我们可以先拿到要排除的列范围,再用drop或者反向选择:

# 拿到要排除的列范围
cols_to_exclude = cols[cols.get_loc("food") : cols.get_loc("height") + 1]

# 方法A:用drop排除
df_excluded = df.drop(columns=cols_to_exclude)

# 方法B:用反向索引选择
df_excluded = df.loc[:, ~df.columns.isin(cols_to_exclude)]

方法2:用第三方库模仿dplyr语法(最贴近你的需求)

如果想完全复刻dplyr的简洁写法,可以用dfply库,它专门做Pandas的dplyr风格操作:

安装库

pip install dfply

选择列范围(和R几乎一模一样)

from dfply import select, X

# 直接用类似dplyr的语法选择列
df_selected = df >> select(X.age:X.color, X.score:X.state)

排除列范围

from dfply import select, everything

# 排除food到height的列,剩下的都选
df_excluded = df >> select(everything(), -(X.food:X.height))

小提示

  • 这些方法都依赖列在DataFrame中的顺序,如果列的顺序被打乱,范围选择就会出错,所以确保列的顺序是你预期的哦。
  • 如果经常需要这种操作,把范围选择封装成一个小函数会更方便,比如:
def select_col_ranges(df, *ranges):
    cols = df.columns
    selected_cols = []
    for start, end in ranges:
        selected_cols.extend(cols[cols.get_loc(start):cols.get_loc(end)+1])
    return df[selected_cols]

# 调用示例
df_selected = select_col_ranges(df, ("age", "color"), ("score", "state"))

内容的提问来源于stack exchange,提问作者ytu

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.15 08:44:15