You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

PySpark:如何对df.summary()的指定列执行取整操作?

解决方法

针对你遇到的问题,这里提供两种简洁的实现方式,既能对Summary列以外的数值列执行取整操作,又能完整保留Summary列的原始分类值:

方法1:使用assign方法(不修改原DataFrame)

通过字典推导式生成需要取整的列及其处理结果,再用assign方法合并回原DataFrame,不会影响Summary列:

# 这里以保留2位小数为例,可根据需求调整round的参数
df_rounded = df.assign(**{col: df[col].round(2) for col in df.columns[1:]})

方法2:使用loc切片修改(支持原地或复制修改)

如果需要原地修改原DataFrame,或者先复制再修改避免影响原数据:

# 先复制原DataFrame,避免修改原始数据
df_rounded = df.copy()
# 选中除Summary外的所有列,执行取整操作
df_rounded.loc[:, df.columns[1:]] = df_rounded.loc[:, df.columns[1:]].round(2)

为什么之前的方法会出问题?

  • 使用select加列表推导式时,若只选择了columns[1:]的列却未重新合并Summary列,就会丢失该列;如果错误地对Summary列执行数值处理,会导致分类值转为NULL。
  • 直接切片df.columns[1:]赋值时,若没有保留原DataFrame的完整结构,而是直接生成子DataFrame,自然会丢失Summary列。

内容的提问来源于stack exchange,提问作者Neptunas

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.03 20:58:15