如何在Polars中对指定列计算行方差并保留非数值列
解决Polars计算指定列行方差并保留非目标列的问题
你可以直接利用Polars的横向行计算能力,无需复杂的join/group操作,就能精准排除col4并计算其余数值列的行方差,同时保留所有原列:
方法一:直接排除指定列
import polars as pl df = pl.DataFrame({ "col1": [1, 2, 3], "col2": [4, 5, 6], "col3": [7, 8, 9], "col4": ["a", "v", "b"], }) # 新增行方差列,排除col4 df = df.with_columns( row_variance=pl.row(pl.exclude("col4")).var() )
方法二:明确指定数值列(更严谨)
如果担心除col4外还有其他非数值列,可以同时筛选数值类型列:
df = df.with_columns( row_variance=pl.row(pl.col(pl.NUMERIC).exclude("col4")).var() )
结果说明
执行后df会保留所有原列,并新增row_variance列,其中每行的值对应col1/col2/col3的行方差:
| col1 | col2 | col3 | col4 | row_variance |
|---|---|---|---|---|
| 1 | 4 | 7 | a | 6.0 |
| 2 | 5 | 8 | v | 6.0 |
| 3 | 6 | 9 | b | 6.0 |
原方法的问题
你之前的方法会把col4的字符串值也melt到value列中,导致计算方差时触发类型错误。而上面的方法直接跳过col4,只针对目标列计算,逻辑更简洁,性能也更高。
内容的提问来源于stack exchange,提问作者klr
相关产品推荐
相关产品推荐

