在PySpark中计算数据集所有行列的总空值数量
计算数据集总空值数量的方法
Python(Pandas)
用Pandas可以快速统计总空值数:
- 读取数据集(以CSV为例):
import pandas as pd df = pd.read_csv("your_dataset.csv")
- 计算总空值:
total_nulls = df.isnull().sum().sum()
df.isnull()生成布尔矩阵标记每个空值单元格,第一个.sum()统计每列的空值数,第二个.sum()将所有列的结果累加,最终total_nulls就是整数类型的总空值数量。
R语言
基础R实现
df <- read.csv("your_dataset.csv") total_nulls <- sum(is.na(df))
is.na(df)生成标记空值的布尔矩阵,sum()直接统计所有空值的总数,结果为整数。
tidyverse实现
library(tidyverse) df <- read_csv("your_dataset.csv") total_nulls <- df %>% summarize(across(everything(), ~sum(is.na(.x)))) %>% sum()
先按列统计空值数,再对列结果求和得到总空值数量。
内容的提问来源于stack exchange,提问作者priston
相关产品推荐
相关产品推荐

