执行df.apply(pd.Series)触发FutureWarning的原理与解决方案
触发警告的代码:
rc = dataset_ex[column_name].apply(p.Series)对应警告内容:
FutureWarning: The default dtype for empty Series will be 'object' instead of 'float64' in a future version. Specify a dtype explicitly to silence this warning.
一、消除该警告的具体方案
警告触发的核心原因是:待处理的列中存在空值、空列表/空字典类的空元素,逐行构造Series时没有显式指定数据类型,pandas未来会调整空Series的默认dtype,因此弹出提示。可以根据自己的场景选下面任意一种方案解决:
- 显式指定Series构造的dtype参数:直接在构造Series时明确数据类型,从根源避免pandas做默认类型推断。如果拆分出的内容是数值可以指定
float64/int64,如果是混合类型、字符串可以指定object,示例代码:# 假设p是pandas的导入别名,按你自己的导入情况调整 rc = dataset_ex[column_name].apply(lambda x: p.Series(x, dtype='object')) - 换用性能更好的专用API替代
apply(p.Series):90%以上场景用这个写法的目的是把列中存储的列表、字典拆成多列,完全可以用pandas原生的专用方法实现,不会触发类型警告,运行速度还能提升数倍:- 如果列中存储的是字典结构:用
p.json_normalize(dataset_ex[column_name])直接完成结构化拆列 - 如果列中存储的是等长列表:用
p.DataFrame(dataset_ex[column_name].tolist(), index=dataset_ex.index)直接构造目标DataFrame
- 如果列中存储的是字典结构:用
- 局部屏蔽警告:如果确认dtype变更不会影响后续业务逻辑,也不想修改原有实现,可以用warnings模块在代码块范围内临时屏蔽该类警告:
import warnings with warnings.catch_warnings(): warnings.simplefilter(action='ignore', category=FutureWarning) rc = dataset_ex[column_name].apply(p.Series)
二、apply(p.Series)的底层运行逻辑
这个写法本质是逐行转换+按索引拼接的流程,没有特殊黑魔法,具体步骤如下:
- 逐行遍历调用apply的原Series(也就是你代码里的
dataset_ex[column_name])的每一个元素,把当前元素作为入参传入p.Series()构造函数,为每一行生成一个独立的Series对象:- 如果当前行元素是列表,比如
[10,20,30],会生成索引为[0,1,2]、值为[10,20,30]的Series - 如果当前行元素是字典,比如
{'pay':100, 'refund':20},会生成索引为['pay','refund']、值为[100,20]的Series - 如果当前行元素是空列表、空字典、None这类空内容,会生成一个没有任何元素的空Series,这时候就会触发你看到的FutureWarning
- 如果当前行元素是列表,比如
- 所有行都转换完成后,pandas会对所有生成的单条Series做全外连接式的索引对齐:所有单条Series中出现过的索引值,都会成为最终返回结果的列名;每个原行对应的值,会填入结果中对应行、对应索引列的位置,索引匹配不上的位置自动填充NaN。
- 对齐拼接完成后,返回一个行索引和原Series完全一致的DataFrame,就是你拿到的rc变量。
*注:因为这个流程是纯Python层逐行循环构造对象,没有走pandas的向量化优化,数据量超过1万行之后运行速度会明显变慢,非必要不推荐使用。
内容的提问来源于stack exchange,提问作者IOzc
相关产品推荐
相关产品推荐

