You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用pandas read_csv时keep_default_na=False致数据类型变更的解决方法

解决方法

要同时保留colC的'NA'实际值,又让colB保持数值类型,关键是让pandas只把空白单元格识别为缺失值,而不把'NA'当成缺失值,具体可以通过组合keep_default_na和na_values参数实现:

方法1:基础实现(colB为浮点类型)

直接指定空白字符串为缺失值,禁用默认的缺失值识别规则:

import pandas as pd

DF = pd.read_csv(
    'your_csv_file.csv',
    keep_default_na=False,
    na_values=['']
)

处理后效果:

  • colC中的'NA'会被保留为字符串类型,不会被转成NaN
  • colB中的空白单元格会被识别为NaN,数值10、25会被识别为浮点型(因存在NaN,pandas默认用浮点存储)

方法2:让colB为可空整数类型

如果需要colB保持整数类型(允许存在缺失值),可以指定dtype参数使用pandas的可空整数类型Int64:

import pandas as pd

DF = pd.read_csv(
    'your_csv_file.csv',
    keep_default_na=False,
    na_values=[''],
    dtype={'colB': 'Int64'}
)

此时colB的类型为Int64,空白单元格显示为<NA>,数值保持整数类型,colC的'NA'依旧保留为字符串。

原理说明

  • keep_default_na=False:禁用pandas默认将'NA'、'N/A'等字符串识别为缺失值的规则,确保colC的'NA'被当作实际数据
  • na_values=['']:单独指定空白单元格为缺失值,避免colB中空白与数值混合导致列类型变为字符串

内容的提问来源于stack exchange,提问作者Jack_coder345

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.24 18:17:07