使用pandas.read_csv decimal参数时单列小数未正常转换的问题
问题原因及解决思路
核心原因
这列没能自动转换为float且手动转换报错,本质是该列存在不符合decimal=','规则的异常内容,导致pandas读取时无法识别为数值类型,只能保留为字符串(object);直接用astype(float)转换时,这些带异常的字符串无法被解析为浮点数。
常见的异常情况包括:
- 部分行存在隐藏字符(比如空格、制表符),比如值是
' 979,5 '而非纯'979,5' - 存在非数值字符串(比如
'n/a'、'-'、空字符串) - 列名存在不可见字符或格式差异,导致你操作的列并非实际目标列(比如列名是
'Luftdruck (hPa)'带两个空格,而非你写的单个空格)
排查与解决步骤
先确认列的真实状态
执行以下代码查看关键信息:# 查看列数据类型 print(self.imported_csv['Luftdruck (hPa)'].dtype) # 查看列的唯一值,定位异常内容 print(self.imported_csv['Luftdruck (hPa)'].unique()) # 核对列名是否完全匹配 print(self.imported_csv.columns.tolist())针对异常内容的处理
如果发现有空格、非数值字符,先清理再转换:# 去除字符串前后空格 self.imported_csv['Luftdruck (hPa)'] = self.imported_csv['Luftdruck (hPa)'].str.strip() # 替换非数字+逗号的内容为NaN self.imported_csv['Luftdruck (hPa)'] = self.imported_csv['Luftdruck (hPa)'].replace(r'[^0-9,]', pd.NA, regex=True) # 用pd.to_numeric指定decimal参数转换,异常值转为NaN self.imported_csv['Luftdruck (hPa)'] = pd.to_numeric(self.imported_csv['Luftdruck (hPa)'], decimal=',', errors='coerce')如果是千位分隔符问题
若该列存在欧洲格式的千位分隔符(比如'1.234,5'),需在读取时额外指定thousands='.'参数:self.imported_csv = pd.read_csv( full_path, encoding='utf_16_le', sep=';', on_bad_lines='warn', decimal=',', thousands='.' )
内容的提问来源于stack exchange,提问作者Stefan Bongers
相关产品推荐
相关产品推荐

