You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用read_csv正确读取UTF-8 CSV?解决列偏移与NaN值问题

解决CSV读取列偏移、NaN值问题的方案

以下是针对你遇到的问题的具体处理步骤,覆盖常见的出错场景:

1. 处理Excel保存CSV时的BOM编码问题

即使选择了UTF-8格式,Excel保存时可能会自动添加UTF-8 BOM(字节顺序标记),导致read_csv解析异常,出现列偏移或NaN。直接指定带BOM的编码即可:

import pandas as pd
df = pd.read_csv("你的文件路径.csv", encoding="utf-8-sig", sep=",")

2. 处理数据中的特殊分隔符/换行符

原始数据可能包含逗号、换行符等特殊字符,复制到Excel后保存时未正确转义,导致解析错位。可以指定引号包裹规则:

# 用双引号包裹含特殊字符的字段,同时指定转义符
df = pd.read_csv("你的文件路径.csv", encoding="utf-8-sig", sep=",", quotechar='"', escapechar="\\")
# 如果是制表符分隔的CSV,将sep改为"\t"

3. 清理复制引入的冗余内容

复制过程中可能带入空行、列名空格,导致列对齐错误:

# 跳过空行
df = pd.read_csv("你的文件路径.csv", encoding="utf-8-sig", skip_blank_lines=True)
# 修剪列名的空格
df.columns = df.columns.str.strip()
# 修剪字符串字段的空格(不影响数值类型)
df = df.apply(lambda x: x.str.strip() if x.dtype == "object" else x)

4. 自定义表头或指定表头行

如果原始数据的表头不在第一行,或者需要手动定义列名:

# 假设表头在第2行(索引从0开始计数)
df = pd.read_csv("你的文件路径.csv", encoding="utf-8-sig", header=1)
# 或者手动指定列名
custom_columns = ["列名1", "列名2", "列名3"]
df = pd.read_csv("你的文件路径.csv", encoding="utf-8-sig", names=custom_columns, header=0)

5. 先预览数据定位问题

如果以上方法无效,先读取少量数据排查结构:

# 读取前5行
preview_df = pd.read_csv("你的文件路径.csv", encoding="utf-8-sig", nrows=5)
print(preview_df)
print("当前列名:", preview_df.columns.tolist())

内容的提问来源于stack exchange,提问作者Rachel

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.10 13:00:13