You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Python pandas读取CSV自定义列名及指定数据类型不生效问题

问题根源

代码配置不生效的核心原因如下:

  • 设置header=None但未传入自定义列名列表时,pandas会默认使用0、1、2…的数字作为列名,你定义的type_dict里的自定义列名和实际列名完全不匹配,类型规则根本不会触发,同时原始CSV的第一行表头会被当成普通数据行读入。
  • 票数字段存在大量被引号包裹的空值,直接指定普通int类型会因为空字符串无法转换报错,pandas会自动回退到类型推断逻辑,把带前导零的FIPS编码转成数值。
  • 全字段被双引号包裹属于标准CSV格式,pandas默认配置可正常识别,不需要修改原始文件。
可直接运行的修正代码
import pandas as pd
import csv
from sqlalchemy import create_engine

# 按原始CSV列顺序严格定义自定义列名,顺序不能错位
custom_columns = [
    'FIPS_County',
    'Election_District',
    'Election_Precinct',
    'Cong_Dist',
    'Legs_Dist',
    'Candidate_Name',
    'Party',
    'Office_Name',
    'Office_District',
    'Winner',
    'Write_In_Flag',
    'Early_Voting_Votes',
    'Early_Voting_Votes_Against',
    'Election_Day_Votes',
    'Election_Day_Votes_Against',
    'By_Mail_Votes',
    'By_Mail_Votes_Against',
    'Prov_Votes',
    'Prov_Votes_Against',
    'By_Mail_2_Votes',
    'By_Mail_2_Votes_Against',
    'Total_Votes',
    'Total_Votes_Against'
]

# 定义列类型:非票数字段全为字符串,票数字段用pandas可空整数类型Int64支持空值
type_dict = {col: 'str' for col in custom_columns}
vote_cols = [
    'Early_Voting_Votes', 'Early_Voting_Votes_Against',
    'Election_Day_Votes', 'Election_Day_Votes_Against',
    'By_Mail_Votes', 'By_Mail_Votes_Against',
    'Prov_Votes', 'Prov_Votes_Against',
    'By_Mail_2_Votes', 'By_Mail_2_Votes_Against',
    'Total_Votes', 'Total_Votes_Against'
]
for col in vote_cols:
    type_dict[col] = 'Int64'

# 读取CSV,全程内存处理不生成中间文件
md = pd.read_csv(
    'D:/Anl_Data/ElectionData/2020_Elec/2020_ElecRes/MD_All_By_Precinct_2020_General.csv',
    header=0,  # 跳过第一行原始表头
    names=custom_columns,  # 应用自定义列名
    dtype=type_dict,  # 应用预定义类型规则
    na_values=[''],  # 把引号包裹的空值识别为缺失值
    quoting=csv.QUOTE_ALL,  # 适配全字段被引号包裹的格式
    encoding='utf-8'
)

# 新增固定字段
md.insert(0, "Election_Type", "General")
md.insert(1, "Election_Year", 2020)
md.insert(2, "FIPS_State", "24")

# 验证结果
print(md.dtypes)
print(md[['FIPS_County', 'Total_Votes', 'Total_Votes_Against']].head())

# 直接写入Postgres,替换为自己的数据库连接信息即可
engine = create_engine('postgresql://用户名:密码@数据库地址:端口/库名')
md.to_sql(
    name='maryland_election_2020',  # 目标数据表名
    con=engine,
    if_exists='replace',  # 表存在时替换,可按需改为append
    index=False,
    method='multi'  # 批量写入提升效率
)
关键注意事项
  • 自定义列名的顺序必须和原始CSV的列顺序完全一致,否则会出现列值错位。
  • FIPS编码在读取时就指定为字符串类型,不会丢失前导零,禁止读取完成后再做数值转字符串的操作,此时前导零已经丢失无法恢复。
  • 票数字段使用Int64(首字母大写)是pandas的可空整数类型,可正常存储空值,不会像普通int类型遇到空值就报错,也不会自动转成浮点数。
  • 全程不需要修改原始CSV文件,也不会生成任何中间临时文件,所有处理都在内存中完成。

内容的提问来源于stack exchange,提问作者BikesNthings

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.27 21:57:20