You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Python3.11下pandas read_fwf读取.dat文件首行列偏移问题

固定宽度文件首行读取偏移问题排查与解决

这种首行偏移、其余行正常的情况,基本不是pandas的bug,更可能是文件本身的编码或隐藏字符问题,以下是具体排查方向和解决办法:

  • 检查首行的隐藏特殊字符
    用Notepad++这类编辑器开启「显示所有字符」功能,查看首行开头是否有不可见的额外字符(比如UTF-8 BOM标记\ufeff)。这类标记会被pandas当作首行的第一个有效字符,直接导致后续列的位置整体偏移。

  • 指定正确编码读取
    如果是UTF-8带BOM的编码,直接在read_fwf里指定encoding='utf-8-sig'即可自动处理BOM:

    df = pd.read_fwf('filename.dat', colspecs=[(4,12), (12,21), (21,100)], names=['Col1', 'Col2', 'Full Name'], encoding='utf-8-sig')
    

    如果文件是其他编码(比如GBK),对应替换编码参数即可。

  • 手动预处理文件内容
    要是确认首行开头有多余字符,也可以先读取所有行并处理后再传给read_fwf:

    from io import StringIO
    
    with open('filename.dat', 'r', encoding='utf-8-sig') as f:
        lines = f.readlines()
    
    df = pd.read_fwf(StringIO(''.join(lines)), colspecs=[(4,12), (12,21), (21,100)], names=['Col1', 'Col2', 'Full Name'])
    
  • 排查换行符格式差异
    极少数情况是首行换行符和其他行不一致(比如首行用\r\n,其余行用\n),可以用文本编辑器的「显示所有字符」功能检查换行符格式,统一后再读取。

内容的提问来源于stack exchange,提问作者JacquesLeen

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.12 18:03:32