You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用pd.read_csv确定CSV正确编码?字符识别异常求助

解决CSV编码识别问题的思路

你遇到的assembléia是典型的编码错位问题——原本的UTF-8编码字符串被错误用Latin-1解码导致的乱码,反过来逆向操作就能修复。以下是具体解决方法:

  • 精准修复单列乱码
    先以latin-1读取文件(确保不丢失原始字节),再对乱码列做编码转换:

    import pandas as pd
    
    df = pd.read_csv(file, encoding='latin-1')
    # 替换成你的目标列名
    df['目标列名'] = df['目标列名'].apply(lambda x: x.encode('latin-1').decode('utf-8') if isinstance(x, str) else x)
    
  • 批量处理所有字符串列
    不确定哪列乱码时,遍历所有字符串类型列统一修复:

    for col in df.select_dtypes(include=['object']).columns:
        df[col] = df[col].apply(lambda x: x.encode('latin-1').decode('utf-8') if isinstance(x, str) else x)
    
  • 直接按UTF-8读取(跳过错误)
    如果文件大部分是UTF-8编码,仅少量错误,可直接读取并忽略/替换错误字节:

    from io import StringIO
    
    with open(file, 'rb') as f:
        content = f.read().decode('utf-8', errors='replace')  # errors='ignore'会直接丢弃错误字节
    
    df = pd.read_csv(StringIO(content))
    
  • 验证编码逻辑
    可以先单独验证乱码字符串的转换是否有效:

    s = 'assembléia'
    print(s.encode('latin-1').decode('utf-8'))  # 输出正确的assembléia
    

内容的提问来源于stack exchange,提问作者user202135

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.16 13:12:10