加载含希伯来文的CSV到Jupyter Notebook遇乱码与编码解码错误
解决希伯来文CSV加载乱码问题
步骤1:自动检测文件编码
先通过工具检测文件实际编码,避免盲目试错:
- 安装编码检测工具(如果未安装):
pip install chardet
- 运行检测代码:
import chardet # 读取文件前10000字节分析编码 with open(r'C:\Users\MyName\Folder\number_of_cars.csv', 'rb') as f: encoding_result = chardet.detect(f.read(10000)) print(encoding_result)
输出会显示类似{'encoding': 'cp1255', 'confidence': 0.99}的结果,直接使用这个编码值即可。
步骤2:指定编码加载文件
根据检测结果加载,若检测为cp1255,可添加errors='replace'跳过无法解码的特殊字符:
import pandas as pd cars = pd.read_csv( r'C:\Users\MyName\Folder\number_of_cars.csv', encoding='cp1255', # 替换为检测出的编码 sep='|', errors='replace' )
如果检测结果是utf-8-sig(带BOM的UTF-8),则用以下代码:
cars = pd.read_csv( r'C:\Users\MyName\Folder\number_of_cars.csv', encoding='utf-8-sig', sep='|' )
步骤3:验证希伯来文显示
加载后查看希伯来文列的内容确认:
# 替换为你的希伯来文列名或索引 print(cars['希伯来文列名'].head())
内容的提问来源于stack exchange,提问作者Liad Traube
相关产品推荐
相关产品推荐

