在Google Colab中加载CSV文件遇UnicodeDecodeError问题求助
解决Pandas读取CSV时的UnicodeDecodeError问题
我在Google Colab中执行以下代码加载CSV文件:
car_sales = pd.read_csv("/content/sample_data/car-sales.csv") car_sales
但出现如下错误:
UnicodeDecodeError: 'utf-8' codec can't decode byte 0xd1 in position 8: invalid continuation byte
文件已保存至/content/sample_data目录,路径确认正确,目录内容如下:
解决方法
这个错误是因为CSV文件的编码不是Pandas默认的UTF-8,导致解码失败。可以尝试以下几种方案:
- 指定常见编码尝试
非UTF-8的CSV文件常用latin-1或cp1252编码,先试latin-1:
car_sales = pd.read_csv("/content/sample_data/car-sales.csv", encoding="latin-1")
如果不行,再换cp1252:
car_sales = pd.read_csv("/content/sample_data/car-sales.csv", encoding="cp1252")
- 自动检测文件编码
用chardet库检测文件真实编码,先安装库(Colab中执行):
!pip install chardet
再运行检测并加载:
import chardet with open("/content/sample_data/car-sales.csv", "rb") as f: encoding_result = chardet.detect(f.read()) car_sales = pd.read_csv("/content/sample_data/car-sales.csv", encoding=encoding_result["encoding"])
- 忽略解码错误(谨慎使用)
如果只是临时加载文件,可忽略解码错误,但可能丢失部分字符:
car_sales = pd.read_csv("/content/sample_data/car-sales.csv", errors="ignore")
内容的提问来源于stack exchange,提问作者Leandro
相关产品推荐
相关产品推荐

