Spotify序列跳过预测数据集CSV文件读取异常求助
Spotify Sequential Skip预测迷你训练集读取异常问题
问题说明
我尝试打开Spotify Sequential Skip预测挑战赛里的Training_Set_And_Track_Features_Mini(17.2MB)数据集,用pandas的read_csv读取后列和行全乱了,哪怕加了encoding='latin1'和error_bad_lines=False参数忽略错误,数据还是有大量问题,列显示完全混乱。
我用的代码是:
import pandas as pd # 文件路径 path_file = '/content/drive/MyDrive/TESTE TCC/training mini/16772e7f-7871-4d42-a44f-5f399f40fd94_training_set_track_features_mini' # 读取CSV data = pd.read_csv(path_file, encoding='latin1', error_bad_lines=False) # 显示数据 data
问题根源和解决办法
- 这个数据集根本不是标准CSV格式,它是JSON Lines格式(每行一个独立的JSON对象),用
read_csv读取自然会解析混乱。 - 正确的做法是用pandas的
read_json方法,加上lines=True参数来逐行解析JSON:
import pandas as pd path_file = '/content/drive/MyDrive/TESTE TCC/training mini/16772e7f-7871-4d42-a44f-5f399f40fd94_training_set_track_features_mini' # 读取JSON Lines格式的数据集 data = pd.read_json(path_file, lines=True) # 查看前几行数据验证 data.head()
- 如果遇到编码问题,试试换成
encoding='utf-8'参数(该数据集默认用UTF-8编码):
data = pd.read_json(path_file, lines=True, encoding='utf-8')
额外提醒
要是重新读取还是有问题,检查下文件是不是下载解压完整了,确认文件大小是17.2MB,避免文件损坏导致的解析错误。
内容的提问来源于stack exchange,提问作者Deimos
相关产品推荐
相关产品推荐

