You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Spotify序列跳过预测数据集CSV文件读取异常求助

Spotify Sequential Skip预测迷你训练集读取异常问题

问题说明

我尝试打开Spotify Sequential Skip预测挑战赛里的Training_Set_And_Track_Features_Mini(17.2MB)数据集,用pandas的read_csv读取后列和行全乱了,哪怕加了encoding='latin1'和error_bad_lines=False参数忽略错误,数据还是有大量问题,列显示完全混乱。

我用的代码是:

import pandas as pd

# 文件路径
path_file = '/content/drive/MyDrive/TESTE TCC/training mini/16772e7f-7871-4d42-a44f-5f399f40fd94_training_set_track_features_mini'

# 读取CSV
data = pd.read_csv(path_file, encoding='latin1', error_bad_lines=False)

# 显示数据
data

问题根源和解决办法

  • 这个数据集根本不是标准CSV格式,它是JSON Lines格式(每行一个独立的JSON对象),用read_csv读取自然会解析混乱。
  • 正确的做法是用pandas的read_json方法,加上lines=True参数来逐行解析JSON:
import pandas as pd

path_file = '/content/drive/MyDrive/TESTE TCC/training mini/16772e7f-7871-4d42-a44f-5f399f40fd94_training_set_track_features_mini'

# 读取JSON Lines格式的数据集
data = pd.read_json(path_file, lines=True)

# 查看前几行数据验证
data.head()
  • 如果遇到编码问题,试试换成encoding='utf-8'参数(该数据集默认用UTF-8编码):
data = pd.read_json(path_file, lines=True, encoding='utf-8')

额外提醒

要是重新读取还是有问题,检查下文件是不是下载解压完整了,确认文件大小是17.2MB,避免文件损坏导致的解析错误。

内容的提问来源于stack exchange,提问作者Deimos

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.20 00:53:12