You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

SVD推荐:训练集与测试集划分及测试模式应用疑问

解决MovieLens数据集SVD训练/测试划分及预测问题

一、训练集与测试集的划分

直接拆分评分记录即可,两种常用方式:

  • 随机拆分:把所有(user, movie, rating)三元组按8:2(或其他比例)随机分配。注意提前过滤掉只有1条评分的用户/物品,或者用分层抽样,保证每个用户/物品在训练集至少有一条数据,避免后续预测时找不到对应特征。
  • 时间拆分(更贴合真实场景):如果数据集带时间戳,把较早的80%评分作为训练集,最近的20%当测试集,模拟用户基于历史评分预测后续行为的场景。

伪代码示例:

import random

# 假设ratings是存储所有评分的列表,每个元素是(user_id, movie_id, rating)
random.seed(42)  # 固定种子保证结果可复现
random.shuffle(ratings)
split_point = int(len(ratings) * 0.8)
train_set = ratings[:split_point]
test_set = ratings[split_point:]

二、训练阶段的SVD操作

  1. 构建训练集的用户-物品矩阵:行对应用户,列对应物品,矩阵值为训练集中的评分,未评分位置填0(或者用用户/物品均值填充,不过推荐系统里常用0保留稀疏性)。如果用Python,可用scipy的稀疏矩阵格式(如csr_matrix)提升效率。
  2. 对训练矩阵做SVD分解:得到三个矩阵U(用户特征矩阵,维度n_users × k)、S(奇异值对角矩阵,k × k)、V^T(物品特征转置矩阵,k × n_items)。这里k是你指定的潜在特征数,需要根据测试效果调参(比如尝试20、50、100)。

三、测试阶段的用法与矩阵计算

1. 单个评分预测

对于测试集中的(user_u, movie_i, true_rating):

  • 从U中取出用户u的特征向量u_vec(第u行)
  • 从V^T中取出物品i的特征向量v_vec(第i列,等价于V的第i行)
  • 预测评分 = u_vec @ S @ v_vec.T(或者简化为u_vec @ (np.diag(S) @ v_vec).T,因为S是对角矩阵)

2. 重构完整用户-物品预测矩阵

直接计算矩阵乘积U @ S @ V^T,这个矩阵的每个元素就是对应用户对物品的预测评分。你可以拿测试集里的真实评分和对应位置的预测值对比,计算评估指标。

3. 关键注意点

  • 必须用训练集的SVD结果做预测,绝对不能先对全量数据做SVD再拆分,否则会泄露测试集信息,导致评估结果无效。
  • 如果用截断SVD(只保留前k个最大奇异值),重构的矩阵是原训练矩阵的低秩近似,能有效降低过拟合风险,推荐系统中常用这种方式。

四、评估模型效果

测试阶段常用RMSE(均方根误差)衡量预测精度:

import numpy as np

def calculate_rmse(true_ratings, pred_ratings):
    return np.sqrt(np.mean((np.array(true_ratings) - np.array(pred_ratings))**2))

# 假设你已经得到测试集的真实评分列表true_scores和预测评分列表pred_scores
rmse = calculate_rmse(true_scores, pred_scores)

内容的提问来源于stack exchange,提问作者Cantaloupe

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.06 17:31:15