You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Pandas按用户合并DataFrame多行值为规则评分列表列

Pandas评分表转换实现方案

直接使用以下代码即可完成需求,输出结果和示例完全匹配:

import pandas as pd
import numpy as np

# --- 替换为你自己的CSV读取代码即可,以下为示例数据构造 ---
df = pd.read_csv("你的评分文件路径.csv") # 实际使用时替换这行
# 示例测试数据
# df = pd.DataFrame({
#     'User_id': [1,1,2,2,2],
#     'Product_id': ['00','02','01','00','02'],
#     'Rating': [3,5,1,2,2]
# })

# 步骤1:预处理商品ID为位置索引,统计总商品种类数L
# 如果你的商品ID本身就是整数,直接用df['prod_idx'] = df['Product_id']即可
df['prod_idx'] = df['Product_id'].astype(int)
L = df['prod_idx'].nunique()

# 步骤2:生成col2:每个用户全量商品评分向量,未评分位置填0
# 先构建用户-商品评分矩阵,缺失评分填0,按商品索引排序保证位置对应
user_full_rating = df.pivot_table(
    index='User_id',
    columns='prod_idx',
    values='Rating',
    fill_value=0
).reindex(columns=range(L), fill_value=0)
# 按User_id把全量评分列表映射回原表每一行
df['col2'] = df['User_id'].map(user_full_rating.agg(list, axis=1))

# 步骤3:生成col1:仅当前行对应商品位置填评分,其余位置填0
def build_single_rating_vec(row):
    rating_vec = [0] * L
    rating_vec[row['prod_idx']] = row['Rating']
    return rating_vec
df['col1'] = df.apply(build_single_rating_vec, axis=1)

# 步骤4:整理为最终要求的列结构,删除中间辅助列
final_df = df[['User_id', 'col1', 'col2']]

适配说明

  • 如果你的商品ID不是从0开始连续编号的,只需要把步骤1的索引生成逻辑替换为自定义映射即可:
    # 给所有唯一商品ID按排序后顺序分配0开始的位置索引
    sorted_prod_ids = sorted(df['Product_id'].unique())
    prod_id2idx = {pid: idx for idx, pid in enumerate(sorted_prod_ids)}
    df['prod_idx'] = df['Product_id'].map(prod_id2idx)
    L = len(sorted_prod_ids)
    
  • 整个处理过程不会增减原表行数,每一行和原数据一一对应,向量长度统一为总商品种类数,完全符合转换规则。

内容的提问来源于stack exchange,提问作者Mkaerobus

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.26 11:57:11