You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何创建输出列统计每位客户在product字段中记录的已购商品

实现方案

以下分别给出常用的SQL、Python Pandas两种场景的实现逻辑,默认你表中客户的唯一标识字段为customer_id,实际使用时替换为你自己的对应字段即可:

SQL 实现

核心逻辑为按客户ID分组,对product字段去重后做字符串聚合,不同数据库的聚合函数略有区别:

  • MySQL 8.0+/MariaDB 版本
SELECT 
    customer_id,
    GROUP_CONCAT(DISTINCT product ORDER BY product SEPARATOR ', ') AS purchased_categories,
    -- 可选:新增列标注是单品类还是多品类客户
    CASE WHEN COUNT(DISTINCT product) > 1 THEN '多品类' ELSE '单品类' END AS purchase_type
FROM 
    你的实际表名
GROUP BY 
    customer_id
-- 可选:过滤只保留购买了多品类的客户
-- HAVING COUNT(DISTINCT product) > 1;
  • PostgreSQL 版本
SELECT 
    customer_id,
    STRING_AGG(DISTINCT product, ', ' ORDER BY product) AS purchased_categories,
    CASE WHEN COUNT(DISTINCT product) > 1 THEN '多品类' ELSE '单品类' END AS purchase_type
FROM 
    你的实际表名
GROUP BY 
    customer_id;
  • Spark SQL/Hive 版本
SELECT 
    customer_id,
    concat_ws(', ', collect_set(product)) AS purchased_categories,
    CASE WHEN size(collect_set(product)) > 1 THEN '多品类' ELSE '单品类' END AS purchase_type
FROM 
    你的实际表名
GROUP BY 
    customer_id;

Python Pandas 实现

import pandas as pd
import numpy as np

# 假设你的原始数据存储在df变量中
result = df.groupby('customer_id')['product'].agg(
    # 去重排序后用逗号拼接成字符串
    purchased_categories=lambda x: ', '.join(sorted(x.unique()))
).reset_index()

# 新增列标注单/多品类
result['purchase_type'] = np.where(
    result['purchased_categories'].str.contains(','), 
    '多品类', 
    '单品类'
)

# 可选:过滤只保留多品类客户
# result = result[result['purchase_type'] == '多品类']

你可以根据自己的使用场景选择对应方案,拼接的分隔符也可以按需调整为顿号、竖线等其他符号。

内容的提问来源于stack exchange,提问作者Razan Aldossary

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.28 08:06:01