You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何为pandas DataFrame中的每个分组生成对应的UUID

简便实现方法

你不需要单独做去重、加字段、再merge的操作,两种更简洁的写法如下:

写法1:用groupby.transform直接生成(最直观)

同一分组内所有行会自动拿到同一个ID,完全满足你同组同ID的需求:

import hashlib
import json
import uuid

# 不需要固定ID的场景,直接生成标准UUID
x['basket_id'] = x.groupby('basket')['basket'].transform(lambda _: uuid.uuid4().hex)

# 需要固定可复现ID的场景,保留你原来的哈希逻辑
x['basket_id'] = x.groupby('basket')['basket'].transform(
    lambda g: hashlib.shake_256(json.dumps(sorted(g.iloc[0])).encode('utf-8')).hexdigest(10)
)

写法2:用字典映射实现(性能更高,适合大数据量)

# 先给每个唯一basket值生成对应ID
basket_id_map = {
    basket_val: hashlib.shake_256(json.dumps(sorted(basket_val)).encode('utf-8')).hexdigest(10)
    for basket_val in x['basket'].unique()
}
# 直接映射到原表即可
x['basket_id'] = x['basket'].map(basket_id_map)

提示:两种写法都和你原有的实现逻辑完全等价,不需要额外做DataFrame合并操作,代码更精简,运行效率也更高。

内容的提问来源于stack exchange,提问作者Fizi

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.29 08:15:04