You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

电商K聚类项目:字符串省份编码数值化方案及资源问询

针对你的K聚类项目需求,下面是具体实现方案、可用公开资源和样本参考:

一、省份编码字符串转数值的实现方法

1. 手动映射编码(可控性强)

如果省份编码数量不多,直接手动创建映射字典,把每个省份编码对应到唯一整数,这种方式不会打乱你对区域的认知,适合后续分析:

import pandas as pd

# 加载清洗后的CSV数据
df = pd.read_csv('cleaned_ecommerce_data.csv')

# 手动创建省份编码映射
province_mapping = {'CA': 0, 'QC': 1, 'UT': 2, 'NY':3}  # 可根据实际编码扩展
df['Province_Code_Num'] = df['Province Code'].map(province_mapping)

# 提取用于聚类的特征
cluster_features = df[['Province_Code_Num', '消费金额']]

2. 自动标签编码(快速高效)

如果省份编码数量多,用sklearn的LabelEncoder自动分配数值,省得手动写映射:

from sklearn.preprocessing import LabelEncoder

le = LabelEncoder()
df['Province_Code_Num'] = le.fit_transform(df['Province Code'])

# 查看编码对应关系,方便后续解读聚类结果
print(dict(zip(le.classes_, le.transform(le.classes_))))

注意:K聚类是基于距离的算法,标签编码的数值大小不代表实际意义,只要每个编码对应唯一数值就没问题,不会影响聚类结果的区域分组逻辑。

二、公开电商消费CSV资源推荐

  • Kaggle上的「E-Commerce Sales Dataset」:包含北美地区电商订单数据,有省份/州编码、消费金额、订单时间等字段,数据量适中适合练手
  • UCI机器学习库的「Online Retail Dataset」:虽为欧洲零售数据,但包含区域编码、消费金额等字段,可筛选出按区域聚合后的消费数据
  • 美国人口普查局公开的「Retail Trade Survey Data」:包含不同州的零售消费统计数据,可匹配省份编码使用

三、清洗后的数据样本

User_ID,Province Code,消费金额,Province_Code_Num
1001,CA,245.99,0
1002,QC,189.50,1
1003,UT,320.75,2
1004,CA,99.99,0
1005,NY,450.00,3
1006,QC,210.20,1

内容的提问来源于stack exchange,提问作者ChickenJoe

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.08 10:40:40