电商K聚类项目:字符串省份编码数值化方案及资源问询
针对你的K聚类项目需求,下面是具体实现方案、可用公开资源和样本参考:
一、省份编码字符串转数值的实现方法
1. 手动映射编码(可控性强)
如果省份编码数量不多,直接手动创建映射字典,把每个省份编码对应到唯一整数,这种方式不会打乱你对区域的认知,适合后续分析:
import pandas as pd # 加载清洗后的CSV数据 df = pd.read_csv('cleaned_ecommerce_data.csv') # 手动创建省份编码映射 province_mapping = {'CA': 0, 'QC': 1, 'UT': 2, 'NY':3} # 可根据实际编码扩展 df['Province_Code_Num'] = df['Province Code'].map(province_mapping) # 提取用于聚类的特征 cluster_features = df[['Province_Code_Num', '消费金额']]
2. 自动标签编码(快速高效)
如果省份编码数量多,用sklearn的LabelEncoder自动分配数值,省得手动写映射:
from sklearn.preprocessing import LabelEncoder le = LabelEncoder() df['Province_Code_Num'] = le.fit_transform(df['Province Code']) # 查看编码对应关系,方便后续解读聚类结果 print(dict(zip(le.classes_, le.transform(le.classes_))))
注意:K聚类是基于距离的算法,标签编码的数值大小不代表实际意义,只要每个编码对应唯一数值就没问题,不会影响聚类结果的区域分组逻辑。
二、公开电商消费CSV资源推荐
- Kaggle上的「E-Commerce Sales Dataset」:包含北美地区电商订单数据,有省份/州编码、消费金额、订单时间等字段,数据量适中适合练手
- UCI机器学习库的「Online Retail Dataset」:虽为欧洲零售数据,但包含区域编码、消费金额等字段,可筛选出按区域聚合后的消费数据
- 美国人口普查局公开的「Retail Trade Survey Data」:包含不同州的零售消费统计数据,可匹配省份编码使用
三、清洗后的数据样本
User_ID,Province Code,消费金额,Province_Code_Num 1001,CA,245.99,0 1002,QC,189.50,1 1003,UT,320.75,2 1004,CA,99.99,0 1005,NY,450.00,3 1006,QC,210.20,1
内容的提问来源于stack exchange,提问作者ChickenJoe
相关产品推荐
相关产品推荐

