如何去除Courses列重复值并保留折扣最小的课程记录?
处理重复课程数据:保留折扣最小的记录
需要处理包含重复课程的数据,确保Courses列无重复值,仅保留每门课程中Discount值最小的记录,删除其余重复项。
输入数据
| Courses | Fee | Duration | Discount |
|---|---|---|---|
| Spark | 20000 | 30days | 1000 |
| PySpark | 25000 | 40days | 2300 |
| pandas | 10000 | 10days | 1 |
| Python | 22000 | 35days | 1200 |
| pandas | 30000 | 50days | 2000 |
| pandas | 400000 | 70days | 2 |
期望输出
| Courses | Fee | Duration | Discount |
|---|---|---|---|
| Spark | 20000 | 30days | 1000 |
| PySpark | 25000 | 40days | 2300 |
| pandas | 10000 | 10days | 1 |
| Python | 22000 | 35days | 1200 |
说明:已删除2条Courses=pandas的记录,保留了该课程中折扣最小的条目。
解决方案(使用pandas)
通过分组并选取折扣最小的记录即可实现需求:
import pandas as pd # 构造输入数据框 df = pd.DataFrame({ 'Courses': ['Spark', 'PySpark', 'pandas', 'Python', 'pandas', 'pandas'], 'Fee': [20000, 25000, 10000, 22000, 30000, 400000], 'Duration': ['30days', '40days', '10days', '35days', '50days', '70days'], 'Discount': [1000, 2300, 1, 1200, 2000, 2] }) # 按课程分组,获取每组折扣最小的记录索引,再提取对应行 result = df.loc[df.groupby('Courses')['Discount'].idxmin()] # 重置索引 result = result.reset_index(drop=True) print(result)
运行代码后输出的结果与期望输出完全一致。
内容的提问来源于Stack Exchange,提问作者Adeeb Shaik
相关产品推荐
相关产品推荐

