You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何去除Courses列重复值并保留折扣最小的课程记录?

处理重复课程数据:保留折扣最小的记录

需要处理包含重复课程的数据,确保Courses列无重复值,仅保留每门课程中Discount值最小的记录,删除其余重复项。

输入数据

CoursesFeeDurationDiscount
Spark2000030days1000
PySpark2500040days2300
pandas1000010days1
Python2200035days1200
pandas3000050days2000
pandas40000070days2

期望输出

CoursesFeeDurationDiscount
Spark2000030days1000
PySpark2500040days2300
pandas1000010days1
Python2200035days1200

说明:已删除2条Courses=pandas的记录,保留了该课程中折扣最小的条目。

解决方案(使用pandas)

通过分组并选取折扣最小的记录即可实现需求:

import pandas as pd

# 构造输入数据框
df = pd.DataFrame({
    'Courses': ['Spark', 'PySpark', 'pandas', 'Python', 'pandas', 'pandas'],
    'Fee': [20000, 25000, 10000, 22000, 30000, 400000],
    'Duration': ['30days', '40days', '10days', '35days', '50days', '70days'],
    'Discount': [1000, 2300, 1, 1200, 2000, 2]
})

# 按课程分组,获取每组折扣最小的记录索引,再提取对应行
result = df.loc[df.groupby('Courses')['Discount'].idxmin()]

# 重置索引
result = result.reset_index(drop=True)

print(result)

运行代码后输出的结果与期望输出完全一致。

内容的提问来源于Stack Exchange,提问作者Adeeb Shaik

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.21 15:25:44