You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Python pandas按指定列相同值合并对应行URL列的实现方法

pandas按路径分组合并URL列实现

原始数据:
数据示意图

预期结果:
结果示意图

需求说明

在Python、Jupyter Notebook环境下处理pandas DataFrame数据,需要实现逻辑:当Full Path(完整路径)列存在重复值时,将对应行的urls列内容合并到同一行。

错误尝试

曾尝试使用groupby方法实现,但未得到预期结果,所用代码如下:

df.groupby("Full Path").apply(lambda x: ", ".join(x)).reset_index()

运行上述代码输出结果不符合预期,错误结果示例:
错误结果示意图

错误原因与正确写法

原代码逻辑错误点:groupby后传入apply的x是每个分组对应的完整子DataFrame,直接对x做字符串拼接会把所有列的内容都拼接到一起,并非仅处理urls列,因此结果不符合要求。

仅保留Full Path和合并后的urls列

如果不需要保留其他列,可以直接指定分组后处理的列,写法最简洁:

df = df.groupby("Full Path", as_index=False)["urls"].agg(
    lambda x: ", ".join(x.dropna().astype(str))
)

保留原表所有列

如果同一路径下除urls外的其他列取值完全一致,分组时其他列取分组内第一个值、仅对urls列做拼接即可,代码如下:

df = df.groupby("Full Path", as_index=False).agg(
    # 非urls列取分组内第一个值,urls列做逗号拼接
    {col: "first" for col in df.columns if col != "urls"} | 
    {"urls": lambda x: ", ".join(x.dropna().astype(str))}
)

提示:代码中dropna()用于跳过urls列的空值,astype(str)用于统一列类型为字符串,避免拼接时报类型错误,可根据自身数据情况调整。


内容的提问来源于stack exchange,提问作者uiu808

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.27 15:06:21