You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何对pandas DataFrame中URL的末尾段按规则替换为指定字符串

实现方案

你可以结合正则匹配和自定义函数实现需求,步骤和代码如下:

依赖导入

首先确保你已经导入了需要的库:

import pandas as pd
import re

自定义处理逻辑

编写规则匹配函数,对应你提到的两个替换要求:

def handle_url_suffix(suffix):
    # 规则1:最后一段为空,返回home_page
    if not suffix.strip():
        return "home_page"
    # 规则2:同时包含字母和数字,返回valid
    has_letter = bool(re.search(r"[a-zA-Z]", suffix))
    has_number = bool(re.search(r"\d", suffix))
    if has_letter and has_number:
        return "valid"
    # 其他情况保留原始后缀
    return suffix

应用到数据框

直接在你原有提取逻辑的基础上调用处理函数即可:

df["processed_url"] = df["url"].str.split("/").str[-1].apply(handle_url_suffix)

结果验证

针对你给出的三个示例URL,输出结果和预期完全一致:

  • https://abc.eu/login → login
  • https://abc.eu/ → home_page
  • https://abc.eu/ar35gjdb4 → valid
    如果需要额外限制“长字符串”的长度阈值,可以在规则2中额外增加len(suffix) >= 你设定的长度的判断条件即可。

内容的提问来源于stack exchange,提问作者user9364978

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.03 18:09:05