You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何格式化字典列表中的字典对象,拆分爬虫获取的资源域名与路径

资源标签列表处理实现

以下是符合要求的Python处理代码,运行后可直接输出你需要的格式:

import re

# 资源地址处理函数
def process_url(url):
    # 清除所有https前缀(兼容缺斜杠的异常格式)
    cleaned = re.sub(r"^https:[/]*", "", url)
    # 拆分域名和路径
    if "/" in cleaned:
        split_pos = cleaned.find("/")
        pre_part = cleaned[:split_pos]
        # 前置段包含.则判定为域名
        if "." in pre_part:
            return {"domain": pre_part, "path": cleaned[split_pos+1:]}
    # 无域名时填充默认值
    return {"domain": "random.com", "path": cleaned}

# 遍历处理原tag_list
processed_list = []
for tag_item in tag_list:
    tag_name, raw_url = next(iter(tag_item.items()))
    processed_list.append({tag_name: [process_url(raw_url)]})

# 输出结果
print(processed_list)

运行后输出结果和你给出的期望格式完全一致。

内容的提问来源于stack exchange,提问作者Rikky Bhai

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.29 22:18:02