如何格式化字典列表中的字典对象,拆分爬虫获取的资源域名与路径
资源标签列表处理实现
以下是符合要求的Python处理代码,运行后可直接输出你需要的格式:
import re # 资源地址处理函数 def process_url(url): # 清除所有https前缀(兼容缺斜杠的异常格式) cleaned = re.sub(r"^https:[/]*", "", url) # 拆分域名和路径 if "/" in cleaned: split_pos = cleaned.find("/") pre_part = cleaned[:split_pos] # 前置段包含.则判定为域名 if "." in pre_part: return {"domain": pre_part, "path": cleaned[split_pos+1:]} # 无域名时填充默认值 return {"domain": "random.com", "path": cleaned} # 遍历处理原tag_list processed_list = [] for tag_item in tag_list: tag_name, raw_url = next(iter(tag_item.items())) processed_list.append({tag_name: [process_url(raw_url)]}) # 输出结果 print(processed_list)
运行后输出结果和你给出的期望格式完全一致。
内容的提问来源于stack exchange,提问作者Rikky Bhai
相关产品推荐
相关产品推荐

