Python如何拆分列表单个索引内的website、page_url、data三类数据
解决方案
你得到截断结果的原因是用split()默认按空格拆分字符串时,data字段的字典值本身包含大量空格,被拆成了多个独立片段,才会出现data={'email':这种不完整的结果。
最优方案:不需要转字符串拆分extract_emails库的DefaultWorker.get_data()返回的每个元素都是结构化对象,直接调用对应属性即可拿到完整的字段值:
# 原有代码保留到 data = worker.get_data() 即可,后续逻辑替换为如下内容 # 取你需要的索引对应的条目,示例用你之前选择的data[3] target_item = data[3] # 直接读取对象属性获取对应字段 website = target_item.website page_url = target_item.page_url data_dict = target_item.data # 输出验证 print(website) print(page_url) print(data_dict) # 可直接读取邮箱列表 email_list = data_dict['email']
补充方案:如果你确实需要处理已转成字符串的内容
可以按换行符拆分,因为你的每个字段都是单独占行的:
part1 = str(data[3]) # 先去掉外层的方括号,再按换行拆分,过滤空行 field_list = [line.strip() for line in part1.strip('[]').split('\n') if line.strip()] value1, value2, value3 = field_list print(value1) print(value2) print(value3)
内容的提问来源于stack exchange,提问作者fyunusa
相关产品推荐
相关产品推荐

