Python爬虫从二手车爬取文本中提取年份数字并存储为独立变量
实现方案
观察你获取的车型字符串均以4位生产年份作为开头,以下两种方法都可以实现提取需求:
方法1:直接切片(最简单)
因为年份固定占据每个字符串的前4位,直接切片即可:
year_list = [car_item[:4] for car_item in model]
运行后year_list就是你需要的年份字符串列表,如果你需要整数格式的年份,修改为:
year_list = [int(car_item[:4]) for car_item in model]
方法2:正则匹配(鲁棒性更高)
如果后续页面结构变动,可能出现字符串开头不是年份的异常情况,用正则匹配更稳妥,不会直接报错:
import re year_list = [] for car_str in model: # 匹配字符串开头的连续4位数字 year_match = re.match(r'^\d{4}', car_str) if year_match: year_list.append(year_match.group()) else: # 未匹配到的场景填充占位符,保证列表长度和原车型列表一致 year_list.append(None)
两种方法得到的结果都和你给出的预期输出完全匹配。
内容的提问来源于stack exchange,提问作者Shailesh2692
相关产品推荐
相关产品推荐

