You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Python爬虫从二手车爬取文本中提取年份数字并存储为独立变量

实现方案

观察你获取的车型字符串均以4位生产年份作为开头,以下两种方法都可以实现提取需求:

方法1:直接切片(最简单)

因为年份固定占据每个字符串的前4位,直接切片即可:

year_list = [car_item[:4] for car_item in model]

运行后year_list就是你需要的年份字符串列表,如果你需要整数格式的年份,修改为:

year_list = [int(car_item[:4]) for car_item in model]

方法2:正则匹配(鲁棒性更高)

如果后续页面结构变动,可能出现字符串开头不是年份的异常情况,用正则匹配更稳妥,不会直接报错:

import re

year_list = []
for car_str in model:
    # 匹配字符串开头的连续4位数字
    year_match = re.match(r'^\d{4}', car_str)
    if year_match:
        year_list.append(year_match.group())
    else:
        # 未匹配到的场景填充占位符,保证列表长度和原车型列表一致
        year_list.append(None)

两种方法得到的结果都和你给出的预期输出完全匹配。

内容的提问来源于stack exchange,提问作者Shailesh2692

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.29 11:27:04