You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Scrapy Shell提取div元素文本并清理日期时间格式问题

直接在Scrapy Shell中提取格式化的日期时间
  • 使用XPath内置的normalize-space()函数,这是最简便的方式,能直接在提取阶段去除文本前后的换行、制表符和多余空格:
    # 提取单个格式化后的日期时间
    response.xpath('normalize-space(//div[@class="fw-bold text-wrap"]/text())').extract_first()
    
    # 如果有多个目标元素,提取所有格式化后的结果
    response.xpath('normalize-space(//div[@class="fw-bold text-wrap"]/text())').extract()
    
  • 原理说明:normalize-space()函数会自动处理字符串:
    1. 移除字符串开头和结尾的所有空白字符(包括换行\n、制表符\t、空格)
    2. 将字符串中间的连续空白字符替换为单个空格

执行以上命令后,返回的结果就是整洁的日期时间格式(比如'12/28/23 08:15 PM EST'),无需额外在脚本中处理。

内容的提问来源于stack exchange,提问作者Leo Torres

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.03 04:45:57