Scrapy Shell提取div元素文本并清理日期时间格式问题
直接在Scrapy Shell中提取格式化的日期时间
- 使用XPath内置的
normalize-space()函数,这是最简便的方式,能直接在提取阶段去除文本前后的换行、制表符和多余空格:# 提取单个格式化后的日期时间 response.xpath('normalize-space(//div[@class="fw-bold text-wrap"]/text())').extract_first() # 如果有多个目标元素,提取所有格式化后的结果 response.xpath('normalize-space(//div[@class="fw-bold text-wrap"]/text())').extract() - 原理说明:
normalize-space()函数会自动处理字符串:- 移除字符串开头和结尾的所有空白字符(包括换行
\n、制表符\t、空格) - 将字符串中间的连续空白字符替换为单个空格
- 移除字符串开头和结尾的所有空白字符(包括换行
执行以上命令后,返回的结果就是整洁的日期时间格式(比如'12/28/23 08:15 PM EST'),无需额外在脚本中处理。
内容的提问来源于stack exchange,提问作者Leo Torres
相关产品推荐
相关产品推荐

