使用Selenium配置User Agent后无法抓取在线PDF文件的问题求助
使用Selenium配置User Agent后无法抓取在线PDF文件的问题求助
大家好,我最近在处理一个在线PDF抓取的需求,遇到了点麻烦想请教下各位:
目标网站需要依赖JavaScript才能正常加载内容,所以我选择用Selenium来实现抓取逻辑。为了避免被网站识别封禁,我特意配置了自定义的User Agent,还附加了对应的Cookies,但代码始终没法正常运行,抓不到PDF的内容。
这是我目前写了一半的示例代码,不仅卡在了导入模块的部分,也完全不确定后续针对PDF加载的处理逻辑该怎么写才对:
from selenium.webdriver.chrome.options import Options from selenium.webdriver.support.ui import WebDriverWait from selenium.webdriver.support import expected_conditions as EC from selenium.webdriver.common.by # 这里代码没写完,不知道接下来怎么处理PDF的定位和内容抓取
有没有大佬能帮我排查下可能的问题?比如User Agent和Cookies的配置是不是有遗漏的细节?或者针对需要JS渲染的在线PDF,用Selenium抓取的正确姿势应该是怎样的?
内容来源于stack exchange
相关产品推荐
相关产品推荐

