You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用Selenium配置User Agent后无法抓取在线PDF文件的问题求助

使用Selenium配置User Agent后无法抓取在线PDF文件的问题求助

大家好,我最近在处理一个在线PDF抓取的需求,遇到了点麻烦想请教下各位:

目标网站需要依赖JavaScript才能正常加载内容,所以我选择用Selenium来实现抓取逻辑。为了避免被网站识别封禁,我特意配置了自定义的User Agent,还附加了对应的Cookies,但代码始终没法正常运行,抓不到PDF的内容。

这是我目前写了一半的示例代码,不仅卡在了导入模块的部分,也完全不确定后续针对PDF加载的处理逻辑该怎么写才对:

from selenium.webdriver.chrome.options import Options
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC
from selenium.webdriver.common.by  # 这里代码没写完,不知道接下来怎么处理PDF的定位和内容抓取

有没有大佬能帮我排查下可能的问题?比如User Agent和Cookies的配置是不是有遗漏的细节?或者针对需要JS渲染的在线PDF,用Selenium抓取的正确姿势应该是怎样的?

内容来源于stack exchange

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.04.08 12:33:03