WGET与Python urllib下载HTML内容不全 如何批量获取完整页面
你遇到的问题是目标网站的内容由JavaScript动态渲染生成,wget、urllib这类静态请求工具只会获取页面初始的静态HTML源码,不会执行JS代码加载后续内容,因此无法拿到完整数据,而浏览器「另存为」操作会保存渲染完成后的完整DOM树,所以内容是全的。
以下是适合批量爬取的解决方案:
方案1:Python Playwright实现(推荐,灵活度高)
Playwright是自带无头浏览器的自动化工具,能模拟完整的浏览器渲染流程,获取的内容和浏览器手动另存为完全一致。
- 安装依赖:
pip install playwright playwright install chromium
- 批量爬取示例代码(支持可变参数URL):
from playwright.sync_api import sync_playwright import time # 填入你所有需要爬取的URL,末尾可变参数自行拼接即可 url_list = [ "https://www.camoni.co.il/411788/168022", # 其余URL直接追加到列表中 ] with sync_playwright() as p: # 启动无界面浏览器,不会弹出窗口 browser = p.chromium.launch(headless=True) page = browser.new_page() for idx, url in enumerate(url_list): page.goto(url) # 可调整等待时长,也可以替换为等待指定元素加载的逻辑,效率更高 time.sleep(2) # 获取渲染完成的完整HTML full_html = page.content() # 用URL末尾的参数作为文件名,避免重复 file_name = f"{url.split('/')[-2]}_{url.split('/')[-1]}.html" with open(file_name, "w", encoding="utf-8") as f: f.write(full_html) # 可按需添加随机延迟,降低被网站封禁的概率 browser.close()
如果爬取量很大,可以改成异步实现,还可以开启请求拦截屏蔽图片、CSS等非必要资源,进一步提升爬取效率。
方案2:命令行实现(适合轻量批量场景)
可以使用基于Chrome内核的命令行渲染工具,不需要写复杂代码即可直接获取完整HTML:
- 安装工具:
npm install -g puppeteer-cli - 单页下载命令:
puppeteer print https://www.camoni.co.il/411788/168022 411788_168022.html - 批量下载只需写shell循环遍历所有URL参数即可
注意:爬取时请控制请求频率,遵守目标网站的爬取规则,避免IP被临时封禁。
内容的提问来源于stack exchange,提问作者Ron Keinan
相关产品推荐
相关产品推荐

