You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

WGET与Python urllib下载HTML内容不全 如何批量获取完整页面

你遇到的问题是目标网站的内容由JavaScript动态渲染生成,wget、urllib这类静态请求工具只会获取页面初始的静态HTML源码,不会执行JS代码加载后续内容,因此无法拿到完整数据,而浏览器「另存为」操作会保存渲染完成后的完整DOM树,所以内容是全的。

以下是适合批量爬取的解决方案:

方案1:Python Playwright实现(推荐,灵活度高)

Playwright是自带无头浏览器的自动化工具,能模拟完整的浏览器渲染流程,获取的内容和浏览器手动另存为完全一致。

  • 安装依赖:
pip install playwright
playwright install chromium
  • 批量爬取示例代码(支持可变参数URL):
from playwright.sync_api import sync_playwright
import time

# 填入你所有需要爬取的URL,末尾可变参数自行拼接即可
url_list = [
    "https://www.camoni.co.il/411788/168022",
    # 其余URL直接追加到列表中
]

with sync_playwright() as p:
    # 启动无界面浏览器,不会弹出窗口
    browser = p.chromium.launch(headless=True)
    page = browser.new_page()
    
    for idx, url in enumerate(url_list):
        page.goto(url)
        # 可调整等待时长,也可以替换为等待指定元素加载的逻辑,效率更高
        time.sleep(2)
        # 获取渲染完成的完整HTML
        full_html = page.content()
        # 用URL末尾的参数作为文件名,避免重复
        file_name = f"{url.split('/')[-2]}_{url.split('/')[-1]}.html"
        with open(file_name, "w", encoding="utf-8") as f:
            f.write(full_html)
        # 可按需添加随机延迟,降低被网站封禁的概率
    
    browser.close()

如果爬取量很大,可以改成异步实现,还可以开启请求拦截屏蔽图片、CSS等非必要资源,进一步提升爬取效率。

方案2:命令行实现(适合轻量批量场景)

可以使用基于Chrome内核的命令行渲染工具,不需要写复杂代码即可直接获取完整HTML:

  • 安装工具:npm install -g puppeteer-cli
  • 单页下载命令:puppeteer print https://www.camoni.co.il/411788/168022 411788_168022.html
  • 批量下载只需写shell循环遍历所有URL参数即可

注意:爬取时请控制请求频率,遵守目标网站的爬取规则,避免IP被临时封禁。

内容的提问来源于stack exchange,提问作者Ron Keinan

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.30 01:15:05