无法使用scraper时如何手动下载动态页面的完整HTML
动态渲染页面完整HTML手动获取方法
你之前用「查看网页源代码」拿到的是服务器初始返回的静态文件,JS动态加载、渲染的内容不会包含在里面,按下面步骤操作就能拿到和你看到的页面完全一致的完整HTML,全程不需要写爬虫,也不会触发站点的抓取识别:
- 用Chrome/Edge这类常见的Chromium内核浏览器打开目标页面,等页面加载完成后,从页面顶部慢慢滚动到底部,把所有懒加载的图片、动态模块都刷出来,确保你需要的内容全部显示在页面上。
- 按
F12快捷键打开开发者工具(Dev Tools),直接切换到*元素(Elements)*面板,这个面板里展示的就是当前页面实时渲染完成的完整DOM结构,不是未执行JS的初始源码。 - 在元素面板的最顶层找到
<html>根标签,右键点击这个标签,依次选择复制(Copy)->复制外部HTML(Copy outerHTML),整个页面的完整HTML代码就会被复制到系统剪贴板。 - 新建一个空白的文本文档,把剪贴板里的内容粘贴进去,把文件后缀名改成
.html保存,就是你需要的完整页面HTML文件。
踩坑提示:如果站点做了右键复制限制,你点选
<html>根标签之后直接按Ctrl+C快捷键就能完成复制,不用依赖右键菜单;如果保存后的文件缺内容,回到页面确认有没有没加载完的动态模块,重新全量加载后再复制一次就行。
内容的提问来源于stack exchange,提问作者Voley Betz
相关产品推荐
相关产品推荐

