You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用wget仅下载到index.html,无法获取目标网站视频的问题排查

问题

我想要从网站获取视频,但使用wget仅下载了index.html文件,请问我的操作存在什么错误?以下是我使用的wget命令:

wget -r --no-cookies --no-check-certificate --page-requisites --span-hosts --convert-links --no-directories --directory-prefix=output -e robots=off --header="Accept-Language: ru-RU,ru;q=0.9,en-US;q=0.8,en;q=0.7" --header="Accept: text/html,application/xhtml+xml,application/xml;q=0.9,image/avif,image/webp,image/apng,*/*;q=0.8,application/signed-exchange;v=b3;q=0.7"  --header="Accept-Encoding: gzip, deflate, br" --header="User-Agent: Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/116.0.0.0 Safari/537.36" --header="Referer: https://5sep.zetfix.online/films/poltora-dnja/"  –wait 5 –randomwait   https://5sep.zetfix.online/films/burja/
回答

你的操作主要存在以下几个问题:

  1. wget无法处理动态加载内容
    这类视频网站的视频链接通常由JavaScript动态生成,wget作为静态HTTP爬虫,仅会下载初始HTML文件,不会执行页面中的JS代码,因此无法获取到实际的视频源地址,自然只能下载index.html。

  2. 命令参数格式错误
    你命令中的–wait 5 –randomwait使用了中文全角破折号,wget无法识别这类非标准参数,会导致等待策略失效,可能触发网站反爬机制,进一步影响爬取结果。需替换为英文半角破折号:--wait 5 --randomwait。

  3. 未指定目标文件类型
    即使wget能找到视频链接,默认也不会优先抓取视频格式文件。你需要添加--accept .mp4,.mkv,.webm这类参数,明确告知wget只下载指定格式的视频文件。

  4. 递归爬取的局限性
    -r递归爬取仅能抓取页面中静态存在的链接,对于JS动态加载的跨域视频资源,即使开启--span-hosts也无法捕获——因为这些链接根本不会出现在初始HTML里。

可行解决办法

  • 直接获取视频源URL下载:打开浏览器开发者工具(F12),切换到Network面板,刷新页面后播放视频,筛选媒体类型(Media),找到实际的视频请求URL,复制后直接用wget下载该URL。
  • 使用支持JS渲染的工具:改用专门的视频下载工具如yt-dlp(支持大多数视频站点),或者用Playwright/Puppeteer编写简单脚本,模拟浏览器渲染页面后提取视频链接再下载。

内容的提问来源于stack exchange,提问作者Artem

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.11 10:55:30