You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用WGET、CURL从网页提取URL并保存到文件

从指定网页提取并保存目标URL到文件的方法

使用WGET实现

1. 提取页面内指定特征的链接并保存

如果目标链接有明显特征(比如包含.mp4、特定域名前缀等),可以直接抓取页面内容后过滤:

wget -qO- https://polsatboxgo.pl/wideo/seriale/pierwsza-milosc/5027238/sezon-44/5027472/pierwsza-milosc-odcinek-2984/585ddf5a3dde69cb58c7f42ba52790a4 | grep -oP 'https?://[^"]+目标特征[^"]+' > target_urls.txt

替换命令中的目标特征为实际链接的标识(比如.mp4或剧集相关的关键词),执行后符合条件的链接会被保存到target_urls.txt。

2. 递归爬取关联链接并筛选

如果需要获取当前页面及直接关联页面的多个剧集链接,可开启递归爬取并限制深度:

wget -r -l 1 -q -O- https://polsatboxgo.pl/wideo/seriale/pierwsza-milosc/5027238/sezon-44/5027472/pierwsza-milosc-odcinek-2984/585ddf5a3dde69cb58c7f42ba52790a4 | grep -oP 'https?://[^"]+目标特征[^"]+' > target_urls.txt

参数说明:

  • -r:开启递归爬取
  • -l 1:限制递归深度为1(仅爬当前页面和直接跳转的页面)
  • -q:静默模式,不显示冗余输出
  • -O-:将爬取内容输出到标准输出,供grep过滤

3. 批量下载已提取的URL

如果已经通过Link Gopher分离出目标地址,将这些地址保存到target_urls.txt后,可直接批量下载:

wget -i target_urls.txt

使用CURL实现

CURL同样可以完成页面内容抓取和链接过滤:

curl -s https://polsatboxgo.pl/wideo/seriale/pierwsza-milosc/5027238/sezon-44/5027472/pierwsza-milosc-odcinek-2984/585ddf5a3dde69cb58c7f42ba52790a4 | grep -oP 'https?://[^"]+目标特征[^"]+' > target_urls.txt

参数说明:

  • -s:静默模式,隐藏进度条等输出信息

如果需要批量下载已提取的URL,CURL也支持从文件读取地址:

curl -O -K target_urls.txt

参数说明:

  • -O:保留原文件名称保存
  • -K:从指定文件读取URL和配置

内容的提问来源于stack exchange,提问作者Tedee12345

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.09 08:25:21