如何用WGET、CURL从网页提取URL并保存到文件
从指定网页提取并保存目标URL到文件的方法
使用WGET实现
1. 提取页面内指定特征的链接并保存
如果目标链接有明显特征(比如包含.mp4、特定域名前缀等),可以直接抓取页面内容后过滤:
wget -qO- https://polsatboxgo.pl/wideo/seriale/pierwsza-milosc/5027238/sezon-44/5027472/pierwsza-milosc-odcinek-2984/585ddf5a3dde69cb58c7f42ba52790a4 | grep -oP 'https?://[^"]+目标特征[^"]+' > target_urls.txt
替换命令中的目标特征为实际链接的标识(比如.mp4或剧集相关的关键词),执行后符合条件的链接会被保存到target_urls.txt。
2. 递归爬取关联链接并筛选
如果需要获取当前页面及直接关联页面的多个剧集链接,可开启递归爬取并限制深度:
wget -r -l 1 -q -O- https://polsatboxgo.pl/wideo/seriale/pierwsza-milosc/5027238/sezon-44/5027472/pierwsza-milosc-odcinek-2984/585ddf5a3dde69cb58c7f42ba52790a4 | grep -oP 'https?://[^"]+目标特征[^"]+' > target_urls.txt
参数说明:
-r:开启递归爬取-l 1:限制递归深度为1(仅爬当前页面和直接跳转的页面)-q:静默模式,不显示冗余输出-O-:将爬取内容输出到标准输出,供grep过滤
3. 批量下载已提取的URL
如果已经通过Link Gopher分离出目标地址,将这些地址保存到target_urls.txt后,可直接批量下载:
wget -i target_urls.txt
使用CURL实现
CURL同样可以完成页面内容抓取和链接过滤:
curl -s https://polsatboxgo.pl/wideo/seriale/pierwsza-milosc/5027238/sezon-44/5027472/pierwsza-milosc-odcinek-2984/585ddf5a3dde69cb58c7f42ba52790a4 | grep -oP 'https?://[^"]+目标特征[^"]+' > target_urls.txt
参数说明:
-s:静默模式,隐藏进度条等输出信息
如果需要批量下载已提取的URL,CURL也支持从文件读取地址:
curl -O -K target_urls.txt
参数说明:
-O:保留原文件名称保存-K:从指定文件读取URL和配置
内容的提问来源于stack exchange,提问作者Tedee12345
相关产品推荐
相关产品推荐

