You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用Shell工具从HTML和JS源码中提取单行多个HTTP/HTTPS域名

原有命令问题说明

原有命令仅能提取单条域名的核心原因是:sed语句中前后的.*为贪婪匹配,会直接吞掉行内除最后一个匹配项外的所有URL,同时sed默认每行仅执行一次替换逻辑,因此无法处理同个行内的多个域名场景。

可行修复命令
find -s [^.]* -type f -print0 | xargs -0 grep -oE 'https?://[a-z0-9\-\._]+' | sed -E 's/^https?:\/\///' | sort | uniq
命令说明
  • 新增-type f参数限制find仅查找文件,避免文件夹名称触发匹配报错
  • grep -oE的-o参数会将每行中所有匹配到的URL单独拆分为一行输出,解决同个行多个域名的识别问题
  • 先全量匹配完整的http/https前缀+域名段,再通过sed删掉前缀,逻辑更稳定不容易漏匹配
  • 如需兼容大写的HTTP/HTTPS协议头、或域名中存在大写字母,可调整为如下命令:
find -s [^.]* -type f -print0 | xargs -0 grep -ioE 'https?://[a-z0-9\-\._]+' | sed -E 's/^https?:\/\///I' | sort | uniq

内容的提问来源于stack exchange,提问作者Leif Pedersen

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.30 06:24:02