如何解析搜索栏生成的URL为域名与搜索词?Python工具推荐
Python解析搜索URL的域名与搜索词
Python有专门的标准库可以完成这个需求,无需额外安装第三方包,核心用到urllib.parse模块,具体实现方法如下:
1. 提取域名
使用urlparse函数拆分URL的各个组成部分,其中netloc字段就是目标域名:
from urllib.parse import urlparse # 示例谷歌搜索URL search_url = "https://www.google.com/search?q=url" parsed_url = urlparse(search_url) domain = parsed_url.netloc print(domain) # 输出: www.google.com
2. 提取搜索词
搜索词通常存储在URL的查询参数中,谷歌搜索用q作为参数名,我们可以用parse_qs函数解析查询参数,再提取对应参数的值:
from urllib.parse import parse_qs, urlparse search_url = "https://www.google.com/search?q=url" parsed_url = urlparse(search_url) query_params = parse_qs(parsed_url.query) # 用get方法避免参数不存在时报错,取列表第一个元素是因为parse_qs返回值为列表 search_term = query_params.get("q", [""])[0] print(search_term) # 输出: url
注意事项
不同搜索引擎的查询参数名可能不同:
- 百度搜索的搜索词参数是
wd - Bing搜索的搜索词参数是
q
使用时需要对应调整参数名即可。
内容的提问来源于stack exchange,提问作者tonygrey
相关产品推荐
相关产品推荐

