如何使用IMPORTXML在Google Sheets中提取网站名称?
解决Google Sheets IMPORTXML提取网站名称的问题
正确XPath路径及公式
针对你提供的Newsweek示例链接,提取网站名称可以定位到og:site_name属性的meta标签,直接用下面的公式即可:
=IMPORTXML("https://www.newsweek.com/joe-biden-ireland-peace-deal-under-threat-1792858", "//meta[@property='og:site_name']/@content")
这个公式会返回Newsweek,也就是目标网站名称。
为什么之前用//meta会报错?
直接写//meta会匹配页面上所有meta标签,IMPORTXML无法处理多个无明确指向的结果,所以触发解析错误。必须指定具体的属性(比如property='og:site_name')来精准定位到存储网站名称的那个标签,同时要加上/@content来提取标签里的内容值,而不是返回整个标签节点。
备用方案(适配其他网站)
如果遇到部分网站没有og:site_name,可以试试这些XPath:
- 针对使用
name属性标记的站点://meta[@name='site_name']/@content - 针对Twitter元数据的站点:
//meta[@name='twitter:site']/@content
内容的提问来源于stack exchange,提问作者Linda Williamson
相关产品推荐
相关产品推荐

