如何使用IMPORTXML提取指定网页列表内所有链接的URL地址?
调整方案
你当前的XPath语句选中的是<a>标签节点本身,IMPORTXML默认会提取节点的文本内容,因此只会返回链接文字。要获取链接地址,只需在原有XPath的基础上指定提取href属性即可。
修改后的XPath语句
//*[contains(concat( " ", @class, " " ), concat( " ", "listaLinks", " " ))]//a/@href
补充说明
如果抓取到的链接是相对路径,可以结合ARRAYFORMULA批量拼接域名前缀,得到完整的可访问URL,完整公式示例如下:
=ARRAYFORMULA("http://www.derecho.uba.ar"&IMPORTXML("http://www.derecho.uba.ar/academica/asuntos_estudiantiles/pasantias/ofertas_anteriores.php", "//*[contains(concat( ' ', @class, ' ' ), concat( ' ', 'listaLinks', ' ' ))]//a/@href"))
内容的提问来源于stack exchange,提问作者nicolas hernandez
相关产品推荐
相关产品推荐

