如何用XPath选取每个div元素中首次出现的a标签?
简洁XPath实现选取每个div下首次出现的a标签
先把你的HTML结构格式化后展示,方便更清晰地理解层级:
<div> <div> <h3> <a href='http://Ali.org'></a> </h3> <div> <p> <a href='http://Mohammad.org'></a> </p> </div> </div> <div> <h4> <a href='http://Ali.org'></a> </h4> <p> <a href='http://Mohammad.org'></a> </p> </div> </div>
你的需求是选取最外层div下每个直接子div中首次出现的a标签(也就是两个指向http://Ali.org的链接),这里有几个更简洁且易读的XPath写法可以满足需求:
方案1:精准定位目标容器后取首个a标签
//div/div//a[1]
哦不对,等下——这个写法会把每个子层级里的首个a都选中(包括http://Mohammad.org的那个),所以得再加一层限制,精准锁定最外层div的直接子div:
//div/*[self::div]//a[1]
解释:
//div/*[self::div]先定位到最外层div的所有直接子div(也就是你要遍历的两个目标容器)//a[1]表示在每个这样的容器下,选取第一个出现的a标签,刚好就是你要的两个目标链接。
方案2:更高效的层级定位写法
如果你的结构里,目标a标签都是所在子div下第一个块级元素(h3/h4)的子元素,还可以用这个性能更优的写法:
//div/div/*[position()=1]/a
解释:
//div/div/*[position()=1]直接选中每个子div下的第一个子元素(也就是h3和h4)/a直接取这个元素下的a标签,不需要遍历所有a标签,定位更精准高效。
为什么你之前的写法存在问题?
//div//a[not(parent::*[not(following-sibling::*)])]:逻辑绕弯太多,可读性差,后续维护成本高//div/div//a[1]:会选中每个子层级里的首个a标签,导致http://Mohammad.org的链接也被选中,不符合需求(//div//a)[1]:是把所有符合//div//a的结果集取第一个,自然只能拿到第一个http://Ali.org的链接
内容的提问来源于stack exchange,提问作者محسن عباسی
相关产品推荐
相关产品推荐

