You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

能否在XPATH查询中将glyphicon-star转换为可读文本?

解决烂番茄评论星星评分的爬取问题

没问题,这个场景我太熟悉了!烂番茄的评分星星确实是用空的图标元素实现的,直接取文本肯定拿不到内容,不过有几个非常实用的解决办法:

  • 统计星星图标的数量(最靠谱的通用方法)
    每个星星对应一个<span class="glyphicon glyphicon-star">元素,评分就是这个元素的个数。你可以调整XPath,针对每条评论行统计星星的数量:

    # 针对单条评论行,获取星星数量
    count(//div[@class='row review_table_row']//span[@class='glyphicon glyphicon-star'])
    

    如果是遍历所有评论,建议先定位到每条评论的父节点(review_table_row),再统计该节点下的星星数量,这样就不会把所有评论的星星混在一起。

  • 检查是否存在隐藏的评分属性
    有些网站会在星星的父元素里隐藏真实的评分值(比如data-rating这类自定义属性),你可以查看那个包含星星的<span class="fl">元素有没有这类属性。比如用XPath查询:

    //div[@class='row review_table_row']//span[@class='fl' and contains(@style, 'color:#F1870A')]/@data-rating
    

    如果能查到结果,直接拿这个属性值会比统计数量更高效。

  • 用爬虫框架直接处理(以Python为例)
    如果你用BeautifulSoup或者Scrapy,处理起来会更灵活。比如用BeautifulSoup的代码示例:

    from bs4 import BeautifulSoup
    
    # 假设你已经获取了页面的HTML内容
    soup = BeautifulSoup(page_html, 'html.parser')
    for review in soup.find_all('div', class_='review_table_row'):
        # 统计当前评论的星星数量
        star_rating = len(review.find_all('span', class_='glyphicon glyphicon-star'))
        # 获取评论日期
        review_date = review.find('span', class_='fr small subtle').get_text(strip=True)
        print(f"评分: {star_rating}, 日期: {review_date}")
    

简单说,核心思路就是不要盯着空的星星元素要文本,而是通过元素数量或关联属性来获取评分值,这也是处理图标类评分的通用技巧。

内容的提问来源于stack exchange,提问作者jmt

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.29 06:42:09