You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何使用BeautifulSoup正确抓取WhatsApp消息中无文本的多个emoji表情

问题修复方案

错误点排查

  • 调用find_all()后返回的是元素列表,不能直接调用仅作用于单个元素的find()、.children属性,必须先遍历列表中的每个元素
  • 外层消息div同时携带JwMbj和i0jNr两个类名,你已经匹配到div.i0jNr后,不需要再在子节点中检索div.JwMbj,该操作会匹配不到任何元素,是第二段代码无输出的核心原因
  • 每个emoji对应独立的span._3R6rC节点,你需要遍历所有匹配到的span节点,再逐个解析内容

可用实现代码

首先确保你已经导入了需要的类:

from bs4 import BeautifulSoup, NavigableString, Tag

适配全场景(单emoji、多emoji、文本+emoji混合)的代码如下:

msglist = []
# 匹配所有消息块
msg_blocks = s.find_all('div', attrs={'class':'i0jNr'}) 
for block in msg_blocks:
    msg_content = ""
    # 遍历消息块下所有层级子节点,兼容文本和emoji混合场景
    for child in block.descendants:
        if isinstance(child, NavigableString):
            # 过滤空空白字符
            if child.strip():
                msg_content += child.strip()
        elif isinstance(child, Tag) and child.name == 'img' and 'alt' in child.attrs:
            msg_content += child.attrs['alt']
    # 输出/存储结果
    print(msg_content)
    msglist.append(msg_content)

实现说明

  • 用descendants遍历消息块下所有层级的子节点,无需逐层嵌套查找,同时兼容纯文本、纯emoji、文本emoji混合的所有场景
  • 直接识别img标签的alt属性提取emoji,不需要额外定位span节点,逻辑更简洁
  • 自动过滤空的空白字符,输出的内容和WhatsApp显示的消息完全一致
  • 如果仅需要提取emoji忽略文本内容,只需删除代码中isinstance(child, NavigableString)对应的分支即可

内容的提问来源于stack exchange,提问作者Pranav Patil

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.06 23:27:01