BeautifulSoup中append()操作导致后续find()查询失败问题咨询
根因
这是Beautiful Soup 4.8.2版本的已知内置缓存bug:
- 为了提升查询效率,bs4内部会维护一份全局元素索引表,预存id、标签名等常用查询字段的映射关系
- 4.8.2版本的
append()方法存在逻辑缺陷:对已经挂载到文档树的元素执行追加操作时,会错误触发全局索引的部分清理逻辑,导致其他已插入元素的索引记录被意外删除 - 出现问题时元素本身仍然完整存在于DOM树中,所以
prettify()可以输出完整结构,但依赖索引的find()方法就会返回空结果。
解决方案
最优方案:升级版本
该bug在4.9.0及之后的版本已经被官方修复,直接升级到最新稳定版即可彻底解决,升级命令:
pip install --upgrade beautifulsoup4
兼容4.8.2版本的规避方案
如果因为项目依赖限制不能升级版本,可选择以下两种稳定处理方式:
- 调整元素拼装顺序:先完成所有子元素的内容、属性、子节点拼装,再把完整的父元素一次性追加到文档树中,和你当前的临时方案逻辑一致
- 放弃依赖索引的
find()查询,改用不走缓存的查询方式:比如用find_all()遍历后过滤属性,或者直接通过DOM层级访问元素,示例如下:# 方式1:find_all过滤 all_tr = doc.find_all('tr') row_1 = [tr for tr in all_tr if tr.get('id') == 'row_1'][0] # 方式2:层级访问 row_1 = doc.table.contents[2] # 按实际DOM节点顺序取值即可
内容的提问来源于stack exchange,提问作者Tye。
相关产品推荐
相关产品推荐

