Pandas结合openpyxl读取xlsx文件失败的原因排查
问题原因分析:openpyxl 3.1.1读取Excel时出现
'ReadOnlyWorksheet' object has no attribute 'defined_names'错误 核心问题:openpyxl 3.1.x的只读模式bug
openpyxl在3.1.x版本更新时,重构了只读模式下的工作表实现,ReadOnlyWorksheet类被移除了defined_names属性,但工作簿读取逻辑里的assign_names方法还在尝试访问这个属性,直接触发了属性不存在的报错。为什么只有部分文件报错
报错的两个文件里包含工作表级的定义名称(Sheet-scoped defined names)——这类名称是绑定到特定工作表的,读取时会触发assign_names方法去处理;而正常的那个文件没有这类名称,所以没触发bug。版本差异的本质
openpyxl 3.0.9及更早版本中,ReadOnlyWorksheet保留了defined_names属性来存储工作表级名称,所以能正常处理这类文件;3.1.x版本的优化没做好,属性删了但逻辑没同步改,才出了问题。Pandas的触发逻辑
Pandas用openpyxl读Excel时默认用只读模式(为了提升大文件读取性能),所以直接撞上了这个bug。
临时规避方案:
- 锁定openpyxl版本为3.0.9;
- 升级到openpyxl 3.1.2及以上版本(该bug后续已被官方修复)
内容的提问来源于stack exchange,提问作者Wing
相关产品推荐
相关产品推荐

