使用read_html读取.xls文件得到列表而非DataFrame的问题
问题原因与解决方法
这不是编码参数的问题,是pd.read_html()的返回特性导致的:
pd.read_html()读取HTML文件后,会返回一个DataFrame对象的列表(因为HTML页面里可能包含多个表格),而你直接对这个列表调用df.head(),自然会触发AttributeError——列表本身没有head()方法。
解决步骤
- 先查看返回的列表里包含多少个表格:
print(len(df))
- 提取列表中的具体DataFrame(比如取第一个表格),再调用
head()方法:
# 提取第一个表格 target_df = df[0] print(target_df.head())
- 如果不确定哪个表格是你需要的,可以遍历列表逐个查看内容:
for table in df: print("--- 表格分割线 ---") print(table.head())
- 进阶定位:如果HTML里有多个表格,还可以通过
pd.read_html()的参数精准锁定目标表格:- 用
match参数匹配表格内的关键字:
df = pd.read_html('/Users/KLG/regionlist1.xls', match="区域列表")- 用
header参数指定表头所在的行:
df = pd.read_html('/Users/KLG/regionlist1.xls', header=0) - 用
内容的提问来源于stack exchange,提问作者KLG
相关产品推荐
相关产品推荐

