如何使用Pandas库将文件夹中的PDF文件名导出至Excel表格
用Pandas导出PDF文件名到Excel
1. 准备工作
先确保已安装pandas和openpyxl(导出xlsx格式需要依赖openpyxl引擎),如果没装,执行以下命令:
pip install pandas openpyxl
2. 核心代码实现
直接筛选PDF文件并导出,比遍历所有文件更高效:
import glob import pandas as pd # 获取当前目录下所有PDF文件名(如需指定其他文件夹,把路径写在引号里,比如"/Users/xxx/Documents/*.pdf") pdf_files = glob.glob("*.pdf") # 将文件名列表转为DataFrame,自定义列名让表格更直观 df = pd.DataFrame(pdf_files, columns=["PDF文件名"]) # 导出到Excel文件,index=False用于去掉默认的索引列 df.to_excel("PDF文件名列表.xlsx", index=False, engine="openpyxl")
3. 拓展场景
- 获取绝对路径:如果需要导出文件的完整路径,可搭配
os.path.abspath:
import os pdf_files = [os.path.abspath(file) for file in glob.glob("*.pdf")]
- 遍历子文件夹:要包含嵌套文件夹里的PDF,开启递归匹配:
pdf_files = glob.glob("**/*.pdf", recursive=True)
内容的提问来源于stack exchange,提问作者Raghav GR
相关产品推荐
相关产品推荐

