使用pyWIN32读取含西班牙语字符的文件路径报错,求无需改文件名的解决方法
解决win32com读取含西班牙语字符docx报错的方案
嘿,这个问题我之前帮人处理过好多次!完全不用修改文件名就能搞定,给你几个靠谱的解决思路:
方案1:在win32com保存时指定UTF-8编码
win32com默认的保存编码可能和系统区域设置绑定,容易漏掉西班牙语的特殊字符(比如ñ、á、é这些)。你可以在调用SaveAs的时候明确指定UTF-8编码,这样就能完美兼容特殊字符了,代码示例:
import win32com.client as win32 word_app = win32.Dispatch("Word.Application") # 后台运行Word,不显示界面 word_app.Visible = False try: doc = word_app.Documents.Open(DOC_FILEPATH) # 65001是UTF-8的编码标识符,wdFormatEncodedText对应编码文本格式 doc.SaveAs( TXT_FILEPATH, FileFormat=win32.constants.wdFormatEncodedText, Encoding=65001 ) finally: doc.Close() word_app.Quit()
这个方法直接在保存环节解决编码问题,完全不需要改动文件名。
方案2:换用python-docx库(更轻量,无需依赖Word客户端)
如果你的环境里不方便依赖Microsoft Word客户端,那python-docx是更好的选择——它直接解析docx的底层XML结构,天生支持多语言字符,而且处理逻辑更简洁:
from docx import Document # 读取docx内容 doc = Document(DOC_FILEPATH) # 提取所有段落文本并拼接 full_text = "\n".join([para.text for para in doc.paragraphs]) # 用UTF-8编码写入txt文件 with open(TXT_FILEPATH, "w", encoding="utf-8") as txt_file: txt_file.write(full_text)
这个方案不仅避开了win32com的编码坑,还不需要安装Word,对服务器环境更友好,同样不用修改文件名。
方案3:调整Word全局编码设置(适合长期使用win32com的场景)
如果你经常用win32com处理多语言文档,可以手动调整Word的默认保存编码:
- 打开Word,点击「文件」→「选项」→「高级」
- 下拉到「保存」区域,找到「将文件保存为此编码」,选择「UTF-8」并确定
之后用win32com保存文件时,默认就会用UTF-8编码,不用每次在代码里指定。
内容的提问来源于stack exchange,提问作者AshMGM
相关产品推荐
相关产品推荐

