使用PyGithub读取编码为none的PDF文件内容失败如何解决?
更新:问题已解决,详见下方评论。
问题现象
- 读取部分PDF文件时返回空字符串,仅发生在编码标识为
none的PDF文件上,编码为base64的文件可正常读取 - 怀疑文件大小是另一影响因素,推测PyGithub无法读取大文件,导致后续无法执行OCR操作
- 触发场景:读取GitHub上的整个目录并复制到其他云存储时出现,未针对特定PDF做定向测试
替代方案
计划使用requests包调用GitHub REST API替代PyGithub,后续会进行测试验证
测试用例
测试涉及包含特殊字符语言的PDF文件,例如20200910-BETA8-ROTULACION-INTERIOR-BOCETO-final.pdf,这类文件均存在相同问题
测试代码
from github import Github github_object = Github(token) github_user = github_object.get_user() repo = github_user.get_repo(repo_name) cont_raw = repo.get_contents("20200910-BETA8-ROTULACION-INTERIOR-BOCETO-final.pdf") print(cont_raw.size, len(cont_raw.content), cont_raw.encoding) # 输出: 1283429 0 none
内容的提问来源于stack exchange,提问作者Yulia V
相关产品推荐
相关产品推荐

