You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用PyGithub读取编码为none的PDF文件内容失败如何解决?

更新:问题已解决,详见下方评论。

问题现象
  • 读取部分PDF文件时返回空字符串,仅发生在编码标识为none的PDF文件上,编码为base64的文件可正常读取
  • 怀疑文件大小是另一影响因素,推测PyGithub无法读取大文件,导致后续无法执行OCR操作
  • 触发场景:读取GitHub上的整个目录并复制到其他云存储时出现,未针对特定PDF做定向测试
替代方案

计划使用requests包调用GitHub REST API替代PyGithub,后续会进行测试验证

测试用例

测试涉及包含特殊字符语言的PDF文件,例如20200910-BETA8-ROTULACION-INTERIOR-BOCETO-final.pdf,这类文件均存在相同问题

测试代码
from github import Github

github_object = Github(token)
github_user = github_object.get_user()
repo = github_user.get_repo(repo_name)
cont_raw = repo.get_contents("20200910-BETA8-ROTULACION-INTERIOR-BOCETO-final.pdf")
print(cont_raw.size, len(cont_raw.content), cont_raw.encoding) 
# 输出: 1283429 0 none

内容的提问来源于stack exchange,提问作者Yulia V

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.17 14:33:00