如何爬取个人LeetCode正确提交并上传GitHub?受robots.txt限制怎么办?
爬取个人LeetCode正确提交记录并同步到GitHub的流程框架
一、优先推荐:合法合规的非爬虫方案
直接爬取robots.txt禁止的路由可能违反LeetCode服务条款,优先选择官方支持的方式:
- 调用LeetCode官方API:利用官方提供的API接口获取个人提交记录,无需爬虫,直接拿到结构化数据,这是最稳妥的途径
- 导出个人账号数据:在LeetCode账号设置中找到数据导出功能,直接下载包含所有提交记录的数据包,后续再处理数据上传
二、爬虫方式流程框架(需注意合规性)
若坚持使用爬虫,仅针对自己的账号数据操作:
- 账号登录验证:用Selenium模拟登录个人LeetCode账号,确保能访问专属的提交记录页面
- 目标数据提取:定位页面中正确提交的代码、题目名称等核心信息
- 数据格式整理:将提取的内容按题目分类,整理成清晰的文件结构(比如按题目名建文件夹,保存对应代码文件)
- 同步至GitHub:通过Git命令或Python的Git相关库,将整理好的文件推送到个人GitHub仓库
三、新手简化版流程
- 先通过LeetCode数据导出功能下载提交记录,手动整理成规范的文件结构
- 熟悉Git基础操作后,再通过GitHub网页端或本地Git工具完成上传
内容的提问来源于stack exchange,提问作者Nagavel Rajasekaran
相关产品推荐
相关产品推荐

