如何将GitHub数据转换为Pandas DataFrame?以及如何在JupyterLab中导入CSV文件创建名为Titanic的DataFrame?
你的两个Pandas数据处理问题解决方案
嘿,我来帮你搞定这两个技术问题:
一、如何将GitHub中的数据转换为Pandas DataFrame?
GitHub上的数据通常可以通过两种方式导入Pandas:
直接读取原始文件链接:如果目标文件是CSV、JSON这类Pandas支持的格式,你可以直接用Pandas的读取函数加载GitHub上的原始文件链接(注意不是文件的GitHub网页链接,要点击文件页面的「Raw」按钮获取纯文本链接)。举个例子:
import pandas as pd # 读取GitHub上的CSV文件 df = pd.read_csv("https://raw.githubusercontent.com/用户名/仓库名/分支名/文件路径.csv") # 如果是JSON文件,用read_json # df = pd.read_json("https://raw.githubusercontent.com/用户名/仓库名/分支名/文件路径.json")克隆仓库后读取本地文件:如果数据文件很多或者需要频繁使用,你可以先把GitHub仓库克隆到本地,再读取本地文件路径:
# 克隆仓库到本地的终端命令 git clone https://github.com/用户名/仓库名.git然后在JupyterLab里读取:
import pandas as pd df = pd.read_csv("/本地仓库路径/文件路径.csv")
二、修复Titanic CSV导入的语法错误
你刚才的错误是把读取数据和导入模块的操作搞混啦!import是用来导入Python模块的,不能直接用来加载数据文件。正确的做法是先导入pandas库,再用pd.read_csv()读取目标URL并赋值给Titanic变量:
import pandas as pd # 直接读取GitHub上的Titanic CSV文件并赋值给Titanic DataFrame Titanic = pd.read_csv("https://raw.githubusercontent.com/pandas-dev/pandas/master/doc/data/titanic.csv") # 可以用head()查看前5行数据验证是否成功 Titanic.head()
运行这段代码后,你就能得到名为Titanic的DataFrame了。如果之后你把CSV文件下载到了本地,只需要把URL换成本地文件路径就行,比如:
Titanic = pd.read_csv("./titanic.csv") # 假设文件在当前工作目录下
内容的提问来源于stack exchange,提问作者SidTheCoder
相关产品推荐
相关产品推荐

