如何通过Pandas查看指定GitHub数据集的内容与列信息?
使用Pandas查看目标数据集内容
直接通过Pandas的read_csv()函数可以读取该raw格式的数据集链接,无需浏览器访问,具体操作步骤如下:
首先确保已安装Pandas,若未安装可执行命令:
pip install pandas编写Python代码读取数据集并查看关键信息:
import pandas as pd # 目标目录下的具体数据集文件链接(原链接是目录,需指定文件名) data_url = "https://raw.githubusercontent.com/python-visualization/folium/master/examples/data/crime.csv" # 读取数据集 df = pd.read_csv(data_url) # 查看完整列列表 print("列列表:") print(df.columns.tolist()) # 查看各列的分类(数据类型)及基本信息 print("\n列分类及基本信息:") df.info() # 可选:查看前5行数据,直观了解内容结构 print("\n前5行数据:") print(df.head())
注意事项
- 原链接是一个文件目录,你需要指定具体文件名才能读取,该目录下常见的文件有
crime.csv、us-states.json、world-countries.json等,对应不同类型的地图数据集。 - 如果Python环境也无法直接访问该链接,可在读取时添加代理配置,示例:
proxies = { 'http': 'http://your-proxy:port', 'https': 'https://your-proxy:port' } df = pd.read_csv(data_url, storage_options=proxies)
内容的提问来源于stack exchange,提问作者Jose Hurtado
相关产品推荐
相关产品推荐

