如何列出NLTK中所有已下载的数据集?
列出已下载NLTK数据集的操作方法
方法1:通过Python代码批量导出已下载资源
如果需要在代码中直接获取结果用于后续处理,可以调用NLTK内置的下载器接口实现:
- 输出包含id、名称、描述的完整已安装资源列表:
from nltk.downloader import Downloader downloader = Downloader() for pkg in downloader.installed_packages(): print(f"资源ID:{pkg.id},名称:{pkg.name},描述:{pkg.description}")
- 只输出简略的资源ID列表:
from nltk.downloader import Downloader print([pkg.id for pkg in Downloader().installed_packages()])
- 仅筛选已下载的语料类数据集,排除模型、工具类资源:
from nltk.downloader import Downloader downloader = Downloader() corpora_list = [pkg.id for pkg in downloader.installed_packages() if pkg.subdir == "corpora"] print(corpora_list)
方法2:通过GUI交互界面查看
如果只需要手动查看不需要代码调用,直接运行nltk.download()调出NLTK的可视化下载管理器,切换到「Installed」标签页,就能直观看到所有已下载的资源,还支持直接进行更新、卸载操作。
内容的提问来源于stack exchange,提问作者Mohit Khulbe
相关产品推荐
相关产品推荐

