Colab中上传TXT文件及文本分词生成tri-grams方法咨询
在Colab中上传TXT文件及后续文本处理方案
一、上传TXT文件到Colab
有两种常用方式,按需选择:
方式1:通过界面上传
- 点击左侧边栏的文件图标(文件夹样式)
- 点击右上角的上传按钮,从本地选择目标TXT文件
- 上传完成后,文件会保存在
/content/目录下,可在左侧文件列表中查看
方式2:用代码上传(适合批量或自动化场景)
运行以下代码块,会弹出文件选择窗口,选择本地TXT文件即可:
from google.colab import files uploaded = files.upload() # 确认上传文件 for filename in uploaded.keys(): print(f'已成功上传:{filename}')
二、文本分词与生成Tri-grams
我们用NLTK库来完成这些操作,步骤如下:
1. 准备依赖库
Colab默认已安装NLTK,但需要下载分词所需的语料库:
import nltk from nltk.tokenize import word_tokenize from nltk.util import trigrams # 下载分词必需的语料 nltk.download('punkt')
2. 读取上传的文本文件
将下面的your_file.txt替换成你实际上传的文件名:
# 读取文件内容(指定编码避免乱码) with open('/content/your_file.txt', 'r', encoding='utf-8') as f: raw_text = f.read() # 可选:查看文本前500字符确认内容 print(raw_text[:500])
3. 执行分词处理
# 分词 token_list = word_tokenize(raw_text) # 可选:过滤非字母数字字符并转为小写,提升tri-grams质量 token_list = [token.lower() for token in token_list if token.isalnum()] # 查看前20个分词结果 print(f'前20个分词:{token_list[:20]}')
4. 生成Tri-grams
# 生成tri-grams列表 tri_grams_list = list(trigrams(token_list)) # 查看前10个tri-grams结果 print(f'前10个Tri-grams:{tri_grams_list[:10]}')
内容的提问来源于stack exchange,提问作者Shark eyes
相关产品推荐
相关产品推荐

