You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Colab中上传TXT文件及文本分词生成tri-grams方法咨询

在Colab中上传TXT文件及后续文本处理方案

一、上传TXT文件到Colab

有两种常用方式,按需选择:

方式1:通过界面上传

  • 点击左侧边栏的文件图标(文件夹样式)
  • 点击右上角的上传按钮,从本地选择目标TXT文件
  • 上传完成后,文件会保存在/content/目录下,可在左侧文件列表中查看

方式2:用代码上传(适合批量或自动化场景)

运行以下代码块,会弹出文件选择窗口,选择本地TXT文件即可:

from google.colab import files
uploaded = files.upload()

# 确认上传文件
for filename in uploaded.keys():
    print(f'已成功上传:{filename}')

二、文本分词与生成Tri-grams

我们用NLTK库来完成这些操作,步骤如下:

1. 准备依赖库

Colab默认已安装NLTK,但需要下载分词所需的语料库:

import nltk
from nltk.tokenize import word_tokenize
from nltk.util import trigrams

# 下载分词必需的语料
nltk.download('punkt')

2. 读取上传的文本文件

将下面的your_file.txt替换成你实际上传的文件名:

# 读取文件内容(指定编码避免乱码)
with open('/content/your_file.txt', 'r', encoding='utf-8') as f:
    raw_text = f.read()

# 可选:查看文本前500字符确认内容
print(raw_text[:500])

3. 执行分词处理

# 分词
token_list = word_tokenize(raw_text)
# 可选:过滤非字母数字字符并转为小写,提升tri-grams质量
token_list = [token.lower() for token in token_list if token.isalnum()]

# 查看前20个分词结果
print(f'前20个分词:{token_list[:20]}')

4. 生成Tri-grams

# 生成tri-grams列表
tri_grams_list = list(trigrams(token_list))

# 查看前10个tri-grams结果
print(f'前10个Tri-grams:{tri_grams_list[:10]}')

内容的提问来源于stack exchange,提问作者Shark eyes

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.24 08:49:53