You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何将字典存储的列表格式字符串转为纯文本以适配NLTK工具

数据集预处理解决方案

你当前数据集字典中存储的每个值都是Python列表转字符串后得到的字面量字符串,只需要把这类字符串还原为实际的列表,再做简单拼接就能得到你需要的纯文本格式,具体实现代码如下:

import ast

# 原始数据集
ds = {0: "['sentences I need to parse.']", 
      1: "['word1', 'word2', 'word3']",
      2: "['sentences and words']",
      3: "['Natural language processing.']",
      4: "['Further tokenization is needed.']",
      5: "['Is it a question?']",
      6: "['You\\'re a real noob.']"}

processed_texts = []
for raw_str in ds.values():
    # 将字符串形式的列表还原为真实Python列表,ast.literal_eval比eval更安全,只会解析合法字面量
    content_list = ast.literal_eval(raw_str)
    # 列表元素用逗号+空格拼接,得到目标格式文本
    processed_text = ', '.join(content_list)
    processed_texts.append(processed_text)

# 打印验证结果
for text in processed_texts:
    print(text)

运行上述代码后输出的结果和你给出的预期输出完全一致。
处理得到的processed_texts列表中每个元素都是纯文本内容,你之前写好的纯文本场景下的NLTK处理逻辑(统计单句标点占比、停用词计数/移除等)可以直接复用,不需要额外调整。


内容的提问来源于stack exchange,提问作者theflteacher

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.26 13:45:08