如何将字典存储的列表格式字符串转为纯文本以适配NLTK工具
数据集预处理解决方案
你当前数据集字典中存储的每个值都是Python列表转字符串后得到的字面量字符串,只需要把这类字符串还原为实际的列表,再做简单拼接就能得到你需要的纯文本格式,具体实现代码如下:
import ast # 原始数据集 ds = {0: "['sentences I need to parse.']", 1: "['word1', 'word2', 'word3']", 2: "['sentences and words']", 3: "['Natural language processing.']", 4: "['Further tokenization is needed.']", 5: "['Is it a question?']", 6: "['You\\'re a real noob.']"} processed_texts = [] for raw_str in ds.values(): # 将字符串形式的列表还原为真实Python列表,ast.literal_eval比eval更安全,只会解析合法字面量 content_list = ast.literal_eval(raw_str) # 列表元素用逗号+空格拼接,得到目标格式文本 processed_text = ', '.join(content_list) processed_texts.append(processed_text) # 打印验证结果 for text in processed_texts: print(text)
运行上述代码后输出的结果和你给出的预期输出完全一致。
处理得到的processed_texts列表中每个元素都是纯文本内容,你之前写好的纯文本场景下的NLTK处理逻辑(统计单句标点占比、停用词计数/移除等)可以直接复用,不需要额外调整。
内容的提问来源于stack exchange,提问作者theflteacher
相关产品推荐
相关产品推荐

