TREC 2006 Spam Track公共语料库格式及文件夹相关技术问询
原始数据集:The TREC 2006 Public Corpus -- 75MB (trec06p.tgz)
解压后文件夹结构:
. └── trec 06p/ ├── data ├── data-delay ├── full ├── full-delay ├── ham25 ├── ham25-delay ├── ham50 ├── ham50-delay ├── spam25 ├── spam25-delay ├── spam50 └── spam50-delay
技术问题解答
带有“-delay”后缀的文件夹作用是什么?
这些后缀为-delay的文件夹对应数据集的延迟评估子集。TREC垃圾邮件评测任务里,延迟设置是模拟真实场景中邮件过滤系统的「延迟反馈」——用户不会立刻标记垃圾/正常邮件,而是间隔一段时间才反馈。这类文件夹的数据就是用来测试模型在延迟反馈场景下的性能,和无-delay的即时反馈子集做对比。full文件夹具体指代什么?是否仅包含标签信息?full文件夹是完整数据集的标签与索引集合,不仅有标注(区分垃圾邮件spam和正常邮件ham),还包含邮件索引映射,用来关联data文件夹里的原始邮件内容。它是连接原始邮件和标注信息的核心文件集合,不是只存标签。full-delay子文件夹中,HAM与ham的区别是什么?
这只是大小写命名的差异,本质都是指代正常邮件(非垃圾邮件)。早期TREC数据集的标注文件偶尔会出现大小写混用的情况,没有语义上的区别,属于同一类邮件的标注条目。data-delay文件夹为空的原因是什么?data-delay不需要单独存放邮件内容——它对应的原始邮件和data文件夹里的完全一致。延迟评估只需要在标签反馈的时序上做调整,不需要额外复制邮件数据,所以这个文件夹是空的,仅作为结构占位,配合full-delay的标注文件使用即可。解析data文件夹中的内容是否有特殊方法?
data文件夹里的邮件以原始MIME格式存储,每个文件对应一封邮件。解析时可以用常见的邮件处理工具:比如Python的email模块、Java的JavaMail库,用来提取邮件头、正文、附件等内容。需要注意部分邮件存在编码问题,要处理好UTF-8、ISO-8859-1等字符编码,同时区分好多部分邮件(multipart)的结构。
内容的提问来源于stack exchange,提问作者Manish Joyeuse

