You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

skip-gram与n-gram文本特征结合输入神经网络的含义及拼接方式问询

问题结论

两类特征结合指的就是特征拼接操作,拼接需要沿特征维度(第二轴,轴索引为1)执行。

具体推导逻辑

  1. 先明确两类特征的维度含义:
    • skip-gram特征维度为 (1600, 500):1600对应全部文档数量,500是单条文档的skip-gram句向量维度(由该文档所有词的词向量取均值得到)
    • n-gram特征维度为 (1600, 2000):1600同样对应全部文档数量,2000是单条文档提取的一元、二元、三元语法特征总数
  2. 拼接逻辑说明:
    深度前馈网络要求每条样本输入对应一个一维特征向量,因此需要把同一条样本的两类特征合并到同一个向量中。沿第二轴拼接后,单条文档的特征总维度为 500+2000=2500,完整数据集的特征维度变为 (1600, 2500),和论文原文提到的「输入属性包含2000个n-grams和500个embeddings」的描述完全匹配。
    如果沿第一轴(样本轴)拼接,会得到维度为 (3200, 500) 或 (3200, 2000) 的矩阵,相当于把两类特征拆成了独立样本,不符合任务要求。

内容的提问来源于stack exchange,提问作者dipankar modak

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.28 00:18:02