如何在Knime中输入氨基酸构建四肽筛选库
KNIME搭建四肽全组合库的氨基酸数据导入及实操步骤
氨基酸数据导入方法
你不需要找外部数据源导入,20种标准氨基酸数据量极小,新手直接用内置节点就能快速生成基础表:
- 最简便方式:从左侧节点仓库搜索
Table Creator节点,拖到工作流画布。双击打开节点配置面板,新增1个String类型的列,列名可以设为AA_Single,逐行填入20种标准氨基酸的单字母缩写:A、R、N、D、C、Q、E、G、H、I、L、K、M、F、P、S、T、W、Y、V,点击确认运行节点,就能得到20行的单氨基酸基础数据集。 - 如果你后续需要给氨基酸关联分子量、等电点、疏水性等筛选属性,可以先把所有氨基酸属性整理成CSV格式文件,再拖入
CSV Reader节点,在配置页选择本地CSV文件路径,节点会自动识别列名和数据类型,导入后直接就能用,适合后续做属性筛选的场景。
后续三次交叉乘积生成四肽库的操作提示
导入基础氨基酸表后,按你规划的逻辑做三次笛卡尔积即可,注意几个新手容易出错的点:
- 交叉运算直接用
Cross Joiner节点实现,配置节点时一定要清空所有连接匹配条件,否则节点不会返回全量组合结果。 - 每次交叉连接完成后,用
Column Combiner节点把两段序列拼接成完整的短肽序列,拼接时分隔符设置为空字符串即可,拼接完成后可以用Column Filter节点删掉冗余的单独氨基酸列,减少表体积提升运行速度。 - 每步运行后可以核对行数确认结果正确:单氨基酸20行、二肽400行、三肽8000行、最终四肽库共160000行,行数匹配就说明组合逻辑没有问题。
小提示:做三次交叉连接时,你不需要重复导入氨基酸表,只需要把最开始生成的单氨基酸基础表复制后接入对应Cross Joiner节点的输入端口即可,能减少冗余节点。
内容的提问来源于stack exchange,提问作者Žan Smrekar
相关产品推荐
相关产品推荐

