使用ggmsa进行MSA时Biostrings报错:seqtype方法匹配失败
多序列比对(MSA)代码错误解决:seqtype方法匹配失败
问题场景
需要对大鼠(Rat)、斑马鱼(Zebrafish)、鳉鱼(Pupfish)3个物种的同一肽段,以及M35、M871两个合成肽段进行多序列比对(MSA),分析一致性与差异性,但运行代码时出现方法匹配错误。
原代码
library(ggmsa) galanin_table <- c("MACSKHLVLFLTILLSLAETPDSAPAHRGRGGWTLNSAGYLLGPVLHLSSKANQGRKTDSALEILDLWKAIDGLPYSRSPRMTKRSMGETFVKPRTGDLRIVDKNVPDEEATLNL", "Rat", "MHRCVGGVCVSLIVCAFLTETLGMVIAAKEKRGWTLNSAGYLLGPRRIDHLIQIKDTPSARGREDLLGQYAIDSHRSLSDKHGLAGKREMPLDEDFKTGALRIADEDVVHTIIDFLSYLKLKEIGALDSLPSSLTSEEISQP", "Zebrafish", "MQRSFAVFCVSLIFCATLSETIGLVIAAKEKRGWTLNSAGYLLGPRRIDHLIQIKDSPSARGRDELVNQYGIDGHRTLGDKAGLAGKRDMAQEDDVRTGPLRIGDEDIIHTVIDFLSYLKLKEMGALDSLPSPLTSDELANP", "Pupfish", "GWTLNSAGYLLGPPPGFSPFR","M35", "WTLNSAGYLLGPEHPPPALALA","M871") galanin_matrix <- matrix(galanin_table, byrow=T, nrow=5) galanin_table <- as.data.frame(galanin_matrix, stringsAsFactors = F) colnames(galanin_table) <- c("Sequences", "Species") galanin_table <- as.data.frame(galanin_table) galanin_list <- as.list(galanin_table) galanin_asvector <- as.vector(galanin_list) galanin_asvector_ss <- Biostrings::AAStringSet(x= galanin_asvector)
错误信息
Error in (function (classes, fdef, mtable) : unable to find an inherited method for function 'seqtype' for signature '"character"'
错误原因
输入向量构建逻辑错误:
as.list(galanin_table)会将数据框拆分为两个列表元素(对应Sequences和Species列),转成向量后得到嵌套结构的字符向量组Biostrings::AAStringSet要求输入是单一的氨基酸序列字符向量,而非嵌套列表,因此触发方法匹配失败- 原代码中重复执行
as.data.frame(galanin_table)属于冗余操作,无实际作用
修正后的代码
library(ggmsa) # 按"序列+名称"的顺序整理原始数据,确保每两个元素为一组 seq_data <- c( "MACSKHLVLFLTILLSLAETPDSAPAHRGRGGWTLNSAGYLLGPVLHLSSKANQGRKTDSALEILDLWKAIDGLPYSRSPRMTKRSMGETFVKPRTGDLRIVDKNVPDEEATLNL", "Rat", "MHRCVGGVCVSLIVCAFLTETLGMVIAAKEKRGWTLNSAGYLLGPRRIDHLIQIKDTPSARGREDLLGQYAIDSHRSLSDKHGLAGKREMPLDEDFKTGALRIADEDVVHTIIDFLSYLKLKEIGALDSLPSSLTSEEISQP", "Zebrafish", "MQRSFAVFCVSLIFCATLSETIGLVIAAKEKRGWTLNSAGYLLGPRRIDHLIQIKDSPSARGRDELVNQYGIDGHRTLGDKAGLAGKRDMAQEDDVRTGPLRIGDEDIIHTVIDFLSYLKLKEMGALDSLPSPLTSDELANP", "Pupfish", "GWTLNSAGYLLGPPPGFSPFR", "M35", "WTLNSAGYLLGPEHPPPALALA", "M871" ) # 拆分出序列和对应的名称 sequences <- seq_data[seq(1, length(seq_data), by = 2)] names(sequences) <- seq_data[seq(2, length(seq_data), by = 2)] # 构建符合要求的AAStringSet对象 galanin_asvector_ss <- Biostrings::AAStringSet(x = sequences) # 执行多序列比对并可视化 ggmsa(galanin_asvector_ss, font = "DroidSansMono", color = "Chemistry_NT")
修正说明
- 直接拆分原始向量为序列和名称两部分,避免冗余的数据框、列表转换操作
- 给序列向量设置名称,后续MSA可视化时会自动显示对应的物种/肽段标识
- 确保传入
AAStringSet的是纯氨基酸序列的字符向量,完全匹配方法的参数要求
内容的提问来源于stack exchange,提问作者sometimespetisometimesfeña
相关产品推荐
相关产品推荐

