R语言中如何针对字符串的每个位置调用自定义函数?
R语言实现全序列TATA框扫描函数
基础实现(完全复用现有find.TATA函数)
直接使用base R自带的vapply遍历1~995的所有位置,调用已有函数返回结果:
scan_TATA_whole_seq <- function(dna_seq) { # 遍历所有待检测位置,调用find.TATA返回布尔结果 bool_res <- vapply( X = 1:995, FUN = find.TATA, FUN.VALUE = logical(1), # 固定返回值类型为单个布尔值,避免类型异常 s = dna_seq # 固定传入待检测DNA序列 ) return(bool_res) }
使用说明
- 调用方式:传入你的DNA序列字符串即可,比如
res <- scan_TATA_whole_seq(your_dna_string) - 返回值是长度为995的布尔向量,第
i位对应序列第i个位置的检测结果 - 统计匹配成功的次数直接用
sum(res)即可,R中布尔值TRUE会自动转为1、FALSE转为0,不需要额外转哑变量
可选优化实现(更高运行效率)
原有find.TATA每次调用都会重复执行字符串转向量的操作,批量检测时可以把这一步提到外层,减少重复计算,不需要依赖原有函数也能实现相同逻辑:
scan_TATA_optimized <- function(dna_seq) { # 提前一次性完成序列转换,避免重复计算 dna_vec <- string.to.vec(dna_seq) tata_vec <- string.to.vec("TATAAA") bool_res <- vapply( X = 1:995, FUN = function(k) all(dna_vec[k:(k+5)] == tata_vec), FUN.VALUE = logical(1) ) return(bool_res) }
内容的提问来源于stack exchange,提问作者user28476
相关产品推荐
相关产品推荐

