R语言中计算二元序列状态转移概率并构建矩阵的方法咨询
计算二元向量的转移概率矩阵
直接用你的示例向量演示实操步骤:
首先定义目标向量:
vec <- c("a", "a", "b", "a", "b", "b", "b", "a")
步骤1:提取相邻元素对
我们需要把向量中连续的元素配对(第1&2个、第2&3个……第7&8个),可以通过截取向量的前后部分实现:
prev_elements <- vec[-length(vec)] # 去掉最后一个元素,得到前7个元素:a,a,b,a,b,b,b next_elements <- vec[-1] # 去掉第一个元素,得到后7个元素:a,b,a,b,b,b,a
步骤2:统计配对出现次数
用table()函数生成交叉统计表,统计每种相邻配对的次数:
transition_counts <- table(prev_elements, next_elements) print(transition_counts)
输出的交叉表如下:
next_elements prev_elements a b a 1 2 b 2 2
这个表的含义:前一个元素是a时,下一个元素为a的有1次、为b的有2次;前一个元素是b时,下一个元素为a的有2次、为b的有2次。
步骤3:计算转移概率矩阵
转移概率是基于前一个元素的条件概率,用prop.table()按行计算比例(margin=1表示按行归一化):
transition_matrix <- prop.table(transition_counts, margin = 1) print(transition_matrix)
最终得到的转移概率矩阵:
next_elements prev_elements a b a 0.3333333 0.6666667 b 0.5000000 0.5000000
第一行对应「前一个为a」时,转为a的概率(1/3)和转为b的概率(2/3);第二行对应「前一个为b」时,转为a的概率(2/4)和转为b的概率(2/4)。
关于你提到的函数的说明
你说的str_detect、str_count都是stringr包的字符串处理函数,适合单字符串内的模式统计(比如统计长字符串中"a"的出现次数),但你的问题是向量元素的相邻配对,用table和prop.table更直接,不需要用到这些字符串函数。duplicate_count(推测是duplicated())用于识别重复元素,这里也用不上。
如果你的原始数据是类似"aababbbba"的字符串,才需要先用str_split拆分向量:
library(stringr) raw_str <- "aababbbba" vec <- str_split(raw_str, "")[[1]]
之后的步骤和上面一致即可。
内容的提问来源于stack exchange,提问作者Mike_R
相关产品推荐
相关产品推荐

