You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

R中不同长度向量组合问题:crossing()结果不符预期

问题原因与解决方案

你猜的没错!tidyr::crossing()确实会自动移除重复值后再生成笛卡尔积,这就是你得到的组合数远小于预期的原因。

为什么会这样?

crossing()的设计逻辑是生成输入向量唯一值之间的所有组合,而不是原始向量所有元素的两两配对。举个简单例子:如果你的sites向量里有5个重复的邮编,crossing()会先把它当成1个唯一值来处理,最终的组合数自然会比「原始长度乘积」小。

你可以快速验证这个猜想:运行下面的代码,看看你的sites和customers的唯一值数量乘积是不是正好等于35760:

length(unique(sites)) * length(unique(customers))

如何得到预期的所有组合?

如果你需要保留原始向量中所有元素的两两配对(包括重复邮编的多次组合),应该用expand.grid()函数——它不会对输入向量去重,会严格按照原始长度生成笛卡尔积。

优化后的代码如下:

library(readxl)
library(dplyr)

# 读取数据
data <- read_xlsx("Sites.xlsx", sheet = "Sheet3")
data2 <- read_xlsx("Customers.xlsx", sheet = "Sheet1")

# 更可靠地提取向量(用pull替代as.vector+数据框索引)
sites <- data %>% pull("FRT - Ship From Zip")
customers <- data2 %>% pull("Ship_To_Zip")

# 生成所有原始元素的笛卡尔积
com_data <- expand.grid(Customers = customers, sites = sites)

# 验证行数:应该等于 20*6057 = 121140
nrow(com_data)

小提示

  • 如果你其实只需要不同邮编之间的唯一组合,那crossing()的行为是符合预期的;
  • 用pull()提取向量比as.vector(data['列名'])更稳妥,因为后者得到的其实是一个列表结构,而不是真正的原子向量。

内容的提问来源于stack exchange,提问作者Dustin Smith

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.07 13:18:10