假设我有一个数据集,即dat1
ID block plot SPID TotHeight
1 1 1 4 44.5
2 1 1 4 51
3 1 1 4 28.7
4 1 1 4 24.5
5 1 1 4 27.3
6 1 1 4 20
17 1 10 1 44.5
19 1 10 1 51
1 1 11 21 28.7
2 1 11 21 24.5
3 1 11 21 27.3
4 1 11 21 20
5 1 11 21 12.88666667
6 1 11 21 7.235238095
7 1 11 21 1.583809524
然后我有另一个大数据集,即dat2:
ID block plot SPID Species TotHeight
1 1 1 4 BENI 72
2 1 1 4 BENI 55
3 1 1 4 BENI 51
4 1 1 4 BENI 47
5 1 1 4 BENI 49
6 1 1 4 BENI 34
7 1 1 4 BENI .
8 1 1 4 BENI 51
9 1 1 4 BENI 66
10 1 1 4 BENI 40
11 1 1 4 BENI 24
12 1 1 4 BENI 62
13 1 1 4 BENI 34
14 1 1 4 BENI 49
15 1 1 4 BENI 57
16 1 1 4 BENI 22
17 1 1 4 BENI 76
18 1 1 4 BENI 56
19 1 1 4 BENI 55
20 1 1 4 BENI 29
21 1 1 4 BENI 24
22 1 1 4 BENI 18
23 1 1 4 BENI 65
24 1 1 4 BENI 55
25 1 1 4 BENI 63
26 1 1 4 BENI 57
27 1 1 4 BENI 57
28 1 1 4 BENI 57
29 1 1 4 BENI 45
30 1 1 4 BENI 83
31 1 1 4 BENI 37
32 1 1 4 BENI 56
33 1 1 4 BENI 65
34 1 1 4 BENI 75
35 1 1 4 BENI 51
36 1 1 4 BENI .
1 1 2 16 PRSE 141
2 1 2 16 PRSE 192
3 1 2 16 PRSE .
4 1 2 16 PRSE 197
5 1 2 16 PRSE 172
6 1 2 16 PRSE 143
7 1 2 16 PRSE 141
8 1 2 16 PRSE 155
9 1 2 16 PRSE 167
10 1 2 16 PRSE 155
11 1 2 16 PRSE 175
12 1 2 16 PRSE 190
13 1 2 16 PRSE 148
14 1 2 16 PRSE 180
15 1 2 16 PRSE .
我的问题是如何从dat2获取数据的子集,其中ID,块和绘图与dat1中的数据匹配?如何从dat2获取数据的子集,其中ID,块和绘图与dat1中的数据不匹配?
答案 0 :(得分:6)
听起来你想在列ID,块和图上有merge
。
假设您的数据是在名为dat1
和dat2
的情况下阅读的,那么这应该是您想要的:
> merge(dat1, dat2, by = c("ID", "block", "plot"))
ID block plot SPID.x TotHeight.x SPID.y Species TotHeight.y
1 1 1 1 4 44.5 4 BENI 72
2 2 1 1 4 51.0 4 BENI 55
3 3 1 1 4 28.7 4 BENI 51
4 4 1 1 4 24.5 4 BENI 47
5 5 1 1 4 27.3 4 BENI 49
6 6 1 1 4 20.0 4 BENI 34
这基本上在感兴趣的三列上以SQL术语执行内连接。如果感兴趣,请阅读帮助页面以了解左,右和外连接可能性。
完全可重复的要点here
要获取未从dat2
合并的行,此黑客可以正常工作。可能有一种更有效的方法来做到这一点,但现在就是这样。首先,添加参数all.y = TRUE
。这指定了一个右连接,它将从dat2
返回未合并的行。然后,我们可以通过知道未合并的行将返回NA
:
subset(merge(dat1, dat2, by = c("ID", "block", "plot"), all.y = TRUE), is.na(SPID.x) == TRUE)