替换字符串中的模式

时间:2015-03-12 00:03:50

标签: regex r data-manipulation

我有几种格式的字符串。分隔符是破折号(-)和每个"事物"介于两者之间是一个标记。

string <- "FA-I2-I2-I2-EX-I2-I3-FA-I1-I2-TR-I1-I2-FA-I3-I1-FAFANR-I3-I2-TR-I1-I2-I1-I2-FA-I2-I1-I3-FAQU-I1-I2-I2-I2-NR-I2-I2-NR-I1-I2-I1-NR-I3-QU-I2-I3-QUNR-I2-I1-NRQUQU-I2-I1-EX"

我想识别包含字母&#34; I&#34;连续发生(即标记I1,I2和I3)。然后我想替换那些没有分隔符的描述。例如,字符串的开头应按如下方式转换:

FA-I2I2I2-EX

所以基本上我想做的就是删除包含&#34; I&#34;的标记之间的所有破折号。

这是一个有点复杂的解决方案:

string1 <- gsub(string, pattern = "I1", replacement = "ZI1Z")
string2 <- gsub(string1, pattern = "I2", replacement = "ZI2Z")
string3 <- gsub(string2, pattern = "I3", replacement = "ZI3Z")
string4 <- gsub(string3, pattern = "Z-Z", replacement = "")
string5 <- gsub(string4, pattern = "Z", replacement = "")

给出:

"FA-I2I2I2-EX-I2I3-FA-I1I2-TR-I1I2-FA-I3I1-FAFANR-I3I2-TR-I1I2I1I2-FA-I2I1I3-FAQU-I1I2I2I2-NR-I2I2-NR-I1I2I1-NR-I3-QU-I2I3-QUNR-I2I1-NRQUQU-I2I1-EX"

有没有更优雅的方法来实现这个目标?

1 个答案:

答案 0 :(得分:4)

  

所以基本上我想做的就是删除包含&#34; I&#34;的标记之间的所有破折号。

如果您的案例听起来很简单,您可以使用外观断言。

gsub('(?<=I\\d)-(?=I\\d)', '', string, perl = TRUE)
# [1] "FA-I2I2I2-EX-I2I3-FA-I1I2-TR-I1I2-FA-I3I1-FAFANR-I3I2-TR-I1I2I1I2-FA-I2I1I3-FAQU-I1I2I2I2-NR-I2I2-NR-I1I2I1-NR-I3-QU-I2I3-QUNR-I2I1-NRQUQU-I2I1-EX"