从列值中拆分并获取字符串的一部分,并从pandas python中创建新列

时间:2017-07-03 12:07:53

标签: python pandas dataframe

我有一个这样的字符串作为我的df中一列的值。

ttt-OPP/MKKL-7/LNFFF-74/OOOP-71/AAD-1/RRR-232
ttt-OPP/MKKL-7/LNFFF-89/OOOP-71/AAD-1/RRR-232

如何使用此列的一部分获取新列。我需要的部分是

74
89

4 个答案:

答案 0 :(得分:4)

string.split()允许您根据分隔符(此处/-)将字符串分解为部分列表。

s = 'ttt-OPP/MKKL-7/LNFFF-74/OOOP-71/AAD-1/RRR-232'
print s.split('/')[2].split('-')[1]
# 74

使用pandas.apply()将其应用于您的专栏

df['b'] = df['a'].apply(lambda s:s.split('/')[2].split('-')[1])
print (df)

输出

                                              a   b
0  ttt-OPP/MKKL-7/LNFFF-74/OOOP-71/AAD-1/RRR-232  74
1  ttt-OPP/MKKL-7/LNFFF-89/OOOP-71/AAD-1/RRR-232  89

nb:使用@A-Za-z的解决方案,它比我的快。

答案 1 :(得分:2)

如果这是df

    val
0   ttt-OPP/MKKL-7/LNFFF-74/OOOP-71/AAD-1/RRR-232
1   ttt-OPP/MKKL-7/LNFFF-89/OOOP-71/AAD-1/RRR-232

您可以使用str.extract

df['num_val'] = df.val.str.extract('LNFFF-(\d+)/', expand = False)

你得到了

    val                                             num_val
0   ttt-OPP/MKKL-7/LNFFF-74/OOOP-71/AAD-1/RRR-232   74
1   ttt-OPP/MKKL-7/LNFFF-89/OOOP-71/AAD-1/RRR-232   89

答案 2 :(得分:1)

假设您的数据框名为df且列col:

 df['sub_col'] = pd.Series([s[21:23] for s in df['col'].values], index=df.index)

答案 3 :(得分:1)

您似乎需要str.extract

df = pd.DataFrame({'a': ['ttt-OPP/MKKL-7/LNFFF-74/OOOP-71/AAD-1/RRR-232',
                         'ttt-OPP/MKKL-7/LNFFF-89/OOOP-71/AAD-1/RRR-232']})  
print (df)
                                               a
0  ttt-OPP/MKKL-7/LNFFF-74/OOOP-71/AAD-1/RRR-232
1  ttt-OPP/MKKL-7/LNFFF-89/OOOP-71/AAD-1/RRR-232

df['new'] = df['a'].str.extract('LNFFF-(\d+)', expand=False)
#if necessary convert to ints
df['new'] = df['new'].astype(int)
print (df)
                                               a new
0  ttt-OPP/MKKL-7/LNFFF-74/OOOP-71/AAD-1/RRR-232  74
1  ttt-OPP/MKKL-7/LNFFF-89/OOOP-71/AAD-1/RRR-232  89

split拆分并按indexing with str选择的解决方案:

df['new'] = df['a'].str.split('/').str[2].str.extract('(\d+)', expand=False)
print (df)
                                               a new
0  ttt-OPP/MKKL-7/LNFFF-74/OOOP-71/AAD-1/RRR-232  74
1  ttt-OPP/MKKL-7/LNFFF-89/OOOP-71/AAD-1/RRR-232  89
df['new'] = df['a'].str.split('/').str[2].str.split('-').str[1]
print (df)
                                               a new
0  ttt-OPP/MKKL-7/LNFFF-74/OOOP-71/AAD-1/RRR-232  74
1  ttt-OPP/MKKL-7/LNFFF-89/OOOP-71/AAD-1/RRR-232  89