我将尝试使用此数据制作数据框:
test1 test2 test3
test [test1, test2] [testbelongsto1, testbelongst2]
对于这样的事情:
test1 test2 test3
test test1 testbelongsto1
test test2 testbelongsto2
我发现这个问题的答案https://stackoverflow.com/a/38652414 看起来我需要什么? 有很多问题可以回答我的问题..
但是,无论我尝试什么,我都会遇到这个错误:
TypeError: Cannot cast array data from dtype('int64') to dtype('int32') according to the rule 'safe'
使用此功能(见链接):
def explode(self, df, columns):
idx = np.repeat(df.index, df[columns[0]].str.len())
a = df.T.reindex_axis(columns).values
concat = np.concatenate([np.concatenate(a[i]) for i in range(a.shape[0])])
p = pd.DataFrame(concat.reshape(a.shape[0], -1).T, idx, columns)
return pd.concat([df.drop(columns, axis=1), p], axis=1).reset_index(drop=True)
重要提示!日期来自read_csv函数。 我需要爆炸的列是字符串,所以我编写了这段代码将它们转换为列表:
df['users'] = df['users'].apply(literal_eval)
尝试从dtype转换为以其他格式保存它们。 但没有解决问题......
请帮忙
更新: A'真实'下面显示了几行的数据集示例: ' TEST2' => '用户'和' test3' => '兴趣',数组大小相同。
{'index': [0, 1, 2, 3, 4], 'Unnamed: 0': [0, 1, 4, 5, 6], 'users': ['[1, 1, 28, 28, 68]', '[1, 1, 16]', '[32, 37, 66, 67, 54, 117]', '[31, 37, 66, 67, 100, 113, 117]', '[32, 37, 66, 67, 54, 117]'], 'interests': ['[set(), set(), set(), set(), set()]', '[set(), set(), set()]', '[set(), set(), set(), set(), {1535, 1542, 1527}, set()]', '[set(), set(), set(), set(), set(), set(), set()]', '[set(), set(), set(), set(), {1535, 1542, 1527}, set()]']}
更新2: 好的,这正是我想要的。 我现在获得的当前数据:
`
index lift confidence interests users
0 {333, 333} 1
0 set() 22
0 set() 77
0 0 0.75 set() 88
4 set() 33
4 3 0.50 set() 44
`
所以似乎只有每次迭代的最后一次添加。 这就是我想要的:
`
index lift confidence interests users
0 88 0.33 344, 1
0 88 0.33 333 1
0 88 0.33 set() 22
0 88 0.33 set() 77
0 88 0.33 set() 88
4 38 0.50 set() 33
4 38 0.50 set() 44
`
所以我想要的是每个用户重复每个数据行(系列),并且每个用户的兴趣也是如此。
答案 0 :(得分:1)
如果您可以信任您的数据不包含malicious strings,那么您可以使用eval
将字符串转换为Python对象。但是要非常小心 - eval的恶意字符串理论上可以在你的计算机上运行任意代码!
突出显示eval
的危险之后,您可以使用apply(pd.Series)
trick解析和重塑您的DataFrame:
import pandas as pd
df = pd.DataFrame({'test': [0, 1, 4, 5, 6], 'test2': [0, 10, 40, 50, 60], 'users': ['[1, 1, 28, 28, 68]', '[1, 1, 16]', '[32, 37, 66, 67, 54, 117]', '[31, 37, 66, 67, 100, 113, 117]', '[32, 37, 66, 67, 54, 117]'], 'interests': ['[set(), set(), set(), set(), set()]', '[set(), set(), set()]', '[set(), set(), set(), set(), {1535, 1542, 1527}, set()]', '[set(), set(), set(), set(), set(), set(), set()]', '[set(), set(), set(), set(), {1535, 1542, 1527}, set()]']})
for col in df.columns.difference(['test', 'test2']):
df[col] = df[col].apply(eval)
interests = df['interests'].apply(pd.Series)
interests = interests.stack().apply(lambda x: pd.Series(list(x)))
users = df['users'].apply(pd.Series)
users = users.stack()
result = pd.concat({'users': users, 'interests':interests}, axis=1)
result = result.stack()
result['users'] = result['users'].ffill()
result.index = result.index.droplevel(level=[1,2])
result = df.drop(['interests','users'], axis=1).join(result)
print(result)
产量
test test2 interests users
0 0 0 NaN 1.0
0 0 0 NaN 1.0
0 0 0 NaN 28.0
0 0 0 NaN 28.0
0 0 0 NaN 68.0
1 1 10 NaN 1.0
1 1 10 NaN 1.0
1 1 10 NaN 16.0
2 4 40 NaN 32.0
2 4 40 NaN 37.0
2 4 40 NaN 66.0
2 4 40 NaN 67.0
2 4 40 1535.0 54.0
2 4 40 1542.0 54.0
2 4 40 1527.0 54.0
2 4 40 NaN 117.0
3 5 50 NaN 31.0
3 5 50 NaN 37.0
3 5 50 NaN 66.0
3 5 50 NaN 67.0
3 5 50 NaN 100.0
3 5 50 NaN 113.0
3 5 50 NaN 117.0
4 6 60 NaN 32.0
4 6 60 NaN 37.0
4 6 60 NaN 66.0
4 6 60 NaN 67.0
4 6 60 1535.0 54.0
4 6 60 1542.0 54.0
4 6 60 1527.0 54.0
4 6 60 NaN 117.0
主要想法是使用apply(pd.Series)
来"爆炸"列表到列:
In [572]: interests = df['interests'].apply(pd.Series); interests
Out[572]:
0 1 2 3 4 5 6
0 {} {} {} {} {} NaN NaN
1 {} {} {} NaN NaN NaN NaN
2 {} {} {} {} {1535, 1542, 1527} {} NaN
3 {} {} {} {} {} {} {}
4 {} {} {} {} {1535, 1542, 1527} {} NaN
因为你希望"爆炸"这些集合也是第二次应用pd.Series
技巧:
In [573]: interests = interests.stack().apply(lambda x: pd.Series(list(x))); interests
Out[573]:
0 1 2
0 0 NaN NaN NaN
1 NaN NaN NaN
2 NaN NaN NaN
3 NaN NaN NaN
4 NaN NaN NaN
1 0 NaN NaN NaN
1 NaN NaN NaN
2 NaN NaN NaN
2 0 NaN NaN NaN
1 NaN NaN NaN
2 NaN NaN NaN
3 NaN NaN NaN
4 1535.0 1542.0 1527.0
...
对users
列执行相同操作后,将两个DataFrame合并为一个:
result = pd.concat({'users': users, 'interests':interests}, axis=1)
将内部列索引级别移动到索引,并在用户有多个兴趣时向前填充users
列以预测users
值:
result = result.stack()
result['users'] = result['users'].ffill()
# interests users
# 0 0 0 NaN 1.0
# 1 0 NaN 1.0
# 2 0 NaN 28.0
# 3 0 NaN 28.0
# 4 0 NaN 68.0
# 1 0 0 NaN 1.0
# 1 0 NaN 1.0
# 2 0 NaN 16.0
# 2 0 0 NaN 32.0
# 1 0 NaN 37.0
# 2 0 NaN 66.0
# 3 0 NaN 67.0
# 4 0 1535.0 54.0
# 1 1542.0 54.0
# 2 1527.0 54.0
# ...
最后,删除2个最里面的索引级别,然后将result
加入df
:
result.index = result.index.droplevel(level=[1,2])
result = df.drop(['interests','users'], axis=1).join(result)