Question

我正在尝试确定Pandas列中是否存在具有特定值的条目。我尝试用if x in df['id']执行此操作。我认为这是有效的，除非我给它提供了一个我知道不在列43 in df['id']中的值，它仍然返回True。当我对仅包含与缺失的标识df[df['id'] == 43]匹配的条目的数据框进行子集化时，显然其中没有条目。如何确定Pandas数据框中的列是否包含特定值以及为什么我的当前方法不起作用？（仅供参考，当我在此answer中使用实现时，我遇到了同样的问题）。

Answer 1

系列的

in检查值是否在索引中：

In [11]: s = pd.Series(list('abc'))

In [12]: s
Out[12]: 
0    a
1    b
2    c
dtype: object

In [13]: 1 in s
Out[13]: True

In [14]: 'a' in s
Out[14]: False

一种选择是查看它是否在unique值中：

In [21]: s.unique()
Out[21]: array(['a', 'b', 'c'], dtype=object)

In [22]: 'a' in s.unique()
Out[22]: True

或python集：

In [23]: set(s)
Out[23]: {'a', 'b', 'c'}

In [24]: 'a' in set(s)
Out[24]: True

正如@DSM所指出的那样，它可能更有效（特别是如果你只是为一个值做这个），只需直接使用这些值：

In [31]: s.values
Out[31]: array(['a', 'b', 'c'], dtype=object)

In [32]: 'a' in s.values
Out[32]: True

Answer 2

您也可以使用pandas.Series.isin，但它比'a' in s.values稍长：

In [2]: s = pd.Series(list('abc'))

In [3]: s
Out[3]: 
0    a
1    b
2    c
dtype: object

In [3]: s.isin(['a'])
Out[3]: 
0    True
1    False
2    False
dtype: bool

In [4]: s[s.isin(['a'])].empty
Out[4]: False

In [5]: s[s.isin(['z'])].empty
Out[5]: True

但是，如果您需要为DataFrame一次匹配多个值，则此方法可以更灵活（请参阅DataFrame.isin）

>>> df = DataFrame({'A': [1, 2, 3], 'B': [1, 4, 7]})
>>> df.isin({'A': [1, 3], 'B': [4, 7, 12]})
       A      B
0   True  False  # Note that B didn't match 1 here.
1  False   True
2   True   True

Answer 3

found = df[df['Column'].str.contains('Text_to_search')]
print(found.count())

found.count()将包含匹配项

如果为0，则表示在列中找不到字符串。

Answer 4

简单情况：

if any(str(elem) in ['a','b'] for elem in df['column'].tolist()):

Answer 5

或使用Series.tolist或Series.any：

>>> s = pd.Series(list('abc'))
>>> s
0    a
1    b
2    c
dtype: object
>>> 'a' in s.tolist()
True
>>> (s=='a').any()
True

Series.tolist列出了一个Series的列表，而另一个我只是从常规Series中得到一个布尔值Series，然后检查是否有任何布尔值。布尔值True中的Series s。

Answer 6

我不建议使用“串联值”，否则可能导致许多错误。请查看以下答案以获取详细信息：Using in operator with Pandas series

Answer 7

我做了一些简单的测试：

In [10]: x = pd.Series(range(1000000))

In [13]: timeit 999999 in x.values
567 µs ± 25.6 µs per loop (mean ± std. dev. of 7 runs, 1000 loops each)

In [15]: timeit x.isin([999999]).any()
9.54 ms ± 291 µs per loop (mean ± std. dev. of 7 runs, 100 loops each)

In [16]: timeit (x == 999999).any()
6.86 ms ± 107 µs per loop (mean ± std. dev. of 7 runs, 100 loops each)

In [17]: timeit 999999 in set(x)
79.8 ms ± 1.98 ms per loop (mean ± std. dev. of 7 runs, 10 loops each)

In [21]: timeit x.eq(999999).any()
7.03 ms ± 33.7 µs per loop (mean ± std. dev. of 7 runs, 100 loops each)

In [22]: timeit x.eq(9).any()
7.04 ms ± 60 µs per loop (mean ± std. dev. of 7 runs, 100 loops each)

In [24]: timeit 9 in x.values
666 µs ± 15.7 µs per loop (mean ± std. dev. of 7 runs, 1000 loops each)

有趣的是，查找9还是999999都没关系，使用in语法（必须使用二进制搜索）似乎花费了相同的时间

In [24]: timeit 9 in x.values
666 µs ± 15.7 µs per loop (mean ± std. dev. of 7 runs, 1000 loops each)

In [25]: timeit 9999 in x.values
647 µs ± 5.21 µs per loop (mean ± std. dev. of 7 runs, 1000 loops each)

In [26]: timeit 999999 in x.values
642 µs ± 2.11 µs per loop (mean ± std. dev. of 7 runs, 1000 loops each)

In [27]: timeit 99199 in x.values
644 µs ± 5.31 µs per loop (mean ± std. dev. of 7 runs, 1000 loops each)

In [28]: timeit 1 in x.values
667 µs ± 20.8 µs per loop (mean ± std. dev. of 7 runs, 1000 loops each)

好像使用x.values最快，但是在熊猫中也许有更优雅的方式吗？

Answer 8

使用

df[df['id']==x].index.tolist()

如果x中存在id，则它将返回存在的索引列表，否则将提供一个空列表。

Answer 9

假设您的数据框看起来像：

现在，您要检查数据框中是否存在文件名“ 80900026941984”。

您可以简单地写：

if sum(df["filename"].astype("str").str.contains("80900026941984")) > 0:
    print("found")

如何确定Pandas列是否包含特定值

9 个答案: