Question

定义items.py：

import scrapy 

class CraigslistSampleItem(scrapy.Item):
    title = scrapy.Field()
    link = scrapy.Field()

并通过蜘蛛填充每个项目：

item = CraigslistSampleItem()
item["title"] = $someXpath.extract() 
item["link"] = $someOtherXpath.extract()

当我将这些附加到列表（由parse（）返回）并将其存储为例如一个csv，我得到两列数据， title 和 link ，如预期的那样。如果我注释掉XPath for link 并存储为csv，我仍然会得到两列数据，其中链接列中的值为空字符串。这似乎是合理的，因为标题和链接都是每个 CraigslistSampleItem 类的属性。那么，我认为我可以做这样的事情（用链接的XPath仍然注释掉）：

  if item["link"] == '':
      print "link has not been given a value"

然而，尝试获取每个项目的链接属性失败了：

File "/System/Library/Frameworks/Python.framework/Versions/2.7/lib/python2.7/site-packages/scrapy/item.py", line 50, in __getitem__
    return self._values[key]
exceptions.KeyError: 'link'

如果每个项目实例确实都有链接值（虽然是空字符串），为什么我无法访问此密钥？

Answer 1

Scrapy Item类提供了一个类似字典的界面，用于存储提取的数据。 没有为项目字段设置默认值。

要检查字段是否已设置，只需检查项目实例中的字段键：

if 'link' not in item:
    print "link has not been given a value"

演示：

In [1]: import scrapy

In [2]: class CraigslistSampleItem(scrapy.Item):
   ...:         title = scrapy.Field()
   ...:         link = scrapy.Field()
   ...:     

In [3]: item = CraigslistSampleItem()

In [4]: item["title"] = "test"

In [5]: item
Out[5]: {'title': 'test'}

In [6]: "link" in item
Out[6]: False

In [7]: item["link"] = "test link"

In [8]: "link" in item
Out[8]: True

Scrapy：如果密钥存在，为什么我会得到KeyError？

1 个答案: