在Web scraper中使用多个Web页面

时间:2016-01-11 09:42:49

标签: python social-media

我一直在研究一些Python代码,以便能够从政府网站获取社交媒体帐户的链接,以便轻松地与城市联系。我设法调整了一些代码,以便在2.7中工作,这会打印出给定输入网站上的facebook,twitter,linkedin和google +的所有链接。我目前遇到的问题是,我不是只在一个网页上查找链接,而是在大约200个网站的列表中,我在Excel文件中。我没有将这些类型的列表导入Python的经验,所以我想知道是否有人可以查看代码,并建议一个正确的方法将所有这些网页设置为base_url,如果可能的话;

import cookielib

import mechanize

base_url = "http://www.amsterdam.nl"

br = mechanize.Browser()
cj = cookielib.LWPCookieJar()
br.set_cookiejar(cj)
br.set_handle_robots(False)
br.set_handle_equiv(False)
br.set_handle_redirect(True)
br.set_handle_refresh(mechanize._http.HTTPRefreshProcessor(), max_time=1)
br.addheaders = [('User-agent',
              'Mozilla/5.0 (X11; U; Linux i686; en-US; rv:1.9.0.1) Gecko/2008071615 Fedora/3.0.1-1.fc9 Firefox/3.0.1')]
page = br.open(base_url, timeout=10)

links = {}
for link in br.links():
    if link.url.find('facebook')>=0 or link.url.find('twitter')>=0 or link.url.find('linkedin')>=0 or link.url.find('plus.google')>=0:
    links[link.url] = {'count': 1, 'texts': [link.text]}

# printing
for link, data in links.iteritems():
print "%s - %s - %s - %d" % (base_url, link, ",".join(data['texts']), data['count'])

1 个答案:

答案 0 :(得分:5)

您提到您的excel文件包含所有网站的列表吗?因此,您可以将excel文件导出为csv文件,然后您可以在python代码中读取值。

Here's some more information regarding that

Here's how to work directly with excel files

你可以做一些事情:

import csv

links = []

with open('urls.csv', 'r') as csv_file:
    csv_reader = csv.reader(csv_file)
    # Simple example where only a single column of URL's is present
    links = list(csv_reader)

现在links是所有网址的列表。然后,您可以在一个函数内循环遍历该列表,该函数将获取页面并擦除数据。

def extract_social_links(links):
    for link in links:
        base_url = link 

        br = mechanize.Browser()
        cj = cookielib.LWPCookieJar()
        br.set_cookiejar(cj)
        br.set_handle_robots(False)
        br.set_handle_equiv(False)
        br.set_handle_redirect(True)
        br.set_handle_refresh(mechanize._http.HTTPRefreshProcessor(),     max_time=1)
        br.addheaders = [('User-agent',
          'Mozilla/5.0 (X11; U; Linux i686; en-US; rv:1.9.0.1) Gecko/2008071615 Fedora/3.0.1-1.fc9 Firefox/3.0.1')]
        page = br.open(base_url, timeout=10)

        links = {}
        for link in br.links():
            if link.url.find('facebook')>=0 or link.url.find('twitter')>=0 or     link.url.find('linkedin')>=0 or link.url.find('plus.google')>=0:
            links[link.url] = {'count': 1, 'texts': [link.text]}

        # printing
        for link, data in links.iteritems():
        print "%s - %s - %s - %d" % (base_url, link, ",".join(data['texts']), data['count'])

顺便说一下,你应该分开你的if条件,使它们更具可读性。