我正在尝试使用请求(和bs4)
从网站自动获取一些内容我有一个获取cookie的脚本:
def getCookies(self):
username = 'username'
password = 'password'
URL = 'logonURL'
r = requests.get(URL, auth=('username', 'password'))
cookies = r.cookies
转储cookie看起来像:
<<class 'requests.cookies.RequestsCookieJar'>[<Cookie ASP.NET_SessionId=yqokjr55ezarqbijyrwnov45 for URL.com/>, <Cookie BIGipServerPE_Journals.lww.com_80=1440336906.20480.0000 for URL.com/>, <Cookie JournalsLockCookie=id=a5720750-3f20-4207-a500-93ae4389213c&ip=IP address for URL.com/>]>
但是当我将cookie对象传递给下一个URL时:
soup = Soup(s.get(URL, cookies = cookies).content)
它没有成功 - 我可以通过倾倒汤来看到我没有正确地向网络服务器提供我的凭据
我尝试过运行请求会话:
def getCookies(self):
self.s = requests.session()
username = 'username'
password = 'password'
URL = 'logURL'
r = self.s.get(URL, auth=('username', 'password'))
我得到的同样没有快乐。
当我访问第二页时,我通过FF中的liveHttp查看了标题,并看到了一个非常不同的形式:
Cookie: WT_FPC=id=264b0aa85e0247eb4f11355304127862:lv=1355317068013:ss=1355314918680; UserInfo=Username=username; BIGipServerPE_Journals.lww.com_80=1423559690.20480.0000; PlatformAuthCookie=true; Institution=ReferrerUrl=http://logonURL.com/?wa=wsignin1.0&wtrealm=urn:adis&wctx=http://URL.com/_layouts/Authenticate.aspx?Source=%252fpecnews%252ftoc%252f2012%252f06440&token=method|ExpireAbsolute; counterSessionGuidId=6e2bd57f-b6da-4dd4-bcb0-742428e08b5e; MyListsRefresh=12/13/2012 12:59:04 AM; ASP.NET_SessionId=40a04p45zppozc45wbadah45; JournalsLockCookie=id=85d1f38f-dcbb-476a-bc2e-92f7ac1ae493&ip=10.204.217.84; FedAuth=77u/PD94bWwgdmVyc2lvbj0iMS4wIiBlbmNvZGluZz0idXRmLTgiPz48U2VjdXJpdHlDb250ZXh0VG9rZW4gcDE6SWQ9Il9mMGU5N2M3Zi1jNzQ5LTQ4ZjktYTUxNS1mODNlYjJiNGNlYzUtNEU1MDQzOEY0RTk5QURCNDFBQTA0Mjc0RDE5QzREMEEiIHhtbG5zOnAxPSJodHRwOi8vZG9jcy5vYXNpcy1vcGVuLm9yZy93c3MvMjAwNC8wMS9vYXNpcy0yMDA0MDEtd3NzLXdzc2VjdXJpdHktdXRpbGl0eS0xLjAueHNkIiB4bWxucz0iaHR0cDovL2RvY3Mub2FzaXMtb3Blbi5vcmcvd3Mtc3gvd3Mtc2VjdXJlY29udmVyc2F0aW9uLzIwMDUxMiI+PElkZW50aWZpZXI+dXJuOnV1aWQ6ZjJmNGY5MGItMmE4Yy00OTdlLTkwNzktY2EwYjM3MTBkN2I1PC9JZGVudGlmaWVyPjxJbnN0YW5jZT51cm46dXVpZDo2NzMxN2U5Ny1lMWQ3LTQ2YzUtOTg2OC05ZGJhYjA3NDkzOWY8L0luc3RhbmNlPjwvU2VjdXJpdHlDb250ZXh0VG9rZW4+
出于显而易见的原因,我已经从问题中修改了用户名,密码和URLS。
我错过了一些明显的东西吗?是否有一种不同/正确的方法来捕获cookie - 我正在使用的当前方法不起作用。
编辑:
这是会话代码的独立版本:
s = requests.session()
username = 'username'
password = 'password'
URL = 'logonURL.aspx'
r = s.get(URL, auth=('username', 'password'))
URL = r"URL.aspx"
soup = Soup(s.get(URL).content)
读取汤的转储,我可以在html中看到它告诉我我没有访问权限 - 这个字符串只有在您没有登录时才会通过浏览器显示。
答案 0 :(得分:22)
我遇到了类似的问题并在这个问题上找到了帮助。会话jar是空的,实际上我需要使用会话的cookie。
session = requests.session()
p = session.post("http://example.com", {'user':user,'password':password})
print 'headers', p.headers
print 'cookies', requests.utils.dict_from_cookiejar(session.cookies)
print 'html', p.text
答案 1 :(得分:7)
您应该重用整个会话对象,而不是关联的cookiejar。对您提出的所有要求使用self.s
。
如果您的请求在重新使用会话时仍然失败,则会因其他原因失败,原因不在于您没有正确返回Cookie。
请注意,如果您需要使用auth=('username', 'password')
,则身份验证是基于HTTPAuth的,而不是基于cookie的。您需要为所有呼叫传递相同的身份验证。请求会话也可以为您做到这一点:
s = requests.session(auth=('username', 'password'))
但是,如果登录页面是带有用户名和密码字段的表单,则需要调用表单目标。检查表单是POST还是GET,并检查字段名:
s.post(loginTarget, {usernamefield=username, passwordfield=password, otherfield=othervalue})
并且根本不使用HTTP身份验证。