使用php curl废弃aspx页面

时间:2012-04-23 13:07:48

标签: php asp.net curl screen-scraping

我正在尝试使用php curl代码废弃一个aspx页面,该代码包含数据页面。最初页面使用get方法加载,但是当我们选择页面号时。从下拉列表中使用post方法提交页面页面。

我希望通过将postfields传递给curl来查找特定页面的数据,但是不能这样做。

我创建了一个虚拟代码来获取第5页的记录,但它总是返回第一页的结果。

示例代码

$url = 'http://www.ticketalternative.com/SitePages/Search.aspx?catid=All&pattern=Enter%20Artist%2c%20Team%2c%20or%20Venue';
$file=file_get_contents($url);
//<input type="hidden" name="__VIEWSTATE" id="__VIEWSTATE" value=
preg_match_all("#<input.*?name=\"__VIEWSTATE\".*?value=\"(.*?)\".*?>.*?<input.*?name=\"__EVENTVALIDATION\".*?value=\"(.*?)\".*?>#mis", $file, $arr_viewstate); 
$viewstate = urlencode($arr_viewstate[1][0]);
$eventvalidation = urlencode($arr_viewstate[2][0]); 
$options = array( 
CURLOPT_RETURNTRANSFER => true, // return web page
CURLOPT_HEADER => true, // don't return headers 
CURLOPT_FOLLOWLOCATION => true, // follow redirects 
CURLOPT_ENCODING => "", // handle all encodings 
CURLOPT_USERAGENT => "spider", // who am i 
CURLOPT_AUTOREFERER => true, // set referer on redirect 
CURLOPT_CONNECTTIMEOUT => 120, // timeout on connect 
CURLOPT_TIMEOUT => 1120, // timeout on response 
CURLOPT_MAXREDIRS => 10, // stop after 10 redirects 
CURLOPT_POST => true,
CURLOPT_VERBOSE => true,
CURLOPT_POSTFIELDS => '__EVENTTARGET='.urlencode('ctl00$ContentPlaceHolder1$SearchResults1$SearchResultsGrid$ctl13$ctl05').'&__EVENTARGUMENT='.urlencode('').'&__VIEWSTATE='.$viewstate.'&__EVENTVALIDATION='.$eventvalidation.'&__LASTFOCUS='.urlencode('').'&ctl00$ContentPlaceHolder1$SearchResults1$SearchResultsGrid$ctl13$ctl05=4');
$ch = curl_init($url); 
curl_setopt_array($ch,$options);
$result = curl_exec($ch);
curl_close($ch);

preg_match_all('/<a id=\".*?LinkToVenue\" href=\"(.*?)\">(.*?)<\/a>/ms',$result,$matches);
print_r($matches);

任何人都可以帮我解决这个问题,我在哪里出错,我认为它不起作用,因为在第一次使用GET方法加载页面时,我们在页面链接上使用post。

我如何获得特定页面编号的记录?

此致

1 个答案:

答案 0 :(得分:-2)

我有时候在客户端需要的时候在php中编写scraper但是我绝不会尝试使用php来抓取一个ASP.NET站点。为此你需要perl python或ruby。所有3个都有一个机械化库,通常很容易。