我想自动访问网站,点击按钮和保存文件。在此站点上下载文件的唯一方法是单击按钮。您无法使用网址导航到该文件。
我一直在尝试使用phantomjs和casperjs来自动化这个过程,但是没有取得任何成功。
我最近尝试在这里使用brandon的解决方案 Grab the resource contents in CasperJS or PhantomJS
这是我的代码
var fs = require('fs');
var cache = require('./cache');
var mimetype = require('./mimetype');
var casper = require('casper').create();
casper.start('http://www.example.com/page_with_download_button', function() {
});
casper.then(function() {
this.click('#download_button');
});
casper.on('resource.received', function (resource) {
"use strict";
for(i=0;i < resource.headers.length; i++){
if(resource.headers[i]["name"] == "Content-Type" && resource.headers[i]["value"] == "text/csv; charset-UTF-8;"){
cache.includeResource(resource);
}
}
});
casper.on('load.finished', function(status) {
for(i=0; i< cache.cachedResources.length; i++){
var file = cache.cachedResources[i].cacheFileNoPath;
var ext = mimetype.ext[cache.cachedResources[index].mimetype];
var finalFile = file.replace("."+cache.cacheExtension,"."+ext);
fs.write('downloads/'+finalFile,cache.cachedResources[i].getContents(),'b');
}
});
casper.run();
我认为问题可能是由于我的cachePath在cache.js
中不正确exports.cachePath = 'C:/Users/username/AppData/Local/Ofi Labs/PhantomJS';
我是否应该在反斜杠中使用某些内容来定义路径?
当我尝试
时 casperjs --disk-cache=true export_script.js
没有下载任何内容。经过一些调试后,我发现cache.cachedResources总是为空。
我也愿意接受phantomjs / casperjs之外的解决方案。
更新
我不再尝试使用CasperJS / PhantomJS来实现这一目标。 我正在使用dandavis建议的chrome扩展名 Tampermonkey 。 Tampermonkey非常容易理解。 我安装了Tampermonkey,导航到带有下载链接的页面,然后点击了tampermonkey下的New Script并添加了我的javascript代码。
document.getElementById("download_button").click();
现在,每当我在浏览器中导航到该页面时,都会下载该文件。然后我创建了一个看起来像这样的批处理脚本
set date=%DATE:~10,4%_%DATE:~4,2%_%DATE:~7,2%
chrome "http://www.example.com/page-with-dl-button"
timeout 10
move "C:\Users\user\Downloads\export.csv" "C:\path\to\dir\export_%date%.csv"
我将该批处理脚本设置为使用Windows任务计划程序每晚运行。
成功!
答案 0 :(得分:4)
您的按钮很可能向服务器发出POST请求。 为了跟踪它:
使用cURL后,您可以根据您使用的操作系统使用cron或任务计划程序安排下载。