使用Mongo Map / Reduce获取子dict值

时间:2011-08-09 14:32:28

标签: python mongodb mongomapper

我有一个mongo集合,我希望通过给定的sitename,timestamp和variant id获得'number_of_ad_clicks'的总值。因为我们有大量数据所以最好使用map / reduce。有人可以给我任何建议吗?

这是我的集合json格式

{ "_id" : ObjectId( "4e3c280ecacbd1333b00f5ff" ),
  "timestamp" : "20110805",
  "variants" : { "94" : { "number_of_ad_clicks" : 41,
      "number_of_search_keywords" : 9,
      "total_duration" : 0,
      "os" : { "os_2" : 2,
        "os_1" : 1,
        "os_0" : 0 },
      "countries" : { "ge" : 6,
        "ca" : 1,
        "fr" : 8,
        "uk" : 4,
        "us" : 6 },
      "screen_resolutions" : { "(320, 240)" : 1,
        "(640, 480)" : 5,
        "(1024, 960)" : 5,
        "(1280, 768)" : 5 },
      "widgets" : { "widget_1" : 1,
        "widget_0" : 0 },
      "languages" : { "ua_uk" : 8,
        "ca_en" : 2,
        "ca_fr" : 2,
        "us_en" : 5 },
      "search_keywords" : { "search_keyword_8" : 8,
        "search_keyword_5" : 5,
        "search_keyword_4" : 4,
        "search_keyword_7" : 7,
        "search_keyword_6" : 6,
        "search_keyword_1" : 1,
        "search_keyword_3" : 3,
        "search_keyword_2" : 2 },
      "number_of_pageviews" : 18,
      "browsers" : { "browser_4" : 4,
        "browser_0" : 0,
        "browser_1" : 1,
        "browser_2" : 2,
        "browser_3" : 3 },
      "keywords" : { "keyword_5" : 5,
        "keyword_4" : 4,
        "keyword_1" : 1,
        "keyword_0" : 0,
        "keyword_3" : 3,
        "keyword_2" : 2 },
      "number_of_keyword_clicks" : 83,
      "number_of_visits" : 96 } },
  "site_name" : "fonter.com",
  "number_of_variants" : 1 }

这是我的尝试。但失败了。 他是我的尝试。

m = function() {
    emit(this.query, {variants: this.variants});
}

r = function(key , vals) {
    var clicks = 0 ;
    for(var i = 0; i < vals.length(); i++){
        clicks = vals[i]['number_of_ad_clicks'];
    }
    return clicks;
}
res = db.variant_daily_collection.mapReduce(m, r, {out : "myoutput", "query":{"site_name": 'fonter.com', 'timestamp': '20110805'}})
db.myoutput.find()

有人可以提出任何建议吗?

非常感谢,我尝试解决方案,但没有回报。 我在下面调用mapreduce,有什么问题吗?

res = db.variant_daily_collection.mapReduce(map, reduce, {out : "myoutput", "query":{"site_name": 'facee.com', 'timestamp': '20110809', 'variant_id': '305'}})
db.myoutput.find()

1 个答案:

答案 0 :(得分:0)

emit函数同时发出keyvalue

如果您习惯于将SQL key视为GROUP BY而将value视为SUM(), AVG(), etc.

在您的情况下,您想要“分组依据”:site_name,timestamp和variant id。看起来您可能有多个变体,因此您需要遍历变体,如下所示:

map = function() {
  for(var i in variants){
    var key = {};
    key.timestamp = this.timestamp;
    key.site_name = this.site_name;
    key.variant_id = i; // that's the "94" string.

    var value = {};
    value.clicks = this.variants[i].number_of_ad_clicks;

    emit(key, value);
  }
}

reduce函数将获得一个值数组,如{ clicks: 41 }。该函数需要返回一个看起来相同的对象。

因此,如果您获得values = [ {clicks:21}, {clicks:10}, {clicks:5} ],则必须输出{clicks:36}

所以你做这样的事情:

reduce = function(key , vals) {
    var returnValue = { clicks: 0 }; // initializing to zero
    for(var i = 0; i < vals.length(); i++){
        returnValue.clicks += vals[i].clicks;
    }
    return returnValue;
}

请注意,value中的map形状与reduce的返回形式相同。