有没有办法让jQuery在Node.io中工作?

4

我是一个Node.js新手。我正在使用node.io爬取网站,但我希望能够在node.io中使用jQuery。由node.io提供的$ object没有提供很多灵活性。

var nodeio = require('node.io'), options = {timeout: 10},
    jQuery = require('jquery');

exports.job = new nodeio.Job(options, {
    input: ['hello', 'foobar', 'weather'],
    run: function (keyword) {
        this.getHtml('http://www.google.com/search?q=' + encodeURIComponent(keyword), function (err, $) {

            // SOMEHOW CREATE THE JQUERY OBJECT USING $

            var results = $('#resultStats').text.toLowerCase();
            this.emit(keyword + ' has ' + results);
        });
    }
});

有人能帮忙吗?

更新

我没有注意到node.io有一个选项可以使用jquery和jsdom:true选项。即使我使用这个选项,它也不起作用,我总是得到超时错误或$未定义的错误。

3个回答

2

好的,问题已经解决。

node.io有一个使用jquery的选项,你需要传递这个选项jsdom:true。我使用的node.io版本(0.3.0)存在一个bug,它总是返回超时。

  // lib/node.io/dom.js
  window.onload = function() {
    callback.apply(self, [null, $, data, headers, response]);
  }

现在这个问题已经在node.io版本0.3.1中得到解决。

非常感谢大家的反馈!


1

我知道jsdom,但我需要帮助将node.io的$ window对象分配给一个jquery或jsdom对象,以便我可以使用jquery。抱歉,你的答案没有帮到我! - Madhusudhan
@Madhusudhan,您可以将“$”替换为任何您想要的内容。重点是,jQuery在没有完整模拟浏览器DOM的情况下无法工作,这就是为什么您需要jsdom的原因。您可以阅读我提供的博客文章以获取有关如何执行此操作的帮助。 - David Tang
其实我没有看到这个,node.io有一个使用jquery的选项。默认选项是jsdom:false,当你传递true时,你会得到$中的jquery对象。不确定为什么,但它会抛出一个错误,说$未定义,当我使用jsdom:true时。 - Madhusudhan

1
你可以考虑使用 Mikeal 的 Spider,它支持这种用例,并且专为爬取而构建。

https://github.com/mikeal/spider

例子:

var spider = require('../main');

spider()
.route('www.nytimes.com', '/pages/dining/index.html', function (window, $) {
  $('a').spider();
})
.route('travel.nytimes.com', '*', function (window, $) {
  $('a').spider();
  if (this.fromCache) return;

  var article = { title: $('nyt_headline').text(), articleBody: '', photos: [] }
  article.body = '' 
  $('div.articleBody').each(function () {
    article.body += this.outerHTML;
  })
  $('div#abColumn img').each(function () {
    var p = $(this).attr('src');
    if (p.indexOf('ADS') === -1) {
      article.photos.push(p);
    }
  })
  // console.log(article);
})
.route('dinersjournal.blogs.nytimes.com', '*', function (window, $) {
  var article = {title: $('h1.entry-title').text()}
  // console.log($('div.entry-content').html())
})
.get('http://www.nytimes.com/pages/dining/index.html')
.log('info')
;

另外,如果您想使用node.io -- 我认为node.io会将数据作为可选参数传递:

io.getHTML('someurl', function(err, junk, data){
    jsdom.env({
      html: data,
      scripts : [
        'http://code.jquery.com/jquery-1.5.min.js'
      ]
    }, function(err, window) {
          var $ = window.jQuery;
          // use jquery here
   });
});

网页内容由stack overflow 提供, 点击上面的
可以查看英文原文,
原文链接