创建可写流时使用createWriteStream方法创建空文件,但是在stream.Writable中,完成事件(finish event)没有触发。

3
编辑2:我认为,这个主题和此链接中的另一个主题可能有关系:https://stackoverflow.com/questions/34600126/ 在那个链接中,我将所有图像的URL存储在一个文件中,然后尝试通过node.js读取并下载它们,但是其中一些文件超时了(并非大多数文件)。
我有一些包含每个html文件中的一些图像的html文件,它们位于MySQL数据库中。我编写了一个使用Node.Js的脚本来获取html文件,并获取图像并将其下载到本地计算机(图像是远程URL,例如http://myServer/whmis_d2.gif)。我使用createWriteStream,它会创建图像文件,但它们都是空文件。我猜问题在于下载文件时文件没有关闭,我尝试使用finish事件,但注意到finish事件不会触发。我的目标是搜索html内容并下载具有远程url的图像到本地计算机。谢谢任何帮助,这是我的代码: 谢谢! 这里放置了所有代码,但是路径是硬编码的,需要根据您的本地路径进行更改。
#!/usr/bin/env node
"use strict";

// dependencies
// npm install mysql
// npm install cheerio

var fs = require('fs');

var mysql = require('mysql');
var cheerio = require('cheerio');
var path = require('path');
var _ = require('underscore');

var async = require('async');
var url = require('url');
var request = require('request');


var lunr = require(__dirname + '/lunr.js');

var db = null;
var myTable = {};
var lunr_index = null;

var open_db = function (callback) {
  var mysql_conf = {
        host: "myHose",
        user: "myUser",
        password: "MyPass",
        database: "MyServer" 
          };
  db = mysql.createConnection(mysql_conf);
  db.connect(function (error) {
    if (error) {
      exit_with_error('problem connecting to database: ' + error);
    }
    callback();
  });
};

  var ensure_directory_exists = function (directory) {
    var directories = _.reduce(directory.split('/').slice(1), function (memo, subdir, index) {
      memo.push(path.normalize(memo[index] + '/' + subdir));
      return memo;
    }, ['/']);
    _.each(directories, function (subdir) {
      if (!fs.existsSync(subdir)) {
        fs.mkdirSync(subdir);
      }
    });
  };

var get_myosh = function (callback) {
  var make_full_markup = function (text) {
  return text;

  };

  var get_images = function (text) {

                     var $ = null;
                      $ = cheerio.load(text, {decodeEntities: false});

                      $('img').each(function (i, img) {
              var img_url = $(img).attr('src');
              var img_src = path.basename(img_url);


        console.log('requesting image ' + img_url + ' ...');
        ensure_directory_exists(path.dirname('/Users/Documents/documents/'));

var file = fs.createWriteStream(img_src);
var stream = request(img_url).pipe(file);


 file.on('finish', function () { 
     // this finish event seems not fire at all     
console.log('finish streaming' + img_src);
             file.close();
 });

           });

  }


  db.query('SELECT path,title,qatext FROM myTable', function (error, results) {
    var $ = null;
    if (error) {
      exit_with_error('problem reading from database: ' + error);
    }
    for (var i in results) {
      $ = cheerio.load('<template>' + results[i].qatext.replace(/<\//g, ' </') + '</template>');
      myTable[results[i].path] = {
        title: results[i].title,
        summary: $('template').text().trim().replace(/\s{2,}/g, '  '),
         images : get_images(results[i].qatext),
        full_markup: make_full_markup(results[i].qatext)

      };

    }
  callback();
  });

};

var build_content = function (callback) {

  for (var id in myTable) {

    ensure_directory_exists(path.dirname('/Users/Documents/documents/' + id));
    fs.writeFileSync('/Users/Documents/documents/' + id, myTable[id].full_markup);

    console.log('indexed %s', id);
  }

  callback();
};

var close_db = function () {
  try {
    db.end();
  } catch (e) {
  }
};

var exit_with_error = function (error) {
  console.log('\nERROR : %s\n', error);
  process.exit(-1);
};

open_db(function () {
  get_myosh(function () {
    build_content(function () {
      close_db();
      process.exit(0);
    });
});
});

同时,我已经从MySQL数据库中获取了一个HTML文件的内容。HTML文本、HTML文件名和HTML文件的相对路径都存储在MySQL表中,我们不仅有一个HTML文件,我们有一堆这样的文件,所以目标是搜索HTML文件,并将img文件(即href图像链接)下载到本地计算机。

<!DOCTYPE html>
<html>
<head>
<meta content="text/html;charset=utf-8" http-equiv="Content-Type">
<meta content="utf-8" http-equiv="encoding">
<meta name = "viewport" content = "width = device-width">
<style type="text/css">
body {
font-family: '-apple-system-font', 'San Francisco', 'Helvetica Neue', 'Helvetica', 'Arial', 'Verdana', 'sans-serif';
margin-left:10px; margin-right:0px; margin-top:0px; margin-bottom:0px;}
</style>
</head>
<body><a name="_1_1"></a><div class="center"><img src="http://images.ccohs.ca/oshanswers/whmis_b.gif" width="108" height="106" alt="Symbol for Class B" /><br />Class B2</div><div class="center"><img src="http://images.ccohs.ca/oshanswers/whmis_d2.gif" width="108" height="107" alt="Symbol for Class D2" /><br />Class D2B</div><br /><a name="_1_3"></a><a name="_1_4"></a>
</body>
</html>


这就是全部的代码吗?它还有其他功能吗(比如写入控制台)?我没有看到你在哪里调用函数,但我相信你只是省略了它们——无论如何,请确保你实际上调用该函数! - Mondongo
另外,也许你应该在开始请求之前添加“完成”事件监听器...否则,在你将事件监听器添加到流中时,流可能已经关闭了。你有console.log()消息的输出吗? - Mondongo
@Mondongo 函数被调用了。我在 get_images 函数内看到了控制台日志(请求图像),但正如我所提到的,finish 事件内的控制台日志未显示在日志中,因为 finish 事件没有使用上述代码触发。我已经尝试在开始请求之前添加 finish 事件监听器,就像你建议的那样,但是没有改变,仍然无法触发 finish 事件。 - Jack
如果您可以将整个代码发布或将其放在jsfiddle上,我可以进行调试并帮助您解决问题... - Mondongo
@Mondongo,我已经编辑了我的帖子,并将整个源代码放在一个块中供您查看。唯一需要注意的是,MySQL数据库是通过我们的互联网连接的,您无法通过互联网进行测试。因此,您可能需要创建自己的MySQL数据库,并使用我提供的HTML内容,在脚本中更改用户/密码/主机以调试问题。谢谢。 - Jack
@Mondongo,我试图将所有图片网址存储在一个文本文件中,然后按行读取它们以下载图片,但我得到了错误代码"ETIMEDOUT"。你能否请看一下我的SO Thread:http://stackoverflow.com/questions/34600126/node-js-download-part-of-them-fine-but-the-other-part-with-errno-etimedout ,或许这个线程的问题也是同样的原因。 - Jack
1个回答

0

你不需要手动关闭WriteStream,使用管道就足够了。 可能会出现网络访问问题-你检查了request响应状态吗? 你没有添加路径到img_src,所以它应该尝试将文件写入您的主目录/进程目录,具体取决于环境。 为了简化代码并减少可能的错误,请使用mkdirp模块在一行中创建子文件夹链。这里是一个好答案,可以检查目录是否存在。


关闭部分没有被Node.js调用,所以这并不重要,我测试了它并删除了它,对结果没有任何影响。我知道我没有为img_src放置子文件夹路径,但这不是问题,因为它将所有文件存储在同一个文件夹中,这不是互联网问题,在另一个线程中,我使用node.js进行了另一个测试,并将所有URL链接放入txt文件中并尝试读取这些行并下载它们,大多数文件都可以正常下载,但有些变为空白,您可以在此链接中查看其他线程:http://stackoverflow.com/questions/34600126 - Jack
你尝试过将“timeout”留空或设置值> 0吗? - iw2rmb

网页内容由stack overflow 提供, 点击上面的
可以查看英文原文,
原文链接