编辑2:我认为,这个主题和此链接中的另一个主题可能有关系:https://stackoverflow.com/questions/34600126/ 在那个链接中,我将所有图像的URL存储在一个文件中,然后尝试通过node.js读取并下载它们,但是其中一些文件超时了(并非大多数文件)。
我有一些包含每个html文件中的一些图像的html文件,它们位于MySQL数据库中。我编写了一个使用Node.Js的脚本来获取html文件,并获取图像并将其下载到本地计算机(图像是远程URL,例如http://myServer/whmis_d2.gif)。我使用createWriteStream,它会创建图像文件,但它们都是空文件。我猜问题在于下载文件时文件没有关闭,我尝试使用finish事件,但注意到finish事件不会触发。我的目标是搜索html内容并下载具有远程url的图像到本地计算机。谢谢任何帮助,这是我的代码: 谢谢! 这里放置了所有代码,但是路径是硬编码的,需要根据您的本地路径进行更改。
我有一些包含每个html文件中的一些图像的html文件,它们位于MySQL数据库中。我编写了一个使用Node.Js的脚本来获取html文件,并获取图像并将其下载到本地计算机(图像是远程URL,例如http://myServer/whmis_d2.gif)。我使用createWriteStream,它会创建图像文件,但它们都是空文件。我猜问题在于下载文件时文件没有关闭,我尝试使用finish事件,但注意到finish事件不会触发。我的目标是搜索html内容并下载具有远程url的图像到本地计算机。谢谢任何帮助,这是我的代码: 谢谢! 这里放置了所有代码,但是路径是硬编码的,需要根据您的本地路径进行更改。
#!/usr/bin/env node
"use strict";
// dependencies
// npm install mysql
// npm install cheerio
var fs = require('fs');
var mysql = require('mysql');
var cheerio = require('cheerio');
var path = require('path');
var _ = require('underscore');
var async = require('async');
var url = require('url');
var request = require('request');
var lunr = require(__dirname + '/lunr.js');
var db = null;
var myTable = {};
var lunr_index = null;
var open_db = function (callback) {
var mysql_conf = {
host: "myHose",
user: "myUser",
password: "MyPass",
database: "MyServer"
};
db = mysql.createConnection(mysql_conf);
db.connect(function (error) {
if (error) {
exit_with_error('problem connecting to database: ' + error);
}
callback();
});
};
var ensure_directory_exists = function (directory) {
var directories = _.reduce(directory.split('/').slice(1), function (memo, subdir, index) {
memo.push(path.normalize(memo[index] + '/' + subdir));
return memo;
}, ['/']);
_.each(directories, function (subdir) {
if (!fs.existsSync(subdir)) {
fs.mkdirSync(subdir);
}
});
};
var get_myosh = function (callback) {
var make_full_markup = function (text) {
return text;
};
var get_images = function (text) {
var $ = null;
$ = cheerio.load(text, {decodeEntities: false});
$('img').each(function (i, img) {
var img_url = $(img).attr('src');
var img_src = path.basename(img_url);
console.log('requesting image ' + img_url + ' ...');
ensure_directory_exists(path.dirname('/Users/Documents/documents/'));
var file = fs.createWriteStream(img_src);
var stream = request(img_url).pipe(file);
file.on('finish', function () {
// this finish event seems not fire at all
console.log('finish streaming' + img_src);
file.close();
});
});
}
db.query('SELECT path,title,qatext FROM myTable', function (error, results) {
var $ = null;
if (error) {
exit_with_error('problem reading from database: ' + error);
}
for (var i in results) {
$ = cheerio.load('<template>' + results[i].qatext.replace(/<\//g, ' </') + '</template>');
myTable[results[i].path] = {
title: results[i].title,
summary: $('template').text().trim().replace(/\s{2,}/g, ' '),
images : get_images(results[i].qatext),
full_markup: make_full_markup(results[i].qatext)
};
}
callback();
});
};
var build_content = function (callback) {
for (var id in myTable) {
ensure_directory_exists(path.dirname('/Users/Documents/documents/' + id));
fs.writeFileSync('/Users/Documents/documents/' + id, myTable[id].full_markup);
console.log('indexed %s', id);
}
callback();
};
var close_db = function () {
try {
db.end();
} catch (e) {
}
};
var exit_with_error = function (error) {
console.log('\nERROR : %s\n', error);
process.exit(-1);
};
open_db(function () {
get_myosh(function () {
build_content(function () {
close_db();
process.exit(0);
});
});
});
同时,我已经从MySQL数据库中获取了一个HTML文件的内容。HTML文本、HTML文件名和HTML文件的相对路径都存储在MySQL表中,我们不仅有一个HTML文件,我们有一堆这样的文件,所以目标是搜索HTML文件,并将img文件(即href图像链接)下载到本地计算机。
<!DOCTYPE html>
<html>
<head>
<meta content="text/html;charset=utf-8" http-equiv="Content-Type">
<meta content="utf-8" http-equiv="encoding">
<meta name = "viewport" content = "width = device-width">
<style type="text/css">
body {
font-family: '-apple-system-font', 'San Francisco', 'Helvetica Neue', 'Helvetica', 'Arial', 'Verdana', 'sans-serif';
margin-left:10px; margin-right:0px; margin-top:0px; margin-bottom:0px;}
</style>
</head>
<body><a name="_1_1"></a><div class="center"><img src="http://images.ccohs.ca/oshanswers/whmis_b.gif" width="108" height="106" alt="Symbol for Class B" /><br />Class B2</div><div class="center"><img src="http://images.ccohs.ca/oshanswers/whmis_d2.gif" width="108" height="107" alt="Symbol for Class D2" /><br />Class D2B</div><br /><a name="_1_3"></a><a name="_1_4"></a>
</body>
</html>