Node.js编写爬虫的基本思路及抓取百度图片的实例分享(nodejs爬取数据)

编辑：rootadmin

推荐整理分享Node.js编写爬虫的基本思路及抓取百度图片的实例分享(nodejs爬取数据)，希望有所帮助，仅作参考，欢迎阅读内容。

文章相关热门搜索词:node网络爬虫,node爬虫框架puppeteer,node网络爬虫,nodejs爬虫框架crawler,node js爬虫,nodejs做爬虫,node.js爬虫教程,node js爬虫,内容如对您有帮助，希望把文章链接给更多的朋友！

其实写爬虫的思路十分简单：

按照一定的规律发送 HTTP 请求获得页面 HTML 源码（必要时需要加上一定的 HTTP 头信息，比如 cookie 或 referer 之类）利用正则匹配或第三方模块解析 HTML 代码，提取有效数据将数据持久化到数据库中

但是真正写起这个爬虫来，我还是遇到了很多的问题（和自己的基础不扎实也有很大的关系，node.js 并没有怎么认真的学过）。主要还是 node.js 的异步和回调知识没有完全掌握，导致在写代码的过程中走了很多弯路。

模块化

模块化对于 node.js 程序是至关重要的，不能像原来写 PHP 那样所有的代码都扔到一个文件里（当然这只是我个人的恶习），所以一开始就要分析这个爬虫需要实现的功能，并大致的划分了三个模块。

主程序，调用爬虫模块和持久化模块实现完整的爬虫功能爬虫模块，根据传来的数据发送请求，解析 HTML 并提取有用数据，返回一个对象持久化模块，接受一个对象，将其中的内容储存到数据库中模块化也带来了困扰了我一个下午的问题：模块之间的异步调用导致数据错误。其实我至今都不太明白问题到底出在哪儿，鉴于脚本语言不那么方便的调试功能，暂时还没有深入研究。

另外一点需要注意的是，模块化时尽量慎用全局对象来储存数据，因为可能你这个模块的一个功能还没有结束，这个全局变量已经被修改了。

Control Flow

这个东西很难翻译，直译叫控制流（吗）。众所周知，node.js 的核心思想就是异步，但是异步多了就会产生好几层嵌套，代码实在难看。这个时候，你需要借助一些 Control Flow 模块来重新整理你的逻辑。在这里就要推荐开发社区十分活跃，用起来也很顺手的 async.js（提供了很多实用的方法，我在写爬虫时主要用到了

async.eachSeries(arr, fn, callback) 依次把 arr 中的每一个元素传给 fn，若 fn 回调没有返回错误对象就继续传下一个，否则把错误对象传给 callback，循环结束 async.parallel(fn[, fn] , callback) 当所有的 fn 都执行完成后执行 callback

这些控制流方法给爬虫的开发工作带来了很大的方便。考虑这么一个应用场景，你需要把若干条数据插入数据库（属于同一个学生），你需要在所有数据都插入完成后才能返回结果，那么如何保证所有的插入操作都结束了呢？只能是层层回调保证，如果用 async.parallel 就方便多了。