位置: - 正文

NodeJS制作爬虫全过程（续）(nodejs爬虫框架crawler)

编辑：rootadmin

推荐整理分享NodeJS制作爬虫全过程（续）(nodejs爬虫框架crawler)，希望有所帮助，仅作参考，欢迎阅读内容。

文章相关热门搜索词:node爬虫框架puppeteer,nodejs做爬虫,node.js写爬虫,node python 爬虫,nodejs爬取数据,node.js写爬虫,nodejs做爬虫,node js爬虫,内容如对您有帮助，希望把文章链接给更多的朋友！

书接上回，我们需要修改程序以达到连续抓取个页面的内容。也就是说我们需要输出每篇文章的标题、链接、第一条评论、评论用户和论坛积分。

如图所示，$('.reply_author').eq(0).text().trim();得到的值即为正确的第一条评论的用户。

{<1>}

在eventproxy获取评论及用户名内容后，我们需要通过用户名跳到用户界面继续抓取该用户积分

在eventproxy这一次中，我们要找到score是放在哪里（class="big"）。

{<2>}

找到classname就好办了，我们先试着把结果输出一下

运行程序，这段代码得到的结果。

{<3>}

但是问题来了，我们在.end()的回调函数中能正确输出结果，但是不能正确的输出outcome。仔细一看，需要输出的outcome是一个Request对象。这是因为粗心犯的错的，.end()函数并不会传递返回值给Request对象，需要将结果返回到上一层（users）。

把users好好地输出发现除了score1其他是正确值。仔细调试发现，程序是先进行了console.log()，然后再进行.map()。更准确地说，在.map()函数内，.get()的回调函数并没有执行完赋值score，return 返回值就进行了。这就是回调函数的异步，而外层的同步操作是不会等待回调函数做完操作的。

{<4>}

我的做法就是eventproxy再emit一层消息，伴随着消息把需要的数据一起传递给接收消息操作.after()，只有当消息全部接收完毕，再打印出传递的参数(结果)。

{<6>}

这个问题解决了，但score1的数值好像太大了点吧。再一看，原来class='big'有两个，用户的话题收藏也是属于这个class。我们得通过cheerio的.slice( start, [end] )来切取第一个元素，即将score 修改为 score = $('.big').slice(0).eq(0).text().trim();。正确结果如图。

{<7>}

sails框架的学习指南上周通过搭建CMS系统接触到了sails框架，知道一些ORM的概念。这周开始深入后台数据交互，发现twenty框架的数据结构在sails上又设计了一番（比如node、cat

node.js开机自启动脚本文件 #!/bin/bash###BEGININITINFO#Provides:xiyoulib#Required-Start:$all#Required-Stop:$all#Default-Start:#Default-Stop:#Short-Description:Startdaemonatboottime#Description:Enableserviceprovidedbydaem

node.js中的path.extname方法使用说明方法说明：返回path路径文件扩展名，如果path以‘.'为结尾，将返回‘.'，如果无扩展名又不以'.'结尾，将返回空值。语法：path.extname(p)由于该方法属于pa

本文链接地址:https://www.jiuchutong.com/biancheng/374216.html 转载请保留说明！

下一篇链接:https://www.jiuchutong.com/biancheng/374217.html