位置: 编程技术 - 正文

玩转python爬虫之爬取糗事百科段子(python爬虫:入门+进阶)

编辑:rootadmin

推荐整理分享玩转python爬虫之爬取糗事百科段子(python爬虫:入门+进阶),希望有所帮助,仅作参考,欢迎阅读内容。

文章相关热门搜索词:python爬虫快速入门,pythone爬虫,python爬虫详解,python 爬虫,python爬虫:入门+进阶,python爬虫快速入门,python爬虫:入门+进阶,python爬虫:入门+进阶,内容如对您有帮助,希望把文章链接给更多的朋友!

大家好,前面入门已经说了那么多基础知识了,下面我们做几个实战项目来挑战一下吧。那么这次为大家带来,Python爬取糗事百科的小段子的例子。

首先,糗事百科大家都听说过吧?糗友们发的搞笑的段子一抓一大把,这次我们尝试一下用爬虫把他们抓取下来。本篇目标

抓取糗事百科热门段子 过滤带有图片的段子 实现每按一次回车显示一个段子的发布时间,发布人,段子内容,点赞数。

糗事百科是不需要登录的,所以也没必要用到Cookie,另外糗事百科有的段子是附图的,我们把图抓下来图片不便于显示,那么我们就尝试过滤掉有图的段子吧。

好,现在我们尝试抓取一下糗事百科的热门段子吧,每按下一次回车我们显示一个段子。

1.确定URL并抓取页面代码

首先我们确定好页面的URL是 class=”article block untagged mb″ id=”…”>…</div>包裹的内容。

现在我们想获取发布人,发布日期,段子内容,以及点赞的个数。不过另外注意的是,段子有些是带图片的,如果我们想在控制台显示图片是不现实的,所以我们直接把带有图片的段子给它剔除掉,只保存仅含文本的段子。

所以我们加入如下正则表达式来匹配一下,用到的方法是 re.findall 是找寻所有匹配的内容。方法的用法详情可以看前面说的正则表达式的介绍。

好,我们的正则表达式匹配语句书写如下,在原来的基础上追加如下代码

现在正则表达式在这里稍作说明

1).*&#; 是一个固定的搭配,.和*代表可以匹配任意无限多个字符,加上?表示使用非贪婪模式进行匹配,也就是我们会尽可能短地做匹配,以后我们还会大量用到 .*&#; 的搭配。

2)(.*&#;)代表一个分组,在这个正则表达式中我们匹配了五个分组,在后面的遍历item中,item[0]就代表第一个(.*&#;)所指代的内容,item[1]就代表第二个(.*&#;)所指代的内容,以此类推。

3)re.S 标志代表在匹配时为点任意匹配模式,点 . 也可以代表换行符。

这样我们就获取了发布人,发布时间,发布内容,附加图片以及点赞数。

玩转python爬虫之爬取糗事百科段子(python爬虫:入门+进阶)

在这里注意一下,我们要获取的内容如果是带有图片,直接输出出来比较繁琐,所以这里我们只获取不带图片的段子就好了。

所以,在这里我们就需要对带图片的段子进行过滤。

我们可以发现,带有图片的段子会带有类似下面的代码,而不带图片的则没有,所以,我们的正则表达式的item[3]就是获取了下面的内容,如果不带图片,item[3]获取的内容便是空。

所以我们只需要判断item[3]中是否含有img标签就可以了。

好,我们再把上述代码中的for循环改为下面的样子

现在,整体的代码如下

运行一下看下效果

恩,带有图片的段子已经被剔除啦。是不是很开森?

3.完善交互,设计面向对象模式

好啦,现在最核心的部分我们已经完成啦,剩下的就是修一下边边角角的东西,我们想达到的目的是:

按下回车,读取一个段子,显示出段子的发布人,发布日期,内容以及点赞个数。

另外我们需要设计面向对象模式,引入类和方法,将代码做一下优化和封装,最后,我们的代码如下所示

好啦,大家来测试一下吧,点一下回车会输出一个段子,包括发布人,发布时间,段子内容以及点赞数,是不是感觉爽爆了!

我们第一个爬虫实战项目介绍到这里,希望大家喜欢。

Python多线程、异步+多进程爬虫实现代码 安装Tornado省事点可以直接用grequests库,下面用的是tornado的异步client。异步用到了tornado,根据官方文档的例子修改得到一个简单的异步爬虫类。可以参

Python利用Nagios增加微信报警通知的功能 Nagios是一款开源的免费网络监视工具,能有效监控Windows、Linux和Unix的主机状态,交换机路由器等网络设置,打印机等。在系统或服务状态异常时发出邮

python装饰器与递归算法详解 1、python装饰器刚刚接触python的装饰器,简直懵逼了,直接不懂什么意思啊有木有,自己都忘了走了多少遍Debug,查了多少遍资料,猜有点点开始明白了

标签: python爬虫:入门+进阶

本文链接地址:https://www.jiuchutong.com/biancheng/382365.html 转载请保留说明!

上一篇:玩转python爬虫之正则表达式(python爬虫详解)

下一篇:Python多线程、异步+多进程爬虫实现代码(python多线程异常后所有线程均不往下执行)

  • 企业合并债权如何处理
  • 所得税的会计分录有哪些
  • 代第三方收取的款项作为什么处理
  • 预缴增值税附加税费申报明细表
  • 月末进项税大于销项税怎么结转
  • 金蝶利润表为什么没有收入
  • 培训费发票开具的要求
  • 个税申报缴费
  • 金税盘离线开票金额超限怎么处理
  • 赠送的产品价格为0怎么入库
  • 个月所得税税率
  • 怎么在网上申请电话卡
  • 承兑汇票怎么做假
  • 资产总额全年季度平均值怎么填写
  • 发票丢失说明怎么填写
  • 结转本月收入类账户到本年利润会计分录
  • 盈余公积补亏什么科目
  • 营改增后哪些费用可以抵扣
  • 留存收益筹资的优缺点
  • 母子公司间资产划拨开免税发票
  • 财务报表中预收账款的数据是怎么来的
  • 存货盘亏的分录怎么写
  • 取得虚开增值税专用发票罪量刑标准
  • 废旧物资增值税税收优惠政策
  • 装卸费的增值税是多少
  • 公司支付劳务派遣人员工资账务处理
  • 企业为职工负担的个人所得税是什么意思
  • 发票勾选了是否就抵扣了
  • 银行回单如何做凭证
  • 汇算清缴补交所得税后报表需要调整吗
  • PRISMSVR.EXE - PRISMSVR是什么进程 有什么用
  • 违约方能否要求返还价款
  • ubuntu系统怎么安装微信
  • php中meta
  • 债券的回购
  • 劳务报酬所得与经营所得
  • vue错误提示
  • 一只棕色
  • 加里西亚省
  • 企业和单位往来怎么做账
  • 应纳税所得额的意思
  • js 切面
  • 公司发放加班补贴 固定金额
  • diff命令参数
  • 红票申请单怎么开
  • 公司过年买的红包封壳怎么做账
  • 进口关税和增值税怎么做账
  • 怎么在网上申请信用卡
  • 有留抵税额可以注销吗
  • 水利基金应税项填的数据怎么查
  • 外购产品用于职工福利企业所得税视作销售吗
  • 收到社保稳岗补贴需要交税吗
  • 发票做账流程
  • 购买固定资产用什么凭证
  • 调整以前年度费用如何做分录
  • 当月没生产有生产费用怎么结转
  • 公司 股东 变更
  • 医院药品进销差价会计核算
  • 进销存的会计处理实务
  • 企业收到政府补助金80 000元,存入银行
  • 车辆报废手续是什么样的
  • 出租写字楼写字楼
  • 报销没有消费凭据怎么办
  • 物业管理费发票税率
  • 企业无形资产入账标准
  • 用Win7系统的Syskey命令来设置系统的启动密码
  • windowsxp桌面文件在哪个文件夹
  • windows Server 2008配置IE使用代理操作步骤
  • telnet root
  • xp系统软件开机自启
  • xp系统下载文件没有出现下载对话框让你选择保存的位置
  • win10系统如何查看版本号
  • iptables防火墙规则
  • js调用音频文件
  • dos强制删除文件命令
  • opengl超级宝典第八版 pdf
  • android打开相机
  • unity接入安卓sdk
  • jquery遍历li
  • 无纸化同义词
  • 免责声明:网站部分图片文字素材来源于网络,如有侵权,请及时告知,我们会第一时间删除,谢谢! 邮箱:opceo@qq.com

    鄂ICP备2023003026号

    网站地图: 企业信息 工商信息 财税知识 网络常识 编程技术

    友情链接: 武汉网站建设