位置: IT常识 - 正文

Go分布式爬虫笔记(五)(分布式网络爬虫)

编辑:rootadmin
Go分布式爬虫笔记(五) day508|高性能设计:自顶向下的高性能Go程序设计与优化性能优化分层‍

推荐整理分享Go分布式爬虫笔记(五)(分布式网络爬虫),希望有所帮助,仅作参考,欢迎阅读内容。

文章相关热门搜索词:golang分布式爬虫,分布式爬虫架构图,分布式网络爬虫,基于分布式爬虫的搜索引擎设计与实现,go 分布式爬虫,go 分布式爬虫,分布式爬虫架构图,golang分布式爬虫,内容如对您有帮助,希望把文章链接给更多的朋友!

​​

系统级别

系统级别优化与架构设计:

如何对服务进行拆分如何将服务链接在一起服务调用的关系以及调用频率

各种问题:

如何让服务随着负载的增加具有可扩展性?是否采用 DDD 的架构设计?如何进行分布式的协调?选择何种中间件、缓存数据库与存储数据库?使用何种通信方式?如何设计缓存与数据库的关系,才能避免缓存失效之后大量数据直接打到数据库导致的服务响应变慢甚至服务雪崩的问题呢?分布式系统中数据的一致性,如果业务能够接受读取到的数据不是最新写入的数据,那么就一定能设计出比强一致性读取响应延迟更低的系统。

服务治理:

监控、告警降级策略(限流、重试、降级、熔断)分布式追踪与分布式日志收集程序设计和组织级别

程序设计

功能的拆分流程的抽象使用何种形式组织代码定义清晰的模块间的接口边界使用何种框架并发处理模型搭建的开发流程和规范重点指标体系的设计和监控

高性能程序设计的几个原则:

流程异步化 为了外部用户的体验,降低延迟,有时我们可以结合业务对流程进行异步化,快速返回结果给外部用户。这可以提高用户体验、服务的 QPS 与吞吐量。 例如,任务执行完毕后需要将一些数据存入缓存中。这时可以直接返回结果,并异步地写入数据库。又如,调用一个执行周期很长的函数,可以先直接返回,然后在执行完毕后请求用户给的回调地址。不过要注意的是,无论怎样异步化,终究是需要执行任务的。在执行的关键阶段请求并行化,尽可能把串行改为并行。 你可能听说过华罗庚烧水泡茶的故事,这个故事的要点,就是将整个大任务分割为小任务,让关键任务并行进行处理,这个方案可以大大减少整个任务的处理时间。合理选择与实际系统匹配的并发模型 根据自身服务的不同,需要了解 Go 语言在网络 I/O、磁盘 I/O,CPU 密集型系统在程序处理过程中的不同处理模型。并根据不同的场景选择不同的高并发模型。无锁化与缓存化,保证并发的威力。 试想一个极端的不合理的锁设计,它可能会让所有的用户协程等待某一个协程执行完成,导致并行处理退化为串行执行。无锁化并不是完全不加锁,而是要合理设计并发控制。 例如设计无锁的结构,在多读少写场景用读锁替代写锁,用局部缓存来减少对于全局结构的访问(关于如何设计无锁化结构,你可以参考 sync.pool 库、go 内存分配、go 调度器等模块在并行处理中的极致优化)。

怎么用工具和指标来验证程序实际并行的效率呢?

协程数量调度器的运行方式

获取协程数量的方式:

借助 Debug 库中的 NumGoroutine 函数,GOMAXPROCS 还可以获取逻辑处理器 P;使用 runtime/metrics 包,获取运行时 metric,进而获取到协程数量;通过 pprof 获取当前的协程数量。

调度器:Go调度跟踪

启动 GODEBUG 特定环境变量方式,查看调度器日志;通过 pprof 和 trace 工具,可视化分析调度器的运行状态。代码实施级别

合理代码优化

代码规范

目录结构规范测试规范版本规范目录结构规范代码评审规范开发规范参考UBER 开源的 Go 语言开发规范

数据结构与算法

算法优化数据结构优化

缓存:空间换时间

CPU多级缓存Go运行时调度器Go内存分配器sync.pool

复杂度

benchmark对比

Go分布式爬虫笔记(五)(分布式网络爬虫)

刻意的优化

放入接口中的数据会进行内存逃逸,需不需要优化?

字节数组与 String 互转导致的性能损失需不需要优化?

无用的内存需不需要复用?

定位瓶颈问题

工具:pprof、trace、dlv、gdb

数据结构与算法

序列化

Go 语言的编译时和运行时。例如,之前介绍过的将环境变量 GOMAXPROC 调整为更合适的大小,本质上就是在修改运行时可并行的线程数量。

此外,当并发量上来之后,垃圾回收(GC)也可能成为系统的瓶颈所在。GC 有一段 STW 的时长完全不能执行用户协程,并且在并行标记期间会占用 25% 的 CPU 时间。如果 STW 时间过长,或者并发标记阶段由于频繁的内存分配触发了辅助标记,都会导致程序无法有效处理用户协程,产生严重的响应超时问题。 一般这类 GC 问题可以通过修改代码逻辑减少内存分配频繁,或是借助 sync.pool 等内存池复用内存来解决。

另外,运行时也暴露了一些有限的 API 能够干预垃圾回收的运行,在特殊情况下调整这些参数能够提高程序运行效率:

运行时环境变量 GOGC 可以调整 GC 的内存触发水位,当 GOGC=off 时,它甚至能够关闭 GC 的执行;Runtime.GC() 可以手动强制执行 GC。

另外,设置运行时环境变量 GODEBUG=gctrace=1 可以让运行时打印 GC 的相关日志。

危险的尝试

少用CGOunsafe 库本身不是向后兼容的,这意味着在当前版本中有效的代码在之后的版本中的行为是未知的。另外,对指针进行运算的 uintptr 类型本质上是一个整数,Go 内置的垃圾回收无法对它进行管理。操作指针时,由于 Go 运行时栈的自动扩容,可能导致之前指针指向的内容无效。这些危险的操作,需要开发者摸透使用规则并进行正确的权衡(unsafe 包的具体用法可以参考这篇文章)。思维导图

​​

思考题对一个爬虫服务,通常一个网站之中又会有若干需要进一步爬取的网站,就像一棵树一样。如果放在一个协程中处理,将会非常慢。那么你会考虑怎样的程序设计来保证爬虫的高性能?

下载器和解析器解耦分离,通过chan联系起来,各司其职,不够就增加worker;

所有要爬取的网页连接可以看做是一个DAG图。 可以采用BFS遍历的方式来实现爬取。维护一个待爬取url的channel, 每次从一个网页上获取到下一级的url就加入到这个channel中。 同时, channel的另一侧读取channel, 待爬取url channel 不为空时就读取url并启动一个新的协程去爬取对应url 并解析返回内容。

假如当前服务响应时间 P99 太高,导致了 QPS 无法增加,你觉得可以用什么指标和工具来定位和解决问题?

资源瓶颈,如CPU、内存、磁盘和文件系统 I/O、网络以及内核资源等各类软硬件资源出现了瓶颈,从而导致应用程序的运行受限。对于这种情况,我们就可以用前面系统资源瓶颈模块提到的各种方法来分析。

依赖服务的瓶颈,也就是诸如数据库、分布式缓存、中间件等应用程序,直接或者间接调用的服务出现了性能问题,从而导致应用程序的响应变慢,或者错误率升高。这说白了就是跨应用的性能问题,使用全链路跟踪系统,就可以帮你快速定位这类问题的根源。

应用程序自身的性能问题,包括了多线程处理不当、死锁、业务算法的复杂度过高等等,用火焰图辅助分析.

推荐资料《Designing Data-Intensive Applications》

「此文章为3月Day5学习笔记,内容来源于极客时间《Go分布式爬虫实战》,强烈推荐该课程!/推荐该课程」

本文链接地址:https://www.jiuchutong.com/zhishi/298440.html 转载请保留说明!

上一篇:Vue前端表格导出Excel文件(vue table导出excel)

下一篇:GoogleMap——谷歌地图Api的使用(google map)

  • 如何有效利用与管理APP的负面评论      (如何合理利用)

    如何有效利用与管理APP的负面评论 (如何合理利用)

  • 佳能怎么退出短片模式(佳能相机怎么退出)

    佳能怎么退出短片模式(佳能相机怎么退出)

  • 爱奇艺阅读里怎么写小说(爱奇艺阅读怎么订阅小说)

    爱奇艺阅读里怎么写小说(爱奇艺阅读怎么订阅小说)

  • 淘宝个人主页访客记录查看方法是什么(淘宝个人主页访客记录)

    淘宝个人主页访客记录查看方法是什么(淘宝个人主页访客记录)

  • 笔记本鼠标触摸板锁住了怎么解锁(笔记本鼠标触摸板不灵敏)

    笔记本鼠标触摸板锁住了怎么解锁(笔记本鼠标触摸板不灵敏)

  • 抖音拍视频用什么软件(抖音拍视频用什么相机)

    抖音拍视频用什么软件(抖音拍视频用什么相机)

  • 游戏测试需要注意什么?(游戏测试需要注意的点)

    游戏测试需要注意什么?(游戏测试需要注意的点)

  • 当前无volte服务无法正常拨号(怎样开通volte功能)

    当前无volte服务无法正常拨号(怎样开通volte功能)

  • 打印机需要墨水吗(打印机加墨水怎么加)

    打印机需要墨水吗(打印机加墨水怎么加)

  • 红米7a和红米8a有什么区别(红米7a和红米8a有什么区别?)

    红米7a和红米8a有什么区别(红米7a和红米8a有什么区别?)

  • 全民k歌的扫一扫在哪里(全民K歌的扫一扫)

    全民k歌的扫一扫在哪里(全民K歌的扫一扫)

  • 单孔电脑耳机怎么开麦(单孔耳机怎么插电脑上能说话)

    单孔电脑耳机怎么开麦(单孔耳机怎么插电脑上能说话)

  • ppt样式怎么设置(幻灯片样式如何设置)

    ppt样式怎么设置(幻灯片样式如何设置)

  • 荣耀20安兔兔跑分多少(荣耀20的安兔兔评测)

    荣耀20安兔兔跑分多少(荣耀20的安兔兔评测)

  • 小米8没有耳机孔怎么听歌(小米8没有耳机孔)

    小米8没有耳机孔怎么听歌(小米8没有耳机孔)

  • vue怎么改字体大小(vue全局设置字体大小)

    vue怎么改字体大小(vue全局设置字体大小)

  • ipad不开机怎么办(iPad不开机怎么定位)

    ipad不开机怎么办(iPad不开机怎么定位)

  • 微信自动收款在哪设置(微信自动收款在哪开)

    微信自动收款在哪设置(微信自动收款在哪开)

  • iphone8需要贴膜么(iphone8用贴膜吗)

    iphone8需要贴膜么(iphone8用贴膜吗)

  • 快手小店必须要有淘宝店吗(快手小店必须要营业执照吗)

    快手小店必须要有淘宝店吗(快手小店必须要营业执照吗)

  • newtv怎么看同步电视台(newtv怎么搜台)

    newtv怎么看同步电视台(newtv怎么搜台)

  • subplot怎么用(subplots=true)

    subplot怎么用(subplots=true)

  • kafka和mq的区别(kafka和mqtt)

    kafka和mq的区别(kafka和mqtt)

  • win10截屏工具在哪(win10截图工具在哪儿)

    win10截屏工具在哪(win10截图工具在哪儿)

  • p30可以用5g吗(p30能不能用5g网)

    p30可以用5g吗(p30能不能用5g网)

  • 笔记本电池0%充不进电(笔记本电池0%充不进电怎么激活)

    笔记本电池0%充不进电(笔记本电池0%充不进电怎么激活)

  • 如何在电脑上玩手游?畅快无阻(如何在电脑上玩三国杀移动版)

    如何在电脑上玩手游?畅快无阻(如何在电脑上玩三国杀移动版)

  • ValueError: all the input arrays must have same number of dimensions, but the array at index 0 has 1

    ValueError: all the input arrays must have same number of dimensions, but the array at index 0 has 1

  • 完税证明缴纳额是如何算出来的
  • 金税四期正式启动
  • 工资用现金发放有风险吗?
  • 资产减值损失可以抵税吗
  • 律师事务所的账务流程
  • 一般纳税人什么时候用简易计税
  • 留抵税额抵税怎么做分录
  • 长期待摊费用做在什么记账凭证里
  • 一般纳税人制作除尘器的制作费开票税率是多少
  • 公司注销实收资本可以退回股东吗?
  • 年薪制有什么好处
  • 纯出口企业要交税吗
  • 车辆施救费会计分录
  • 财务负责人和办税人员哪个责任大
  • 国有划拨地是否能转让土地
  • 开发经济适用房是否需要缴纳土增税
  • 房屋抵债如何确定契税计税依据?
  • 初级如何备考
  • 月中发当月工资是怎么算的
  • 资产处置收益属于利润表项目吗
  • 税款已缴纳可以作废申报吗
  • 财务报表包括哪三大报表?(多选)
  • 违约金合同条款怎么写
  • 存货丢失取得赔偿
  • 销售部门品种多怎么说
  • linux 计算字符数
  • 外购固定资产的税率
  • 发票明细与实际不符是什么行为
  • 成本法转为权益法属于会计政策变更吗
  • 进程aissca.exe
  • neoCopy.exe - neoCopy是什么进程 有什么用
  • 滴水观音的养殖方法选好浇水
  • 出口货物如何开票入账
  • 价税款均未支付
  • 视同销售的会计处理怎么做?
  • 夜间潜水时发现水体
  • 数据库锁面试题
  • 二手车折旧法
  • python del语法
  • 期末结转会计分录模板
  • 民间非营利组织会计账务处理
  • phpcms api
  • 其他科技推广服务业可以加计扣除吗
  • 收到红字发票如何入账
  • 出租房产怎么交房产税
  • 可转债中签卖出流程
  • 固定资产计提折旧的原则
  • 承包经营的承包人工资能税前扣除吗
  • 小规模企业收到专票怎么做账
  • 公司班车运费如何入账的
  • 债务转化为资本是啥意思?
  • 其他收益结转到什么科目
  • 企业职工福利费使用范围和标准
  • 垫款报销
  • 接受捐赠后怎么发表感言
  • 企业共同控制持股比例怎么算
  • 房地产开发企业增值税税率
  • 物业服务企业管理
  • linux 查看numa
  • sql2008数据库置疑
  • windows vista X86 RTM/OEM 中文正式版下载地址
  • win7使用mbr还是guid
  • windows8音频服务尚未启用 怎么解决
  • 命令行教程
  • win10资源管理器在哪里打开
  • linux开启关闭命令
  • mysql删除key
  • Linux网络抓包工具
  • 安卓开发源码
  • flask框架菜鸟教程
  • jquery怎么修改样式
  • python函数详解
  • 税务文书档案保管期限
  • 企业年金企业账户部分可以提取么
  • 火车票抵扣申报表怎么填
  • 江苏高速通行费标准
  • 单位纪检员和纪检委员区别
  • 山东省地方税务局关于个人所得税
  • 出口退税函调管理办法
  • 建筑安装工程承包条例还有效吗
  • 免责声明:网站部分图片文字素材来源于网络,如有侵权,请及时告知,我们会第一时间删除,谢谢! 邮箱:opceo@qq.com

    鄂ICP备2023003026号

    网站地图: 企业信息 工商信息 财税知识 网络常识 编程技术

    友情链接: 武汉网站建设