现在有很多Java技术方向的同学在找工作的时候,肯定都会去招聘网站上找职位投递简历。
但是在很多职位JD上往往会有这样的一个要求:熟悉分布式系统理论、设计和开发,具备复杂分布式系统构建经验。
之前不少同学后台留言问过我:这个分布式系统的设计和开发经验,到底指的是什么?那么这篇文章就给大家来解释一下这个问题。
1从单块系统说起
要说分布式系统是什么东西,那么就得先从单块系统开始说起。
很多同学应该都知道,如果你在一些中小型的传统软件公司里工作,那么很有可能现在在做的系统是如下这个样子。
所有的代码都在一个工程里,最多可能就是通过maven等构件工具拆分了一下代码工程模块,不同的模块可以放在不同的工程代码里。
在部署的时候,可能就是直接在线上的几台机器里直接放到里面的tomcat下来运行。
然后在web服务器前面可能会有一层负载均衡服务器,比如用nginx或者是其他的负载均衡设备。
很多流量很小的企业内部系统,比如OA、CRM、财务等系统,甚至可能就直接在一台机器的tomcat下部署一下。
然后直接配置一下域名解析,就可以让这个系统的可能几十个,或者几百个用户通过访问域名来使用这个软件了。
至于说系统的依赖大概来说很可能只有一个,那就是MySQL、Oracle等关系型数据库,可能会在某台机器上专门部署一个数据库,让应用系统来使用。
大家看看下面的图,体会一下这种单体架构。
这种系统在很多中小型公司里现在还是比较多的,就是典型的单块系统,所有代码在一个工程,部署在一个tomcat里即可,这里包含了系统所有的功能。
你哪怕就部署一台机器,这个系统也可以运行,只不过为了所谓的“高可用”,可能一般会部署两台机器,前面加一层负载均衡设备,这样其中一个机器挂了,另外一个机器上还有一个系统可以用。
2团队越来越大,业务越来越复杂
其实上面说的那种单块系统,如果是一个10人以内的小团队大家一起维护和开发一个用户数量不多,请求量不大的系统,也是没问题的,还挺方便的,对吧。
你搞一个代码仓库,然后就一份代码,每个人都在自己本地写代码,最后把代码合并一下,做做测试,然后就直接部署基于Tomcat来就可以了。
但是问题就在于说,如果你的团队超过了10个人,比如有20个人,甚至几十个人,上百个人要一起协作开发这个系统,然后里面的业务逻辑特别多,可能功能模块多达几百个。这个时候就麻烦了,你要是还用那种单块系统的模式,那肯定是很痛苦的。
因为几十个人维护一个单块系统,大家在一个工程里写代码,大量的冲突以及代码合并都会让人崩溃。
而且部署的时候会有各种冲突,比如某个功能模块要上线了,但是他必须得把整个单块系统所有的功能都回归测试一遍才敢上线。
因为大家的代码都在一个工程里,都是耦合在一起的,你修改了代码,必须全部测试一遍才能保证系统正常。
所以说这个时候,就必须想办法把系统改造成分布式系统了。
3分布式出现:庞大系统分而治之
这个时候就可以尝试把一个大的系统拆分为很多小的系统,甚至很多小的服务,然后几个人组成一个小组就专门维护其中一个小系统,或者每个人维护一个小服务。
简单来说,就是分而治之,这样每个人可以专注维护自己的代码。
然后不同的小系统自己开发、测试和上线,都不会跟别人耦合在一起,可以自己独立进行,非常的方便,大大简化了大规模系统的开发成本。
不同的子系统之间,就是通过接口互相来回调用,每个子系统都有自己的数据库,大家看下面的图。
4分布式系统所带来的技术问题
那么大家这个时候可以思考一下,如果你的公司是采用这种分布式系统的方式来构建公司的一个大规模系统的,那么这个时候会涉及到哪些技术问题?
(1)分布式服务框架
你如果要让不同的子系统或者服务之间互相通信,首先必须有一套分布式服务框架。
也就是各个服务可以互相感知到对方在哪里,可以发送请求过去,可以通过HTTP或者RPC的方式。
在这里,最常见的技术就是dubbo以及spring cloud,当然大厂一般都是自己有服务框架
(2)分布式事务
一旦你的系统拆分为了多个子系统之后,那么一个贯穿全局的分布式事务应该怎么来实现?
这个你需要了解TCC、最终一致性、2PC等分布式事务的实现方案和开源技术。
(3)分布式锁
不同的系统之间如果需要在全局加锁获取某个资源的锁定,此时应该怎么来做?
毕竟大家不是在一个JVM里了,不可能用synchronized来在多个子系统之间实现锁吧,是不是?
(4)分布式缓存
如果你原来就是个单块系统,那么你其实是可以在单个JVM里进行本地缓存就可以了,比如搞一个HashMap来缓存一些数据。
但是现在你有很多个子系统,他们如果要共享一个缓存,你应该怎么办?是不是需要引入Redis等缓存系统?
(5)分布式消息系统
在单块系统内,就一个JVM进程内部,你可以用类似LinkedList之类的数据结构作为一个本地内存里的队列。
但是多个子系统之间要进行消息队列的传递呢?那是不是要引入类似RabbitMQ之类的分布式消息中间件?
(6)分布式搜索系统
如果在单块系统内,你可以比如在本地就基于Lucene来开发一个全文检索模块,但是如果是分布式系统下的很多子系统,你还能直接基于Lucene吗?
明显不行,你需要在系统里引入一个外部的分布式搜索系统,比如Elasticsearch。
(7)其他很多的技术
比如说分布式配置中心、分布式日志中心、分布式监控告警中心、分布式会话,等等,都是分布式系统场景下你需要使用和了解的一些技术。
因为沿用单块系统时代的那些技术已经不行了,比如说你单块系统的时候,直接在本地用一个properties文件存放自己的配置即可,日志也写到本地即可。
但是分布式时代呢?
你那么多的子系统,怎么共享同一份配置?怎么把各个系统的日志聚合写到一个地方来查看?
单块系统的时候,你一个web应用直接基于Servlet API提供的Session会话功能即可,那么分布式时代呢,你有N多个子系统如果要共享会话该怎么做?
5一句话总结:什么是分布式系统设计和开发经验?
其实分析完了之后,大家应该就大概知道了,招聘JD上写这个分布式系统的设计和开发经验,其实他是一个很大的主题,里面包含很多的内容。
你的系统一旦分布式了之后,通信、缓存、消息、事务、锁、配置、日志、监控、会话,等等各种原来单块系统场景下很容易解决的问题,都会变得很复杂,需要引入大量外部的技术。
所以你有没有参与过类似这样的一个大的分布式系统?你有没有基于各种技术解决过分布式系统场景下的各种技术问题?这就是人家希望和要求的分布式系统设计和开发的经验。如果大家还没接触过,建议多去学习一下。
6补充说明:中间件系统及大数据系统
最后给大家说明一点,一般这种招聘JD,如果是Java岗位要求分布式相关的经验,其实主要还是上面说的那些东西,他面向的是分布式的业务系统的构建。
但是其实分布式系统本身是一个非常复杂的话题,因为刚才说的只是一个分布式业务系统要依赖哪些技术来进行构建。
但是其实比如Kafka、Rocket等中间件,本身他也是分布式的,你要搞明白他们自己是如何实现分布式的,又是一个非常复杂的话题。
此外,像hadoop、spark、hbase等大数据系统,本身也都是世界上最最复杂的分布式系统,这又涉及到大数据领域的话题了,以后有机会可以单独聊聊。
当今互联网蓬勃发展,万物互联互通,数据化和智能化的发展趋势日益明显。企业需要快速搭建自己的运维监控平台、数据仓储、图文报表、办公系统等平台。难免会遇到以下问题:
(1)通过购买定制化的整套软件,往往价格昂贵,并且后续升级维护依然需要较大费用。
(2)公司从头到尾都独立
开发
自己的系统,周期较长,不划算。小公司以及高校等科研单位很难实现。
前期接触了各种大小品牌的公司,谈判接触很多,走...
互联网医院软件是目前比较受大家关注的一种医疗服务软件,通过互联网技术可以为患者提供更加高效的服务,医疗行业的进步也在影响着我们的生活,对于一些外的患者来说更加少去了两地奔波的情况,搭建互联网医院可以提供质量更好的医疗服务,未来线上医疗将会给我们的带来更多的便利条件。2、数据库设计:互联网医院系统的数据库设计需要考虑到数据的安全性、可扩展性和性能等因素。3、接口设计:互联网医院系统的
开发
需要涉及到多个接口的设计和实现。在接口设计中,需要考虑到接口参数的传递、接口返回值的格式以及接口的安全性等因素。
Availability=MTTF/(MTTF+MTTRMTTF)
MTTF 是 Mean Time To Failure,指平均故障前的时间,即系统平均能够正常运行多长时间才发生一次故障。系统的可靠性越高,MTTF 越长(简单理解MTTF 就是指系统正常运行的时间)。MTTR 是 Mean Time To Recov
业务刚开始是都是单体应用,随着用户量和访问量的增加,架构层面也发生了变化,逐步由单体应用转变为
分布式
应用
开发
,如把单体应用的每个模块按照特定的方法拆分成一组独立的服务,服务与服务之间通过HTTP或RPC方式调用。但随着服务的数量增加,维护服务的URL地址就变得非常麻烦,所以需要设计一套系统来管理每个服务所对应的URL地址,出现了注册中心。还会面临流量削峰、版本兼容、服务熔断、服务降级、服务限流等问题,如何解决这些问题,让服务更稳定运行,就叫做服务治理。...
我们在
分布式
开发
中经常听到的一个词就是“服务治理”。在理解“服务治理”的概念之前让我们先理解什么是
分布式系统
,
分布式系统
之间如何通过RPC(Remote Procedure Call,远程过程调用)方式通信,以及如何解决RPC框架存在的问题,这样才能真正地理解服务治理的核心思想。...
互联网每天产生数以亿计的数据,这些数据如何能够被正确地存储、解析、利用,是摆在每个数据公司面前的挑战。传统的关系型数据库,对于处理大规模的数据显得力不从心,由此以NoSQL为代表的
分布式
存储应运而生。NoSQL,泛指非关系型的数据库。NoSQL数据库的产生旨在解决大规模数据集合多重数据种类带来的挑战,尤其是大数据应用的难题。本章介绍
分布式
存储。
分布式
存储系统,是将数据分散存储在多台独立的设备上。传统的网络存储系统采用集中的存储服务器存放所有数据,存储服务器的空间有限成为系统性能的瓶颈,也是可靠性和安全性的焦
一直在搞
分布式系统
,Hadoop, Spark, Kafka, ZooKeeper之类的都玩过,然而以前只是简单地用用各个开源组件实现,并没有系统地学习其中的原理和算法。最近在跟着MIT 6.824课程学习
分布式系统
的各种理论原理,这里就来简单总结下
分布式系统
中的一些基础内容吧~
CAP Theory
CAP Theory阐述了
分布式系统
中的一个事实:一致性(Consistency)、可用性(...
构建
分布式系统
Jeaf Dean的《构建大型
分布式系统
的设计,教训和建议》。 (Designs, Lessons and Advice from Building Large Distributed Systems by Jeaf Dean.)
Everyone who is interested in large distributed systems should read: 对大型
分布式
系...
在概述
分布式
核心技术之前,我们有必要先概括阐述一-下
分布式
计算、并行计算、云计算等相关概念,以及市场上流行的相关技术产品,如Hadoop生态体系,然后再结合背景引出我们为什么要归纳出一个轻量级的
分布式
框架。本章为后续章节的背景。本章意在使读者对
分布式
技术话题的前因后果先有所了解。由于只是概述,我们对涉及的
分布式
计算概念和Hadoop生态体系只是蜻蜓点水地带过,目的仅是让读者了解到这些内容大致是什么。...
研究
分布式系统
有快二年时间了,在自已的学习与工作过程中走过不少弯路,也遇到过不少的挫折,但所幸自己还算走过来了,近日不少新手网友们老向我询问一些相关的技术,发了不少邮件,最后想想,还是自己总结一下与大家交流一下吧。 在
分布式
应用系统
开发
过程中有几个比较重要的技术,一是网络通讯技术;二是相关协议架构;三是数据库设计与管理操作技术;四是安全技术。一套
分布式系统
首先要
开发
其底层可靠的网络通讯,在其上是
与近期与InfoQ的一次对话中,Vaughn Vernon分享了一些他在
开发
分布式系统
方面的心得。他特别指出,在
分布式系统
中,有可能会出现局部故障之类的问题。对于这种类型的问题以及一些其它挑战来说,最佳的应对方式是做好一切准备,而不是无助地祈祷它不要出现。Vaughn还推荐了Jeff Hodges所撰写的一篇博客文章,这篇文章为
分布式系统
给出了一些落到实处的设计方式,并提出了一些实用的建议,非常适...