简单来说,分布式数据存储确实是把数据分散存放在不同的地方。你可以把它理解成把数据切成很多小块,并且为了安全起见,还会做多重备份。这些数据和备份会被分布部署在不同的集群里,也就是说它们最终是存在不同的主机和存储介质上的,而不是集中在一个地方。
分布式数据存储是将数据分散存储在不同位置吗?
我们要对比一下传统的集中式存储,就会发现它有很多局限。因为硬件都集中在一起,所以对机房的空间布局、散热系统以及地面承重都有非常严格的标准。同时,为了支撑高性能,存储设备本身要很强大,而且对主干网络的带宽资源也提出了极高的要求,搭建和维护起来比较麻烦。
在如今这个信息爆炸的时代,数据量的增长是指数级的。如果还只是单纯在固定地点增加硬盘,无论是在容量上限、扩容速度,还是读写性能及数据备份效率上,都很难满足需求。特别是大数据处理中,客户产生的数据类型繁多,包含大量半结构化和非结构化数据,比如文档、图片和视频,这时候用分布式文件系统来管理是最合适的。
具体从技术分类来看,分布式存储主要包含三种形式:分布式块存储、分布式文件存储以及分布式对象存储。这里有个很好的例子就是Ceph,它是一个开源的分布式存储系统,特点是非常灵活,既可以部署在单机上,也可以扩展到集群环境中使用,适应性很强。