大数据存储与管理

发布时间: 2025-05-22 06:20:03

1. 什么是大数据存储管理

1.分布式存储

传统化集中式存储存在已有一段时间。但大数据并非真的适合集中式存储架构。Hadoop设计用于将计算更接近数据节点，同时采用了HDFS文件系统的大规模横向扩展功能。

虽然，通常解决Hadoop管理自身数据低效性的方案是将Hadoop 数据存储在SAN上。但这也造成了它自身性能与规模的瓶颈。现在，如果你把所有的数据都通过集中式SAN处理器进行处理，与Hadoop的分布式和并行化特性相悖。你要么针对不同的数据节点管理多个SAN，要么将所有的数据节点都集中到一个SAN。

但Hadoop是一个分布式应用，就应该运行在分布式存储上，这样存储就保留了与Hadoop本身同样的灵活性，不过它也要求拥抱一个软件定义存储方案，并在商用服务器上运行，这相比瓶颈化的Hadoop自然更为高效。

2.超融合VS分布式

注意，不要混淆超融合与分布式。某些超融合方案是分布式存储，但通常这个术语意味着你的应用和存储都保存在同一计算节点上。这是在试图解决数据本地化的问题，但它会造成太多资源争用。这个Hadoop应用和存储平台会争用相同的内存和CPU。Hadoop运行在专有应用层，分布式存储运行在专有存储层这样会更好。之后，利用缓存和分层来解决数据本地化并补偿网络性能损失。

3.避免控制器瓶颈(Controller Choke Point)

实现目标的一个重要方面就是——避免通过单个点例如一个传统控制器来处理数据。反之，要确保存储平台并行化，性能可以得到显着提升。

此外，这个方案提供了增量扩展性。为数据湖添加功能跟往里面扔x86服务器一样简单。一个分布式存储平台如有需要将自动添加功能并重新调整数据。

4.删重和压缩

掌握大数据的关键是删重和压缩技术。通常大数据集内会有70%到90%的数据简化。以PB容量计，能节约数万美元的磁盘成本。现代平台提供内联(对比后期处理)删重和压缩，大大降低了存储数据所需能力。

5.合并Hadoop发行版

很多大型企业拥有多个Hadoop发行版本。可能是开发者需要或是企业部门已经适应了不同版本。无论如何最终往往要对这些集群的维护与运营。一旦海量数据真正开始影响一家企业时，多个Hadoop发行版存储就会导致低效性。我们可以通过创建一个单一，可删重和压缩的数据湖获取数据效率

6.虚拟化Hadoop

虚拟化已经席卷企业级市场。很多地区超过80%的物理服务器现在是虚拟化的。但也仍有很多企业因为性能和数据本地化问题对虚拟化Hadoop避而不谈。

7.创建弹性数据湖

创建数据湖并不容易，但大数据存储可能会有需求。我们有很多种方法来做这件事，但哪一种是正确的?这个正确的架构应该是一个动态，弹性的数据湖，可以以多种格式(架构化，非结构化，半结构化)存储所有资源的数据。更重要的是，它必须支持应用不在远程资源上而是在本地数据资源上执行。

不幸的是，传统架构和应用(也就是非分布式)并不尽如人意。随着数据集越来越大，将应用迁移到数据不可避免，而因为延迟太长也无法倒置。

理想的数据湖基础架构会实现数据单一副本的存储，而且有应用在单一数据资源上执行，无需迁移数据或制作副本

8.整合分析

分析并不是一个新功能，它已经在传统RDBMS环境中存在多年。不同的是基于开源应用的出现，以及数据库表单和社交媒体，非结构化数据资源(比如，维基网络)的整合能力。关键在于将多个数据类型和格式整合成一个标准的能力，有利于更轻松和一致地实现可视化与报告制作。合适的工具也对分析/商业智能项目的成功至关重要。

9. 大数据遇见大视频

大数据存储问题已经让人有些焦头烂额了，现在还出现了大视频现象。比如，企业为了安全以及操作和工业效率逐渐趋于使用视频监控，简化流量管理，支持法规遵从性和几个其它的使用案例。很短时间内这些资源将产生大量的内容，大量必须要处理的内容。如果没有专业的存储解决方案很可能会导致视频丢失和质量降低的问题。

10.没有绝对的赢家

Hadoop的确取得了一些进展。那么随着大数据存储遍地开花，它是否会成为赢家，力压其它方案，其实不然。

比如，基于SAN的传统架构在短期内不可取代，因为它们拥有OLTP，100%可用性需求的内在优势。所以最理想的办法是将超融合平台与分布式文件系统和分析软件整合在一起。而成功的最主要因素则是存储的可扩展性因素。

2. 简述大数据在存储和管理时用到的关键技术

大数据在存储和管理时用到的关键技术主要包括：

1. 分布式存储技术 Hadoop的HDFS：该技术能够将数据分散地存储在多个节点上，通过多个节点的协同工作，实现对海量数据的高效存储和访问。

2. 分布式计算框架 Hadoop的MapRece：该框架能够在大量计算机集群上并行地处理大数据，通过将大数据任务拆分成多个小任务，并在集群中的各个节点上并行执行，实现大数据的快速分析。

3. 数据挖掘和机器学习算法 如Scikitlearn、TensorFlow等：这些算法和框架是大数据挖掘和分析的重要工具，能够帮助用户从海量数据中提取有价值的信息，并构建预测模型，为决策提供科学依据。

4. 数据压缩技术 用于减小数据大小的技术：大数据的存储和管理需要消耗大量的存储空间和计算资源，数据压缩技术通过减小数据的大小，可以降低存储成本和提高数据处理效率。

以上这些关键技术共同构成了大数据存储和管理的基础，它们的结合应用使得海量数据的处理和分析成为可能，为现代信息化社会提供了强大的技术支持。

3. 大数据技术是干什么的

大数据技术是干数据存储和管理、数据分析和挖掘、数据可视化、实时数据处理、数据安全和隐私保护的。

1、数据存储和管理：大数据技术可以高效地存储、管理和处理海量的数据，例如分布式文件系统HDFS和数据存储和管理软件Hive、HBase等，可以为企业提供高效的数据存储和管理方案。

阅读全文

热点内容

java返回this 发布：2025-10-20 08:28:16 浏览：590

制作脚本网站发布：2025-10-20 08:17:34 浏览：886

python中的init方法发布：2025-10-20 08:17:33 浏览：579

图案密码什么意思发布：2025-10-20 08:16:56 浏览：763

怎么清理微信视频缓存发布：2025-10-20 08:12:37 浏览：680

c语言编译器怎么看执行过程发布：2025-10-20 08:00:32 浏览：1010

邮箱如何填写发信服务器发布：2025-10-20 07:45:27 浏览：253

shell脚本入门案例发布：2025-10-20 07:44:45 浏览：111

怎么上传照片浏览上传发布：2025-10-20 07:44:03 浏览：802

python股票数据获取发布：2025-10-20 07:39:44 浏览：709

大数据存储与管理

与大数据存储与管理相关的资讯