预约成功

大数据已经成为大多数商业组织的首要任务,他们越来越意识到数据在其自身成功中所起的核心作用。但许多公司仍在为如何在当今的现代体系结构中最好地保护、管理和分析数据而苦苦挣扎。如果不做好这项工作,将会导致长时间的停机和可能的数据丢失,从而给企业组织造成巨大的损失。
一些最常见的误解如下:
1、数据的备份误区有哪些——如果有多个数据拷贝,就不需要单独的大数据备份/恢复工具。
大多数大数据平台创建数据的多个副本,并将其分发到不同的服务器或机架上。在硬件故障的情况下,这种数据冗余机制可以保护数据。但是,任何其他情况(如用户错误、意外删除或数据损坏)都可能导致数据丢失,因为这些错误或损坏会迅速蔓延到数据的所有副本。
2、数据的备份误区有哪些——丢失的数据可以快速而容易地从原始数据中重建。
如果仍有所有原始数据来重建丢失的数据,这可能是可行的。但在大多数情况下,原始数据被删除或不易访问。即使原始数据可用,重建丢失的大数据也可能需要数周时间,消耗大量技术资源,延长大数据用户的停机时间。
3、数据的备份误区有哪些——备份Pb级的大数据既不经济也不实用。
Pb级数据的定期完整备份需要数周时间,并且需要至少50万美元的基础设施投资。但是,有几种方法可以缓解这些问题。您可以找到对您的业务有价值的少量数据,并仅备份这些数据。使用更新的备份技术(如重复数据消除以高效地存储备份内容)、永久增量备份(用于传输更改的内容)以及使用商用服务器也有助于降低成本和缩短备份时间。
4、数据的备份误区有哪些——远程灾难恢复拷贝可以充当备份拷贝。
谨慎的做法是将数据副本放在远程数据中心,以防止火灾和地震等大规模灾难。这通常是通过定期将数据从生产数据中心复制到灾难恢复数据中心来实现的。但是,对生产数据中心的所有更改都可能蔓延到灾难恢复站点,包括意外删除、数据库损坏、应用程序损坏等。因此,灾难恢复副本不能用作备份副本,因为它没有可用于回滚的时间点副本。
5、数据的备份误区有哪些——为大数据编写备份/恢复脚本很容易。
如果你有技术资源,数据量小,只有一个大数据平台,写脚本是可行的。大多数企业组织通常在多个大数据平台上都有几十甚至几百TB的大数据。为这种环境编写、测试和维护脚本并不容易。需要为每个支持的平台编写脚本(例如,Hadoop需要一个脚本,Cassandra需要另一个脚本)。脚本必须进行大规模测试;在平台版本更改(从Cassandra 2.1到2.2)后必须重新测试。在某些情况下,脚本可能需要定期更新以支持新特性、新api、新数据类型等。
大多数企业组织没有意识到,一个好的大数据平台备份脚本面临着巨大的隐性成本,需要相应的专业知识。由于恢复过程涉及到很多方面:找到合适的备份副本,将数据复制回相应的节点,并使用针对特定平台的恢复程序来恢复数据,所以恢复过程更加困难和容易出错。
6、数据的备份误区有哪些——大数据备份/恢复的运行成本很低。
除了常规的维护和测试脚本外,备份和恢复还需要额外的成本。额外费用包括:
确保有人成功地执行备份、调试,等等。
存储成本:存储备份内容需要花钱。
停机成本:在此期间,管理员需要找到备份副本并将数据恢复到理想状态。
尤其是当大数据环境变得更大、更复杂时,这些成本可能会显著增加。
7、数据的备份误区有哪些——快照是一种有效的大数据备份机制。
快照(在特定时间点冻结的数据状态)有时用作备份副本,以防止用户错误或应用程序损坏。在使用平台或存储快照进行备份时,有几点需要考虑。
首先,快照可用于自动化备份过程。但是,在使用存储快照时,需要额外的手动步骤来确保备份数据和元数据的一致性。其次,快照只有在数据没有快速变化时才有效。就大数据平台而言,数据变化的速度非常快,而压缩等技术只能加速数据变化的速度。因此,快照需要大量的存储开销(高达50%)才能保留多个时间点拷贝。
最后,从快照恢复数据可能是一个非常麻烦的手动过程。管理员或数据库管理员必须找到要恢复的数据对应的快照文件(如密钥空间或表),然后通过快照恢复到集群中相应的节点上。一旦恢复过程中出现错误,数据将永久丢失。
数据的备份误区有哪些?优秀的数据分析师都不会这么做,大数据已经成为大多数商业组织的首要任务,他们越来越意识到数据在其自身成功中所起的核心作用,如果不做好这项工作,企业组织造成巨大的损失,如果您还也想成为数据分析师,那么下方的资料下载链接一定会帮助你。