预约成功

1、这才是数据分析的开源框架——开源框架
目前,就中国而言,在涉及数据分析的开源框架方面,不能忽视以下三点:
hadoop:batch,mapReduce
storm:streaming
spark:batch + streaming
这些开源框架的共同特点是关注并行计算框架,关注作业延迟、负载平衡和故障恢复,很少考虑资源分配、用户管理和权限控制。它们基于这样一个假设:所有用户都是相同的、平等的权利,所有用户都可以使用所有机器尽快完成所有工作。
2、这才是数据分析的开源框架——开源框架的局限性
在大企业中,不同部门、同一部门的不同岗位是不平等的。不同部门之间也有许多私人数据,其他部门无法访问。不同的用户有不同的权限。对于计算资源的需求,由于不同作业的优先级不同,也需要加以区分。
在这种需求下,出现了一些第三方来提供诸如Hadoop这样的开源框架的资源、权限管理产品或服务。Hadoop升级到2之后,还考虑了一些数据隔离问题。
但其实力可能无法满足大多数大型企业的要求。这也是使用开源框架的挫败感。使用开源产品的商业发行是另一种方式。然而,在这方面,它并不如企业原生系统的支持好。
3、这才是数据分析的开源框架——企业原有框架
确实,有些企业已经独立开发了完全独立(不基于开源产品)的分布式数据处理平台,仅限于内部使用。在用户管理、数据访问权限、存储、计算资源管理等方面。
例如,每个用户都需要在提交作业之前申请令牌。有多少令牌,就有多少计算。不同数据存储路径之间的权限是单独管理的,用户还需要申请权限。
但这样一个体系的发展,意味着企业必须具有非常强的研发能力,能够承受巨大的人力资源消耗。与开源系统已经实现的功能相比,很难避免重复制造轮子。即使是大企业也很少选择这种方案。
以上就是《这才是数据分析的开源框架,数据分析师表示这些很常用》的全部内容,从文字中我们可以看到,开源框架的共同特点是关注并行计算框架,关注作业延迟、负载平衡和故障恢复,很少考虑资源分配。如果你想学习更多数据分析知识,可以点击下方资料下载链接。