预约成功
我们碰到的数据通常有这样几个数据分析的主要困难。一是数据量大。大家只要想一想,万维网上有多少网页,这些网页上有多少数据,就可以对现在碰到的数据量之大有点感觉了。数据量大带来的挑战是计算方面的,因此一些随机方法就显得重要,另外一种思路是分布式计算。第二是数据维数高。例如前面提到的SNP数据是64万维的。第三是数据类型复杂。数据可以是网页或报纸,也可以是图像,视频,多种类型的数据给数据融合带来困难。第四是噪音大。数据在生成、采集、传输和处理等流程中,均可能引入噪音。这些噪音的存在给数据清洗和分析带来挑战。需要有一定的修正功能的模型,例如图像中的正则化和机器学习中的去燥自编码器。
这里面最核心的数据分析的主要困难是维数高。维数高给我们带来的是维数灾难(curse ofdimensionality)。即模型的复杂度和计算量随着维数的增加而指数增长。
那么怎样克服维数高带来的困难?通常有两类方法。一类方法就是将数学模型限制在一个极小的特殊类里面,如线性模型。另一类方法是利用数据可能有的特殊结构,例如稀疏性、低维或低秩和光滑性等。这些特性可以通过对模型作适当的正则化而实现,也可以通过降维方法来实现。
总而言之,数据分析本质上是一个反问题。因此,处理反问题的许多想法,如正则化,在数据分析中扮演了很重要的角色。这也正是统计学与统计力学的不同之处。统计力学处理的是正问题,统计学处理的是反问题。
以上就是有关于数据分析的主要困难的相关内容,以及相应的解析,不论你是已经入职数据分析师岗位的新人,还是打算进入数据分析岗位的小白,以上的内容都或多或少会对大家有所帮助,环球网校的小编在这里祝大家的数据分析师职业道路顺利。