山东省大数据局大数据百科干货丨大数据基础术语精粹来袭|数据清洗的基本流程图解_家电

DMPDSPSaaSPaasHaaS我天这是说的什么

以下为您带来49例大数据基础术语，一起来学习吧!

一、大数据

英文：bigdata，megadata

大数据，或称巨量资料，指的是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。

二、大数据的4V：

Volume(大量)、Velocity(高速)、Variety(多样)、Value(价值)

三、当前用于分析大数据的工具主要有开源与商用两个生态圈

开源大数据生态圈：

1、HadoopHDFS、HadoopMapReduce,HBase、Hive渐次诞生，早期Hadoop生态圈逐步形成。

2、.Hypertable是另类。它存在于Hadoop生态圈之外，但也曾经有一些用户。

3、NoSQL，membase、MongoDb

商用大数据生态圈：

1、一体机数据库/数据仓库：IBMPureData(Netezza),OracleExadata,SAPHana等等。

2、数据仓库：TeradataAsterData,EMCGreenPlum,HPVertica等等。

3、数据集市：QlikView、Tableau、以及国内的YonghongDataMart。

四、Hadoop

Hadoop是一个由Apache基金会所开发的分布式系统基础架构。

用户可以在不了解分布式底层细节的情况下，开发分布式程序。充分利用集群的威力进行高速运算和存储。

Hadoop实现了一个分布式文件系统(HadoopDistributedFileSystem)，简称HDFS。HDFS有高容错性的特点，并且设计用来部署在低廉的(low-cost)硬件上;而且它提供高吞吐量(highthroughput)来访问应用程序的数据，适合那些有着超大数据集(largedataset)的应用程序。HDFS放宽了(relax)POSIX的要求，可以以流的形式访问(streamingaccess)文件系统中的数据。

Hadoop的框架最核心的设计就是：HDFS和MapReduce。HDFS为海量的数据提供了存储，则MapReduce为海量的数据提供了计算。

五、Apache基金会

Apache软件基金会(也就是ApacheSoftwareFoundation，简称为ASF)，是专门为支持开源软件项目而办的一个非盈利性组织。在它所支持的Apache项目与子项目中，所发行的软件产品都遵循Apache许可证(ApacheLicense)。

六、MapReduce

MapReduce是一种编程模型，用于大规模数据集(大于1TB)的并行运算。概念”Map(映射)”和”Reduce(归约)”，和它们的主要思想，都是从函数式编程语言里借来的，还有从矢量编程语言里借来的特性。它极大地方便了编程人员在不会分布式并行编程的情况下，将自己的程序运行在分布式系统上。当前的软件实现是指定一个Map(映射)函数，用来把一组键值对映射成一组新的键值对，指定并发的Reduce(归约)函数，用来保证所有映射的键值对中的每一个共享相同的键组。

七、BI

商业智能(BI，BusinessIntelligence)。

BI(BusinessIntelligence)即商务智能，它是一套完整的解决方案，用来将企业中现有的数据进行有效的整合，快速准确的提供报表并提出决策依据，帮助企业做出明智的业务经营决策。

八、CRM

CRM即客户关系管理，是指企业用CRM技术来管理与客户之间的关系。在不同场合下，CRM可能是一个管理学术语，可能是一个软件系统。通常所指的CRM，指用计算机自动化分析销售、市场营销、客户服务以及应用等流程的软件系统。它的目标是通过提高客户的价值、满意度、赢利性和忠实度来缩减销售周期和销售成本、增加收入、寻找扩展业务所需的新的市场和渠道。CRM是选择和管理有价值客户及其关系的一种商业策略，CRM要求以客户为中心的企业文化来支持有效的市场营销、销售与服务流程。

九、云计算

分布式计算(DistributedComputing)

并行计算(ParallelComputing)

效用计算(UtilityComputing)

网络存储(NetworkStorageTechnologies)

虚拟化(Virtualization)

负载均衡(LoadBalance)

热备份冗余(HighAvailable)

十一：数据仓库

十二：非关系型数据库

NoSQL，泛指非关系型的数据库。随着互联网web2.0网站的兴起，传统的关系数据库在应付web2.0网站，特别是超大规模和高并发的SNS类型的web2.0纯动态网站已经显得力不从心，暴露了很多难以克服的问题，而非关系型的数据库则由于其本身的特点得到了非常迅速的发展。NoSQL数据库的产生就是为了解决大规模数据集合多重数据种类带来的挑战，尤其是大数据应用难题。

十三：结构化数据

结构化数据(即行数据，存储在数据库里，可以用二维表结构来逻辑表达实现的数据)而言，不方便用数据库二维逻辑表来表现的数据即称为非结构化数据，包括所有格式的办公文档、文本、图片、标准通用标记语言下的子集XML、HTML、各类报表、图像和音频/视频信息等等。

十四：结构化分析方法

结构化分析方法(StructuredMethod，结构化方法)是强调开发方法的结构合理性以及所开发软件的结构合理性的软件开发方法。结构是指系统内各个组成要素之间的相互联系、相互作用的框架。结构化开发方法提出了一组提高软件结构合理性的准则，如分解与抽象、模块独立性、信息隐蔽等。针对软件生存周期各个不同的阶段，它有结构化分析(SA)和结构化程序设计(SP)等方法。

十五：半结构化数据

和普通纯文本相比，半结构化数据具有一定的结构性，但和具有严格理论模型的关系数据库的数据相比。OEM(ObjectexchangeModel)是一种典型的半结构化数据模型。

半结构化数据(semi-structureddata)

在做一个信息系统设计时肯定会涉及到数据的存储，一般我们都会将系统信息保存在某个指定的关系数据库中。我们会将数据按业务分类，并设计相应的表，然后将对应的信息保存到相应的表中。比如我们做一个业务系统，要保存员工基本信息：工号、姓名、性别、出生日期等等;我们就会建立一个对应的staff表。

但不是系统中所有信息都可以这样简单的用一个表中的字段就能对应的。

十六：非结构化数据

非结构化数据库是指其字段长度可变，并且每个字段的记录又可以由可重复或不可重复的子字段构成的数据库，用它不仅可以处理结构化数据(如数字、符号等信息)而且更适合处理非结构化数据(全文文本、图象、声音、影视、超媒体等信息)。

十七：数据库(Database)

数据库是按照数据结构来组织、存储和管理数据的仓库，它产生于距今六十多年前，随着信息技术和市场的发展，特别是二十世纪九十年代以后，数据管理不再仅仅是存储和管理数据，而转变成用户所需要的各种数据管理的方式。数据库有很多种类型，从最简单的存储有各种数据的表格到能够进行海量数据存储的大型数据库系统都在各个方面得到了广泛的应用。

十八：数据分析

英文名：DataAnalysis

数据分析是指用适当的统计分析方法对收集来的大量数据进行分析，提取有用信息和形成结论而对数据加以详细研究和概括总结的过程。这一过程也是质量管理体系的支持过程。在实用中，数据分析可帮助人们作出判断，以便采取适当行动。

Excel作为常用的分析工具，可以实现基本的分析工作，在商业智能领域Cognos、StyleIntelligence、Microstrategy、Brio、BO和Oracle以及国内产品如YonghongZ-SuiteBI套件等。

十九：数据挖掘

数据挖掘(英语：Datamining)，又译为资料探勘、数据采矿。它是数据库知识发现(英语：Knowledge-DiscoveryinDatabases，简称：KDD)中的一个步骤。数据挖掘一般是指从大量的数据中通过算法搜索隐藏于其中信息的过程。数据挖掘通常与计算机科学有关，并通过统计、在线分析处理、情报检索、机器学习、专家系统(依靠过去的经验法则)和模式识别等诸多方法来实现上述目标。

二十：数据清洗

数据清洗从名字上也看的出就是把“脏”的“洗掉”，指发现并纠正数据文件中可识别的错误的最后一道程序，包括检查数据一致性，处理无效值和缺失值等。因为数据仓库中的数据是面向某一主题的数据的集合，这些数据从多个业务系统中抽取而来而且包含历史数据，这样就避免不了有的数据是错误数据、有的数据相互之间有冲突，这些错误的或有冲突的数据显然是我们不想要的，称为“脏数据”。我们要按照一定的规则把“脏数据”“洗掉”，这就是数据清洗。而数据清洗的任务是过滤那些不符合要求的数据，将过滤的结果交给业务主管部门，确认是否过滤掉还是由业务单位修正之后再进行抽取。不符合要求的数据主要是有不完整的数据、错误的数据、重复的数据三大类。数据清洗是与问卷审核不同，录入后的数据清理一般是由计算机而不是人工完成。

二十一：可视化

可视化(Visualization)是利用计算机图形学和图像处理技术，将数据转换成图形或图像在屏幕上显示出来，并进行交互处理的理论、方法和技术。它涉及到计算机图形学、图像处理、计算机视觉、计算机辅助设计等多个领域，成为研究数据表示、数据处理、决策分析等一系列问题的综合技术。目前正在飞速发展的虚拟现实技术也是以图形图像的可视化技术为依托的。

二十二：数据可视化

英文名：Datavisualization

数据可视化技术的基本思想是将数据库中每一个数据项作为单个图元元素表示，大量的数据集构成数据图像，同时将数据的各个属性值以多维数据的形式表示，可以从不同的维度观察数据，从而对数据进行更深入的观察和分析。

数据可视化主要旨在借助于图形化手段，清晰有效地传达与沟通信息。但是，这并不就意味着，数据可视化就一定因为要实现其功能用途而令人感到枯燥乏味，或者是为了看上去绚丽多彩而显得极端复杂。为了有效地传达思想概念，美学形式与功能需要齐头并进，通过直观地传达关键的方面与特征，从而实现对于相当稀疏而又复杂的数据集的深入洞察。然而，设计人员往往并不能很好地把握设计与功能之间的平衡，从而创造出华而不实的数据可视化形式，无法达到其主要目的，也就是传达与沟通信息。

二十三：产品数据管理

产品数据管理(ProductDataManagement)是基于分布式网络、主从结构、图形化用户接口和数据库件管理技术发展起来的一种软件框架(或数据平台)，PDM对并行工程中的人员工具、设备资源、产品数据以及数据生成过程进行全面管理。

二十四：DSP(需求方平台)

二十五：DMP(数据管理平台)

DMP(Data-ManagementPlatform)数据管理平台，是把分散的第一、第三方数据进行整合纳入统一的技术平台，并对这些数据进行标准化和细分，让用户可以把这些细分结果推向现有的互动营销环境里。

DMP的核心元素包括：

·数据整合及标准化能力：采用统一化的方式，将各方数据吸纳整合。

·数据细分管理能力：创建出独一无二、有意义的客户细分，进行有效营销活动。

·功能健全的数据标签：提供数据标签灵活性，便于营销活动的使用。

·自助式的用户界面：基于网页web界面或其他集成方案直接获取数据工具，功能和几种形式报表和分析。

二十九：算法

三十：机器学习

机器学习(MachineLearning,ML)是一门多领域交叉学科，涉及概率论、统计学、逼近论、凸分析、算法复杂度理论等多门学科。专门研究计算机怎样模拟或实现人类的学习行为，以获取新的知识或技能，重新组织已有的知识结构使之不断改善自身的性能。

它是人工智能的核心，是使计算机具有智能的根本途径，其应用遍及人工智能的各个领域，它主要使用归纳、综合而不是演绎。

三十一：人工智能

人工智能(ArtificialIntelligence)，英文缩写为AI。它是研究、开发用于模拟、延伸和扩展人的智能的理论、方法、技术及应用系统的一门新的技术科学。人工智能是计算机科学的一个分支，它企图了解智能的实质，并生产出一种新的能以人类智能相似的方式做出反应的智能机器，该领域的研究包括机器人、语言识别、图像识别、自然语言处理和专家系统等。人工智能从诞生以来，理论和技术日益成熟，应用领域也不断扩大，可以设想，未来人工智能带来的科技产品，将会是人类智慧的“容器”。

三十二：深度学习

英文名：DeepLearning

深度学习的概念源于人工神经网络的研究。含多隐层的多层感知器就是一种深度学习结构。深度学习通过组合低层特征形成更加抽象的高层表示属性类别或特征，以发现数据的分布式特征表示。

深度学习是机器学习研究中的一个新的领域，其动机在于建立、模拟人脑进行分析学习的神经网络，它模仿人脑的机制来解释数据，例如图像，声音和文本。

三十三：神经网络

人工神经网络(ArtificialNeuralNetworks，简写为ANNs)也简称为神经网络(NNs)或称作连接模型(ConnectionModel)，它是一种模仿动物神经网络行为特征，进行分布式并行信息处理的算法数学模型。这种网络依靠系统的复杂程度，通过调整内部大量节点之间相互连接的关系，从而达到处理信息的目的。

三十四：OpenStack

OpenStack是一个开源的云计算管理平台项目，由几个主要的组件组合起来完成具体工作。OpenStack支持几乎所有类型的云环境，项目目标是提供实施简单、可大规模扩展、丰富、标准统一的云计算管理平台。OpenStack通过各种互补的服务提供了基础设施即服务(IaaS)的解决方案，每个服务提供API以进行集成。

三十五：SaaS

三十六：Paas

PaaS是Platform-as-a-Service的缩写，意思是平台即服务。把服务器平台作为一种服务提供的商业模式。通过网络进行程序提供的服务称之为SaaS(SoftwareasaService)，而云计算时代相应的服务器平台或者开发环境作为服务进行提供就成为了PaaS(PlatformasaService)。

所谓PaaS实际上是指将软件研发的平台(计世资讯定义为业务基础平台)作为一种服务，以SaaS的模式提交给用户。因此，PaaS也是SaaS模式的一种应用。但是，PaaS的出现可以加快SaaS的发展，尤其是加快SaaS应用的开发速度。在2007年国内外SaaS厂商先后推出自己的PAAS平台。

三十七：IaaS

IaaS(InfrastructureasaService)，即基础设施即服务。

消费者通过Internet可以从完善的计算机基础设施获得服务。这类服务称为基础设施即服务。基于Internet的服务(如存储和数据库)是IaaS的一部分。Internet上其他类型的服务包括平台即服务(PlatformasaService，PaaS)和软件即服务(SoftwareasaService，SaaS)。PaaS提供了用户可以访问的完整或部分的应用程序开发，SaaS则提供了完整的可直接使用的应用程序，比如通过Internet管理企业资源。

三十八：HaaS

以提供的Hadoop作为一种服务(HAAS)

HaaS(Hardware-as-a-service)的意思是硬件即服务。HaaS概念的出现源于云计算，现在被称作基础架构即服务(IaaS)或基础架构云，使用IaaS，各企业可通过Web将更多的基础架构容量作为服务提供。“通过Web”分配更多的存储或处理容量当然要比供应商在基础环境中引入和安装新硬件要快得多。HaaS还具有另外一层含义是针对嵌入式设备而言的，目的在于建立通过互联网(Web)进行嵌入式设备统一管理服务的模式。在这种情况下，HaaS类似于SaaS，对于嵌入式设备使用者来说，无需对所需嵌入式设备进行一次性购买，仅需按照设备使用量或其它标准支付设备的服务费及维护费即可。

三十九：决策树

决策树(DecisionTree)是在已知各种情况发生概率的基础上，通过构成决策树来求取净现值的期望值大于等于零的概率，评价项目风险，判断其可行性的决策分析方法，是直观运用概率分析的一种图解法。由于这种决策分支画成图形很像一棵树的枝干，故称决策树。在机器学习中，决策树是一个预测模型，他代表的是对象属性与对象值之间的一种映射关系。Entropy=系统的凌乱程度，使用算法ID3,C4.5和C5.0生成树算法使用熵。这一度量是基于信息学理论中熵的概念。

四十：EM算法

最大期望算法(ExpectationMaximizationAlgorithm，又译期望最大化算法)，是一种迭代算法，用于含有隐变量(hiddenvariable)的概率参数模型的最大似然估计或极大后验概率估计。

四十一：数据聚类

数据聚类(英语:Clusteranalysis)是对于静态数据分析的一门技术，在许多领域受到广泛应用，包括机器学习，数据挖掘，模式识别，图像分析以及生物信息。聚类是把相似的对象通过静态分类的方法分成不同的组别或者更多的子集(subset)，这样让在同一个子集中的成员对象都有相似的一些属性，常见的包括在坐标系中更加短的空间距离等。

四十二：概率模型

四十三：贝索斯定律

英文：Bezos’Law

贝索斯定律是指在云的发展过程中，单位计算能力的价格大约每隔3年会降低50%。

四十四：回归分析

回归分析(regressionanalysis)是确定两种或两种以上变量间相互依赖的定量关系的一种统计分析方法。运用十分广泛，回归分析按照涉及的自变量的多少，可分为一元回归分析和多元回归分析;按照自变量和因变量之间的关系类型，可分为线性回归分析和非线性回归分析。如果在回归分析中，只包括一个自变量和一个因变量，且二者的关系可用一条直线近似表示，这种回归分析称为一元线性回归分析。如果回归分析中包括两个或两个以上的自变量，且因变量和自变量之间是线性关系，则称为多元线性回归分析。

四十五：推荐算法

四十六：八叉树

英文名：Octree

八叉树是一种用于描述三维空间的树状数据结构。八叉树的每个节点表示一个正方体的体积元素，每个节点有八个子节点，将八个子节点所表示的体积元素加在一起就等于父节点的体积。

四十七：红黑树

红黑树(RedBlackTree)是一种自平衡二叉查找树，是在计算机科学中用到的一种数据结构，典型的用途是实现关联数组。

它是在1972年由RudolfBayer发明的，当时被称为平衡二叉B树(symmetricbinaryB-trees)。后来，在1978年被LeoJ.Guibas和RobertSedgewick修改为如今的“红黑树”。

红黑树和AVL树类似，都是在进行插入和删除操作时通过特定操作保持二叉查找树的平衡，从而获得较高的查找性能。

四十八：哈希表

散列表(Hashtable，也叫哈希表)，是根据关键码值(Keyvalue)而直接进行访问的数据结构。也就是说，它通过把关键码值映射到表中一个位置来访问记录，以加快查找的速度。这个映射函数叫做散列函数，存放记录的数组叫做散列表。

给定表M，存在函数f(key)，对任意给定的关键字值key，代入函数后若能得到包含该关键字的记录在表中的地址，则称表M为哈希(Hash)表，函数f(key)为哈希(Hash)函数。

四十九：随机森林

英文名：Randomforest

在机器学习中，随机森林是一个包含多个决策树的分类器，并且其输出的类别是由个别树输出的类别的众数而定。LeoBreiman和AdeleCutler发展出推论出随机森林的算法。而“RandomForests”是他们的商标。这个术语是1995年由贝尔实验室的TinKamHo所提出的随机决策森林(randomdecisionforests)而来的。这个方法则是结合Breimans的“Bootstrapaggregating”想法和Ho的”randomsubspacemethod””以建造决策树的集合。

THE END

山东省大数据局大数据百科干货丨大数据基础术语精粹来袭

AI驱动的数据清洗：提升数据质量的高效策略

大数据分析：精通数据清洗与特征工程实践技巧

睿法生物申请基于人工智能的基因检测数据清洗方法专利，使得基因检测数据的清洗效果更佳

山东省大数据局大数据百科干货丨大数据基础术语精粹来袭

如何进行数据清洗?数据清洗的基本流程

数据清洗的基本流程

(完整word版)换热器计算思考题及参考答案

数据处理的基本流程FantasyBoy

数据资产管理怎么做？8分钟带你入门数据资产管理

澳门码最快最准开奖结果，效率解答解释落实The53.65.26车主社区

投票数据制作过程图片大全

热点阅读新人连发SCI！组学方向迎来时代性“变革”，搭乘驶向新风口的快车！点击上方的?行舟Drug?▲?添加关注个体化风险预测是提供个体化药物的先决条件。目标本研究将蛋白质组学机器学习(ML)算...

化学实验报告常用(15篇)

数据仓库测试与验证：确保数据准确性和可靠性

600图库大全免费资料图2,数据科学解析说明QVY83.310超级版五金交电

芯片制作