Hadoop基础

标签：大数据分类：大数据创建时间：2019-12-25 02:44:55 更新时间：2025-04-28 14:37:40

1.Hadoop及其生态系统介绍

还有一个:

(1) Apache Hadoop:是Apache开源组织的一个分布式计算开源框架，提供了一个分布式文件系统子项目(HDFS)和支持MapReduce分布式计算的软件架构。
(2) Apache Hive:是基于Hadoop的一个数据仓库工具，可以将结构化的数据文件映射为一张数据库表，通过类SQL语句快速实现简单的MapReduce统计，不必开发专门的MapReduce应用，十分适合数据仓库的统计分析。
(3) Apache Pig:是一个基于Hadoop的大规模数据分析工具，它提供的SQL-LIKE语言叫PigLatin，该语言的编译器会把类SQL的数据分析请求转换为一系列经过优化处理的MapReduce运算。
(4) Apache HBase:是一个高可靠性、高性能、面向列、可伸缩的分布式存储系统，利用HBase技术可在廉价PCServer上搭建起大规模结构化存储集群。
(5) Apache Sqoop:是一个用来将Hadoop和关系型数据库中的数据相互转移的工具，可以将一个关系型数据库（MySQL,Oracle,Postgres等）中的数据导进到Hadoop的HDFS中，也可以将HDFS的数据导进到关系型数据库中。
(6) Apache Zookeeper:是一个为分布式应用所设计的分布的、开源的协调服务，它主要是用来解决分布式应用中经常遇到的一些数据管理问题，简化分布式应用协调及其管理的难度，提供高性能的分布式服务。
(7) Apache Mahout:是基于Hadoop的机器学习和数据挖掘的一个分布式框架。Mahout用MapReduce实现了部分数据挖掘算法，解决了并行挖掘的问题。
(8) Apache Cassandra:是一套开源分布式NoSQL数据库系统。它最初由Facebook开发，用于储存简单格式数据，集GoogleBigTable的数据模型与AmazonDynamo的完全分布式的架构于一身。
(9) Apache Avro:是一个数据序列化系统，设计用于支持数据密集型，大批量数据交换的应用。Avro是新的数据序列化格式与传输工具，将逐步取代Hadoop原有的IPC机制。
(10) Apache Ambari:是一种基于Web的工具，支持Hadoop集群的供应、管理和监控。
(11) Apache Chukwa:是一个开源的用于监控大型分布式系统的数据收集系统，它可以将各种各样类型的数据收集成适合Hadoop处理的文件保存在HDFS中供Hadoop进行各种MapReduce操作。
(12) Apache Hama:是一个基于HDFS的BSP（BulkSynchronousParallel)并行计算框架,Hama可用于包括图、矩阵和网络算法在内的大规模、大数据计算。
(13) Apache Flume:是一个分布的、可靠的、高可用的海量日志聚合的系统，可用于日志数据收集，日志数据处理，日志数据传输。
(14) Apache Giraph:是一个可伸缩的分布式迭代图处理系统，基于Hadoop平台，灵感来自BSP(bulksynchronousparallel)和Google的Pregel。
(15) Apache Oozie:是一个工作流引擎服务器,用于管理和协调运行在Hadoop平台上（HDFS、Pig和MapReduce）的任务。
(16) Apache Crunch:是基于Google的FlumeJava库编写的Java库，用于创建MapReduce程序。与Hive，Pig类似，Crunch提供了用于实现如连接数据、执行聚合和排序记录等常见任务的模式库。
(17) Apache Whirr:是一套运行于云服务的类库（包括Hadoop），可提供高度的互补性。Whirr学支持AmazonEC2和Rackspace的服务。
(18) Apache Bigtop:是一个对Hadoop及其周边生态进行打包，分发和测试的工具。
(19) Apache HCatalog:是基于Hadoop的数据表和存储管理，实现中央的元数据和模式管理，跨越Hadoop和RDBMS，利用Pig和Hive提供关系视图。
(20) Cloudera Hue:是一个基于WEB的监控和管理系统，实现对HDFS，MapReduce/YARN,HBase,Hive,Pig的web化操作和管理。

参考文章：
1.Hadoop教程(一) Hadoop入门教程

2.Hadoop和Spark的关系

Hadoop和Spark是并列的关系，但目前来说，好像Spark还不够强大，只能作为Hadoop的一个补充。

Spark是一个计算框架。Spark是MapReduce的替代方案，而且兼容HDFS、Hive等分布式存储系统，可融入Hadoop生态。
Hadoop是包含计算框架MapReducehe分布式文件系统HDFS。

参考文章：
1.Spark和Hadoop之间的关系
2.Spark 安装和配置
3.hadoop和大数据的关系？和spark的关系？

往期推荐

文章目录

1. 1.Hadoop及其生态系统介绍
2. 2.Hadoop和Spark的关系

微信公众号

广告位

诚心邀请广大金主爸爸洽谈合作

每日一省

isNaN 和 Number.isNaN 函数的区别？

1.函数 isNaN 接收参数后，会尝试将这个参数转换为数值，任何不能被转换为数值的的值都会返回 true，因此非数字值传入也会返回 true ，会影响 NaN 的判断。

2.函数 Number.isNaN 会首先判断传入参数是否为数字，如果是数字再继续判断是否为 NaN ，不会进行数据类型的转换，这种方法对于 NaN 的判断更为准确。

每日二省

为什么0.1+0.2 ! == 0.3，如何让其相等?

一个直接的解决方法就是设置一个误差范围，通常称为“机器精度”。对JavaScript来说，这个值通常为2-52，在ES6中，提供了Number.EPSILON属性，而它的值就是2-52，只要判断0.1+0.2-0.3是否小于Number.EPSILON，如果小于，就可以判断为0.1+0.2 ===0.3。

每日三省

== 操作符的强制类型转换规则？

1.首先会判断两者类型是否**相同，**相同的话就比较两者的大小。

2.类型不相同的话，就会进行类型转换。

3.会先判断是否在对比 null 和 undefined，是的话就会返回 true。

4.判断两者类型是否为 string 和 number，是的话就会将字符串转换为 number。

5.判断其中一方是否为 boolean，是的话就会把 boolean 转为 number 再进行判断。

6.判断其中一方是否为 object 且另一方为 string、number 或者 symbol，是的话就会把 object 转为原始类型再进行判断。

每日英语

Happiness is time precipitation, smile is the lonely sad.

幸福是年华的沉淀，微笑是寂寞的悲伤。