2020/9/9小于 1 分钟
概述
MapReduce 是 Hadoop 项目中的分布式计算框架,源自 Google 2004 年发表的同名论文。它降低了分布式计算的门槛,可以让用户轻松编写程序,让其以可靠、容错的方式运行在大型集群上并行处理海量数据(TB 级)。
MapReduce 的两大核心设计思路:
- 分而治之,并行计算:将大规模数据切分为若干子集,多个节点并行处理
- 移动计算,而非移动数据:将计算程序调度到数据所在节点,避免大量数据在网络中传输
MapReduce 框架仅对 <key, value> 对进行操作,将作业的输入视为一组 <k1, v1> 对,经过 Map、Shuffle、Reduce 处理后,生成 <k3, v3> 对作为输出:
2020/6/22大约 9 分钟
概述
HDFS(Hadoop Distributed File System) 是 Apache Hadoop 项目的核心子项目,是一个运行在普通廉价硬件上的分布式文件系统。其设计思想源自 Google 2003 年发表的 GFS(Google File System)论文。
HDFS 的设计目标是:将大量数据可靠地存储在普通机器集群上,并以流式方式高效访问。它对外呈现为一个统一的文件系统视图,内部将数据以 Block(数据块)为单位分散存储在集群各节点上,每个 Block 保存多份副本(默认 3 份),以实现容错。
2020/2/24大约 16 分钟
简介
【初级】简介一下大数据技术生态?⭐
要点
- 数据采集:Flume、Sqoop、Logstash、Filebeat
- 分布式文件存储:Hadoop HDFS
- NoSql
- 文档数据库:Mongodb
- 列式数据库:HBase
- 搜索引擎:Solr、Elasticsearch
- 分布式计算
- 批处理:Hadoop MapReduce
- 流处理:Storm、Kafka
- 混合处理:Spark、Flink
- 查询分析:Hive、Spark SQL、Flink SQL、Pig、Phoenix
- 集群资源管理:Hadoop YARN
- 分布式协调:Zookeeper
- 任务调度:Azkaban、Oozie
- 集群部署和监控:Ambari、Cloudera Manager

2020/2/24大约 40 分钟
概述
Apache YARN(Yet Another Resource Negotiator) 是 Hadoop 2.0 引入的集群资源管理系统,于 2012 年正式发布。
在 Hadoop 1.x 时代,JobTracker 同时承担资源管理和作业调度两大职责,这导致了严重的单点瓶颈和扩展性问题——一个集群最多只能支撑约 4000 个节点和 40000 个并发任务。
YARN 的核心设计思想是将资源管理与作业调度彻底分离:
2019/5/7大约 10 分钟