2020/9/9小于 1 分钟
- Java219
- 数据库114
- 分布式82
- 设计81
- 框架75
- JavaCore65
- Spring64
- 工具53
- 笔记52
- 大数据32
- 分布式通信29
- 设计模式28
- Spring核心24
- 架构23
- 搜索引擎数据库22
- DevOps21
- 关系型数据库21
- 软件20
- KV数据库20
- 网络19
- Redis18
- 算法17
- MQ17
- 分布式协同16
- Elasticsearch16
- 操作系统15
- 列式数据库15
- 分布式理论15
- MySQL15
- 综合14
- 面试13
- 基础特性13
- HBase13
- 编程12
- 文档数据库12
- 中间件11
- Linux11
- IO11
- 并发11
- 其他11
- MongoDB11
- Spring数据10
- Kafka10
- Flink9
- Hive9
- JVM9
- 安全9
- 构建9
- 工作8
- 服务器8
- 编程语言8
- 解决方案8
- 分布式存储8
- SpringWeb8
- 重构7
- 分布式调度7
- 容器7
- 高级特性7
- ZooKeeper7
- Maven7
- 人工智能6
- JavaWeb6
- 网络分层6
- 网络协议6
- 分布式治理6
- 监控诊断6
- Python6
- Nginx6
- Hadoop5
- 缓存5
- 测试5
- Tomcat5
- 微服务5
- Docker5
- Elastic5
- RPC5
- UML4
- 网络技术4
- 数据库综合4
- 术4
- JavaBean4
- 模板引擎4
- ORM4
- IDE4
- SpringIO4
- Spring其他4
- Spring综合4
- Spring集成4
- 软件工程3
- 编程范式3
- 数据库中间件3
- 流量控制3
- Git3
- Kubernetes3
- RocketMQ3
- Spring安全2
- 健康1
- 器1
- 法1
概述
MapReduce 是 Hadoop 项目中的分布式计算框架,源自 Google 2004 年发表的同名论文。它降低了分布式计算的门槛,可以让用户轻松编写程序,让其以可靠、容错的方式运行在大型集群上并行处理海量数据(TB 级)。
MapReduce 的两大核心设计思路:
- 分而治之,并行计算:将大规模数据切分为若干子集,多个节点并行处理
- 移动计算,而非移动数据:将计算程序调度到数据所在节点,避免大量数据在网络中传输
MapReduce 框架仅对 <key, value> 对进行操作,将作业的输入视为一组 <k1, v1> 对,经过 Map、Shuffle、Reduce 处理后,生成 <k3, v3> 对作为输出:
2020/6/22大约 9 分钟
概述
HDFS(Hadoop Distributed File System) 是 Apache Hadoop 项目的核心子项目,是一个运行在普通廉价硬件上的分布式文件系统。其设计思想源自 Google 2003 年发表的 GFS(Google File System)论文。
HDFS 的设计目标是:将大量数据可靠地存储在普通机器集群上,并以流式方式高效访问。它对外呈现为一个统一的文件系统视图,内部将数据以 Block(数据块)为单位分散存储在集群各节点上,每个 Block 保存多份副本(默认 3 份),以实现容错。
2020/2/24大约 16 分钟
简介
【初级】简介一下大数据技术生态?⭐
要点
- 数据采集:Flume、Sqoop、Logstash、Filebeat
- 分布式文件存储:Hadoop HDFS
- NoSql
- 文档数据库:Mongodb
- 列式数据库:HBase
- 搜索引擎:Solr、Elasticsearch
- 分布式计算
- 批处理:Hadoop MapReduce
- 流处理:Storm、Kafka
- 混合处理:Spark、Flink
- 查询分析:Hive、Spark SQL、Flink SQL、Pig、Phoenix
- 集群资源管理:Hadoop YARN
- 分布式协调:Zookeeper
- 任务调度:Azkaban、Oozie
- 集群部署和监控:Ambari、Cloudera Manager

2020/2/24大约 40 分钟
概述
Apache YARN(Yet Another Resource Negotiator) 是 Hadoop 2.0 引入的集群资源管理系统,于 2012 年正式发布。
在 Hadoop 1.x 时代,JobTracker 同时承担资源管理和作业调度两大职责,这导致了严重的单点瓶颈和扩展性问题——一个集群最多只能支撑约 4000 个节点和 40000 个并发任务。
YARN 的核心设计思想是将资源管理与作业调度彻底分离:
2019/5/7大约 10 分钟