概述
Apache Flume 是一个分布式、高可用的数据采集、聚合和传输系统,主要用于从各种来源(如 Web 服务器日志、社交媒体数据、传感器数据等)收集大量日志数据,经过聚合处理后可靠地写入 HDFS、HBase、Kafka 等存储系统。
Flume 最初由 Cloudera 开发,2012 年成为 Apache 顶级项目。它分为 OG(1.0 之前)和 NG(1.0+)两个版本,NG 在 OG 的基础上进行了完全的重构,是目前使用最广泛的版本。
特性
| 特性 | 说明 |
|---|---|
| 可靠传输 | 基于事务的数据流保证,Channel 持久化存储,确保 At-Least-Once 语义 |
| 高扩展性 | 可水平扩展 Agent 数量,支持千级节点的日志收集集群 |
| 灵活配置 | 通过配置文件组合不同类型的 Source、Channel、Sink,无需修改代码 |
| 丰富的内置组件 | 内置数十种 Source、Channel、Sink 类型,覆盖绝大多数采集场景 |
| 多种部署模式 | 支持单 Agent、多 Agent 级联、扇入(多对一)、扇出(一对多)等拓扑 |
| 与 Hadoop 生态集成 | 原生支持写入 HDFS、HBase,与 Kafka 深度集成 |
2019/5/7大约 7 分钟