Hive 简介
【简单】什么是 Hive?⭐⭐
🎯 目标等级:L2 | ⏱ 建议用时:10 min | 🏷 标签:Hive / 概述
💎 关键结论
Hive 是构建在 Hadoop 之上的分布式数据仓库,把结构化数据文件映射成表,用类 SQL(HQL)做大规模离线分析,SQL 会被翻译成 MapReduce 作业提交到 Hadoop 运行。它上手门槛低、支持 UDF 扩展、元数据统一可被多引擎共享,但执行延迟高,只适合离线批处理,不适合实时场景。
🎯 目标等级:L2 | ⏱ 建议用时:10 min | 🏷 标签:Hive / 概述
Hive 是构建在 Hadoop 之上的分布式数据仓库,把结构化数据文件映射成表,用类 SQL(HQL)做大规模离线分析,SQL 会被翻译成 MapReduce 作业提交到 Hadoop 运行。它上手门槛低、支持 UDF 扩展、元数据统一可被多引擎共享,但执行延迟高,只适合离线批处理,不适合实时场景。
大数据技术起源于 Google 在 2004 年前后发表的三篇论文:
Apache Flink 有两种关系型 API 来做流批统一处理:Table API 和 SQL。Table API 是用于 Scala 和 Java 语言的查询 API,它可以用一种非常直观的方式来组合使用选取、过滤、join 等关系型算子。Flink SQL 是基于 Apache Calcite 来实现的标准 SQL。无论输入是连续的(流式)还是有界的(批处理),在两个接口中指定的查询都具有相同的语义,并指定相同的结果。
Apache Flink 是一个框架和分布式处理引擎,用于在无边界和有边界数据流上进行有状态的计算。Flink 能在所有常见集群环境中运行,并能以内存速度和任意规模进行计算。
Flink 为流式/批式处理应用程序的开发提供了不同级别的抽象。
Apache Flink 的一种常见应用场景是 ETL(抽取、转换、加载)管道任务。从一个或多个数据源获取数据,进行一些转换操作和信息补充,将结果存储起来。在这个教程中,我们将介绍如何使用 Flink 的 DataStream API 实现这类应用。
这里注意,Flink 的 Table 和 SQL API 完全可以满足很多 ETL 使用场景。但无论你最终是否直接使用 DataStream API,对这里介绍的基本知识有扎实的理解都是有价值的。