数据类型
2025/9/1大约 22 分钟
NoSQL、列式数据库、K-V数据库、文档数据库、图数据库B+树、LSM树、倒排索引、哈希索引、聚簇索引关键词:链表、数组、散列表、红黑树、B+ 树、LSM 树、跳表
数据库是“按照 数据结构 来组织、存储和管理数据的仓库”。是一个长期存储在计算机内的、有组织的、可共享的、统一管理的大量数据的集合。
——上面这句定义对数据库的定义来自百度百科。通过这个定义,我们也能明显看出数据结构是实现数据库的基石。
从本质来看,数据库只负责两件事:读数据、写数据;而数据结构研究的是如何合理组织数据,尽可能提升读、写数据的效率,这恰好是数据库的核心问题。因此,数据结构与数据库这两个领域有非常多的交集。其中,数据库索引最能体现二者的紧密关联。
传统的软件计算处理模型,都是“输入 -> 计算 -> 输出”模型。
如何解决 PB 级数据进行计算的问题呢?
采用分布式集群的解决方案,用数千台甚至上万台计算机构建一个大数据计算处理集群,利用更多的网络带宽、内存空间、磁盘容量、CPU 核心数去进行计算处理。
大数据计算处理通常针对的是网站的存量数据,网站大数据系统要做的就是将这些统计规律和关联关系计算出来,并由此进一步改善网站的用户体验和运营决策。
将程序分发到数据所在的地方进行计算,也就是所谓的移动计算比移动数据更划算。

传统的关系型数据库存在以下缺点:
LIKE 查询的匹配会非常慢,即使在有索引的情况下。况且关系型数据库也不应该对文本字段进行索引。大数据(Big Data)是指超出传统数据库工具收集、存储、管理和分析能力的数据集。随着互联网、物联网、移动互联网的高速发展,数据量呈指数级增长,催生了以 Hadoop、Spark 为代表的新一代分布式计算技术体系。
大数据技术不仅仅是"量大的数据",更是围绕海量数据的采集→存储→处理→分析→可视化全链路的技术解决方案。
大数据通常由以下四个维度定义,即"4V"特征:
| 特征 | 英文 | 说明 |
|---|---|---|
| 大量 | Volume | 数据规模巨大,从 TB 级到 PB 级甚至 EB 级 |
| 高速 | Velocity | 数据生成和处理速度极快,要求实时或近实时处理 |
| 多样 | Variety | 数据类型多样,包含结构化(关系型数据库)、半结构化(JSON/XML)、非结构化(图片/视频/日志)数据 |
| 低价值密度 | Value | 海量数据中真正有价值的信息密度低,需要通过挖掘提取有价值的信息 |