大数据与数据科学
大数据中国团队开源的分布式可视化工作流调度平台,以拖拽式 DAG 与去中心化架构见长。
大数据跨语言的内存列式数据标准,让不同系统零拷贝共享数据,是现代数据引擎互操作的基础设施。
大数据谷歌基于 Dremel 技术的无服务器云数据仓库,存算分离、按量计费,可秒级扫描超大规模数据。
大数据Cloudera 开源的 MPP 交互式 SQL 引擎,以 C++ 实现并绕开 MapReduce,直接查询 HDFS 与 HBase。
大数据开源分布式 SQL 查询引擎,原名 PrestoSQL,擅长跨数据源交互式联邦查询,计算与存储分离。
大数据LinkedIn 开源的实时分布式 OLAP 存储,为面向用户的分析应用提供高并发毫秒级查询。
大数据Airbnb 开源的现代化 BI 与数据可视化平台,提供 SQL 探索与丰富图表,是商业 BI 的开源替代。
大数据分布式计算中数据在节点间分布不均导致少数任务拖慢全局的现象,是大数据作业调优的头号难题。
大数据谷歌开源的批流统一编程模型,一套代码可运行在Flink、Spark、Dataflow等多种引擎上。
大数据数据仓库中最经典的建模结构:中心事实表连接多个反规范化维度表,形似星状,查询简单高效。
大数据AWS 于 2013 年推出的云数据仓库服务,基于 MPP 列式架构,开启了云数仓大规模商用时代。
大数据Kafka自带的流处理客户端库,无需独立集群即可在应用内做有状态流计算,提出KStream/KTable抽象。
大数据LinkedIn开源的流处理框架,与Kafka同源共生,以本地RocksDB状态和changelog容错设计著称。
大数据Ralph Kimball 提出的数据仓库设计方法,以事实表与维度表组织数据,面向业务过程与查询易用性。
将原始数据加工为模型可用特征,提升机器学习效果的关键步骤。
从海量数据中发现潜在模式规律与有用知识的过程与技术。
对持续到达的数据流进行实时连续处理的计算范式。
大数据构建在 HDFS 之上的分布式列式 NoSQL 数据库,支持海量随机读写。
大数据阿里云自研的大规模批量计算与数仓平台,前身 ODPS,支撑阿里内部及公有云的海量离线计算。
大数据Uber 开源的数据湖存储框架,为 HDFS 与对象存储上的数据集提供插入更新、增量查询与事务能力。