加载中...
Apache Flink 是一款开源的分布式流处理与批处理引擎,擅长以低延迟、高吞吐处理无界和有界数据流。它以有状态计算和精确一次语义著称,广泛用于实时数据分析、事件驱动应用和实时数仓等场景。

| 前身 | Stratosphere |
| 顶级项目 | 2014 年 |
| 开发语言 | Java / Scala |
| 开源许可 | Apache License 2.0 |
| 处理模型 | 流批一体 |
Apache Flink 是一个开源的分布式数据处理框架,以流处理为核心,统一支持流式与批量计算,能够对持续到达的数据进行低延迟、有状态的实时处理。
Flink 起源于德国柏林高校的研究项目 Stratosphere,2014 年进入 Apache 软件基金会孵化并很快成为顶级项目,后由 Ververica 等公司持续推动。与早期以批处理为主、把流当作小批次处理的框架不同,Flink 从设计上就以真正的流处理为一等公民,把批处理视为流处理的特例,即所谓的流批一体。它在实时数据处理领域被广泛采用,是许多企业实时数仓和实时风控的核心引擎。
Flink 常用于实时数据分析与监控,如实时统计业务指标、实时报表和大屏展示;在电商和金融领域用于实时风控与反欺诈;在推荐系统中用于实时特征计算。此外,它也是构建实时数仓、进行数据同步和复杂事件处理的主流选择。凭借流批一体的能力,企业可以用同一套引擎同时满足实时和离线的计算需求。
问:Flink 和 Spark 有何区别?答:Spark 早期以批处理为核心,流处理基于微批实现;Flink 则以真正的流处理为核心,在低延迟和有状态流计算方面通常更有优势,两者如今在能力上也有相互借鉴。
问:什么是精确一次语义?答:指在发生故障和恢复时,每条数据对最终结果的影响都恰好被计算一次,既不丢失也不重复,是保证实时计算结果正确性的重要特性。

| 前身 | Stratosphere |
| 顶级项目 | 2014 年 |
| 开发语言 | Java / Scala |
| 开源许可 | Apache License 2.0 |
| 处理模型 | 流批一体 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧