Apache Hadoop准实时数据处理的架构模式

36大数据 • 10年前扫码分享

我是创始人李岩：很抱歉！给自己产品做个广告，点击进来看看。

大数据

Ted Malaska 译：Robin robinlee@cmu.edu

原文地址： Architectural Patterns for Near Real-Time Data Processing with Apache Hadoop

本文由董飞老师翻译并投稿至36大数据，转载必须获得原文作者、译者和本站的同意。拒绝任何不标明作者和出处的转载。

进入董飞先生在36大数据的专栏>>>

评估好哪一种流架构模式最适合你的案例，是成功生产开发的先决条件。

Apache Hadoop 生态系统已成为企业实时地处理和挖掘大数据的首选。 Apache的Kafka， Flume， Spark， Storm， Samza等技术在不断地推进新的可能。人们很容易泛化大规模实时数据案例，但其实他们可以细分为几种架构模式，Apache系统里的不同组件适合于不同的案例。

这篇文章探讨四种主要的设计模式，案例来自于我们企业客户的数据中心的实例，并解释如何在Hadoop上实现这些架构模式。

流处理模式

四种流模式（经常串联使用）为：

流采集 ：低延迟将数据输入到HDFS，Apache HBase和Apache Solr。

基于外部环境的准实时事件处理 ：对事件采取警报，标示，转化，过滤等动作。这些动作的触发可能取决于复杂的标准，例如异常监测模型。通常的使用案例，例如准实时的欺诈监测和推荐系统，需要达到100毫秒以内的延迟。

准实时事件分割处理 ：类似于准实时事件处理，但通过将数据分割获得一些好处—例如将更多相关外部信息存入内存。这个模式也要求延迟在100毫秒以内。

为整合或机器学习使用的复杂拓扑结构 ：流处理的精髓：实时地通过复杂而灵活的操作从数据中获取答案。这里，因为结果通常依赖于一段窗口内的计算，需要更多的活跃的数据，于是重点从获得超低延迟转移到了功能性和准确性。

接下来，我们将介绍如何用可检测的，可被证明的和可维护的方式来实现这些设计模式。

流采集

传统上，Flume是最为推荐的流采集系统。它的大的源和池囊括了所有关于消费什么和写到哪里的基础（关于如何配置和管理flume，参考Using Flume，由O’Reilly 出版的Cloudera工程师/Flume 项目管理委员会成员Hari Shreedharan编写）。

Apache Hadoop
Figure 1译者附：Flume架构

在过去的一年中，Kafka也变得非常受欢迎，因为playback和replication等特性。由于Flume和Kafka有重叠的目标，他们的关系常常令人困惑。他们如何配合？答案是简单的：Kafka的管道和Flume的通道类似，虽然是一个更好的管道，原因就是刚才所述的特性。一个通行的方法就是用Flume作为源(source)和池(sink)，而Kafka是他们中间的管道。

下图阐明kafka如何作为Flume的上游数据和下游目的，或Flume管道。

Apache Hadoop
下图的设计是具有大规模拓展性，经过实战检验的架构设计，由Cloudera 管理者监控，容错，并且支持回放。

Apache Hadoop
值得注意的一件事就是，这个设计多么优雅地处理故障。Flume 池从Kafka消费者群里取回。通过Apache zookeeper的帮助，Kafka 消费者群取回topic的位移。如果一个Flume池发生故障，Kafka消费者将把负载重新分发到其他的池中。当那个池恢复了，消费者池将重新分发。