应用 Linux 和 Hadoop 进行分布式计算-Linux-爱易网页

应用 Linux 和 Hadoop 进行分布式计算

日期：2014-05-16　浏览次数：20887 次

使用 Linux 和 Hadoop 进行分布式计算

Hadoop 由 Apache Software Foundation 公司于 2005 年秋天作为 Lucene 的子项目 Nutch 的一部分正式引入。它受到最先由 Google Lab 开发的 MapReduce 和 Google File System 的启发。2006 年 3 月份，MapReduce 和 Nutch Distributed File System (NDFS) 分别被纳入称为 Hadoop 的项目中。

Hadoop 是最受欢迎的在 Internet 上对搜索关键字进行内容分类的工具，但它也可以解决许多要求极大伸缩性的问题。例如，如果您要?grep?一个 10TB 的巨型文件，会出现什么情况？在传统的系统上，这将需要很长的时间。但是 Hadoop 在设计时就考虑到这些问题，因此能大大提高效率。

先决条件

在 developerWorks 上阅读更多 Tim Jones 的文章

Tim 的剖析……?系列文章
Tim 在 developerWorks 上的所有文章

Hadoop 是一个能够对大量数据进行分布式处理的软件框架。但是 Hadoop 是以一种可靠、高效、可伸缩的方式进行处理的。Hadoop 是可靠的，因为它假设计算元素和存储会失败，因此它维护多个工作数据副本，确保能够针对失败的节点重新分布处理。Hadoop 是高效的，因为它以并行的方式工作，通过并行处理加快处理速度。Hadoop 还是可伸缩的，能够处理 PB 级数据。此外，Hadoop 依赖于社区服务器，因此它的成本比较低，任何人都可以使用。

您可能已经想到，Hadoop 运行在 Linux 生产平台上是非常理想的，因为它带有用 Java? 语言编写的框架。Hadoop 上的应用程序也可以使用其他语言编写，比如 C++。

回页首

Hadoop 架构

Hadoop 有许多元素构成。最底部是 Hadoop Distributed File System（HDFS），它存储 Hadoop 集群中所有存储节点上的文件。HDFS（对于本文）的上一层是 MapReduce 引擎，该引擎由 JobTrackers 和 TaskTrackers 组成。

回页首

HDFS

免责声明： 本文仅代表作者个人观点，与爱易网无关。其原创性以及文中陈述文字和内容未经本站证实，对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺，请读者仅作参考，并请自行核实相关内容。

应用 Linux 和 Hadoop 进行分布式计算

在 developerWorks 上阅读更多 Tim Jones 的文章

相关资料更多>

推荐阅读更多>