準備好釋放潛藏在您資料中的力量了嗎?
透過這本綜合技術大全,您將學會如何用Apache Hadoop來打造並維運一個可靠而具擴充性的分散式系統。無論是想瞭解如何分析各種大小資料集的程式設計師,或者想要設定與運行Hadoop叢集的系統管理員,都合適閱讀本書。
針對Hadoop 2所做的這個改版,新增了YARN以及Hadoop相關專案的新章節,像是Parquet、Flume、Crunch及Spark。從這些新案例中,您可以了解Hadoop在健康照護系統以及基礎資料處理這些領域所扮演的角色。
.學習基礎元件如MapReduce、HDFS及YARN。
.更深入探索MapReduce,包含開發應用程式。
.設定及維護Hadoop叢集以使用HDFS及YARN上的Mapreduce。
.學習兩種資料格式:Avro 的資料序列化和Parquet巢狀資料。
.使用資料攝取工具,如Flume(使用於串流資料)和Sqoop(使用於批量資料傳輸)。
.了解高階資料處理工具,如Pig、Hive、Crunch,以及Spark。
.學習HBase分散式資料庫以及運用ZooKeeper打造分散式服務。
作者簡介:
Tom White自2007年起就是Apache Hadoop的提交者。他不僅是阿帕契軟體基金會的成員,同時也是Cloudera的工程師。他曾幫orielly.com、java.net與IBM的developerWorks撰寫技術文章,並在商業研討會上發表多場演講。
推薦序
Martin Gardner是一位數學和科學作家,在一次的採訪中提到:「除了微積分,我什麼都沒有,這就是我的專欄成功的秘密。我花了很長的時間去瞭解我寫些什麼,這讓我知道如何寫作才能讓讀者都能看得懂」。在許多方面,我對Hadoop的感覺是:它的內部作業非常複雜,結合了分散式系統理論、實務技術和常識來作為支持它運作的基礎。對於缺乏特定知識和經驗的人而言,Hadoop就像外星人一樣,無法理解。
但它也未必會變成這樣。拆開它的核心,它就只是Hadoop提供用來建立分散式系統、對資料儲存、資料分析和協調運作一個很簡單的工具。如果有一個共通的主題,提高它相關的抽象化層級-這就像創造積木用來建立基礎環境,當遇到有大量資料需要儲存或有大量資料需要分析或有大量主機需要協調,而程式設計師又沒有足夠時間、技能或不想要變成分散式系統專家時,就可以輕易的掌控。應該要有這樣一個簡單且具普遍應用性的套件,當我開始有這個想法的時候,在我心中很清楚,唯有如此Hadoop才能更廣泛的被使用。然而,在當時(2006年初),建置、配置和撰寫程式來使用Hadoop是一件藝術。從那時候事情開始有了改善:有愈來愈多的文件、有更多的範例,而且當你有問題時可以透過郵件清單來反應。而對新的使用者而言,最大的障礙是還不知道這項技術的能力、擅長的地方和如何使用它。這也就是為什麼我要寫這本書的原因。
Martin Gardner是一位數學和科學作家,在一次的採訪中提到:「除了微積分,我什麼都沒有,這就是我的專欄成功的秘密。我花了很長的時間去瞭解我寫些什麼,這讓我知道如何寫作才能讓讀者都能看得懂」。在許多方面,我對Hadoop的感覺是:它的內部作業非常複雜,結合了分散式系統理論、實務技術和常識來作為支持它運作的基礎。對於缺乏特定知識和經驗的人而言,Hadoop就像外星人一樣,無法理解。
但它也未必會變成這樣。拆開它的核心,它就只是Hadoop提供用來建立分散式系統、對資料儲存、資料分析和協調運作一個很簡單的工具。如果有一個...
目錄
第一部分 Hadoop 基礎
chapter 1|遇見 Hadoop
chapter 2|MapReduce
chapter 3|Hadoop 分散式檔案系統
chapter 4|YARN
chapter 5|Hadoop 的 I/O
第二部分 MapReduce
chapter 6|開發 MapReduce 程式
chapter 7|MapReduce 如何運作
chapter 8|MapReduce 的類型與格式
chapter 9|MapReduce 的特性
第三部分 Hadoop 操作
chapter 10|建立一個 Hadoop 叢集
chapter 11|Hadoop 的管理
第四部分 相關專案
chapter 12|Avro
chapter 13|Parquet
chapter 14|Flume
chapter 15|Sqoop
chapter 16|Pig
chapter 17|Hive
chapter 18|Crunch
chapter 19|Spark
chapter 20|HBase
chapter 21|ZooKeeper
第五部分 案例研究
chapter 22|Cerner 的可聚集資料
chapter 23|生物資料科學:用軟體拯救生命
chapter 24|Cascading
appendix A|安裝 Apache Hadoop
appendix B|Cloudera 的Hadoop 發行套件
appendix C|準備 NCDC 氣象資料
appendix D|舊版及新版的 Java MapReduce API
index
第一部分 Hadoop 基礎
chapter 1|遇見 Hadoop
chapter 2|MapReduce
chapter 3|Hadoop 分散式檔案系統
chapter 4|YARN
chapter 5|Hadoop 的 I/O
第二部分 MapReduce
chapter 6|開發 MapReduce 程式
chapter 7|MapReduce 如何運作
chapter 8|MapReduce 的類型與格式
chapter 9|MapReduce 的特性
第三部分 Hadoop 操作
chapter 10|建立一個 Hadoop 叢集
chapter 11|Hadoop 的管理
第四部分 相關專案
chapter 12|Avro
chapter 13|Parquet
chapter 14|Flume
chapter 15|Sqoop
chapter 16|Pig ...
購物須知
關於二手書說明:
商品建檔資料為新書及二手書共用,因是二手商品,實際狀況可能已與建檔資料有差異,購買二手書時,請務必檢視商品書況、備註說明及書況影片,收到商品將以書況影片內呈現為準。若有差異時僅可提供退貨處理,無法換貨或再補寄。
商品版權法律說明:
TAAZE 單純提供網路二手書託售平台予消費者,並不涉入書本作者與原出版商間之任何糾紛;敬請各界鑒察。
退換貨說明:
二手書籍商品享有10天的商品猶豫期(含例假日)。若您欲辦理退貨,請於取得該商品10日內寄回。
二手影音商品(例如CD、DVD等),恕不提供10天猶豫期退貨。
二手商品無法提供換貨服務,僅能辦理退貨。如須退貨,請保持該商品及其附件的完整性(包含書籍封底之TAAZE物流條碼)。若退回商品無法回復原狀者,可能影響退換貨權利之行使或須負擔部分費用。
訂購本商品前請務必詳閱
退換貨原則、
二手CD、DVD退換貨說明。