hive與hbase的聯絡與區別

阿新 • • 發佈：2019-01-13

兩者分別是什麼？

Apache Hive是一個構建在Hadoop基礎設施之上的資料倉庫。通過Hive可以使用HQL語言查詢存放在HDFS上的資料。HQL是一種類SQL語言，這種語言最終被轉化為Map/Reduce. 雖然Hive提供了SQL查詢功能，但是Hive不能夠進行互動查詢–因為它只能夠在Haoop上批量的執行Hadoop。

Apache HBase是一種Key/Value系統，它執行在HDFS之上。和Hive不一樣，Hbase的能夠在它的資料庫上實時執行，而不是執行MapReduce任務。Hive被分割槽為表格，表格又被進一步分割為列簇。列簇必須使用schema定義，列簇將某一型別列集合起來（列不要求schema定義）。例如，“message”列簇可能包含：“to”, ”from” “date”, “subject”, 和”body”. 每一個 key/value對在Hbase中被定義為一個cell，每一個key由row-key，列簇、列和時間戳。在Hbase中，行是key/value對映的集合，這個對映通過row-key來唯一標識。Hbase利用Hadoop的基礎設施，可以利用通用的裝置進行水平的擴充套件。
兩者的特點

Hive幫助熟悉SQL的人執行MapReduce任務。因為它是JDBC相容的，同時，它也能夠和現存的SQL工具整合在一起。執行Hive查詢會花費很長時間，因為它會預設遍歷表中所有的資料。雖然有這樣的缺點，一次遍歷的資料量可以通過Hive的分割槽機制來控制。分割槽允許在資料集上執行過濾查詢，這些資料集儲存在不同的資料夾內，查詢的時候只遍歷指定資料夾（分割槽）中的資料。這種機制可以用來，例如，只處理在某一個時間範圍內的檔案，只要這些檔名中包括了時間格式。

HBase通過儲存key/value來工作。它支援四種主要的操作：增加或者更新行，檢視一個範圍內的cell，獲取指定的行，刪除指定的行、列或者是列的版本。版本資訊用來獲取歷史資料（每一行的歷史資料可以被刪除，然後通過Hbase compactions就可以釋放出空間）。雖然HBase包括表格，但是schema僅僅被表格和列簇所要求，列不需要schema。Hbase的表格包括增加/計數功能。
限制

Hive目前不支援更新操作。另外，由於hive在hadoop上執行批量操作，它需要花費很長的時間，通常是幾分鐘到幾個小時才可以獲取到查詢的結果。Hive必須提供預先定義好的schema將檔案和目錄對映到列，並且Hive與ACID不相容。

HBase查詢是通過特定的語言來編寫的，這種語言需要重新學習。類SQL的功能可以通過Apache Phonenix實現，但這是以必須提供schema為代價的。另外，Hbase也並不是相容所有的ACID特性，雖然它支援某些特性。最後但不是最重要的–為了執行Hbase，Zookeeper是必須的，zookeeper是一個用來進行分散式協調的服務，這些服務包括配置服務，維護元資訊和名稱空間服務。
應用場景

Hive適合用來對一段時間內的資料進行分析查詢，例如，用來計算趨勢或者網站的日誌。Hive不應該用來進行實時的查詢。因為它需要很長時間才可以返回結果。

Hbase非常適合用來進行大資料的實時查詢。Facebook用Hbase進行訊息和實時的分析。它也可以用來統計Facebook的連線數。
總結

Hive和Hbase是兩種基於Hadoop的不同技術–Hive是一種類SQL的引擎，並且執行MapReduce任務，Hbase是一種在Hadoop之上的NoSQL 的Key/vale資料庫。當然，這兩種工具是可以同時使用的。就像用Google來搜尋，用FaceBook進行社交一樣，Hive可以用來進行統計查詢，HBase可以用來進行實時查詢，資料也可以從Hive寫到Hbase，設定再從Hbase寫回Hive。

附：
共同點：
1.hbase與hive都是架構在hadoop之上的。都是用hadoop作為底層儲存

區別：

2.Hive是建立在Hadoop之上為了減少MapReduce jobs編寫工作的批處理系統，HBase是為了支援彌補Hadoop對實時操作的缺陷的專案。
3.想象你在操作RMDB資料庫，如果是全表掃描，就用Hive+Hadoop,如果是索引訪問，就用HBase+Hadoop 。
4.Hive query就是MapReduce jobs可以從5分鐘到數小時不止，HBase是非常高效的，肯定比Hive高效的多。
5.Hive本身不儲存和計算資料，它完全依賴於HDFS和MapReduce，Hive中的表純邏輯。
6.hive借用hadoop的MapReduce來完成一些hive中的命令的執行
7.hbase是物理表，不是邏輯表，提供一個超大的記憶體hash表，搜尋引擎通過它來儲存索引，方便查詢操作。
8.hbase是列儲存。
9.hdfs作為底層儲存，hdfs是存放檔案的系統，而Hbase負責組織檔案。
10.hive需要用到hdfs儲存檔案，需要用到MapReduce計算框架。
：

hive與hbase的聯絡與區別

hive與hbase之間的區別

Java基礎：&與&&，|與| |的聯絡與區別（詳解及示例）

source 與export聯絡與使用

hive與hbase的聯絡與區別

hive與hbase的區別與聯絡

Hbase和Hive的區別，Hbase與傳統資料庫的區別

Hive 與 HDFS 之間的聯絡、Hive 與關係型資料庫的區別

Hive與HBase的區別

Hadoop生態上幾個技術的關係與區別：hive、pig、hbase 關係與區別

注意區分HBase與Hive之間的定義和區別

Hive定義、Hive與HBase關係、Hive與RDBMS的關係、資料庫與資料倉庫的區別

Hadoop生態中：Hive、Pig、HBase 關係與區別

Spark訪問與HBase關聯的Hive表

hive與hbase

hive與hbase關聯表的創建，外表方式

全網最詳細的hive-site.xml配置文件裏如何添加達到Hive與HBase的集成，即Hive通過這些參數去連接HBase（圖文詳解）

hive 與 hbase 結合

hashCode與equals的聯絡與區別

Linux curl與wget 命令的區別和聯絡

反捲積、上取樣、上池化的聯絡與區別

hive與hbase的聯絡與區別

相關推薦