圖解 MySQL 索引:B-樹、B+樹
看了很多關(guān)于索引的博客,講的大同小異。但是始終沒有讓我明白關(guān)于索引的一些概念,如B-Tree索引,Hash索引,唯一索引….或許有很多人和我一樣,沒搞清楚概念就開始研究B-Tree,B+Tree等結(jié)構(gòu),導(dǎo)致在面試的時(shí)候答非所問!
索引是什么?
索引是幫助MySQL高效獲取數(shù)據(jù)的數(shù)據(jù)結(jié)構(gòu)。
索引能干什么?
提高數(shù)據(jù)查詢的效率。
索引:排好序的快速查找數(shù)據(jù)結(jié)構(gòu)!索引會影響where后面的查找,和order by 后面的排序。
一、索引的分類
1️⃣從存儲結(jié)構(gòu)上來劃分:BTree索引(B-Tree或B+Tree索引),Hash索引,full-index全文索引,R-Tree索引。
2️⃣從應(yīng)用層次來分:普通索引,唯一索引,復(fù)合索引。
3️⃣根據(jù)中數(shù)據(jù)的物理順序與鍵值的邏輯(索引)順序關(guān)系:聚集索引,非聚集索引。
1️⃣中所描述的是索引存儲時(shí)保存的形式,2️⃣是索引使用過程中進(jìn)行的分類,兩者是不同層次上的劃分。不過平時(shí)講的索引類型一般是指在應(yīng)用層次的劃分。
就像手機(jī)分類,安卓手機(jī),IOS手機(jī) 與 華為手機(jī),蘋果手機(jī),OPPO手機(jī)一樣。
- 普通索引:即一個(gè)索引只包含單個(gè)列,一個(gè)表可以有多個(gè)單列索引
- 唯一索引:索引列的值必須唯一,但允許有空值
- 復(fù)合索引:即一個(gè)索引包含多個(gè)列
- 聚簇索引(聚集索引):并不是一種單獨(dú)的索引類型,而是一種數(shù)據(jù)存儲方式。具體細(xì)節(jié)取決于不同的實(shí)現(xiàn),InnoDB的聚簇索引其實(shí)就是在同一個(gè)結(jié)構(gòu)中保存了B-Tree索引(技術(shù)上來說是B+Tree)和數(shù)據(jù)行。
- 非聚簇索引:不是聚簇索引,就是非聚簇索引(認(rèn)真臉)。
二、索引的底層實(shí)現(xiàn)
mysql默認(rèn)存儲引擎innodb只顯式支持B-Tree( 從技術(shù)上來說是B+Tree)索引,對于頻繁訪問的表,innodb會透明建立自適應(yīng)hash索引,即在B樹索引基礎(chǔ)上建立hash索引,可以顯著提高查找效率,對于客戶端是透明的,不可控制的,隱式的。
不談存儲引擎,只討論實(shí)現(xiàn)(抽象)
Hash索引
基于哈希表實(shí)現(xiàn),只有精確匹配索引所有列的查詢才有效,對于每一行數(shù)據(jù),存儲引擎都會對所有的索引列計(jì)算一個(gè)哈希碼(hash code),并且Hash索引將所有的哈希碼存儲在索引中,同時(shí)在索引表中保存指向每個(gè)數(shù)據(jù)行的指針。
B-Tree能加快數(shù)據(jù)的訪問速度,因?yàn)榇鎯σ娌辉傩枰M(jìn)行全表掃描來獲取數(shù)據(jù),數(shù)據(jù)分布在各個(gè)節(jié)點(diǎn)之中。
是B-Tree的改進(jìn)版本,同時(shí)也是數(shù)據(jù)庫索引索引所采用的存儲結(jié)構(gòu)。數(shù)據(jù)都在葉子節(jié)點(diǎn)上,并且增加了順序訪問指針,每個(gè)葉子節(jié)點(diǎn)都指向相鄰的葉子節(jié)點(diǎn)的地址。相比B-Tree來說,進(jìn)行范圍查找時(shí)只需要查找兩個(gè)節(jié)點(diǎn),進(jìn)行遍歷即可。而B-Tree需要獲取所有節(jié)點(diǎn),相比之下B+Tree效率更高。
案例:假設(shè)有一張學(xué)生表,id為主鍵
在MyISAM引擎中的實(shí)現(xiàn)(二級索引也是這樣實(shí)現(xiàn)的)
在InnoDB中的實(shí)現(xiàn)
三、問題
問:為什么索引結(jié)構(gòu)默認(rèn)使用B-Tree,而不是hash,二叉樹,紅黑樹?
hash:雖然可以快速定位,但是沒有順序,IO復(fù)雜度高。
二叉樹:樹的高度不均勻,不能自平衡,查找效率跟數(shù)據(jù)有關(guān)(樹的高度),并且IO代價(jià)高。
紅黑樹:樹的高度隨著數(shù)據(jù)量增加而增加,IO代價(jià)高。
問:為什么官方建議使用自增長主鍵作為索引。
結(jié)合B+Tree的特點(diǎn),自增主鍵是連續(xù)的,在插入過程中盡量減少頁分裂,即使要進(jìn)行頁分裂,也只會分裂很少一部分。并且能減少數(shù)據(jù)的移動(dòng),每次插入都是插入到最后。總之就是減少分裂和移動(dòng)的頻率。
插入連續(xù)的數(shù)據(jù):
插入非連續(xù)的數(shù)據(jù)