
Google Analytics存儲(chǔ)了全球范圍內(nèi)網(wǎng)站的大量靜態(tài)數(shù)據(jù),隨著數(shù)據(jù)體積越來越大,檢索的難度也必然隨之增加。近日,Gen Furukaw在Dzone上撰文表示,Google Analytics的高效一定程度上歸功于其兼職存儲(chǔ)BigTable。
以下為譯文
在Google,隨時(shí)都可能存在大量應(yīng)用程序被添加到其基礎(chǔ)設(shè)施,而這些應(yīng)用程序中,任意一個(gè)都可能給系統(tǒng)帶來繁重的工作負(fù)載。迎合這樣的資源需求并不簡(jiǎn)單,而在有限時(shí)間內(nèi)做到這一點(diǎn)就更是難上加難了。
如果Google部署的是一個(gè)單節(jié)點(diǎn)上的傳統(tǒng)數(shù)據(jù)庫,那么一旦達(dá)到容量限制,他們必須為其更新硬件。鑒于Google應(yīng)用程序的數(shù)量和存儲(chǔ)數(shù)據(jù)的體積,這種硬件升級(jí)可能每天都會(huì)進(jìn)行一次。雖然負(fù)載也可以分配到多個(gè)節(jié)點(diǎn),但隨著節(jié)點(diǎn)數(shù)的增加,系統(tǒng)維護(hù)的難度將變得不可思議。
綜上所述,鑒于大規(guī)模系統(tǒng)升級(jí)和維護(hù)的難度,標(biāo)準(zhǔn)關(guān)系型數(shù)據(jù)庫對(duì)Google來說并不可選。
尋找一個(gè)可擴(kuò)展解決方案
為了保證速度,及避免頻繁的更新硬件,Google定制了自己的存儲(chǔ)解決方案——BigTable。取代關(guān)系型數(shù)據(jù)庫將數(shù)據(jù)存放到表格中,BigTable使用了多維排序映射的方式對(duì)數(shù)據(jù)進(jìn)行存儲(chǔ),也就是現(xiàn)在我們所說的鍵值存儲(chǔ)類型。這種方式不僅提升了性能,也簡(jiǎn)化了擴(kuò)展過程。
關(guān)系型數(shù)據(jù)庫中的信息存儲(chǔ)
關(guān)系型數(shù)據(jù)庫將信息的每個(gè)部分都存放到獨(dú)立的位置,通常是表中的一列。同時(shí),在關(guān)系型數(shù)據(jù)庫中,數(shù)據(jù)的規(guī)范化非常重要,這個(gè)過程保證了其他表格或者列中不會(huì)存在冗余數(shù)據(jù)。
舉個(gè)例子,客戶的“姓”必須存放在某個(gè)表格的對(duì)應(yīng)列中。如果某個(gè)客戶的姓在其他位置發(fā)現(xiàn),那么它將被刪除,信息的檢索仍然會(huì)被指定到原始表格。
這種結(jié)構(gòu)的缺點(diǎn)是數(shù)據(jù)庫內(nèi)部可能變得非常復(fù)雜,從而導(dǎo)致即使一個(gè)簡(jiǎn)單的查詢都可能涉及到大量的執(zhí)行路徑,而所有這些路徑都會(huì)在運(yùn)行時(shí)進(jìn)行計(jì)算以尋找最優(yōu)路徑。數(shù)據(jù)庫越復(fù)雜,運(yùn)行時(shí)就需要越多的資源來確定查詢路徑。
鍵值存儲(chǔ)中的信息存儲(chǔ)
在鍵值存儲(chǔ)中,數(shù)據(jù)被允許存在多個(gè)備份。取代使用其他昂貴硬件資源來增加速度,這里的設(shè)計(jì)理念是利用磁盤空間,它更新起來非常容易,成本也不高。
對(duì)于簡(jiǎn)單查詢來說,多備份非常有利,在鍵值存儲(chǔ)中,相關(guān)的數(shù)據(jù)可以被存儲(chǔ)到一起,從而避免在查詢過程中訪問多個(gè)路徑以獲得所需數(shù)據(jù)。
取代關(guān)系型數(shù)據(jù)中的表格存儲(chǔ)類型,鍵值存儲(chǔ)使用域,同時(shí)也無需預(yù)定義數(shù)據(jù)結(jié)構(gòu)模式。域中存儲(chǔ)的數(shù)據(jù)通過鍵定義,它們可以通過大量不同的屬性訪問。
這些屬性可能是字符串,也可以是流行編程語言中匹配的任意數(shù)據(jù)類型,它可能會(huì)是數(shù)組、對(duì)象、整形、浮點(diǎn)型、布爾型以及編程語言中使用的任意基本數(shù)據(jù)類型。
在鍵值存儲(chǔ)中,取代數(shù)據(jù)本身,數(shù)據(jù)完整性和邏輯通過應(yīng)用程序代碼維護(hù),通過使用1個(gè)或多個(gè)API,開發(fā)者可以編寫出最優(yōu)的實(shí)現(xiàn)方法。這樣一來,數(shù)據(jù)檢索工作被轉(zhuǎn)移到編寫正確的邏輯上,而不是依賴數(shù)據(jù)庫去優(yōu)化在大量可能路徑中選擇一個(gè)最佳路徑。
寫在最后
當(dāng)然,除了鍵值存儲(chǔ)的使用之外,Google Analytics快還源于其優(yōu)秀的編程邏輯,這點(diǎn)就不再一一詳述了。本文來自:CDA數(shù)據(jù)分析師培訓(xùn)官網(wǎng)
數(shù)據(jù)分析咨詢請(qǐng)掃描二維碼
若不方便掃碼,搜微信號(hào):CDAshujufenxi
CDA 精益業(yè)務(wù)數(shù)據(jù)分析:數(shù)據(jù)驅(qū)動(dòng)業(yè)務(wù)增長(zhǎng)的實(shí)戰(zhàn)方法論 在企業(yè)數(shù)字化轉(zhuǎn)型的浪潮中,“數(shù)據(jù)分析” 已從 “加分項(xiàng)” 成為 “必修課 ...
2025-07-16MySQL 中 ADD KEY 與 ADD INDEX 詳解:用法、差異與優(yōu)化實(shí)踐 在 MySQL 數(shù)據(jù)庫表結(jié)構(gòu)設(shè)計(jì)中,索引是提升查詢性能的核心手段。無論 ...
2025-07-16解析 MySQL Update 語句中 “query end” 狀態(tài):含義、成因與優(yōu)化指南? 在 MySQL 數(shù)據(jù)庫的日常運(yùn)維與開發(fā)中,開發(fā)者和 DBA 常會(huì) ...
2025-07-16如何考取數(shù)據(jù)分析師證書:以 CDA 為例? ? 在數(shù)字化浪潮席卷各行各業(yè)的當(dāng)下,數(shù)據(jù)分析師已然成為企業(yè)挖掘數(shù)據(jù)價(jià)值、驅(qū)動(dòng)決策的 ...
2025-07-15CDA 精益業(yè)務(wù)數(shù)據(jù)分析:驅(qū)動(dòng)企業(yè)高效決策的核心引擎? 在數(shù)字經(jīng)濟(jì)時(shí)代,企業(yè)面臨著前所未有的數(shù)據(jù)洪流,如何從海量數(shù)據(jù)中提取有 ...
2025-07-15MySQL 無外鍵關(guān)聯(lián)表的 JOIN 實(shí)戰(zhàn):數(shù)據(jù)整合的靈活之道? 在 MySQL 數(shù)據(jù)庫的日常操作中,我們經(jīng)常會(huì)遇到需要整合多張表數(shù)據(jù)的場(chǎng)景 ...
2025-07-15Python Pandas:數(shù)據(jù)科學(xué)的瑞士軍刀? ? 在數(shù)據(jù)驅(qū)動(dòng)的時(shí)代,面對(duì)海量、復(fù)雜的數(shù)據(jù),如何高效地進(jìn)行處理、分析和挖掘成為關(guān)鍵。 ...
2025-07-15用 SQL 生成逆向回滾 SQL:數(shù)據(jù)操作的 “后悔藥” 指南? 在數(shù)據(jù)庫操作中,誤刪數(shù)據(jù)、錯(cuò)改字段或誤執(zhí)行批量更新等問題時(shí)有發(fā)生。 ...
2025-07-14t檢驗(yàn)與Wilcoxon檢驗(yàn)的選擇:何時(shí)用t.test,何時(shí)用wilcox.test? t 檢驗(yàn)與 Wilcoxon 檢驗(yàn)的選擇:何時(shí)用 t.test,何時(shí)用 wilcox. ...
2025-07-14AI 浪潮下的生存與進(jìn)階: CDA數(shù)據(jù)分析師—開啟新時(shí)代職業(yè)生涯的鑰匙(深度研究報(bào)告、發(fā)展指導(dǎo)白皮書) 發(fā)布機(jī)構(gòu):CDA數(shù)據(jù)科 ...
2025-07-13LSTM 模型輸入長(zhǎng)度選擇技巧:提升序列建模效能的關(guān)鍵? 在循環(huán)神經(jīng)網(wǎng)絡(luò)(RNN)家族中,長(zhǎng)短期記憶網(wǎng)絡(luò)(LSTM)憑借其解決長(zhǎng)序列 ...
2025-07-11CDA 數(shù)據(jù)分析師報(bào)考條件詳解與準(zhǔn)備指南? ? 在數(shù)據(jù)驅(qū)動(dòng)決策的時(shí)代浪潮下,CDA 數(shù)據(jù)分析師認(rèn)證愈發(fā)受到矚目,成為眾多有志投身數(shù) ...
2025-07-11數(shù)據(jù)透視表中兩列相乘合計(jì)的實(shí)用指南? 在數(shù)據(jù)分析的日常工作中,數(shù)據(jù)透視表憑借其強(qiáng)大的數(shù)據(jù)匯總和分析功能,成為了 Excel 用戶 ...
2025-07-11尊敬的考生: 您好! 我們誠摯通知您,CDA Level I和 Level II考試大綱將于 2025年7月25日 實(shí)施重大更新。 此次更新旨在確保認(rèn) ...
2025-07-10BI 大數(shù)據(jù)分析師:連接數(shù)據(jù)與業(yè)務(wù)的價(jià)值轉(zhuǎn)化者? ? 在大數(shù)據(jù)與商業(yè)智能(Business Intelligence,簡(jiǎn)稱 BI)深度融合的時(shí)代,BI ...
2025-07-10SQL 在預(yù)測(cè)分析中的應(yīng)用:從數(shù)據(jù)查詢到趨勢(shì)預(yù)判? ? 在數(shù)據(jù)驅(qū)動(dòng)決策的時(shí)代,預(yù)測(cè)分析作為挖掘數(shù)據(jù)潛在價(jià)值的核心手段,正被廣泛 ...
2025-07-10數(shù)據(jù)查詢結(jié)束后:分析師的收尾工作與價(jià)值深化? ? 在數(shù)據(jù)分析的全流程中,“query end”(查詢結(jié)束)并非工作的終點(diǎn),而是將數(shù) ...
2025-07-10CDA 數(shù)據(jù)分析師考試:從報(bào)考到取證的全攻略? 在數(shù)字經(jīng)濟(jì)蓬勃發(fā)展的今天,數(shù)據(jù)分析師已成為各行業(yè)爭(zhēng)搶的核心人才,而 CDA(Certi ...
2025-07-09【CDA干貨】單樣本趨勢(shì)性檢驗(yàn):捕捉數(shù)據(jù)背后的時(shí)間軌跡? 在數(shù)據(jù)分析的版圖中,單樣本趨勢(shì)性檢驗(yàn)如同一位耐心的偵探,專注于從單 ...
2025-07-09year_month數(shù)據(jù)類型:時(shí)間維度的精準(zhǔn)切片? ? 在數(shù)據(jù)的世界里,時(shí)間是最不可或缺的維度之一,而year_month數(shù)據(jù)類型就像一把精準(zhǔn) ...
2025-07-09