
揭秘大數(shù)據(jù)悄悄記錄你比你更懂你_數(shù)據(jù)分析師
大數(shù)據(jù)正在改變我們的生活,帶來(lái)高效率的同時(shí),也帶來(lái)用戶隱私可能泄露等隱憂
3·15來(lái)臨之際,網(wǎng)上發(fā)布了眾多有關(guān)消費(fèi)調(diào)查的數(shù)據(jù)。消費(fèi)習(xí)慣、支付方式、熱衷品牌……也許就在你某次花錢消費(fèi)時(shí),你不知不覺(jué)成為了各種各樣消費(fèi)數(shù)據(jù)的一分子。
當(dāng)你網(wǎng)購(gòu)時(shí),系統(tǒng)會(huì)自動(dòng)向你推薦此前購(gòu)買過(guò)的同類商品;當(dāng)你瀏覽電影、音樂(lè)網(wǎng)站時(shí),會(huì)根據(jù)你的觀影記錄推薦你或許感興趣的影片、歌曲;當(dāng)制作方開(kāi)始關(guān)注觀眾的反饋信息時(shí),也許你在貼吧的一句評(píng)論就可以影響到電視劇的大結(jié)局……不管你是否注意到,我們的生活中大數(shù)據(jù)已經(jīng)無(wú)處不在,通過(guò)分析你的個(gè)人數(shù)據(jù)得出的報(bào)告甚至可能比你自己還要懂你。
新概念 你的一舉一動(dòng)都是大數(shù)據(jù)
每天早上起床后,打開(kāi)微信查看朋友圈有無(wú)最新動(dòng)向;白天上班,在網(wǎng)絡(luò)上瀏覽行業(yè)信息、發(fā)郵件與客戶洽談業(yè)務(wù);閑暇時(shí)候下載APP,尋找長(zhǎng)沙街頭巷尾的美食……這是長(zhǎng)沙市民張慧清的日常生活。與其他人一樣,她的這些行為都會(huì)在網(wǎng)絡(luò)上留下痕跡。這些痕跡的另一個(gè)稱謂便是大數(shù)據(jù)。
我們的日常活動(dòng)、情緒、想法,都通過(guò)電腦或者手機(jī)形成數(shù)據(jù),記錄在網(wǎng)絡(luò)上的各種應(yīng)用系統(tǒng)中;甚至當(dāng)我們逛街時(shí),商戶的WLAN、無(wú)處不在的攝像頭、銀行的ATM機(jī)、加油站的刷卡機(jī)也都在悄悄地記錄上你的一舉一動(dòng)。
中南大學(xué)信息科學(xué)與工程學(xué)院副院長(zhǎng)、大數(shù)據(jù)與知識(shí)工程研究所所長(zhǎng)龍軍教授介紹,大數(shù)據(jù)技術(shù)(big data)又被稱為巨量資料,簡(jiǎn)單來(lái)說(shuō),大數(shù)據(jù)就是通過(guò)對(duì)巨量的資料進(jìn)行擷取、管理、處理、整理后,幫助企業(yè)經(jīng)營(yíng)或者政府決策提供資訊。在大數(shù)據(jù)時(shí)代,我們的每一個(gè)行為、位置、生理數(shù)據(jù)都被記錄為可分析的數(shù)據(jù),整合成一個(gè)大數(shù)據(jù)世界。
大數(shù)據(jù)是怎樣起作用的呢?比如我們?cè)诰W(wǎng)上搜索的服裝關(guān)鍵詞,以及你網(wǎng)購(gòu)時(shí)留下的身高、胸圍、腰圍等數(shù)據(jù),都將被翻譯成電腦能夠聽(tīng)懂的語(yǔ)言,而根據(jù)你的性別、年齡等基本資料和以往的購(gòu)物經(jīng)歷,電腦可以判斷你喜歡什么風(fēng)格的服飾,推薦最可能符合你的要求的商品。
新方法 用數(shù)據(jù)分析告訴你答案
當(dāng)你購(gòu)買電子產(chǎn)品時(shí),最關(guān)心什么呢?產(chǎn)品顏色、外觀,還是功能配置?過(guò)去,手機(jī)的生產(chǎn)流程是,產(chǎn)品經(jīng)理冥思苦想,然后開(kāi)始畫(huà)圖做樣機(jī),之后再由團(tuán)隊(duì)看看哪款樣機(jī)還不錯(cuò),做成成品、量產(chǎn)、鋪銷售渠道。如果商品在設(shè)計(jì)之初就能得知消費(fèi)者的想法,無(wú)疑將能更符合用戶需求。
2012年11月,天貓與華為展開(kāi)了一場(chǎng)日點(diǎn)擊量超過(guò)24萬(wàn)次的大面積用戶調(diào)研,前者還向后者開(kāi)放了大規(guī)模的手機(jī)消費(fèi)行為數(shù)據(jù),華為則通過(guò)分析數(shù)據(jù)定制產(chǎn)品,再通過(guò)天貓銷售,這就是如今十分熱銷的華為Mate系列手機(jī)。
大數(shù)據(jù)在監(jiān)測(cè)非法交易方面屢建奇功。2013年中國(guó)證監(jiān)會(huì)建立大數(shù)據(jù)分析中心,交易所也同步建立實(shí)時(shí)監(jiān)測(cè)中心,所有上市公司的股票交易信息都會(huì)被實(shí)時(shí)監(jiān)測(cè),如果達(dá)到某個(gè)設(shè)定值就會(huì)觸發(fā)專門軟件的預(yù)警,經(jīng)過(guò)初步分析如果懷疑某個(gè)基金賬戶有“老鼠倉(cāng)”的嫌疑,稽查人員就會(huì)通過(guò)專門的信息分析系統(tǒng)對(duì)交易信息進(jìn)行運(yùn)算篩選。自啟用大數(shù)據(jù)分析系統(tǒng)以來(lái),已調(diào)查內(nèi)幕交易線索375起,立案142起。
想要了解90后,就去看看《古劍奇譚》。去年,這部峰值收視率達(dá)到2.85,網(wǎng)絡(luò)點(diǎn)播量超過(guò)50億的“神劇”,創(chuàng)造了6億人次對(duì)該劇的各種點(diǎn)擊和口碑行為大數(shù)據(jù),這就是大數(shù)據(jù)的一個(gè)濃縮版。編劇和百度平臺(tái)“大數(shù)據(jù)”人工智能編劇聯(lián)袂,使得電視劇獲得較高收視率。
龍軍表示:“大數(shù)據(jù)的根本目標(biāo)就是要像挖掘萬(wàn)有引力定律一樣,挖掘數(shù)據(jù)背后的規(guī)律,讓數(shù)據(jù)由大變小,從而為我所用,創(chuàng)造出更多的經(jīng)濟(jì)、社會(huì)和科學(xué)價(jià)值。”
新問(wèn)題 大數(shù)據(jù)可能泄露用戶隱私
大數(shù)據(jù)的紅火也帶來(lái)了一批用戶的擔(dān)心。用戶的各種數(shù)據(jù)被接入網(wǎng)絡(luò),會(huì)不會(huì)使得大家都變成毫無(wú)隱私的“透明人”?由于大數(shù)據(jù)可以光明正大地搜集用戶數(shù)據(jù),并可以對(duì)用戶數(shù)據(jù)進(jìn)行分析,這幾乎讓用戶隱私?jīng)]有任何保障。在沒(méi)有標(biāo)準(zhǔn)和相應(yīng)監(jiān)管措施情況下,大數(shù)據(jù)泄露事件頻繁發(fā)生,已經(jīng)暴露出大數(shù)據(jù)時(shí)代用戶隱私安全的尖銳問(wèn)題。
如何從海量的數(shù)據(jù)中分析出有效信息是另一個(gè)難題。
龍軍表示,如果把大數(shù)據(jù)比作一種產(chǎn)業(yè),那么這種產(chǎn)業(yè)實(shí)現(xiàn)盈利的關(guān)鍵,在于提高對(duì)數(shù)據(jù)的“加工能力”,通過(guò)“加工”實(shí)現(xiàn)數(shù)據(jù)的“增值”?!按髷?shù)據(jù)并不在"大",而在于"有用"。價(jià)值含量、挖掘成本比數(shù)量更為重要。”
但網(wǎng)絡(luò)水軍的存在卻極大影響了互聯(lián)網(wǎng)信息的真實(shí)。按照統(tǒng)計(jì)學(xué)原理來(lái)講,基數(shù)越大,最終得到的結(jié)果就越接近于真實(shí),但是它的前提必須是用戶真實(shí)客觀的反饋。然而在網(wǎng)絡(luò)水軍存在的情況下,很多信息往往是不真實(shí)的。例如,淘寶賣家刷鉆,微博僵尸粉絲,貼吧論壇營(yíng)銷帖等等。虛假數(shù)據(jù)在網(wǎng)絡(luò)中無(wú)處不在,還沒(méi)有十分有效的方法加以鑒別。
新趨勢(shì) 帶來(lái)新一輪的技術(shù)革命
“大數(shù)據(jù)很有可能是新一輪的技術(shù)革命?!饼堒姼嬖V記者,隨著應(yīng)用日益廣泛,大數(shù)據(jù)已然成為企業(yè)和社會(huì)關(guān)注的重要戰(zhàn)略資源和爭(zhēng)相搶奪的新焦點(diǎn)。隨之興起的數(shù)據(jù)挖掘、機(jī)器學(xué)習(xí)和人工智能等相關(guān)技術(shù),可能會(huì)改變數(shù)據(jù)世界里的很多算法和基礎(chǔ)理論,實(shí)現(xiàn)科學(xué)技術(shù)上的突破。
未來(lái),數(shù)據(jù)科學(xué)將成為一門專門的學(xué)科,被越來(lái)越多的人所認(rèn)知。各大高校將設(shè)立專門的數(shù)據(jù)科學(xué)類專業(yè),也會(huì)催生一批與之相關(guān)的新的就業(yè)崗位。與此同時(shí),基于數(shù)據(jù)這個(gè)基礎(chǔ)平臺(tái),也將建立起跨領(lǐng)域的數(shù)據(jù)聯(lián)盟平臺(tái),數(shù)據(jù)共享將擴(kuò)展到企業(yè)層面,并且成為未來(lái)產(chǎn)業(yè)的核心一環(huán)。大數(shù)據(jù),正在并將更大范圍地影響我們的生活。
數(shù)據(jù)分析咨詢請(qǐng)掃描二維碼
若不方便掃碼,搜微信號(hào):CDAshujufenxi
訓(xùn)練與驗(yàn)證損失驟升:機(jī)器學(xué)習(xí)訓(xùn)練中的異常診斷與解決方案 在機(jī)器學(xué)習(xí)模型訓(xùn)練過(guò)程中,“損失曲線” 是反映模型學(xué)習(xí)狀態(tài)的核心指 ...
2025-09-19解析 DataHub 與 Kafka:數(shù)據(jù)生態(tài)中兩類核心工具的差異與協(xié)同 在數(shù)字化轉(zhuǎn)型加速的今天,企業(yè)對(duì)數(shù)據(jù)的需求已從 “存儲(chǔ)” 轉(zhuǎn)向 “ ...
2025-09-19CDA 數(shù)據(jù)分析師:讓統(tǒng)計(jì)基本概念成為業(yè)務(wù)決策的底層邏輯 統(tǒng)計(jì)基本概念是商業(yè)數(shù)據(jù)分析的 “基礎(chǔ)語(yǔ)言”—— 從描述數(shù)據(jù)分布的 “均 ...
2025-09-19CDA 數(shù)據(jù)分析師:表結(jié)構(gòu)數(shù)據(jù) “獲取 - 加工 - 使用” 全流程的賦能者 表結(jié)構(gòu)數(shù)據(jù)(如數(shù)據(jù)庫(kù)表、Excel 表、CSV 文件)是企業(yè)數(shù)字 ...
2025-09-19SQL Server 中 CONVERT 函數(shù)的日期轉(zhuǎn)換:從基礎(chǔ)用法到實(shí)戰(zhàn)優(yōu)化 在 SQL Server 的數(shù)據(jù)處理中,日期格式轉(zhuǎn)換是高頻需求 —— 無(wú)論 ...
2025-09-18MySQL 大表拆分與關(guān)聯(lián)查詢效率:打破 “拆分必慢” 的認(rèn)知誤區(qū) 在 MySQL 數(shù)據(jù)庫(kù)管理中,“大表” 始終是性能優(yōu)化繞不開(kāi)的話題。 ...
2025-09-18DSGE 模型中的 Et:理性預(yù)期算子的內(nèi)涵、作用與應(yīng)用解析 動(dòng)態(tài)隨機(jī)一般均衡(Dynamic Stochastic General Equilibrium, DSGE)模 ...
2025-09-17Python 提取 TIF 中地名的完整指南 一、先明確:TIF 中的地名有哪兩種存在形式? 在開(kāi)始提取前,需先判斷 TIF 文件的類型 —— ...
2025-09-17CDA 數(shù)據(jù)分析師:解鎖表結(jié)構(gòu)數(shù)據(jù)特征價(jià)值的專業(yè)核心 表結(jié)構(gòu)數(shù)據(jù)(以 “行 - 列” 規(guī)范存儲(chǔ)的結(jié)構(gòu)化數(shù)據(jù),如數(shù)據(jù)庫(kù)表、Excel 表、 ...
2025-09-17Excel 導(dǎo)入數(shù)據(jù)含缺失值?詳解 dropna 函數(shù)的功能與實(shí)戰(zhàn)應(yīng)用 在用 Python(如 pandas 庫(kù))處理 Excel 數(shù)據(jù)時(shí),“缺失值” 是高頻 ...
2025-09-16深入解析卡方檢驗(yàn)與 t 檢驗(yàn):差異、適用場(chǎng)景與實(shí)踐應(yīng)用 在數(shù)據(jù)分析與統(tǒng)計(jì)學(xué)領(lǐng)域,假設(shè)檢驗(yàn)是驗(yàn)證研究假設(shè)、判斷數(shù)據(jù)差異是否 “ ...
2025-09-16CDA 數(shù)據(jù)分析師:掌控表格結(jié)構(gòu)數(shù)據(jù)全功能周期的專業(yè)操盤手 表格結(jié)構(gòu)數(shù)據(jù)(以 “行 - 列” 存儲(chǔ)的結(jié)構(gòu)化數(shù)據(jù),如 Excel 表、數(shù)據(jù) ...
2025-09-16MySQL 執(zhí)行計(jì)劃中 rows 數(shù)量的準(zhǔn)確性解析:原理、影響因素與優(yōu)化 在 MySQL SQL 調(diào)優(yōu)中,EXPLAIN執(zhí)行計(jì)劃是核心工具,而其中的row ...
2025-09-15解析 Python 中 Response 對(duì)象的 text 與 content:區(qū)別、場(chǎng)景與實(shí)踐指南 在 Python 進(jìn)行 HTTP 網(wǎng)絡(luò)請(qǐng)求開(kāi)發(fā)時(shí)(如使用requests ...
2025-09-15CDA 數(shù)據(jù)分析師:激活表格結(jié)構(gòu)數(shù)據(jù)價(jià)值的核心操盤手 表格結(jié)構(gòu)數(shù)據(jù)(如 Excel 表格、數(shù)據(jù)庫(kù)表)是企業(yè)最基礎(chǔ)、最核心的數(shù)據(jù)形態(tài) ...
2025-09-15Python HTTP 請(qǐng)求工具對(duì)比:urllib.request 與 requests 的核心差異與選擇指南 在 Python 處理 HTTP 請(qǐng)求(如接口調(diào)用、數(shù)據(jù)爬取 ...
2025-09-12解決 pd.read_csv 讀取長(zhǎng)浮點(diǎn)數(shù)據(jù)的科學(xué)計(jì)數(shù)法問(wèn)題 為幫助 Python 數(shù)據(jù)從業(yè)者解決pd.read_csv讀取長(zhǎng)浮點(diǎn)數(shù)據(jù)時(shí)的科學(xué)計(jì)數(shù)法問(wèn)題 ...
2025-09-12CDA 數(shù)據(jù)分析師:業(yè)務(wù)數(shù)據(jù)分析步驟的落地者與價(jià)值優(yōu)化者 業(yè)務(wù)數(shù)據(jù)分析是企業(yè)解決日常運(yùn)營(yíng)問(wèn)題、提升執(zhí)行效率的核心手段,其價(jià)值 ...
2025-09-12用 SQL 驗(yàn)證業(yè)務(wù)邏輯:從規(guī)則拆解到數(shù)據(jù)把關(guān)的實(shí)戰(zhàn)指南 在業(yè)務(wù)系統(tǒng)落地過(guò)程中,“業(yè)務(wù)邏輯” 是連接 “需求設(shè)計(jì)” 與 “用戶體驗(yàn) ...
2025-09-11塔吉特百貨孕婦營(yíng)銷案例:數(shù)據(jù)驅(qū)動(dòng)下的精準(zhǔn)零售革命與啟示 在零售行業(yè) “流量紅利見(jiàn)頂” 的當(dāng)下,精準(zhǔn)營(yíng)銷成為企業(yè)突圍的核心方 ...
2025-09-11