99999久久久久久亚洲,欧美人与禽猛交狂配,高清日韩av在线影院,一个人在线高清免费观看,啦啦啦在线视频免费观看www

熱線電話：13121318867

登錄

首頁精彩閱讀大數(shù)據(jù)不是萬能！會(huì)遭遇數(shù)據(jù)凈化難題

大數(shù)據(jù)不是萬能！會(huì)遭遇數(shù)據(jù)凈化難題

2015-02-02

大數(shù)據(jù)不是萬能！會(huì)遭遇數(shù)據(jù)凈化難題

拼寫錯(cuò)誤、以及各種不準(zhǔn)確和過時(shí)的信息就好比米堆里的砂子，如果不挑出來，企業(yè)和研究人員就很難利用大數(shù)據(jù)技術(shù)做出一鍋好飯，而數(shù)據(jù)凈化要做的工作就是去蕪存菁。

　　大數(shù)據(jù)不是萬能！會(huì)遭遇數(shù)據(jù)凈化難題

　　卡里姆?科夏瓦杰是多倫多的一名醫(yī)生和網(wǎng)絡(luò)健康顧問，他要從500名醫(yī)生那里反饋的海量數(shù)據(jù)中總結(jié)出怎樣才能更好地治療病人。但是眾所周知，醫(yī)生的“書法”本來就堪比天書，要想讓電腦識(shí)別出其中的拼寫錯(cuò)誤和縮寫更是難于登天。

　　比如科夏瓦杰指出：“患者是否吸煙是個(gè)很重要的信息。如果你直接閱讀病歷，你馬上就能明白醫(yī)生是什么意思。但是要想讓電腦去理解它，那就只能祝你好運(yùn)了。雖然你也可以在電腦上設(shè)置‘從不吸煙’或‘吸煙=0’的選項(xiàng)。但是一個(gè)患者每天吸多少支煙?這幾乎是電腦不可能搞明白的問題。

　　由于宣傳報(bào)道把大數(shù)據(jù)吹得神乎其神，因此很多人可能覺得大數(shù)據(jù)用起來特別簡單：只要把相當(dāng)于一整個(gè)圖書館的信息插到電腦上，然后就可以坐在一邊，等著電腦給出精辟見解，告訴你如何提高自動(dòng)生產(chǎn)線的生產(chǎn)效率，如何讓網(wǎng)購者在網(wǎng)上購買更多的運(yùn)動(dòng)鞋，或是如何治療癌癥。但事實(shí)遠(yuǎn)遠(yuǎn)比想象復(fù)雜得多。由于信息會(huì)過時(shí)、不準(zhǔn)確和缺失，因此數(shù)據(jù)不可避免地也有“不干凈”的時(shí)候。如何把數(shù)據(jù)變“干凈”是一個(gè)越來越重要但又經(jīng)常被人忽略的工作，但它可以防止你犯下代價(jià)高昂的錯(cuò)誤。

　　雖然科技一直都在進(jìn)步，但是人們?cè)趦艋瘮?shù)據(jù)上能想到的法子并不多。即便是處理一些相對(duì)較“干凈”的數(shù)據(jù)，要想獲得有用的結(jié)果往往也是件費(fèi)時(shí)費(fèi)力的事情。

　　博思艾倫咨詢公司(Booz Allen)副總裁約什?沙利文說：“我對(duì)我的客戶說，這是個(gè)混亂骯臟的世界，沒有完全干凈的數(shù)據(jù)集?！?/span>

　　很多醫(yī)生在病歷中沒有記錄病人的血壓，這個(gè)問題是無論哪種數(shù)據(jù)凈化方法都修復(fù)不了的。光憑借現(xiàn)有病歷的信息去判斷病人得了什么病對(duì)電腦來說就已經(jīng)是一項(xiàng)極其困難的任務(wù)。醫(yī)生在輸入糖尿病編號(hào)的時(shí)候，可能忘了清楚地標(biāo)注究竟是患者本人得了糖尿病，還是他的某個(gè)家人得了糖尿病。又或許他們光是輸入了“胰島素”三個(gè)字，而沒有提到患者得了什么病，因?yàn)檫@對(duì)他們來說是再明顯不過的事情。

　　醫(yī)生用來診斷、開藥和填寫病人基本信息時(shí)會(huì)大量用到一套獨(dú)特的速記字體。即使讓人類來破解它也要大為頭痛，而對(duì)于電腦基本上是不可能完成的任務(wù)。比如科夏瓦杰提到有個(gè)醫(yī)生在病歷中寫下“gpa”三個(gè)字母，讓他百思不得其解。好在他發(fā)現(xiàn)后面不遠(yuǎn)處又寫著“gma”三字，他才恍然大悟——原來它們是爺爺(grandpa)和奶奶(grandma)的縮寫。

　　科夏瓦杰說：“我花了好半天才明白它們到底是什么意思?！?/span>

　　科夏瓦杰認(rèn)為，解決數(shù)據(jù)“不干凈”的終極方法之一是要給病歷制定一套“數(shù)據(jù)紀(jì)律”。要訓(xùn)練醫(yī)生養(yǎng)成正確錄入信息的習(xí)慣，這樣事后凈化數(shù)據(jù)時(shí)才不至于亂得一團(tuán)糟。科夏瓦杰表示，谷歌有一個(gè)很有用的工具，可以在用戶進(jìn)行輸入時(shí)告訴他們?nèi)绾纹磳懮ё?，這樣的工具完全可以添加到電子病歷工具中。電腦雖然可以挑出拼寫錯(cuò)誤，但是讓醫(yī)生摒棄不良習(xí)慣才是朝著正確的方向邁出了一步。

　　科夏瓦杰的另一個(gè)建議是，在電子病歷中設(shè)置更多標(biāo)準(zhǔn)化的域。這樣電腦就會(huì)知道到哪里去找特定的信息，從而減少出錯(cuò)率。當(dāng)然，實(shí)際操作起來并沒有這么簡單，因?yàn)楹芏嗖∪送瑫r(shí)身患好幾種疾病。因此，一個(gè)標(biāo)準(zhǔn)的表格必須擁有足夠的靈活性，把這些復(fù)雜情況全部考慮進(jìn)去。

　　但是出于診療的需要，醫(yī)生有時(shí)需要在病歷上記下一些自由行文的東西，這些內(nèi)容肯定不是一個(gè)小格子能裝得下的。比如一個(gè)患者為什么會(huì)摔倒，如果不是受傷導(dǎo)致的，那么原因就非常重要。但是在沒有上下文的條件下，軟件對(duì)于自由行文的理解只能用撞大運(yùn)來形容。篩選數(shù)據(jù)的時(shí)候，如果人們用關(guān)鍵詞搜索的話可能會(huì)做得更好些，但這樣也難免會(huì)漏掉很多有關(guān)的記錄。

　　當(dāng)然，在有些案例中，有些看起來不干凈的數(shù)并不是真的不干凈。博思艾倫咨詢公司副總裁沙利文舉例說，有一次他的團(tuán)隊(duì)為一家豪華連鎖酒店分析顧客的人口統(tǒng)計(jì)數(shù)據(jù)，突然發(fā)現(xiàn)，數(shù)據(jù)顯示一個(gè)富有的中東國家的青少年群體是這家酒店的常客。

　　沙利文回憶道：“有一大群17歲的青少年在世界各地都住這家酒店，我們以為：‘這肯定不是真的。’”

　　但做了一些挖掘工作后，他們發(fā)現(xiàn)這個(gè)信息其實(shí)是正確的。這家酒店有大量的青少年顧客，甚至連酒店自己也沒有意識(shí)到，而且酒店也沒有針對(duì)這部分顧客做過任何促銷和宣傳。所有22歲以下的顧客都被這家公司的電腦自動(dòng)列入“低收入”群體，酒店的高管們也從來沒有考慮過這些孩子的腰包有多鼓。

　　沙利文說：“我認(rèn)為如果沒有離群值的話，構(gòu)建模型會(huì)更難?！?/span>

　　即便有時(shí)數(shù)據(jù)明顯不干凈，它有時(shí)依然能派上大用場。比如上文提到的谷歌(Google)的拼寫糾正技術(shù)。它可以自動(dòng)識(shí)別拼寫錯(cuò)誤的單詞，然后提供替代拼寫。這個(gè)工具之所以有這樣神奇的功用，是因?yàn)楣雀柙谶^去幾年中已經(jīng)收集了幾億甚至幾十億個(gè)拼寫錯(cuò)誤的詞條。因此不干凈的數(shù)據(jù)也可以變廢為寶。

　　最終，從大數(shù)據(jù)中獲得結(jié)論的是人而不是機(jī)器。電腦雖然可以整理幾百萬份文件，但它并不能真的解讀它。數(shù)據(jù)凈化就是為了方便人們從數(shù)據(jù)中獲取結(jié)論而反復(fù)試錯(cuò)的過程。盡管大數(shù)據(jù)已被奉為能提高商業(yè)利潤、能造福全人類的神器，但它也是個(gè)很讓人頭痛的東西。

　　沙利文指出：“失敗的概念在數(shù)據(jù)科學(xué)中完全是另一回事。如果我們每天不失敗10次或12次來試錯(cuò)，它們就不會(huì)給出正確的結(jié)果?！?財(cái)富中文網(wǎng))

　　數(shù)據(jù)分析師一般喜歡先尋找非常態(tài)的信息。由于數(shù)據(jù)量太巨大，他們一般都會(huì)把篩選數(shù)據(jù)的工作交給軟件來完成，來尋找是否有些反常的東西需要進(jìn)一步檢查。隨著時(shí)間的推移，電腦篩選數(shù)據(jù)的精確性也會(huì)提高。通過對(duì)類似案例進(jìn)行分類，它們也會(huì)更好地了解一些詞語和句子的含義，然后提高篩選的精確性。

　　沙利文說：“這種方法簡單直接，但‘訓(xùn)練’你的模型可以需要一周又一周的時(shí)間?！?/span>

　　有些公司也提供了用來凈化數(shù)據(jù)的軟件和服務(wù)，其中既包括像IBM和SAP一樣的科技巨頭，也包括Cloudera和Talend開放工作室從事等大數(shù)據(jù)和分析的專門機(jī)構(gòu)。一大批創(chuàng)業(yè)公司也想爭當(dāng)大數(shù)據(jù)的看門人，其中有代表性的包括Trifacta、Tamr和Paxata等。

　　由于“不干凈”的數(shù)據(jù)太多，醫(yī)療業(yè)被認(rèn)為是大數(shù)據(jù)技術(shù)最難搞定的行業(yè)之一。雖然隨著電子病歷的普及，將醫(yī)療信息輸入電腦的難度已經(jīng)變得越來越低，但是研究人員、制藥公司和醫(yī)療業(yè)分析人士要想把他們需要的數(shù)據(jù)盡情地拿來分析，在數(shù)據(jù)上要提高的地方還有很多。

　　健康數(shù)據(jù)咨詢公司InfoClin的醫(yī)生兼CEO科夏瓦杰花了很多時(shí)間，希望數(shù)以萬計(jì)的電子醫(yī)療病歷中篩選有用的數(shù)據(jù)，以提高對(duì)病人的診療水平。但他們?cè)诤Y選的過程中卻不斷遇到阻礙。

CDA數(shù)據(jù)分析師考試相關(guān)入口一覽（建議收藏）：

? 想報(bào)名CDA認(rèn)證考試，點(diǎn)擊>>> “CDA報(bào)名” 了解CDA考試詳情；

? 想學(xué)習(xí)CDA考試教材，點(diǎn)擊>>> “CDA教材” 了解CDA考試詳情；

? 想加入CDA考試題庫，點(diǎn)擊>>> “CDA題庫” 了解CDA考試詳情；

? 想了解CDA考試含金量，點(diǎn)擊>>> “CDA含金量” 了解CDA考試詳情；

大數(shù)據(jù) 數(shù)據(jù)分析

數(shù)據(jù)分析咨詢請(qǐng)掃描二維碼

若不方便掃碼，搜微信號(hào)：CDAshujufenxi

上一篇圖論在大數(shù)據(jù)分析中的作用！

下一篇CDA認(rèn)證再升一檔！與國家共同推進(jìn)大數(shù)據(jù)人才培養(yǎng)標(biāo)準(zhǔn)教育事業(yè)！

CDA報(bào)考指南

報(bào)考流程
考試時(shí)間
報(bào)名費(fèi)用
聯(lián)系我們

數(shù)據(jù)分析學(xué)習(xí)

數(shù)據(jù)分析師資訊

京公網(wǎng)安備 11010802034615號(hào) 經(jīng)營許可證編號(hào)：京B2-20210330

聯(lián)系電話：13321103290 (微信同號(hào))

CDA教材
CDA題庫
CDA大綱

客服在線

立即咨詢

客服在線

立即咨詢

免密碼登錄

提交首次登錄驗(yàn)證后自動(dòng)注冊(cè)

') } function initGt() { var handler = function (captchaObj) { captchaObj.appendTo('#captcha'); captchaObj.onReady(function () { $("#wait").hide(); }).onSuccess(function(){ $('.getcheckcode').removeClass('dis'); $('.getcheckcode').trigger('click'); }); window.captchaObj = captchaObj; }; $('#captcha').show(); $.ajax({ url: "/login/gtstart?t=" + (new Date()).getTime(), // 加隨機(jī)數(shù)防止緩存 type: "get", dataType: "json", success: function (data) { $('#text').hide(); $('#wait').show(); // 調(diào)用 initGeetest 進(jìn)行初始化 // 參數(shù)1：配置參數(shù) // 參數(shù)2：回調(diào)，回調(diào)的第一個(gè)參數(shù)驗(yàn)證碼對(duì)象，之后可以使用它調(diào)用相應(yīng)的接口 initGeetest({ // 以下 4 個(gè)配置參數(shù)為必須，不能缺少 gt: data.gt, challenge: data.challenge, offline: !data.success, // 表示用戶后臺(tái)檢測極驗(yàn)服務(wù)器是否宕機(jī) new_captcha: data.new_captcha, // 用于宕機(jī)時(shí)表示是新驗(yàn)證碼的宕機(jī) product: "float", // 產(chǎn)品形式，包括：float，popup width: "280px", https: true // 更多配置參數(shù)說明請(qǐng)參見：http://docs.geetest.com/install/client/web-front/ }, handler); } }); } function codeCutdown() { if(_wait == 0){ //倒計(jì)時(shí)完成 $(".getcheckcode").removeClass('dis').html("重新獲取"); }else{ $(".getcheckcode").addClass('dis').html("重新獲取("+_wait+"s)"); _wait--; setTimeout(function () { codeCutdown(); },1000); } } function inputValidate(ele,telInput) { var oInput = ele; var inputVal = oInput.val(); var oType = ele.attr('data-type'); var oEtag = $('#etag').val(); var oErr = oInput.closest('.form_box').next('.err_txt'); var empTxt = '請(qǐng)輸入'+oInput.attr('placeholder')+'！'; var errTxt = '請(qǐng)輸入正確的'+oInput.attr('placeholder')+'！'; var pattern; if(inputVal==""){ if(!telInput){ errFun(oErr,empTxt); } return false; }else { switch (oType){ case 'login_mobile': pattern = /^1[3456789]\d{9}$/; if(inputVal.length==11) { $.ajax({ url: '/login/checkmobile', type: "post", dataType: "json", data: { mobile: inputVal, etag: oEtag, page_ur: window.location.href, page_referer: document.referrer }, success: function (data) { } }); } break; case 'login_yzm': pattern = /^\d{6}$/; break; } if(oType=='login_mobile'){ } if(!!validateFun(pattern,inputVal)){ errFun(oErr,'') if(telInput){ $('.getcheckcode').removeClass('dis'); } }else { if(!telInput) { errFun(oErr, errTxt); }else { $('.getcheckcode').addClass('dis'); } return false; } } return true; } function errFun(obj,msg) { obj.html(msg); if(msg==''){ $('.login_submit').removeClass('dis'); }else { $('.login_submit').addClass('dis'); } } function validateFun(pat,val) { return pat.test(val); }

99999久久久久久亚洲,欧美人与禽猛交狂配,高清日韩av在线影院,一个人在线高清免费观看,啦啦啦在线视频免费观看www

大數(shù)據(jù)不是萬能！會(huì)遭遇數(shù)據(jù)凈化難題

數(shù)據(jù)分析師考試動(dòng)態(tài)

CDA報(bào)考指南

數(shù)據(jù)分析學(xué)習(xí)

數(shù)據(jù)分析師資訊

【CDA干貨】訓(xùn)練與驗(yàn)證損失驟升：機(jī)器學(xué)習(xí)訓(xùn)練中的 ...

【CDA干貨】解析 DataHub 與 Kafka：數(shù)據(jù)生態(tài)中兩類 ...

CDA 數(shù)據(jù)分析師：讓統(tǒng)計(jì)基本概念成為業(yè)務(wù)決策的底層 ...

CDA 數(shù)據(jù)分析師：表結(jié)構(gòu)數(shù)據(jù) “獲取 - 加工 - 使用 ...

【CDA干貨】SQL Server 中 CONVERT 函數(shù)的日期轉(zhuǎn)換 ...

【CDA干貨】MySQL 大表拆分與關(guān)聯(lián)查詢效率：打破 “ ...

【CDA干貨】DSGE 模型中的 Et：理性預(yù)期算子的內(nèi)涵 ...

【CDA干貨】Python 提取 TIF 中地名的完整指南 ...

CDA 數(shù)據(jù)分析師：解鎖表結(jié)構(gòu)數(shù)據(jù)特征價(jià)值的專業(yè)核心 ...

【CDA干貨】Excel 導(dǎo)入數(shù)據(jù)含缺失值？詳解 dropna ...

【CDA干貨】深入解析卡方檢驗(yàn)與 t 檢驗(yàn)：差異、適用 ...

CDA 數(shù)據(jù)分析師：掌控表格結(jié)構(gòu)數(shù)據(jù)全功能周期的專業(yè) ...

【CDA干貨】MySQL 執(zhí)行計(jì)劃中 rows 數(shù)量的準(zhǔn)確性解 ...

【CDA干貨】解析 Python 中 Response 對(duì)象的 text ...

CDA 數(shù)據(jù)分析師：激活表格結(jié)構(gòu)數(shù)據(jù)價(jià)值的核心操盤手 ...

【CDA干貨】Python HTTP 請(qǐng)求工具對(duì)比：urllib.requ ...

【CDA干貨】解決 pd.read\_csv 讀取長浮點(diǎn)數(shù)據(jù)的科 ...

CDA 數(shù)據(jù)分析師：業(yè)務(wù)數(shù)據(jù)分析步驟的落地者與價(jià)值優(yōu) ...

【CDA干貨】用 SQL 驗(yàn)證業(yè)務(wù)邏輯：從規(guī)則拆解到數(shù)據(jù) ...

【CDA干貨】塔吉特百貨孕婦營銷案例：數(shù)據(jù)驅(qū)動(dòng)下的 ...

CDA教育閉環(huán)

常見問題

關(guān)于我們

CDA數(shù)據(jù)分析師公眾號(hào)

CDA考試中心小程序

CDA數(shù)據(jù)分析師App下載

99999久久久久久亚洲,欧美人与禽猛交狂配,高清日韩av在线影院,一个人在线高清免费观看,啦啦啦在线视频免费观看www

大數(shù)據(jù)不是萬能！會(huì)遭遇數(shù)據(jù)凈化難題

數(shù)據(jù)分析師考試動(dòng)態(tài)

CDA報(bào)考指南

數(shù)據(jù)分析學(xué)習(xí)

數(shù)據(jù)分析師資訊

【CDA干貨】訓(xùn)練與驗(yàn)證損失驟升：機(jī)器學(xué)習(xí)訓(xùn)練中的 ...

【CDA干貨】解析 DataHub 與 Kafka：數(shù)據(jù)生態(tài)中兩類 ...

CDA 數(shù)據(jù)分析師：讓統(tǒng)計(jì)基本概念成為業(yè)務(wù)決策的底層 ...

CDA 數(shù)據(jù)分析師：表結(jié)構(gòu)數(shù)據(jù) “獲取 - 加工 - 使用 ...

【CDA干貨】SQL Server 中 CONVERT 函數(shù)的日期轉(zhuǎn)換 ...

【CDA干貨】MySQL 大表拆分與關(guān)聯(lián)查詢效率：打破 “ ...

【CDA干貨】DSGE 模型中的 Et：理性預(yù)期算子的內(nèi)涵 ...

【CDA干貨】Python 提取 TIF 中地名的完整指南 ...

CDA 數(shù)據(jù)分析師：解鎖表結(jié)構(gòu)數(shù)據(jù)特征價(jià)值的專業(yè)核心 ...

【CDA干貨】Excel 導(dǎo)入數(shù)據(jù)含缺失值？詳解 dropna ...

【CDA干貨】深入解析卡方檢驗(yàn)與 t 檢驗(yàn)：差異、適用 ...

CDA 數(shù)據(jù)分析師：掌控表格結(jié)構(gòu)數(shù)據(jù)全功能周期的專業(yè) ...

【CDA干貨】MySQL 執(zhí)行計(jì)劃中 rows 數(shù)量的準(zhǔn)確性解 ...

【CDA干貨】解析 Python 中 Response 對(duì)象的 text ...

CDA 數(shù)據(jù)分析師：激活表格結(jié)構(gòu)數(shù)據(jù)價(jià)值的核心操盤手 ...

【CDA干貨】Python HTTP 請(qǐng)求工具對(duì)比：urllib.requ ...

【CDA干貨】解決 pd.read\_csv 讀取長浮點(diǎn)數(shù)據(jù)的科 ...

CDA 數(shù)據(jù)分析師：業(yè)務(wù)數(shù)據(jù)分析步驟的落地者與價(jià)值優(yōu) ...

【CDA干貨】用 SQL 驗(yàn)證業(yè)務(wù)邏輯：從規(guī)則拆解到數(shù)據(jù) ...

【CDA干貨】塔吉特百貨孕婦營銷案例：數(shù)據(jù)驅(qū)動(dòng)下的 ...

CDA教育閉環(huán)

常見問題

關(guān)于我們

CDA數(shù)據(jù)分析師公眾號(hào)

CDA考試中心小程序

CDA數(shù)據(jù)分析師App下載

【CDA干貨】Excel 導(dǎo)入數(shù)據(jù)含缺失值？詳解 dropna ...

【CDA干貨】深入解析卡方檢驗(yàn)與 t 檢驗(yàn)：差異、適用 ...