99999久久久久久亚洲,欧美人与禽猛交狂配,高清日韩av在线影院,一个人在线高清免费观看,啦啦啦在线视频免费观看www

熱線電話:13121318867

登錄
首頁精彩閱讀數(shù)據(jù)挖掘與數(shù)據(jù)建模的9大定律?(1)
數(shù)據(jù)挖掘與數(shù)據(jù)建模的9大定律?(1)
2015-10-09
收藏

數(shù)據(jù)挖掘數(shù)據(jù)建模的9大定律(1)


數(shù)據(jù)挖掘是利用業(yè)務(wù)知識從數(shù)據(jù)中發(fā)現(xiàn)和解釋知識(或稱為模式)的過程,這種知識是以自然或者人工形式創(chuàng)造的新知識。

當(dāng)前的數(shù)據(jù)挖掘形式,是在20世紀(jì)90年代實踐領(lǐng)域誕生的,是在集成數(shù)據(jù)挖掘算法平臺發(fā)展的支撐下適合商業(yè)分析的一種形式。也許是因為數(shù)據(jù)挖掘源于實踐而非 理論,在其過程的理解上不太引人注意。20世紀(jì)90年代晚期發(fā)展的CRISP-DM,逐漸成為數(shù)據(jù)挖掘過程的一種標(biāo)準(zhǔn)化過程,被越來越多的數(shù)據(jù)挖掘實踐者 成功運用和遵循。

雖然CRISP-DM能夠指導(dǎo)如何實施數(shù)據(jù)挖掘,但是它不能解釋數(shù)據(jù)挖掘是什么或者為什么適合這樣做。在本文中我將闡述我提出數(shù)據(jù)挖掘的九種準(zhǔn)則或“定律”(其中大多數(shù)為實踐者所熟知)以及另外其它一些熟知的解釋。開始從理論上(不僅僅是描述上)來解釋數(shù)據(jù)挖掘過程。

我的目的不是評論CRISP-DM,但CRISP-DM的許多概念對于理解數(shù)據(jù)挖掘是至關(guān)重要的,本文也將依賴于CRISP-DM的常見術(shù)語。CRISP-DM僅僅是論述這個過程的開始。

第一,目標(biāo)律:業(yè)務(wù)目標(biāo)是所有數(shù)據(jù)解決方案的源頭。

它定義了數(shù)據(jù)挖掘的主題:數(shù)據(jù)挖掘關(guān)注解決業(yè)務(wù)業(yè)問題和實現(xiàn)業(yè)務(wù)目標(biāo)。數(shù)據(jù)挖掘主要不是一種技術(shù),而是一個過程,業(yè)務(wù)目標(biāo)是它的的核心。 沒有業(yè)務(wù)目標(biāo),沒有數(shù)據(jù)挖掘(不管這種表述是否清楚)。因此這個準(zhǔn)則也可以說成:數(shù)據(jù)挖掘是業(yè)務(wù)過程。

 第二,知識律:業(yè)務(wù)知識是數(shù)據(jù)挖掘過程每一步的核心。

這里定義了數(shù)據(jù)挖掘過程的一個關(guān)鍵特征。CRISP-DM的一種樸素的解讀是業(yè)務(wù)知識僅僅作用于數(shù)據(jù)挖掘過程開始的目標(biāo)的定義與最后的結(jié)果的實施,這將錯過數(shù)據(jù)挖掘過程的一個關(guān)鍵屬性,即業(yè)務(wù)知識是每一步的核心。

為了方便理解,我使用CRISP-DM階段來說明:

·             商業(yè)理解必須基于業(yè)務(wù)知識,所以數(shù)據(jù)挖掘目標(biāo)必須是業(yè)務(wù)目標(biāo)的映射(這種映射也基于數(shù)據(jù)知識和數(shù)據(jù)挖掘知識);

·             數(shù)據(jù)理解使用業(yè)務(wù)知識理解與業(yè)務(wù)問題相關(guān)的數(shù)據(jù),以及它們是如何相關(guān)的;

·             數(shù)據(jù)預(yù)處理就是利用業(yè)務(wù)知識來塑造數(shù)據(jù),使得業(yè)務(wù)問題可以被提出和解答(更詳盡的第三條—準(zhǔn)備律);

·             建模是使用數(shù)據(jù)挖掘算法創(chuàng)建預(yù)測模型,同時解釋模型和業(yè)務(wù)目標(biāo)的特點,也就是說理解它們之間的業(yè)務(wù)相關(guān)性;

·             評估是模型對理解業(yè)務(wù)的影響;

·             實施是將數(shù)據(jù)挖掘結(jié)果作用于業(yè)務(wù)過程;

總之,沒有業(yè)務(wù)知識,數(shù)據(jù)挖掘過程的每一步都是無效的,也沒有“純粹的技術(shù)”步驟。 業(yè)務(wù)知識指導(dǎo)過程產(chǎn)生有益的結(jié)果,并使得那些有益的結(jié)果得到認(rèn)可。數(shù)據(jù)挖掘是一個反復(fù)的過程,業(yè)務(wù)知識是它的核心,驅(qū)動著結(jié)果的持續(xù)改善。

這背后的原因可以用“鴻溝的表現(xiàn)”(chasm of representation)來解釋(Alan Montgomery在20世紀(jì)90年代對數(shù)據(jù)挖掘提出的一個觀點)。Montgomery指出數(shù)據(jù)挖掘目標(biāo)涉及到現(xiàn)實的業(yè)務(wù),然而數(shù)據(jù)僅能表示現(xiàn)實的一 部分;數(shù)據(jù)和現(xiàn)實世界是有差距(或“鴻溝”)的。在數(shù)據(jù)挖掘過程中,業(yè)務(wù)知識來彌補這一差距,在數(shù)據(jù)中無論發(fā)現(xiàn)什么,只有使用業(yè)務(wù)知識解釋才能顯示其重要 性,數(shù)據(jù)中的任何遺漏必須通過業(yè)務(wù)知識彌補。只有業(yè)務(wù)知識才能彌補這種缺失,這是業(yè)務(wù)知識為什么是數(shù)據(jù)挖掘過程每一步驟的核心的原因。

 第三,準(zhǔn)備律:數(shù)據(jù)預(yù)處理比數(shù)據(jù)挖掘其他任何一個過程都重要。

這是數(shù)據(jù)挖掘著名的格言,數(shù)據(jù)挖掘項目中最費力的事是數(shù)據(jù)獲取和預(yù)處理。非正式估計,其占用項目的時間為50%-80%。最簡單的解釋可以概括為“數(shù)據(jù)是困 難的”,經(jīng)常采用自動化減輕這個“問題”的數(shù)據(jù)獲取、數(shù)據(jù)清理、數(shù)據(jù)轉(zhuǎn)換等數(shù)據(jù)預(yù)處理各部分的工作量。雖然自動化技術(shù)是有益的,支持者相信這項技術(shù)可以減 少數(shù)據(jù)預(yù)處理過程中的大量的工作量,但這也是誤解數(shù)據(jù)預(yù)處理在數(shù)據(jù)挖掘過程中是必須的原因。

數(shù)據(jù)預(yù)處理的目的是把數(shù)據(jù)挖掘問題轉(zhuǎn)化為格式化的數(shù)據(jù),使得分析技術(shù)(如數(shù)據(jù)挖掘算法)更容易利用它。數(shù)據(jù)任何形式的變化(包括清理、最大最小值轉(zhuǎn)換、增長 等)意味著問題空間的變化,因此這種分析必須是探索性的。 這是數(shù)據(jù)預(yù)處理重要的原因,并且在數(shù)據(jù)挖掘過程中占有如此大的工作量,這樣數(shù)據(jù)挖掘者可以從容 地操縱問題空間,使得容易找到適合分析他們的方法。

有兩種方法“塑造”這個問題 空間。第一種方法是將數(shù)據(jù)轉(zhuǎn)化為可以分析的完全格式化的數(shù)據(jù),比如,大多數(shù)數(shù)據(jù)挖掘算法需要單一表格形式的數(shù)據(jù),一個記錄就是一個樣例。數(shù)據(jù)挖掘者都知道 什么樣的算法需要什么樣的數(shù)據(jù)形式,因此可以將數(shù)據(jù)轉(zhuǎn)化為一個合適的格式。第二種方法是使得數(shù)據(jù)能夠含有業(yè)務(wù)問題的更多的信息,例如,某些領(lǐng)域的一些數(shù)據(jù) 挖掘問題,數(shù)據(jù)挖掘者可以通過業(yè)務(wù)知識和數(shù)據(jù)知識知道這些。 通過這些領(lǐng)域的知識,數(shù)據(jù)挖掘者通過操縱問題空間可能更容易找到一個合適的技術(shù)解決方案。

因此,通過業(yè)務(wù)知識、數(shù)據(jù)知識、數(shù)據(jù)挖掘知識從根本上使得數(shù)據(jù)預(yù)處理更加得心應(yīng)手。 數(shù)據(jù)預(yù)處理的這些方面并不能通過簡單的自動化實現(xiàn)。

這個定律也解釋了一個有疑義的現(xiàn)象,也就是雖然經(jīng)過數(shù)據(jù)獲取、清理、融合等方式創(chuàng)建一個數(shù)據(jù)倉庫,但是數(shù)據(jù)預(yù)處理仍然是必不可少的,仍然占有數(shù)據(jù)挖掘過程一 半以上的工作量。此外,就像CRISP-DM展示的那樣,即使經(jīng)過了主要的數(shù)據(jù)預(yù)處理階段,在創(chuàng)建一個有用的模型的反復(fù)過程中,進(jìn)一步的數(shù)據(jù)預(yù)處理的必要 的。

第四,試驗律(NFL律:No Free Lunch):對于數(shù)據(jù)挖掘者來說,天下沒有免費的午餐,一個正確的模型只有通過試驗(experiment)才能被發(fā)現(xiàn)。

機器學(xué)習(xí)有一個原則:如果我們充分了解一個問題空間(problem space),我們可以選擇或設(shè)計一個找到最優(yōu)方案的最有效的算法。一個卓越算法的參數(shù)依賴于數(shù)據(jù)挖掘問題空間一組特定的屬性集,這些屬性可以通過分析發(fā) 現(xiàn)或者算法創(chuàng)建。但是,這種觀點來自于一個錯誤的思想,在數(shù)據(jù)挖掘過程中數(shù)據(jù)挖掘者將問題公式化,然后利用算法找到解決方法。事實上,數(shù)據(jù)挖掘者將問題公 式化和尋找解決方法是同時進(jìn)行的—–算法僅僅是幫助數(shù)據(jù)挖掘者的一個工具。

有五種因素說明試驗對于尋找數(shù)據(jù)挖掘解決方案是必要的: 

·             數(shù)據(jù)挖掘項目的業(yè)務(wù)目標(biāo)定義了興趣范圍(定義域),數(shù)據(jù)挖掘目標(biāo)反映了這一點;

·             與業(yè)務(wù)目標(biāo)相關(guān)的數(shù)據(jù)及其相應(yīng)的數(shù)據(jù)挖掘目標(biāo)是在這個定義域上的數(shù)據(jù)挖掘過程產(chǎn)生的;

·             這些過程受規(guī)則限制,而這些過程產(chǎn)生的數(shù)據(jù)反映了這些規(guī)則;

·             在這些過程中,數(shù)據(jù)挖掘的目的是通過模式發(fā)現(xiàn)技術(shù)(數(shù)據(jù)挖掘算法)和可以解釋這個算法結(jié)果的業(yè)務(wù)知識相結(jié)合的方法來揭示這個定義域上的規(guī)則;

·             數(shù)據(jù)挖掘需要在這個域上生成相關(guān)數(shù)據(jù),這些數(shù)據(jù)含有的模式不可避免地受到這些規(guī)則的限制。

在這里強調(diào)一下最后一點,在數(shù)據(jù)挖掘中改變業(yè)務(wù)目標(biāo),CRISP-DM有所暗示,但經(jīng)常不易被覺察到。廣為所知的CRISP-DM過程不是下一個步驟僅接著上一個步驟的“瀑布”式的過程。事實上,在項目中的任何地方都可以進(jìn)行任何CRISP-DM步驟,同樣商業(yè)理解也可以存在于任何一個步驟。業(yè)務(wù)目標(biāo)不是簡 單地在開始就給定,它貫穿于整個過程。這也許可以解釋一些數(shù)據(jù)挖掘者在沒有清晰的業(yè)務(wù)目標(biāo)的情況下開始項目,他們知道業(yè)務(wù)目標(biāo)也是數(shù)據(jù)挖掘的一個結(jié)果,不是靜態(tài)地給定。

Wolpert的“沒有免費的午餐”理論已經(jīng)應(yīng)用于機器學(xué)習(xí)領(lǐng)域,無偏的狀態(tài)好于(如一個具體的算法)任何其他可能的問題(數(shù)據(jù)集)出現(xiàn)的平均狀態(tài)。這是因為,如果我們考慮所有可能的問題,他們的解決方法是均勻分布的,以至于一個算法(或偏倚)對一個子集是有利的,而對另一個子集是不利的。這與數(shù)據(jù)挖掘者所知的具有驚人的相似性,沒有一個算法適合每一個問題。但是經(jīng) 過數(shù)據(jù)挖掘處理的問題或數(shù)據(jù)集絕不是隨機的,也不是所有可能問題的均勻分布,他們代表的是一個有偏差的樣本,那么為什么要應(yīng)用NFL的結(jié)論?答案涉及到上 面提到的因素:問題空間初始是未知的,多重問題空間可能和每一個數(shù)據(jù)挖掘目標(biāo)相關(guān),問題空間可能被數(shù)據(jù)預(yù)處理所操縱,模型不能通過技術(shù)手段評估,業(yè)務(wù)問題本身可能會變化。由于這些原因,數(shù)據(jù)挖掘問題空間在數(shù)據(jù)挖掘過程中展開,并且在這個過程中是不斷變化的,以至于在有條件的約束下,用算法模擬一個隨機選擇的數(shù)據(jù)集是有效的。對于數(shù)據(jù)挖掘者來說:沒有免費的午餐。

這大體上描述了數(shù)據(jù) 挖掘過程。但是,在有條件限制某些情況下,比如業(yè)務(wù)目標(biāo)是穩(wěn)定的,數(shù)據(jù)和其預(yù)處理是穩(wěn)定的,一個可接受的算法或算法組合可以解決這個問題。在這些情況下, 一般的數(shù)據(jù)挖掘過程中的步驟將會減少。 但是,如果這種情況穩(wěn)定是持續(xù)的,數(shù)據(jù)挖掘者的午餐是免費的,或者至少相對便宜的。像這樣的穩(wěn)定性是臨時的,因為 對數(shù)據(jù)的業(yè)務(wù)理解(第二律)和對問題的理解(第九律)都會變化的。

數(shù)據(jù)分析咨詢請掃描二維碼

若不方便掃碼,搜微信號:CDAshujufenxi

數(shù)據(jù)分析師資訊
更多

OK
客服在線
立即咨詢
客服在線
立即咨詢
') } function initGt() { var handler = function (captchaObj) { captchaObj.appendTo('#captcha'); captchaObj.onReady(function () { $("#wait").hide(); }).onSuccess(function(){ $('.getcheckcode').removeClass('dis'); $('.getcheckcode').trigger('click'); }); window.captchaObj = captchaObj; }; $('#captcha').show(); $.ajax({ url: "/login/gtstart?t=" + (new Date()).getTime(), // 加隨機數(shù)防止緩存 type: "get", dataType: "json", success: function (data) { $('#text').hide(); $('#wait').show(); // 調(diào)用 initGeetest 進(jìn)行初始化 // 參數(shù)1:配置參數(shù) // 參數(shù)2:回調(diào),回調(diào)的第一個參數(shù)驗證碼對象,之后可以使用它調(diào)用相應(yīng)的接口 initGeetest({ // 以下 4 個配置參數(shù)為必須,不能缺少 gt: data.gt, challenge: data.challenge, offline: !data.success, // 表示用戶后臺檢測極驗服務(wù)器是否宕機 new_captcha: data.new_captcha, // 用于宕機時表示是新驗證碼的宕機 product: "float", // 產(chǎn)品形式,包括:float,popup width: "280px", https: true // 更多配置參數(shù)說明請參見:http://docs.geetest.com/install/client/web-front/ }, handler); } }); } function codeCutdown() { if(_wait == 0){ //倒計時完成 $(".getcheckcode").removeClass('dis').html("重新獲取"); }else{ $(".getcheckcode").addClass('dis').html("重新獲取("+_wait+"s)"); _wait--; setTimeout(function () { codeCutdown(); },1000); } } function inputValidate(ele,telInput) { var oInput = ele; var inputVal = oInput.val(); var oType = ele.attr('data-type'); var oEtag = $('#etag').val(); var oErr = oInput.closest('.form_box').next('.err_txt'); var empTxt = '請輸入'+oInput.attr('placeholder')+'!'; var errTxt = '請輸入正確的'+oInput.attr('placeholder')+'!'; var pattern; if(inputVal==""){ if(!telInput){ errFun(oErr,empTxt); } return false; }else { switch (oType){ case 'login_mobile': pattern = /^1[3456789]\d{9}$/; if(inputVal.length==11) { $.ajax({ url: '/login/checkmobile', type: "post", dataType: "json", data: { mobile: inputVal, etag: oEtag, page_ur: window.location.href, page_referer: document.referrer }, success: function (data) { } }); } break; case 'login_yzm': pattern = /^\d{6}$/; break; } if(oType=='login_mobile'){ } if(!!validateFun(pattern,inputVal)){ errFun(oErr,'') if(telInput){ $('.getcheckcode').removeClass('dis'); } }else { if(!telInput) { errFun(oErr, errTxt); }else { $('.getcheckcode').addClass('dis'); } return false; } } return true; } function errFun(obj,msg) { obj.html(msg); if(msg==''){ $('.login_submit').removeClass('dis'); }else { $('.login_submit').addClass('dis'); } } function validateFun(pat,val) { return pat.test(val); }