99999久久久久久亚洲,欧美人与禽猛交狂配,高清日韩av在线影院,一个人在线高清免费观看,啦啦啦在线视频免费观看www

熱線電話:13121318867

登錄
首頁(yè)精彩閱讀做好數(shù)據(jù)挖掘模型,有什么好的經(jīng)驗(yàn)推薦?
做好數(shù)據(jù)挖掘模型,有什么好的經(jīng)驗(yàn)推薦?
2016-05-27
收藏

做好數(shù)據(jù)挖掘模型,有什么好的經(jīng)驗(yàn)推薦?

數(shù)據(jù)挖掘是利用業(yè)務(wù)知識(shí)從數(shù)據(jù)中發(fā)現(xiàn)和解釋知識(shí)(或稱為模式)的過(guò)程,這種知識(shí)是以自然或者人工形式創(chuàng)造的新知識(shí)。
第一,目標(biāo)律:業(yè)務(wù)目標(biāo)是所有數(shù)據(jù)解決方案的源頭。

它定義了數(shù)據(jù)挖掘的主題:數(shù)據(jù)挖掘關(guān)注解決業(yè)務(wù)業(yè)問(wèn)題和實(shí)現(xiàn)業(yè)務(wù)目標(biāo)。數(shù)據(jù)挖掘主要不是一種技術(shù),而是一個(gè)過(guò)程,業(yè)務(wù)目標(biāo)是它的的核心。 沒(méi)有業(yè)務(wù)目標(biāo),沒(méi)有數(shù)據(jù)挖掘(不管這種表述是否清楚)。因此這個(gè)準(zhǔn)則也可以說(shuō)成:數(shù)據(jù)挖掘是業(yè)務(wù)過(guò)程。

第二,知識(shí)律:業(yè)務(wù)知識(shí)是數(shù)據(jù)挖掘過(guò)程每一步的核心。

這里定義了數(shù)據(jù)挖掘過(guò)程的一個(gè)關(guān)鍵特征。CRISP-DM的一種樸素的解讀是業(yè)務(wù)知識(shí)僅僅作用于數(shù)據(jù)挖掘過(guò)程開(kāi)始的目標(biāo)的定義與最后的結(jié)果的實(shí)施,這將錯(cuò)過(guò)數(shù)據(jù)挖掘過(guò)程的一個(gè)關(guān)鍵屬性,即業(yè)務(wù)知識(shí)是每一步的核心。

第三,準(zhǔn)備律:數(shù)據(jù)預(yù)處理比數(shù)據(jù)挖掘其他任何一個(gè)過(guò)程都重要。

這是數(shù)據(jù)挖掘著名的格言,數(shù)據(jù)挖掘項(xiàng)目中最費(fèi)力的事是數(shù)據(jù)獲取和預(yù)處理。非正式估計(jì),其占用項(xiàng)目的時(shí)間為50%-80%。最簡(jiǎn)單的解釋可以概括為“數(shù)據(jù)是困難的”,經(jīng)常采用自動(dòng)化減輕這個(gè)“問(wèn)題”的數(shù)據(jù)獲取、數(shù)據(jù)清理、數(shù)據(jù)轉(zhuǎn)換等數(shù)據(jù)預(yù)處理各部分的工作量。雖然自動(dòng)化技術(shù)是有益的,支持者相信這項(xiàng)技術(shù)可以減少數(shù)據(jù)預(yù)處理過(guò)程中的大量的工作量,但這也是誤解數(shù)據(jù)預(yù)處理在數(shù)據(jù)挖掘過(guò)程中是必須的原因。

數(shù)據(jù)預(yù)處理的目的是把數(shù)據(jù)挖掘問(wèn)題轉(zhuǎn)化為格式化的數(shù)據(jù),使得分析技術(shù)(如數(shù)據(jù)挖掘算法)更容易利用它。數(shù)據(jù)任何形式的變化(包括清理、最大最小值轉(zhuǎn)換、增長(zhǎng)等)意味著問(wèn)題空間的變化,因此這種分析必須是探索性的。 這是數(shù)據(jù)預(yù)處理重要的原因,并且在數(shù)據(jù)挖掘過(guò)程中占有如此大的工作量,這樣數(shù)據(jù)挖掘者可以從容地操縱問(wèn)題空間,使得容易找到適合分析他們的方法。

有兩種方法“塑造”這個(gè)問(wèn)題 空間。第一種方法是將數(shù)據(jù)轉(zhuǎn)化為可以分析的完全格式化的數(shù)據(jù),比如,大多數(shù)數(shù)據(jù)挖掘算法需要單一表格形式的數(shù)據(jù),一個(gè)記錄就是一個(gè)樣例。數(shù)據(jù)挖掘者都知道什么樣的算法需要什么樣的數(shù)據(jù)形式,因此可以將數(shù)據(jù)轉(zhuǎn)化為一個(gè)合適的格式。第二種方法是使得數(shù)據(jù)能夠含有業(yè)務(wù)問(wèn)題的更多的信息,例如,某些領(lǐng)域的一些數(shù)據(jù)挖掘問(wèn)題,數(shù)據(jù)挖掘者可以通過(guò)業(yè)務(wù)知識(shí)和數(shù)據(jù)知識(shí)知道這些。 通過(guò)這些領(lǐng)域的知識(shí),數(shù)據(jù)挖掘者通過(guò)操縱問(wèn)題空間可能更容易找到一個(gè)合適的技術(shù)解決方案。

因此,通過(guò)業(yè)務(wù)知識(shí)、數(shù)據(jù)知識(shí)、數(shù)據(jù)挖掘知識(shí)從根本上使得數(shù)據(jù)預(yù)處理更加得心應(yīng)手。 數(shù)據(jù)預(yù)處理的這些方面并不能通過(guò)簡(jiǎn)單的自動(dòng)化實(shí)現(xiàn)。

這個(gè)定律也解釋了一個(gè)有疑義的現(xiàn)象,也就是雖然經(jīng)過(guò)數(shù)據(jù)獲取、清理、融合等方式創(chuàng)建一個(gè)數(shù)據(jù)倉(cāng)庫(kù),但是數(shù)據(jù)預(yù)處理仍然是必不可少的,仍然占有數(shù)據(jù)挖掘過(guò)程一半以上的工作量。此外,就像CRISP-DM展示的那樣,即使經(jīng)過(guò)了主要的數(shù)據(jù)預(yù)處理階段,在創(chuàng)建一個(gè)有用的模型的反復(fù)過(guò)程中,進(jìn)一步的數(shù)據(jù)預(yù)處理的必要的。

第四,試驗(yàn)律(NFL律:No Free Lunch):對(duì)于數(shù)據(jù)挖掘者來(lái)說(shuō),天下沒(méi)有免費(fèi)的午餐,一個(gè)正確的模型只有通過(guò)試驗(yàn)(experiment)才能被發(fā)現(xiàn)。

機(jī)器學(xué)習(xí)有一個(gè)原則:如果我們充分了解一個(gè)問(wèn)題空間(problem space),我們可以選擇或設(shè)計(jì)一個(gè)找到最優(yōu)方案的最有效的算法。一個(gè)卓越算法的參數(shù)依賴于數(shù)據(jù)挖掘問(wèn)題空間一組特定的屬性集,這些屬性可以通過(guò)分析發(fā) 現(xiàn)或者算法創(chuàng)建。但是,這種觀點(diǎn)來(lái)自于一個(gè)錯(cuò)誤的思想,在數(shù)據(jù)挖掘過(guò)程中數(shù)據(jù)挖掘者將問(wèn)題公式化,然后利用算法找到解決方法。事實(shí)上,數(shù)據(jù)挖掘者將問(wèn)題公式化和尋找解決方法是同時(shí)進(jìn)行的—–算法僅僅是幫助數(shù)據(jù)挖掘者的一個(gè)工具。

第五,模式律(大衛(wèi)律):數(shù)據(jù)中總含有模式。

這條規(guī)律最早由David Watkins提出。 我們可能預(yù)料到一些數(shù)據(jù)挖掘項(xiàng)目會(huì)失敗,因?yàn)榻鉀Q業(yè)務(wù)問(wèn)題的模式并不存在于數(shù)據(jù)中,但是這與數(shù)據(jù)挖掘者的實(shí)踐經(jīng)驗(yàn)并不相關(guān)。

前文的闡述已經(jīng)提到,這是因?yàn)椋涸谝粋€(gè)與業(yè)務(wù)相關(guān)的數(shù)據(jù)集中總會(huì)發(fā)現(xiàn)一些有趣的東西,以至于即使一些期望的模式不能被發(fā)現(xiàn),但其他的一些有用的東西可能會(huì)被發(fā)現(xiàn)(這與數(shù)據(jù)挖掘者的實(shí)踐經(jīng)驗(yàn)是相關(guān)的);除非業(yè)務(wù)專家期望的模式存在,否則數(shù)據(jù)挖掘項(xiàng)目不會(huì)進(jìn)行,這不應(yīng)感到奇怪,因?yàn)闃I(yè)務(wù)專家通常是對(duì)的。

然而,Watkins提出一個(gè)更簡(jiǎn)單更直接的觀點(diǎn):“數(shù)據(jù)中總含有模式。”這與數(shù)據(jù)挖掘者的經(jīng)驗(yàn)比前面的闡述更一致。這個(gè)觀點(diǎn)后來(lái)經(jīng)過(guò)Watkins修正,基于客戶關(guān)系的數(shù)據(jù)挖掘項(xiàng)目,總是存在著這樣的模式即客戶未來(lái)的行為總是和先前的行為相關(guān),顯然這些模式是有利可圖的(Watkins的客戶關(guān)系管理定律)。但是,數(shù)據(jù)挖掘者的經(jīng)驗(yàn)不僅僅局限于客戶關(guān)系管理問(wèn)題,任何數(shù)據(jù)挖掘問(wèn)題都會(huì)存在模式(Watkins的通用律)。

第六,洞察律:數(shù)據(jù)挖掘增大對(duì)業(yè)務(wù)的認(rèn)知。

數(shù)據(jù)挖掘是如何產(chǎn)生洞察力的?這個(gè)定律接近了數(shù)據(jù)挖掘的核心:為什么數(shù)據(jù)挖掘必須是一個(gè)業(yè)務(wù)過(guò)程而不是一個(gè)技術(shù)過(guò)程。業(yè)務(wù)問(wèn)題是由人而非算法解決的。數(shù)據(jù)挖掘者和業(yè)務(wù)專家從問(wèn)題中找到解決方案,即從問(wèn)題的定義域上達(dá)到業(yè)務(wù)目標(biāo)需要的模式。數(shù)據(jù)挖掘完全或部分有助于這個(gè)認(rèn)知過(guò)程。數(shù)據(jù)挖掘算法揭示的模式通常不是人類以正常的方式所能認(rèn)識(shí)到的。綜合這些算法和人類正常的感知的數(shù)據(jù)挖掘過(guò)程在本質(zhì)上是敏捷的。在數(shù)據(jù)挖掘過(guò)程中,問(wèn)題解決者解釋數(shù)據(jù)挖掘算法產(chǎn)生的結(jié)果,并統(tǒng)一到業(yè)務(wù)理解上,因此這是一個(gè)業(yè)務(wù)過(guò)程。

這類似于“智能放大器”的概念,在早期的人工智能的領(lǐng)域,AI的第一個(gè)實(shí)際成果不是智能機(jī)器,而是被稱為“智能放大器”的工具,它能夠協(xié)助人類使用者提高獲取有效信息的能力。數(shù)據(jù)挖掘提供一個(gè)類似的“智能放大器”,幫助業(yè)務(wù)專家解決他們不能單獨(dú)完成的業(yè)務(wù)問(wèn)題。

總之,數(shù)據(jù)挖掘算法提供一種超越人類以正常方式探索模式的能力,數(shù)據(jù)挖掘過(guò)程允許數(shù)據(jù)挖掘者和業(yè)務(wù)專家將這種能力融合在他們的各自的問(wèn)題的中和業(yè)務(wù)過(guò)程中。

第七,預(yù)測(cè)律:預(yù)測(cè)提高了信息泛化能力

“預(yù)測(cè)”已經(jīng)成為數(shù)據(jù)挖掘模型可以做什么的可接受的描述,即我們常說(shuō)的“預(yù)測(cè)模型”和“預(yù)測(cè)分析”。這是因?yàn)樵S多流行的數(shù)據(jù)挖掘模型經(jīng)常使用“預(yù)測(cè)最可能的結(jié)果”(或者解釋可能的結(jié)果如何有可能)。這種方法是分類和回歸模型的典型應(yīng)用。

但是,其他類型的數(shù)據(jù)挖掘模型,比如聚類和關(guān)聯(lián)模型也有“預(yù)測(cè)”的特征。這是一個(gè)含義比較模糊的術(shù)語(yǔ)。一個(gè)聚類模型被描述為“預(yù)測(cè)”一個(gè)個(gè)體屬于哪個(gè)群體,一個(gè)關(guān)聯(lián)模型可能被描述為基于已知基本屬性“預(yù)測(cè)”一個(gè)或更多屬性。

同樣我們也可以分析“預(yù)測(cè)”這個(gè)術(shù)語(yǔ)在不同的主題中的應(yīng)用:一個(gè)分類模型可能被說(shuō)成可以預(yù)測(cè)客戶行為—-更加確切的說(shuō)它可以預(yù)測(cè)以某種確定行為的目標(biāo)客戶,即使不是所有的目標(biāo)個(gè)體的行為都符合“預(yù)測(cè)”的結(jié)果。一個(gè)詐騙檢測(cè)模型可能被說(shuō)成可以預(yù)測(cè)個(gè)別交易是否具有高風(fēng)險(xiǎn)性,即使不是所有的預(yù)測(cè)的交易都有欺詐行為。

“預(yù)測(cè)”這個(gè)術(shù)語(yǔ)廣泛的使用導(dǎo)致了所謂的“預(yù)測(cè)分析”被作為數(shù)據(jù)挖掘的總稱,并且在業(yè)務(wù)解決方案中得到了廣泛的應(yīng)用。但是我們應(yīng)該意識(shí)到這不是日常所說(shuō)的“預(yù)測(cè)”,我們不能期望預(yù)測(cè)一個(gè)特殊個(gè)體的行為或者一個(gè)特別的欺詐調(diào)查結(jié)果。

那么,在這個(gè)意義下的“預(yù)測(cè)”是什么?分類、回歸、聚類和 關(guān) 聯(lián)算法以及他們集成模型有什么共性呢?答案在于“評(píng)分”,這是預(yù)測(cè)模型應(yīng)用到一個(gè)新樣例的方式。模型產(chǎn)生一個(gè)預(yù)估值或評(píng)分,這是這個(gè)樣例的新信息的一部 分;在概括和歸納的基礎(chǔ)上,這個(gè)樣例的可利用信息得到了提高,模式被算法發(fā)現(xiàn)和模型具體化。值得注意的是這個(gè)新信息不是在“給定”意義上的“數(shù)據(jù)”,它僅有統(tǒng)計(jì)學(xué)意義。

第八,價(jià)值律:數(shù)據(jù)挖掘的結(jié)果的價(jià)值不取決于模型的穩(wěn)定性或預(yù)測(cè)的準(zhǔn)確性。

準(zhǔn)確性和穩(wěn)定性是預(yù)測(cè)模型常用的兩個(gè)度量。準(zhǔn)確性是指正確的預(yù)測(cè)結(jié)果所占的比例;穩(wěn)定性是指當(dāng)創(chuàng)建模型的數(shù)據(jù)改變時(shí),用于同一口徑的預(yù)測(cè)數(shù)據(jù),其預(yù)測(cè)結(jié)果變化有多大(或多?。?。鑒于數(shù)據(jù)挖掘中預(yù)測(cè)概念的核心角色,一個(gè)預(yù)測(cè)模型的準(zhǔn)確性和穩(wěn)定性常被認(rèn)為決定了其結(jié)果的價(jià)值的大小,實(shí)際上并非如此。

體現(xiàn)預(yù)測(cè)模型價(jià)值的有兩種方式:一種是用模型的預(yù)測(cè)結(jié)果來(lái)改善或影響行為,另一種是模型能夠傳遞導(dǎo)致改變策略的見(jiàn)解(或新知識(shí))。

對(duì)于后者,傳遞出的任何新知識(shí)的價(jià)值和準(zhǔn)確性的聯(lián)系并不那么緊密;一些模型的預(yù)測(cè)能力可能有必要使我們相信發(fā)現(xiàn)的模式是真實(shí)的。然而,一個(gè)難以理解的復(fù)雜的 或者完全不透明的模型的預(yù)測(cè)結(jié)果具有高準(zhǔn)確性,但傳遞的知識(shí)也不是那么有見(jiàn)地;然而,一個(gè)簡(jiǎn)單的低準(zhǔn)確度的模型可能傳遞出更有用的見(jiàn)解。

準(zhǔn)確性和價(jià)值之間的分離在改善行為的情況下并不明顯,然而一個(gè)突出問(wèn)題是“預(yù)測(cè)模型是為了正確的事,還是為了正確的原因?” 換句話說(shuō),一個(gè)模型的價(jià)值和它的預(yù)測(cè)準(zhǔn)確度一樣,都源自它的業(yè)務(wù)問(wèn)題。例如,客戶流失模型可能需要高的預(yù)測(cè)準(zhǔn)確度,否則對(duì)于業(yè)務(wù)上的指導(dǎo)不會(huì)那么有效。相反的是一個(gè)準(zhǔn)確度高的客戶流失模型可能提供有效的指導(dǎo),保留住老客戶,但也僅僅是最少利潤(rùn)客戶群體的一部分。如果不適合業(yè)務(wù)問(wèn)題,高準(zhǔn)確度并不能提高模型的價(jià)值。

模型穩(wěn)定性同樣如此,雖然穩(wěn)定性是預(yù)測(cè)模型的有趣的度量,穩(wěn)定性不能代替模型提供業(yè)務(wù)理解的能力或解決業(yè)務(wù)問(wèn)題,其它技術(shù)手段也是如此。

總之,預(yù)測(cè)模型的價(jià)值不是由技術(shù)指標(biāo)決定的。數(shù)據(jù)挖掘者應(yīng)該在模型不損害業(yè)務(wù)理解和適應(yīng)業(yè)務(wù)問(wèn)題的情況下關(guān)注預(yù)測(cè)準(zhǔn)確度、模型穩(wěn)定性以及其它的技術(shù)度量。

第九,變化律:所有的模式因業(yè)務(wù)變化而變化。

數(shù)據(jù)挖掘發(fā)現(xiàn)的模式不是永遠(yuǎn)不變的。數(shù)據(jù)挖掘的許多應(yīng)用是眾所周知的,但是這個(gè)性質(zhì)的普遍性沒(méi)有得到廣泛的重視。

數(shù)據(jù)挖掘在市場(chǎng)營(yíng)銷和CRM方面的應(yīng)用很容易理解,客戶行為模式隨著時(shí)間的變化而變化。行為的變化、市場(chǎng)的變化、競(jìng)爭(zhēng)的變化以及整個(gè)經(jīng)濟(jì)形勢(shì)的變化,預(yù)測(cè)模型會(huì)因這些變化而過(guò)時(shí),當(dāng)他們不能準(zhǔn)確預(yù)測(cè)時(shí),應(yīng)當(dāng)定期更新。

數(shù)據(jù)挖掘在欺詐模型和風(fēng)險(xiǎn)模型的應(yīng)用中同樣如此,隨著環(huán)境的變化欺詐行為也在變化,因?yàn)樽锓敢淖冃袨橐员3诸I(lǐng)先于反欺詐。欺詐檢測(cè)的應(yīng)用必須設(shè)計(jì)為就像處理舊的、熟悉的欺詐行為一樣能夠處理新的、未知類型的欺詐行為。

某些種類的數(shù)據(jù)挖掘可能被認(rèn)為發(fā)現(xiàn)的模式不會(huì)隨時(shí)間而變化,比如數(shù)據(jù)挖掘在科學(xué)上的應(yīng)用,我們有沒(méi)有發(fā)現(xiàn)不變的普遍的規(guī)律?也許令人驚奇的是,答案是即使是這些模式也期望得到改變。理由是這些模式并不是簡(jiǎn)單的存在于這個(gè)世界上的規(guī)則,而是數(shù)據(jù)的反應(yīng)—-這些規(guī)則可能在某些領(lǐng)域確實(shí)是靜態(tài)的。

然而,數(shù)據(jù)挖掘發(fā)現(xiàn)的模式是認(rèn)知過(guò)程的一部分,是數(shù)據(jù)挖掘在數(shù)據(jù)描述的世界與觀測(cè)者或業(yè)務(wù)專家的認(rèn)知之間建立的一個(gè)動(dòng)態(tài)過(guò)程。因?yàn)槲覀兊恼J(rèn)知在持續(xù)發(fā)展和增長(zhǎng),所以我們也期望模式也會(huì)變化。明天的數(shù)據(jù)表面上看起來(lái)相似,但是它可能已經(jīng)集合了不同的模式、(可能巧妙地)不同的目的、不同的語(yǔ)義;分析過(guò)程因受業(yè)務(wù)知識(shí)驅(qū)動(dòng),所以會(huì)隨著業(yè)務(wù)知識(shí)的變化而變化?;谶@些原因,模式會(huì)有所不同。


數(shù)據(jù)分析咨詢請(qǐng)掃描二維碼

若不方便掃碼,搜微信號(hào):CDAshujufenxi

數(shù)據(jù)分析師資訊
更多

OK
客服在線
立即咨詢
客服在線
立即咨詢
') } function initGt() { var handler = function (captchaObj) { captchaObj.appendTo('#captcha'); captchaObj.onReady(function () { $("#wait").hide(); }).onSuccess(function(){ $('.getcheckcode').removeClass('dis'); $('.getcheckcode').trigger('click'); }); window.captchaObj = captchaObj; }; $('#captcha').show(); $.ajax({ url: "/login/gtstart?t=" + (new Date()).getTime(), // 加隨機(jī)數(shù)防止緩存 type: "get", dataType: "json", success: function (data) { $('#text').hide(); $('#wait').show(); // 調(diào)用 initGeetest 進(jìn)行初始化 // 參數(shù)1:配置參數(shù) // 參數(shù)2:回調(diào),回調(diào)的第一個(gè)參數(shù)驗(yàn)證碼對(duì)象,之后可以使用它調(diào)用相應(yīng)的接口 initGeetest({ // 以下 4 個(gè)配置參數(shù)為必須,不能缺少 gt: data.gt, challenge: data.challenge, offline: !data.success, // 表示用戶后臺(tái)檢測(cè)極驗(yàn)服務(wù)器是否宕機(jī) new_captcha: data.new_captcha, // 用于宕機(jī)時(shí)表示是新驗(yàn)證碼的宕機(jī) product: "float", // 產(chǎn)品形式,包括:float,popup width: "280px", https: true // 更多配置參數(shù)說(shuō)明請(qǐng)參見(jiàn):http://docs.geetest.com/install/client/web-front/ }, handler); } }); } function codeCutdown() { if(_wait == 0){ //倒計(jì)時(shí)完成 $(".getcheckcode").removeClass('dis').html("重新獲取"); }else{ $(".getcheckcode").addClass('dis').html("重新獲取("+_wait+"s)"); _wait--; setTimeout(function () { codeCutdown(); },1000); } } function inputValidate(ele,telInput) { var oInput = ele; var inputVal = oInput.val(); var oType = ele.attr('data-type'); var oEtag = $('#etag').val(); var oErr = oInput.closest('.form_box').next('.err_txt'); var empTxt = '請(qǐng)輸入'+oInput.attr('placeholder')+'!'; var errTxt = '請(qǐng)輸入正確的'+oInput.attr('placeholder')+'!'; var pattern; if(inputVal==""){ if(!telInput){ errFun(oErr,empTxt); } return false; }else { switch (oType){ case 'login_mobile': pattern = /^1[3456789]\d{9}$/; if(inputVal.length==11) { $.ajax({ url: '/login/checkmobile', type: "post", dataType: "json", data: { mobile: inputVal, etag: oEtag, page_ur: window.location.href, page_referer: document.referrer }, success: function (data) { } }); } break; case 'login_yzm': pattern = /^\d{6}$/; break; } if(oType=='login_mobile'){ } if(!!validateFun(pattern,inputVal)){ errFun(oErr,'') if(telInput){ $('.getcheckcode').removeClass('dis'); } }else { if(!telInput) { errFun(oErr, errTxt); }else { $('.getcheckcode').addClass('dis'); } return false; } } return true; } function errFun(obj,msg) { obj.html(msg); if(msg==''){ $('.login_submit').removeClass('dis'); }else { $('.login_submit').addClass('dis'); } } function validateFun(pat,val) { return pat.test(val); }