
線性回歸和邏輯回歸通常是人們在數(shù)據(jù)科學中學習的第一種算法。由于它們的受歡迎程度,許多分析師甚至認為它們是唯一的回歸形式。哪兒些稍微有工作經(jīng)驗的人也會認為它們是所有回歸分析形式的中最重要的。
事實是,有無數(shù)種形式的回歸可以使用。每種形式的回歸都有其自身的重要性和最適合應用的特定場景。在本文中,我會以簡單的方式解釋了數(shù)據(jù)科學中最常用的7種回歸形式。通過這篇文章,我也希望人們能夠?qū)貧w的廣度有一個概念,而不是僅僅對他們遇到的每個問題應都用線性/邏輯回歸,并希望他們能夠使用這么多的回歸技術!
如果您是數(shù)據(jù)科學的新手,并且正在尋找一個開始學習的地方,那么“ 數(shù)據(jù)科學 ”課程是一個很好的起點!它涵蓋了Python,統(tǒng)計和預測建模的核心主題,它是你進入數(shù)據(jù)科學的第一步的完美方法。
回歸分析是預測建模技術的一種技術,它研究依賴(目標)和自變量(預測變量)之間的關系。該技術用于預測,時間序列建模和查找變量之間的因果關系。例如,通過回歸可以最好地研究魯莽駕駛與駕駛員發(fā)生道路交通事故數(shù)量之間的關系。
回歸分析是建模和分析數(shù)據(jù)的重要工具。在這里,我們將曲線/直線線擬合到數(shù)據(jù)點,使得數(shù)據(jù)點距曲線或直線的距離之間的差異最小化。我將在接下來的章節(jié)中詳細解釋這一點。
為什么我們使用回歸分析?
如上所述,回歸分析是估計兩個或更多變量之間的關系。讓我們通過一個簡單的例子來理解這一點:
比方說,你想根據(jù)當前的經(jīng)濟狀況估算公司的銷售增長率。您有最近的公司數(shù)據(jù)表明銷售增長約為經(jīng)濟增長的2.5倍。利用這種洞察力,我們可以根據(jù)當前和過去的信息預測公司的未來銷售情況。
使用回歸分析有許多好處。如下:
回歸分析還允許我們比較不同尺度上測量的變量的影響,例如價格變化的影響和促銷活動的數(shù)量。這些優(yōu)勢有助于市場研究人員/數(shù)據(jù)分析師/數(shù)據(jù)科學家消除和評估用于構建預測模型的最佳變量集。
我們有各種各樣的回歸技術可用用于預測。這些技術主要由三個指標(自變量的數(shù)量,因變量的類型和回歸線的形狀)驅(qū)動。我們將在以下部分詳細討論它們。
對于創(chuàng)造性的,如果您覺得需要使用上述參數(shù)的組合,您甚至可以制作新的回歸,以前人們沒有使用過。但在開始之前,讓我們了解最常用的回歸:
它是最廣為人知的建模技術之一。線性回歸通常是人們在學習預測建模時最先選擇的幾個方法之一。在該方法中,因變量是連續(xù)的,自變量可以是連續(xù)的或離散的,并且回歸線的性質(zhì)是線性的。
線性回歸使用最佳擬合直線(也稱為回歸線)在因變量(Y)和一個或多個自變量(X)之間建立關系。
它由方程Y = a + b * X + e表示,其中a是截距,b是直線的斜率,e是誤差項。該等式可以根據(jù)給定的預測變量預測目標變量的值。
簡單線性回歸和多元線性回歸之間的區(qū)別在于,多元線性回歸具有(> 1)個獨立變量,而簡單線性回歸只有1個獨立變量?,F(xiàn)在的問題是“我們?nèi)绾潍@得最佳擬合線?”。
如何獲得最佳擬合線(a和b的值)?
這項任務可以通過最小二乘法輕松完成。它是用于擬合回歸線的最常用方法。它通過最小化每個數(shù)據(jù)點到直線的垂直偏差的平方和來計算觀測數(shù)據(jù)的最佳擬合線。因為偏差首先要平方,所以當相加時,正值和負值之間不會抵消。
我們可以使用度量的R平方來評估模型性能 。
邏輯回歸方法用于查找事件成功的概率和失敗的概率。當因變量本質(zhì)上是二進制(0/1,真/假,是/否)時,我們應該使用邏輯回歸。這里Y值的范圍從0到1,它可以用下面的等式表示。
odds = p /(1-p)=事件發(fā)生概率/非事件發(fā)生概率 ln(賠率)= ln(p /(1-p)) logit(p)= ln(p /(1-p))= b0 + b1X1 + b2X2 + b3X3 .... + bkXk
以上,p是存在感興趣特征的概率。這時候你應該要問一個問題就是“為什么我們要在等式中使用對數(shù)log?”。
由于我們在這里使用的是二項分布(因變量),我們需要選擇最適合此分布的鏈接函數(shù)。而且,它是logit函數(shù)。在上面的等式中,選擇此參數(shù)是為了以最大化觀察樣本值的可能性,而不是最小化平方誤差的總和(如在普通回歸中一樣)。
如果自變量的冪大于1,則回歸方程是多項式回歸方程。下面的等式表示多項式方程:
Y = A + B * X ^ 2
在這種回歸技術中,最佳擬合線不是直線。它是一條與數(shù)據(jù)點吻合的曲線。
當我們處理多個自變量時,會使用這種形式的回歸。在這種技術中,自變量的選擇是在自動過程的幫助下完成的,這個過程是不需要人為的去進行干預的。
通過觀察R方、t檢驗和AIC指標等統(tǒng)計值來識別重要變量,可以實現(xiàn)這一壯舉。逐步回歸基本上適合回歸模型,通過基于指定的標準一次一個地添加/刪除協(xié)變量。下面列出了一些最常用的逐步回歸方法:
該建模技術的目的是以最少的預測變量來最大化預測能力。它是處理數(shù)據(jù)集更高維度的方法之一。
嶺回歸是一種在數(shù)據(jù)存在多重共線性(自變量高度相關)時使用的技術。在多重共線性中,即使最小二乘估計(OLS)是無偏的,但它們的方差也很大,這使得觀測值偏離真實值。通過在回歸估計中增加一定程度的偏差,嶺回歸可以減少標準誤差。
上面,我們看到了線性回歸的方程。還記得嘛?它可以表示為:
y = a + b * x
這個方程也有一個誤差項。完整的等式變?yōu)椋?/span>
y = a + b * x + e(誤差項),[誤差項是校正觀測值和預測值之間預測誤差所需的值] 表示多個自變量,=> y = a + y = a + b1x1 + b2x2 + .... + e。
在線性方程中,預測誤差可以分解為兩個子分量。首先是由于偏差,第二是由于方差。由于這兩個或兩個組件中的任何一個,都可能發(fā)生預測錯誤。在這里,我們將討論由于方差引起的錯誤。
嶺回歸通過收縮參數(shù) λ(lambda)解決了多重共線性問題 ??聪旅娴姆匠獭?/span>
在這個方程中,我們有兩個組成部分。第一個是最小二乘項,另一個是β2 (β平方)總和的λ,其中β是系數(shù)。這被添加到最小二乘項,以便縮小參數(shù)以具有非常低的方差。
類似于嶺回歸,Lasso(最小絕對收縮和選擇算子)也會對回歸系數(shù)的絕對大小進行限制。此外,它還能夠降低線性回歸模型的可變性并提高其準確性。請看下面的方程:
Lasso回歸與嶺回歸的不同之處在于,它在懲罰函數(shù)中使用絕對值而不是平方。這導致懲罰(或等效地約束估計值的絕對值的總和)值,從而導致一些參數(shù)估計值恰好為零。應用的懲罰越大,估計值就會縮小到絕對零值。這導致從給定的n個變量中進行變量選擇。
彈性網(wǎng)絡回歸是Lasso回歸和嶺回歸技術的混合體。它使用L1和L2先驗作為正則化器進行訓練。當存在多個相關的特征時,彈性網(wǎng)絡是很有用的。Lasso可能隨機選擇其中一種,而彈性網(wǎng)很可能同時選擇兩個。
在Lasso回歸和嶺回歸之間進行權衡的一個實際優(yōu)勢是,它允許彈性網(wǎng)絡在旋轉(zhuǎn)下繼承嶺回歸的一些穩(wěn)定性。
當你只知道一兩種技術時,生活通常是很簡單的。我所知道的其中一個培訓機構告訴他們的學生 - 如果結果是連續(xù)的 - 那就用線性回歸。如果是二進制的 - 那就用邏輯回歸!但是,我們可以使用的選項數(shù)量越多,選擇正確的選項就越困難?;貧w模型也會發(fā)生類似的情況。
在多種類型的回歸模型中,基于自變量和因變量的類型,數(shù)據(jù)中的維度以及數(shù)據(jù)的其他基本特征來選擇最適合的回歸方法是很重要的。以下是應該選擇正確的回歸模型的關鍵因素:
到現(xiàn)在為止,我希望你已經(jīng)對回歸有所了解??紤]數(shù)據(jù)條件來應用這些回歸技術。找出使用哪種技術的最佳技巧之一就是檢查變量族,即離散變量還是連續(xù)變量。
在本文中,我討論了7種類型的回歸以及與每種技術相關的一些關鍵事實。作為這個行業(yè)的新人,我建議你學習這些技術,然后在你的模型中實現(xiàn)它們。
-以上就是作者推薦的七種數(shù)據(jù)科學人必知必會的七種回歸模型,如果大家對這七種模型感興趣,那就自己動手去實驗一下吧,只知道理論是不夠的,要多動手實驗,才能真正的掌握這些模型。
7 Types of Regression Techniques you should know!
數(shù)據(jù)分析咨詢請掃描二維碼
若不方便掃碼,搜微信號:CDAshujufenxi
LSTM 模型輸入長度選擇技巧:提升序列建模效能的關鍵? 在循環(huán)神經(jīng)網(wǎng)絡(RNN)家族中,長短期記憶網(wǎng)絡(LSTM)憑借其解決長序列 ...
2025-07-11CDA 數(shù)據(jù)分析師報考條件詳解與準備指南? ? 在數(shù)據(jù)驅(qū)動決策的時代浪潮下,CDA 數(shù)據(jù)分析師認證愈發(fā)受到矚目,成為眾多有志投身數(shù) ...
2025-07-11數(shù)據(jù)透視表中兩列相乘合計的實用指南? 在數(shù)據(jù)分析的日常工作中,數(shù)據(jù)透視表憑借其強大的數(shù)據(jù)匯總和分析功能,成為了 Excel 用戶 ...
2025-07-11尊敬的考生: 您好! 我們誠摯通知您,CDA Level I和 Level II考試大綱將于 2025年7月25日 實施重大更新。 此次更新旨在確保認 ...
2025-07-10BI 大數(shù)據(jù)分析師:連接數(shù)據(jù)與業(yè)務的價值轉(zhuǎn)化者? ? 在大數(shù)據(jù)與商業(yè)智能(Business Intelligence,簡稱 BI)深度融合的時代,BI ...
2025-07-10SQL 在預測分析中的應用:從數(shù)據(jù)查詢到趨勢預判? ? 在數(shù)據(jù)驅(qū)動決策的時代,預測分析作為挖掘數(shù)據(jù)潛在價值的核心手段,正被廣泛 ...
2025-07-10數(shù)據(jù)查詢結束后:分析師的收尾工作與價值深化? ? 在數(shù)據(jù)分析的全流程中,“query end”(查詢結束)并非工作的終點,而是將數(shù) ...
2025-07-10CDA 數(shù)據(jù)分析師考試:從報考到取證的全攻略? 在數(shù)字經(jīng)濟蓬勃發(fā)展的今天,數(shù)據(jù)分析師已成為各行業(yè)爭搶的核心人才,而 CDA(Certi ...
2025-07-09【CDA干貨】單樣本趨勢性檢驗:捕捉數(shù)據(jù)背后的時間軌跡? 在數(shù)據(jù)分析的版圖中,單樣本趨勢性檢驗如同一位耐心的偵探,專注于從單 ...
2025-07-09year_month數(shù)據(jù)類型:時間維度的精準切片? ? 在數(shù)據(jù)的世界里,時間是最不可或缺的維度之一,而year_month數(shù)據(jù)類型就像一把精準 ...
2025-07-09CDA 備考干貨:Python 在數(shù)據(jù)分析中的核心應用與實戰(zhàn)技巧? ? 在 CDA 數(shù)據(jù)分析師認證考試中,Python 作為數(shù)據(jù)處理與分析的核心 ...
2025-07-08SPSS 中的 Mann-Kendall 檢驗:數(shù)據(jù)趨勢與突變分析的有力工具? ? ? 在數(shù)據(jù)分析的廣袤領域中,準確捕捉數(shù)據(jù)的趨勢變化以及識別 ...
2025-07-08備戰(zhàn) CDA 數(shù)據(jù)分析師考試:需要多久?如何規(guī)劃? CDA(Certified Data Analyst)數(shù)據(jù)分析師認證作為國內(nèi)權威的數(shù)據(jù)分析能力認證 ...
2025-07-08LSTM 輸出不確定的成因、影響與應對策略? 長短期記憶網(wǎng)絡(LSTM)作為循環(huán)神經(jīng)網(wǎng)絡(RNN)的一種變體,憑借獨特的門控機制,在 ...
2025-07-07統(tǒng)計學方法在市場調(diào)研數(shù)據(jù)中的深度應用? 市場調(diào)研是企業(yè)洞察市場動態(tài)、了解消費者需求的重要途徑,而統(tǒng)計學方法則是市場調(diào)研數(shù) ...
2025-07-07CDA數(shù)據(jù)分析師證書考試全攻略? 在數(shù)字化浪潮席卷全球的當下,數(shù)據(jù)已成為企業(yè)決策、行業(yè)發(fā)展的核心驅(qū)動力,數(shù)據(jù)分析師也因此成為 ...
2025-07-07剖析 CDA 數(shù)據(jù)分析師考試題型:解鎖高效備考與答題策略? CDA(Certified Data Analyst)數(shù)據(jù)分析師考試作為衡量數(shù)據(jù)專業(yè)能力的 ...
2025-07-04SQL Server 字符串截取轉(zhuǎn)日期:解鎖數(shù)據(jù)處理的關鍵技能? 在數(shù)據(jù)處理與分析工作中,數(shù)據(jù)格式的規(guī)范性是保證后續(xù)分析準確性的基礎 ...
2025-07-04CDA 數(shù)據(jù)分析師視角:從數(shù)據(jù)迷霧中探尋商業(yè)真相? 在數(shù)字化浪潮席卷全球的今天,數(shù)據(jù)已成為企業(yè)決策的核心驅(qū)動力,CDA(Certifie ...
2025-07-04CDA 數(shù)據(jù)分析師:開啟數(shù)據(jù)職業(yè)發(fā)展新征程? ? 在數(shù)據(jù)成為核心生產(chǎn)要素的今天,數(shù)據(jù)分析師的職業(yè)價值愈發(fā)凸顯。CDA(Certified D ...
2025-07-03