
數(shù)據(jù)分析師用r語(yǔ)言做數(shù)據(jù)分析的時(shí)候會(huì)很多,也有很多數(shù)據(jù)分析師對(duì)于用r語(yǔ)言不是很了解,下面就談?wù)撘幌拢?span style="font-family:微軟雅黑, sans-serif;line-height:32px;">
線性回歸簡(jiǎn)介:如下圖所示,如果把自變量(也叫independent variable)和因變量(也叫dependent variable)畫(huà)在二維坐標(biāo)上,則每條記錄對(duì)應(yīng)一個(gè)點(diǎn)。線性回規(guī)最常見(jiàn)的應(yīng)用場(chǎng)景則是用一條直線去擬和已知的點(diǎn),并對(duì)給定的x值預(yù)測(cè)其y值。而我們要做的就是找出一條合適的曲線,也就是找出合適的斜率及縱截矩。
SSE & RMSE
上圖中的SSE指sum of squared error,也即預(yù)測(cè)值與實(shí)際值之差的平方和,可由此判斷該模型的誤差。但使用SSE表征模型的誤差有些弊端,比如它依賴于點(diǎn)的個(gè)數(shù),且不好定其單位。所以我們有另外一個(gè)值去稱量模型的誤差。RMSE(Root-Mean-Square Error)。
由N將其標(biāo)準(zhǔn)化,并且其單位與變量單位相同。
案例
許多研究表明,全球平均氣溫在過(guò)去幾十年中有所升高,以此引起的海平面上升和極端天氣頻現(xiàn)將會(huì)影響無(wú)數(shù)人。本文所講案例就試圖研究全球平均氣溫與一些其它因素的關(guān)系。
本例我們以1983年5月到2006年12月的數(shù)據(jù)作為訓(xùn)練數(shù)據(jù)集,以之后的數(shù)據(jù)作為測(cè)試數(shù)據(jù)集。
數(shù)據(jù)
首先加載數(shù)據(jù)
temp <- read.csv("climate_change.csv")
數(shù)據(jù)解釋
Year 年份 M
Month 月份 T
emp 當(dāng)前周期內(nèi)的全球平均氣溫與一個(gè)參考值之差
CO2, N2O,CH4,CFC.11,CFC.12:這幾個(gè)氣體的大氣濃度 Aerosols
模型選擇
線性回歸模型保留兩部分。
"數(shù)據(jù)分析師'選擇目標(biāo)feature。我們數(shù)據(jù)中,有多個(gè)feature,但并非所有的feature都對(duì)預(yù)測(cè)有幫助,或者并非所有的feature都需要一起工作來(lái)做預(yù)測(cè),因此我們需要篩選出最小的最能預(yù)測(cè)出接近事實(shí)的feature組合。
確定feature系數(shù)(coefficient)。feature選出來(lái)后,我們要確定每個(gè)feature對(duì)預(yù)測(cè)結(jié)果所占的權(quán)重,這個(gè)權(quán)重即為coefficient
結(jié)合實(shí)例選擇模型
初始選擇所有feature
選擇所有feature作為第一個(gè)model1,并使用summary函數(shù)算出其Adjusted R2為0.7371。
model1 <- lm(Temp ~ MEI + CO2 + CH4 + N2O + CFC.11 + CFC.12 + TSI + Aerosols, temp) summary(model1)
逐一去掉feature
在model1中去掉任一個(gè)feature,并記下相應(yīng)的Adjusted R2如下
Feature |
Adjusted R2 |
CO2 + CH4 + N2O + CFC.11 + CFC.12 + TSI + Aerosols |
0.6373 |
MEI + CH4 + N2O + CFC.11 + CFC.12 + TSI + Aerosols |
0.7331 |
MEI + CO2 + N2O + CFC.11 + CFC.12 + TSI + Aerosols |
0.738 |
MEI + CO2 + CH4 + CFC.11 + CFC.12 + TSI + Aerosols |
0.7339 |
MEI + CO2 + CH4 + N2O + CFC.12 + TSI + Aerosols |
0.7163 |
MEI + CO2 + CH4 + N2O + CFC.11 + TSI + Aerosols |
0.7172 |
MEI + CO2 + CH4 + N2O + CFC.11 + CFC.12 + Aerosols |
0.697 |
MEI + CO2 + CH4 + N2O + CFC.11 + CFC.12 + TSI |
0.6883 |
本輪得到Temp ~ MEI + CO2 + N2O + CFC.11 + CFC.12 + TSI + Aerosols
從model2中任意去掉1個(gè)feature,并記下相應(yīng)的Adjusted R2如下
Feature |
Adjusted R2 |
CO2 + N2O + CFC.11 + CFC.12 + TSI + Aerosols |
0.6377 |
MEI + N2O + CFC.11 + CFC.12 + TSI + Aerosols |
0.7339 |
MEI + CO2 + CFC.11 + CFC.12 + TSI + Aerosols |
0.7346 |
MEI + CO2 + N2O + CFC.12 + TSI + Aerosols |
0.7171 |
MEI + CO2 + N2O + CFC.11 + TSI + Aerosols |
0.7166 |
MEI + CO2 + N2O + CFC.11 + CFC.12 + Aerosols |
0.698 |
MEI + CO2 + N2O + CFC.11 + CFC.12 + TSI |
0.6891 |
任一組合的Adjusted R2都比上一輪小,因此選擇上一輪的feature組合作為最終的模型,也即Temp ~ MEI + CO2 + N2O + CFC.11 + CFC.12 + TSI + Aerosols
由summary(model2)可算出每個(gè)feature的coefficient如下 。
線性回歸介紹
在線性回歸中,數(shù)據(jù)使用線性預(yù)測(cè)函數(shù)來(lái)建模,并且未知的模型參數(shù)也是通過(guò)數(shù)據(jù)來(lái)估計(jì)。這些模型被叫做線性模型。最常用的線性回歸建模是給定X值的y的條件均值是X的仿射函數(shù)。
線性回歸是回歸分析中第一種經(jīng)過(guò)嚴(yán)格研究并在實(shí)際應(yīng)用中廣泛使用的類(lèi)型。這是因?yàn)榫€性依賴于其未知參數(shù)的模型比非線性依賴于其位置參數(shù)的模型更容易擬合,而且產(chǎn)生的估計(jì)的統(tǒng)計(jì)特性也更容易確定。
上面這段定義來(lái)自于維基百科。
這個(gè)錯(cuò)誤估計(jì)函數(shù)是去對(duì)x(i)的估計(jì)值與真實(shí)值y(i)差的平方和作為錯(cuò)誤估計(jì)函數(shù),前面乘上的1/2m是為了在求導(dǎo)的時(shí)候,這個(gè)系數(shù)就不見(jiàn)了。至于為何選擇平方和作為錯(cuò)誤估計(jì)函數(shù),就得從概率分布的角度來(lái)解釋了。
如何調(diào)整θ以使得J(θ)取得最小值有很多方法,本文會(huì)重點(diǎn)介紹梯度下降法和正規(guī)方程法。
梯度下降
在選定線性回歸模型后,只需要確定參數(shù)θ,就可以將模型用來(lái)預(yù)測(cè)。然而θ需要使得J(θ)最小。因此問(wèn)題歸結(jié)為求極小值問(wèn)題。
梯度下降法流程如下:
1. 首先對(duì)θ賦值,這個(gè)值可以是隨機(jī)的,也可以讓?duì)葹橐粋€(gè)全零向量。
2. 改變?chǔ)鹊闹?,使?/span>J(θ)按梯度下降的方向進(jìn)行調(diào)整。
梯度方向由J(θ)對(duì)θ的偏導(dǎo)數(shù)確定,由于求的是極小值,因此梯度方向是偏導(dǎo)數(shù)的反方向。更新公式為為:
這種方法需要對(duì)全部的訓(xùn)練數(shù)據(jù)求得誤差后再對(duì)θ進(jìn)行更新。(α為學(xué)習(xí)速度)
正規(guī)方程(Normal Equation)數(shù)據(jù)分析師培訓(xùn)
數(shù)據(jù)分析咨詢請(qǐng)掃描二維碼
若不方便掃碼,搜微信號(hào):CDAshujufenxi
SQL Server 中 CONVERT 函數(shù)的日期轉(zhuǎn)換:從基礎(chǔ)用法到實(shí)戰(zhàn)優(yōu)化 在 SQL Server 的數(shù)據(jù)處理中,日期格式轉(zhuǎn)換是高頻需求 —— 無(wú)論 ...
2025-09-18MySQL 大表拆分與關(guān)聯(lián)查詢效率:打破 “拆分必慢” 的認(rèn)知誤區(qū) 在 MySQL 數(shù)據(jù)庫(kù)管理中,“大表” 始終是性能優(yōu)化繞不開(kāi)的話題。 ...
2025-09-18CDA 數(shù)據(jù)分析師:表結(jié)構(gòu)數(shù)據(jù) “獲取 - 加工 - 使用” 全流程的賦能者 表結(jié)構(gòu)數(shù)據(jù)(如數(shù)據(jù)庫(kù)表、Excel 表、CSV 文件)是企業(yè)數(shù)字 ...
2025-09-18DSGE 模型中的 Et:理性預(yù)期算子的內(nèi)涵、作用與應(yīng)用解析 動(dòng)態(tài)隨機(jī)一般均衡(Dynamic Stochastic General Equilibrium, DSGE)模 ...
2025-09-17Python 提取 TIF 中地名的完整指南 一、先明確:TIF 中的地名有哪兩種存在形式? 在開(kāi)始提取前,需先判斷 TIF 文件的類(lèi)型 —— ...
2025-09-17CDA 數(shù)據(jù)分析師:解鎖表結(jié)構(gòu)數(shù)據(jù)特征價(jià)值的專業(yè)核心 表結(jié)構(gòu)數(shù)據(jù)(以 “行 - 列” 規(guī)范存儲(chǔ)的結(jié)構(gòu)化數(shù)據(jù),如數(shù)據(jù)庫(kù)表、Excel 表、 ...
2025-09-17Excel 導(dǎo)入數(shù)據(jù)含缺失值?詳解 dropna 函數(shù)的功能與實(shí)戰(zhàn)應(yīng)用 在用 Python(如 pandas 庫(kù))處理 Excel 數(shù)據(jù)時(shí),“缺失值” 是高頻 ...
2025-09-16深入解析卡方檢驗(yàn)與 t 檢驗(yàn):差異、適用場(chǎng)景與實(shí)踐應(yīng)用 在數(shù)據(jù)分析與統(tǒng)計(jì)學(xué)領(lǐng)域,假設(shè)檢驗(yàn)是驗(yàn)證研究假設(shè)、判斷數(shù)據(jù)差異是否 “ ...
2025-09-16CDA 數(shù)據(jù)分析師:掌控表格結(jié)構(gòu)數(shù)據(jù)全功能周期的專業(yè)操盤(pán)手 表格結(jié)構(gòu)數(shù)據(jù)(以 “行 - 列” 存儲(chǔ)的結(jié)構(gòu)化數(shù)據(jù),如 Excel 表、數(shù)據(jù) ...
2025-09-16MySQL 執(zhí)行計(jì)劃中 rows 數(shù)量的準(zhǔn)確性解析:原理、影響因素與優(yōu)化 在 MySQL SQL 調(diào)優(yōu)中,EXPLAIN執(zhí)行計(jì)劃是核心工具,而其中的row ...
2025-09-15解析 Python 中 Response 對(duì)象的 text 與 content:區(qū)別、場(chǎng)景與實(shí)踐指南 在 Python 進(jìn)行 HTTP 網(wǎng)絡(luò)請(qǐng)求開(kāi)發(fā)時(shí)(如使用requests ...
2025-09-15CDA 數(shù)據(jù)分析師:激活表格結(jié)構(gòu)數(shù)據(jù)價(jià)值的核心操盤(pán)手 表格結(jié)構(gòu)數(shù)據(jù)(如 Excel 表格、數(shù)據(jù)庫(kù)表)是企業(yè)最基礎(chǔ)、最核心的數(shù)據(jù)形態(tài) ...
2025-09-15Python HTTP 請(qǐng)求工具對(duì)比:urllib.request 與 requests 的核心差異與選擇指南 在 Python 處理 HTTP 請(qǐng)求(如接口調(diào)用、數(shù)據(jù)爬取 ...
2025-09-12解決 pd.read_csv 讀取長(zhǎng)浮點(diǎn)數(shù)據(jù)的科學(xué)計(jì)數(shù)法問(wèn)題 為幫助 Python 數(shù)據(jù)從業(yè)者解決pd.read_csv讀取長(zhǎng)浮點(diǎn)數(shù)據(jù)時(shí)的科學(xué)計(jì)數(shù)法問(wèn)題 ...
2025-09-12CDA 數(shù)據(jù)分析師:業(yè)務(wù)數(shù)據(jù)分析步驟的落地者與價(jià)值優(yōu)化者 業(yè)務(wù)數(shù)據(jù)分析是企業(yè)解決日常運(yùn)營(yíng)問(wèn)題、提升執(zhí)行效率的核心手段,其價(jià)值 ...
2025-09-12用 SQL 驗(yàn)證業(yè)務(wù)邏輯:從規(guī)則拆解到數(shù)據(jù)把關(guān)的實(shí)戰(zhàn)指南 在業(yè)務(wù)系統(tǒng)落地過(guò)程中,“業(yè)務(wù)邏輯” 是連接 “需求設(shè)計(jì)” 與 “用戶體驗(yàn) ...
2025-09-11塔吉特百貨孕婦營(yíng)銷(xiāo)案例:數(shù)據(jù)驅(qū)動(dòng)下的精準(zhǔn)零售革命與啟示 在零售行業(yè) “流量紅利見(jiàn)頂” 的當(dāng)下,精準(zhǔn)營(yíng)銷(xiāo)成為企業(yè)突圍的核心方 ...
2025-09-11CDA 數(shù)據(jù)分析師與戰(zhàn)略 / 業(yè)務(wù)數(shù)據(jù)分析:概念辨析與協(xié)同價(jià)值 在數(shù)據(jù)驅(qū)動(dòng)決策的體系中,“戰(zhàn)略數(shù)據(jù)分析”“業(yè)務(wù)數(shù)據(jù)分析” 是企業(yè) ...
2025-09-11Excel 數(shù)據(jù)聚類(lèi)分析:從操作實(shí)踐到業(yè)務(wù)價(jià)值挖掘 在數(shù)據(jù)分析場(chǎng)景中,聚類(lèi)分析作為 “無(wú)監(jiān)督分組” 的核心工具,能從雜亂數(shù)據(jù)中挖 ...
2025-09-10統(tǒng)計(jì)模型的核心目的:從數(shù)據(jù)解讀到?jīng)Q策支撐的價(jià)值導(dǎo)向 統(tǒng)計(jì)模型作為數(shù)據(jù)分析的核心工具,并非簡(jiǎn)單的 “公式堆砌”,而是圍繞特定 ...
2025-09-10