
如何使用spss進(jìn)行交叉列聯(lián)表分析_數(shù)據(jù)分析師
在實(shí)際分析中,除了需要對(duì)單個(gè)變量的數(shù)據(jù)分布情況進(jìn)行分析外,還需要掌握多個(gè)變量在不同取值情況下的數(shù)據(jù)分布情況,從而進(jìn)一步深入分析變量之間的相互影響和關(guān)系,這種分析就稱為交叉列聯(lián)表分析。
當(dāng)所觀察的現(xiàn)象同時(shí)與兩個(gè)因素有關(guān)時(shí),如某種服裝的銷(xiāo)量受價(jià)格和居民收入的影響,某種產(chǎn)品的生產(chǎn)成本受原材料價(jià)格和產(chǎn)量的影響等,通過(guò)交叉列聯(lián)表分析,可以較好地反映出這兩個(gè)因素之間有無(wú)關(guān)聯(lián)性及兩個(gè)因素與所觀察現(xiàn)象之間的相關(guān)關(guān)系。
因此,數(shù)據(jù)交叉列聯(lián)表分析主要包括兩個(gè)基本任務(wù):一是根據(jù)收集的樣本數(shù)據(jù),產(chǎn)生二維或多維交叉列聯(lián)表;二是在交叉列聯(lián)表的基礎(chǔ)上,對(duì)兩個(gè)變量間是否存在相關(guān)性進(jìn)行檢驗(yàn)。要獲得變量之間的相關(guān)性,僅僅靠描述性統(tǒng)計(jì)的數(shù)據(jù)是不夠的,還需要借助一些表示變量間相關(guān)程度的統(tǒng)計(jì)量和一些非參數(shù)檢驗(yàn)的方法。
常用的衡量變量間相關(guān)程度的統(tǒng)計(jì)量是簡(jiǎn)單相關(guān)系數(shù),但在交叉列聯(lián)表分析中,由于行列變量往往不是連續(xù)變量,不符合計(jì)算簡(jiǎn)單相關(guān)系數(shù)的前提條件。因此,需要根據(jù)變量的性質(zhì)選擇其他的相關(guān)系數(shù),如Kendall等級(jí)相關(guān)系數(shù)、Eta值等。
SPSS提供了多種適用于不同類型數(shù)據(jù)的相關(guān)系數(shù)表達(dá),這些相關(guān)性檢驗(yàn)的零假設(shè)都是:行和列變量之間相互獨(dú)立,不存在顯著的相關(guān)關(guān)系。根據(jù)SPSS檢驗(yàn)后得出的相伴概率(Concomitant Significance)判斷是否存在相關(guān)關(guān)系。如果相伴概率小于顯著性水平0.05,那么拒絕零假設(shè),行列變量之間彼此相關(guān);如果相伴概率大于顯著性水平0.05,那么接受原假設(shè),行列變量之間彼此獨(dú)立。
在交叉列聯(lián)表分析中,SPSS所提供的相關(guān)關(guān)系的檢驗(yàn)方法主要有以下3種:
(1)卡方(χ2)統(tǒng)計(jì)檢驗(yàn):常用于檢驗(yàn)行列變量之間是否相關(guān)。計(jì)算公式為:
其中,f0表示實(shí)際觀察頻數(shù),fe表示期望頻數(shù)。
卡方統(tǒng)計(jì)量服從(行數(shù) 1) (列數(shù) 1)個(gè)自由度的卡方統(tǒng)計(jì)。SPSS在計(jì)算卡方統(tǒng)計(jì)量時(shí),同時(shí)給出相應(yīng)的相伴概率,由此判斷行列變量之間是否相關(guān)。
(2)列聯(lián)系數(shù)(Contingency coefficient):常用于名義變量之間的相關(guān)系數(shù)計(jì)算。計(jì)算公式由卡方統(tǒng)計(jì)量修改而得,公式如下:
(3) 系數(shù)(Phi and Cramer's V):常用于名義變量之間的相關(guān)系數(shù)計(jì)算。計(jì)算公式由卡方統(tǒng)計(jì)量修改而得,公式如下:
系數(shù)介于0和1之間,其中,K為行數(shù)和列數(shù)較小的實(shí)際數(shù)。
交叉列聯(lián)表分析的具體操作步驟如下:
打開(kāi)數(shù)據(jù)文件,選擇【分析】(Analyze)菜單,單擊【描述統(tǒng)計(jì)】(Descriptive Statistics)命令下的【交叉表】(Crosstabs)命令。"交叉表"(Crosstabs)主對(duì)話框如圖3-13所示。
在該主對(duì)話框中,左邊的變量列表為原變量列表,通過(guò)單擊 按鈕可選擇一個(gè)或者幾個(gè)變量進(jìn)入右邊的"行"(Row(s))變量列表框、"列"(Column(s))變量列表框和"層"(Layer)變量列表框中。
如果是二維列聯(lián)表分析,只需選擇行列變量即可,但如進(jìn)行三維以上的列聯(lián)表分析,可以將其他變量作為控制變量選到"層"(Layer)變量列表框中。有多個(gè)層控制變量時(shí),可以根據(jù)實(shí)際的分析要求確定它們的層次,既可以是同層次的也可以是逐層疊加的。
在"交叉表"對(duì)話框底端有兩個(gè)可選擇項(xiàng):
顯示復(fù)式條形圖(Display clustered bar chart):指定繪制各個(gè)變量不同交叉取值下關(guān)于頻數(shù)分布的柱形圖;
取消表格(Suppress table):不輸出列聯(lián)表的具體表格,而直接顯示交叉列聯(lián)表分析過(guò)程中的統(tǒng)計(jì)量,如果沒(méi)有選中統(tǒng)計(jì)量,則不產(chǎn)生任何結(jié)果。所以,一般情況下,只有在分析行列變量間關(guān)系時(shí)選擇此項(xiàng)。
該對(duì)話框的右端有4個(gè)按鈕,從上到下依次為【精確】(Exact)按鈕、【統(tǒng)計(jì)量】(Statistics)按鈕、【單元格】(Cells)按鈕和【格式】(Format)按鈕。單擊可進(jìn)入對(duì)應(yīng)的對(duì)話框。
單擊【精確】(Exact)按鈕,打開(kāi)"精確檢驗(yàn)"(Exact Tests)對(duì)話框,如圖3-14所示。
該對(duì)話框提供了3種用于不同條件的檢驗(yàn)方式來(lái)檢驗(yàn)行列變量的相關(guān)性。用戶可選擇以下3種檢驗(yàn)方式之一:
僅漸近法(Asymptotic only):適用于具有漸近分布的大樣本數(shù)據(jù),SPSS默認(rèn)選擇該項(xiàng)。
Monte Carlo(蒙特卡羅法):此項(xiàng)為精確顯著性水平值的無(wú)偏估計(jì),無(wú)需數(shù)據(jù)具有漸近分布的假設(shè),是一種非常有效的計(jì)算確切顯著性水平的方法。在"置信水平"(Confidence Level)參數(shù)框內(nèi)輸入數(shù)據(jù),可以確定置信區(qū)間的大小,一般為90、95、99。在"樣本數(shù)"(Number of samples)參數(shù)框中可以輸入數(shù)據(jù)的樣本容量。
精確(Exact):觀察結(jié)果概率,同時(shí)在下面的"每個(gè)檢驗(yàn)的時(shí)間限制為"(Time limit per test)的參數(shù)框內(nèi),選擇進(jìn)行精確檢驗(yàn)的最大時(shí)間限度。
用戶在本對(duì)話框內(nèi)進(jìn)行選擇后,單擊【繼續(xù)】(Continue)按鈕即可返回"交叉表"主對(duì)話框。一般情況下,"精確檢驗(yàn)"(Exact Tests)對(duì)話框的選項(xiàng)都默認(rèn)為系統(tǒng)默認(rèn)值,不作調(diào)整。
單擊【統(tǒng)計(jì)量】(Statistics)按鈕,打開(kāi)"交叉表:統(tǒng)計(jì)量"(Crosstabs:Statistics)對(duì)話框,如圖3-15所示。
在該對(duì)話框中,用戶可以選擇輸出合適的統(tǒng)計(jì)檢驗(yàn)統(tǒng)計(jì)量。對(duì)話框中各選項(xiàng)的意義如下:
(1)卡方(Chi-square)檢驗(yàn)復(fù)選框:檢驗(yàn)列聯(lián)表行列變量的獨(dú)立性檢驗(yàn),也被稱為Pearson chi-square檢驗(yàn)、χ2檢驗(yàn)。
(2)相關(guān)性(Correlations)檢驗(yàn)復(fù)選框:輸出列聯(lián)表行列變量的Pearson相關(guān)系數(shù)或Spearman相關(guān)系數(shù)。
(3)名義(Nominal)欄:適用于名稱變量統(tǒng)計(jì)量。
相依系數(shù)(Contingency coefficient):即Pearson相關(guān)系數(shù)或Spearman相關(guān)系數(shù)。
Phi 和Cramer變量( 系數(shù)):常用于名義變量之間的相關(guān)系數(shù)計(jì)算。計(jì)算公式由卡方統(tǒng)計(jì)量修改而得,如公式(3.13)所示。ψ系數(shù)介于0和1之間,其中,K為行數(shù)和列數(shù)較小的實(shí)際數(shù)。
Lambda(λ系數(shù)):在自變量預(yù)測(cè)中用于反映比例縮減誤差,其值為1時(shí)表明自變量預(yù)測(cè)因變量好,為0時(shí)表明自變量預(yù)測(cè)因變量差。
不定性系數(shù)(Uncertainty coefficient):以熵為標(biāo)準(zhǔn)的比例縮減誤差,其值接近1時(shí)表明后一變量的信息很大程度上來(lái)自前一變量,其值接近0時(shí)表明后一變量的信息與前一變量無(wú)關(guān)。
(4)有序(Ordinal)欄:適用于有序變量的統(tǒng)計(jì)量。
Gamma(伽馬系數(shù),γ系數(shù)):兩有序變量之間的關(guān)聯(lián)性的對(duì)稱檢驗(yàn)。其數(shù)值界于0和1之間,所有觀察實(shí)際數(shù)集中于左上角和右下角時(shí),取值為1,表示兩個(gè)變量之間有很強(qiáng)的相關(guān);取值為0時(shí),表示兩個(gè)變量之間相互獨(dú)立。
Somers'd值:兩有序變量之間的關(guān)聯(lián)性的檢驗(yàn),取值范圍為[-1,1]。
Kendall s tau-b值:考慮有結(jié)的秩或等級(jí)變量關(guān)聯(lián)性的非參數(shù)檢驗(yàn),相同的觀察值選入計(jì)算過(guò)程中,取值范圍為[-1,1]。
Kendall s tau-c值:忽略有結(jié)的秩或等級(jí)變量關(guān)聯(lián)性的非參數(shù)檢驗(yàn),相同的觀察值不選入計(jì)算過(guò)程,取值范圍界為[-1,1]。
(5)按區(qū)間標(biāo)定(Nominal by interval)欄:適用于一個(gè)名義變量與一個(gè)等距變量的相關(guān)性檢驗(yàn)。
Kappa系數(shù):檢驗(yàn)數(shù)據(jù)內(nèi)部的一致性,僅適用于具有相同分類值和相同分類數(shù)量的變量交叉表。
Eta值:其平方值可認(rèn)為是因變量受不同因素影響所致方差的比例。
風(fēng)險(xiǎn)(相對(duì)危險(xiǎn)度):檢驗(yàn)事件發(fā)生和某因素之間的關(guān)聯(lián)性。
McNemar檢驗(yàn):主要用于檢驗(yàn)配對(duì)的資料率(相當(dāng)于配對(duì)卡方檢驗(yàn))。
(6)Cochran's and Mantel-Haenszel統(tǒng)計(jì)量復(fù)選框:適用于在一個(gè)二值因素變量和一個(gè)二值響應(yīng)變量之間的獨(dú)立性檢驗(yàn)。
用戶在"交叉表:統(tǒng)計(jì)量"對(duì)話框中進(jìn)行選擇后,單擊【繼續(xù)】(Continue),即可返回"交叉表"(Crosstabs)主對(duì)話框。一般情況下,對(duì)"交叉表:統(tǒng)計(jì)量"對(duì)話框內(nèi)的選項(xiàng)不作選擇或選擇較為常用的卡方檢驗(yàn)。
單擊【單元格】(Cells)按鈕,打開(kāi)"交叉表:?jiǎn)卧@示"(Crosstabs:Cell Display)對(duì)話框,如圖3-16所示。
在該對(duì)話框中,用戶可以指定列聯(lián)表單元格中的輸出內(nèi)容。SPSS17.0默認(rèn)在交叉列聯(lián)表中輸出實(shí)際的觀察值,但觀察值有時(shí)候不能確切地反映事物的實(shí)質(zhì),因此還需要輸出其他的數(shù)據(jù)項(xiàng)。對(duì)話框中各選項(xiàng)的具體意義如下:
(1)計(jì)數(shù)(Counts)欄:
觀察值(Observed):系統(tǒng)默認(rèn)選項(xiàng),表示輸出為實(shí)際觀察值。
期望值(Expected):表示輸出為理論值。
(2)百分比(Percentages)欄:
行(Row)百分比:以行為單元,統(tǒng)計(jì)行變量的百分比。
列(Column)百分比:以列為單元,統(tǒng)計(jì)列變量的百分比。
總計(jì)(Total)百分比:行列變量的百分比都進(jìn)行輸出。
(3)殘差(Residuals)欄:
未標(biāo)準(zhǔn)化(Unstandardized):輸出非標(biāo)準(zhǔn)化殘差,為實(shí)際數(shù)與理論數(shù)的差值。
標(biāo)準(zhǔn)化(Standardized):輸出標(biāo)準(zhǔn)化殘差,為實(shí)際數(shù)與理論數(shù)的差值除以理論數(shù)。
調(diào)節(jié)的標(biāo)準(zhǔn)化(Adjusted standardized):輸出修正標(biāo)準(zhǔn)化殘差,為標(biāo)準(zhǔn)誤確定的單元格殘差。
(4)非整數(shù)權(quán)重(Noninteger Weights)欄:
四舍五入單元格計(jì)數(shù)(Round cell counts,系統(tǒng)默認(rèn)):將單元格計(jì)數(shù)的非整數(shù)部分的尾數(shù)四舍五入為整數(shù)。
截短單元格計(jì)數(shù)(Truncate cell counts):將單元格計(jì)數(shù)的非整數(shù)部分的尾數(shù)舍去,直接化為整數(shù)。
四舍五入個(gè)案權(quán)重(Round case Weights):將觀測(cè)量權(quán)數(shù)的非整數(shù)部分的尾數(shù)四舍五入為整數(shù)。
截短個(gè)案權(quán)重(Truncate case Weights):將觀測(cè)量權(quán)數(shù)的非整數(shù)部分的尾數(shù)舍去,化為整數(shù)。
無(wú)調(diào)節(jié)(No adjustments):不對(duì)計(jì)數(shù)數(shù)據(jù)進(jìn)行調(diào)整。
用戶在"交叉表:?jiǎn)卧@示"對(duì)話框中進(jìn)行選擇后,單擊【繼續(xù)】(Continue)按鈕,即可返回"交叉表"主對(duì)話框。一般情況下,對(duì)"交叉表:?jiǎn)卧@示"對(duì)話框的選項(xiàng)都默認(rèn)為系統(tǒng)默認(rèn)值,不作調(diào)整。
單擊【格式】(Format)按鈕,打開(kāi)"交叉表:表格格式"(Crosstabs:Table Format)對(duì)話框,如圖3-17所示。
在該對(duì)話框中,用戶可以指定列聯(lián)表的輸出排列順序。對(duì)話框中各選項(xiàng)的具體意義如下:
在行序(Row Order)欄中有如下兩個(gè)選項(xiàng):
升序(Ascending):系統(tǒng)默認(rèn),以升序顯示各變量值;
降序(Descending):以降序顯示各變量值。
用戶在該對(duì)話框中進(jìn)行選擇后,單擊【繼續(xù)】(Continue)按鈕,即可返回"交叉表"主對(duì)話框。
在"交叉表"對(duì)話框中單擊【確定】(OK)按鈕,可在輸出窗口中得到數(shù)據(jù)概述、交叉列聯(lián)表、卡方檢驗(yàn)表、交叉分組下頻率分布柱形圖、相對(duì)危險(xiǎn)性估計(jì)等圖表。更多相關(guān)文章:CDA數(shù)據(jù)分析師官網(wǎng)
數(shù)據(jù)分析咨詢請(qǐng)掃描二維碼
若不方便掃碼,搜微信號(hào):CDAshujufenxi
LSTM 模型輸入長(zhǎng)度選擇技巧:提升序列建模效能的關(guān)鍵? 在循環(huán)神經(jīng)網(wǎng)絡(luò)(RNN)家族中,長(zhǎng)短期記憶網(wǎng)絡(luò)(LSTM)憑借其解決長(zhǎng)序列 ...
2025-07-11CDA 數(shù)據(jù)分析師報(bào)考條件詳解與準(zhǔn)備指南? ? 在數(shù)據(jù)驅(qū)動(dòng)決策的時(shí)代浪潮下,CDA 數(shù)據(jù)分析師認(rèn)證愈發(fā)受到矚目,成為眾多有志投身數(shù) ...
2025-07-11數(shù)據(jù)透視表中兩列相乘合計(jì)的實(shí)用指南? 在數(shù)據(jù)分析的日常工作中,數(shù)據(jù)透視表憑借其強(qiáng)大的數(shù)據(jù)匯總和分析功能,成為了 Excel 用戶 ...
2025-07-11尊敬的考生: 您好! 我們誠(chéng)摯通知您,CDA Level I和 Level II考試大綱將于 2025年7月25日 實(shí)施重大更新。 此次更新旨在確保認(rèn) ...
2025-07-10BI 大數(shù)據(jù)分析師:連接數(shù)據(jù)與業(yè)務(wù)的價(jià)值轉(zhuǎn)化者? ? 在大數(shù)據(jù)與商業(yè)智能(Business Intelligence,簡(jiǎn)稱 BI)深度融合的時(shí)代,BI ...
2025-07-10SQL 在預(yù)測(cè)分析中的應(yīng)用:從數(shù)據(jù)查詢到趨勢(shì)預(yù)判? ? 在數(shù)據(jù)驅(qū)動(dòng)決策的時(shí)代,預(yù)測(cè)分析作為挖掘數(shù)據(jù)潛在價(jià)值的核心手段,正被廣泛 ...
2025-07-10數(shù)據(jù)查詢結(jié)束后:分析師的收尾工作與價(jià)值深化? ? 在數(shù)據(jù)分析的全流程中,“query end”(查詢結(jié)束)并非工作的終點(diǎn),而是將數(shù) ...
2025-07-10CDA 數(shù)據(jù)分析師考試:從報(bào)考到取證的全攻略? 在數(shù)字經(jīng)濟(jì)蓬勃發(fā)展的今天,數(shù)據(jù)分析師已成為各行業(yè)爭(zhēng)搶的核心人才,而 CDA(Certi ...
2025-07-09【CDA干貨】單樣本趨勢(shì)性檢驗(yàn):捕捉數(shù)據(jù)背后的時(shí)間軌跡? 在數(shù)據(jù)分析的版圖中,單樣本趨勢(shì)性檢驗(yàn)如同一位耐心的偵探,專注于從單 ...
2025-07-09year_month數(shù)據(jù)類型:時(shí)間維度的精準(zhǔn)切片? ? 在數(shù)據(jù)的世界里,時(shí)間是最不可或缺的維度之一,而year_month數(shù)據(jù)類型就像一把精準(zhǔn) ...
2025-07-09CDA 備考干貨:Python 在數(shù)據(jù)分析中的核心應(yīng)用與實(shí)戰(zhàn)技巧? ? 在 CDA 數(shù)據(jù)分析師認(rèn)證考試中,Python 作為數(shù)據(jù)處理與分析的核心 ...
2025-07-08SPSS 中的 Mann-Kendall 檢驗(yàn):數(shù)據(jù)趨勢(shì)與突變分析的有力工具? ? ? 在數(shù)據(jù)分析的廣袤領(lǐng)域中,準(zhǔn)確捕捉數(shù)據(jù)的趨勢(shì)變化以及識(shí)別 ...
2025-07-08備戰(zhàn) CDA 數(shù)據(jù)分析師考試:需要多久?如何規(guī)劃? CDA(Certified Data Analyst)數(shù)據(jù)分析師認(rèn)證作為國(guó)內(nèi)權(quán)威的數(shù)據(jù)分析能力認(rèn)證 ...
2025-07-08LSTM 輸出不確定的成因、影響與應(yīng)對(duì)策略? 長(zhǎng)短期記憶網(wǎng)絡(luò)(LSTM)作為循環(huán)神經(jīng)網(wǎng)絡(luò)(RNN)的一種變體,憑借獨(dú)特的門(mén)控機(jī)制,在 ...
2025-07-07統(tǒng)計(jì)學(xué)方法在市場(chǎng)調(diào)研數(shù)據(jù)中的深度應(yīng)用? 市場(chǎng)調(diào)研是企業(yè)洞察市場(chǎng)動(dòng)態(tài)、了解消費(fèi)者需求的重要途徑,而統(tǒng)計(jì)學(xué)方法則是市場(chǎng)調(diào)研數(shù) ...
2025-07-07CDA數(shù)據(jù)分析師證書(shū)考試全攻略? 在數(shù)字化浪潮席卷全球的當(dāng)下,數(shù)據(jù)已成為企業(yè)決策、行業(yè)發(fā)展的核心驅(qū)動(dòng)力,數(shù)據(jù)分析師也因此成為 ...
2025-07-07剖析 CDA 數(shù)據(jù)分析師考試題型:解鎖高效備考與答題策略? CDA(Certified Data Analyst)數(shù)據(jù)分析師考試作為衡量數(shù)據(jù)專業(yè)能力的 ...
2025-07-04SQL Server 字符串截取轉(zhuǎn)日期:解鎖數(shù)據(jù)處理的關(guān)鍵技能? 在數(shù)據(jù)處理與分析工作中,數(shù)據(jù)格式的規(guī)范性是保證后續(xù)分析準(zhǔn)確性的基礎(chǔ) ...
2025-07-04CDA 數(shù)據(jù)分析師視角:從數(shù)據(jù)迷霧中探尋商業(yè)真相? 在數(shù)字化浪潮席卷全球的今天,數(shù)據(jù)已成為企業(yè)決策的核心驅(qū)動(dòng)力,CDA(Certifie ...
2025-07-04CDA 數(shù)據(jù)分析師:開(kāi)啟數(shù)據(jù)職業(yè)發(fā)展新征程? ? 在數(shù)據(jù)成為核心生產(chǎn)要素的今天,數(shù)據(jù)分析師的職業(yè)價(jià)值愈發(fā)凸顯。CDA(Certified D ...
2025-07-03