
作者:李曉飛
來源:Python 技術(shù)
爬蟲程序想必大家都很熟悉了,隨便寫一個就可以獲取網(wǎng)頁上的信息,甚至可以通過請求自動生成 Python 腳本[1]。
最近我遇到一個爬蟲項目,需要爬取網(wǎng)上的文章。感覺沒有什么特別的,但問題是沒有限定爬取范圍,意味著沒有明確的頁面的結(jié)構(gòu)。
對于一個頁面來說,除了核心文章內(nèi)容外,還有頭部,尾部,左右列表欄等等。有的頁面框架用 div 布局,有的用 table,即使都用 div,不太的網(wǎng)站風(fēng)格和布局也不同。
但問題必須解決,我想,既然搜索引擎抓取到各種網(wǎng)頁的核心內(nèi)容,我們也應(yīng)該可以搞定,拎起 Python, 說干就干!
如何解決呢?
開始想了一個取巧的方法,就是利用工具(wkhtmltopdf[2])將目標(biāo)網(wǎng)頁生成 PDF 文件。
好處是不必關(guān)心頁面的具體形式,就像給頁面拍了一張照片,文章結(jié)構(gòu)是完整的。
雖然 PDF 是可以源碼級檢索,但是,生成 PDF 有諸多缺點:
耗費計算資源多、效率低、出錯率高,體積太大。
幾萬條數(shù)據(jù)已經(jīng)兩百多G,如果數(shù)據(jù)量上來光存儲就是很大的問題。
不生成PDF,有簡單辦法就是通過 xpath[3] 提取頁面上的所有文字。
但是內(nèi)容將失去結(jié)構(gòu),可讀性差。更要命的是,網(wǎng)頁上有很多無關(guān)內(nèi)容,比如側(cè)邊欄,廣告,相關(guān)鏈接等,也會被提取下來,影響內(nèi)容的精確性。
為了保證有一定的結(jié)構(gòu),還要識別到核心內(nèi)容,就只能識別并提取文章部分的結(jié)構(gòu)了。像搜索引擎學(xué)習(xí),就是想辦法識別頁面的核心內(nèi)容。
我們知道,通常情況下,頁面上的核心內(nèi)容(如文章部分)文字比較集中,可以從這個地方著手分析。
于是編寫了一段代碼,我是用 Scrapy[4] 作為爬蟲框架的,這里只截取了其中提取文章部分的代碼 :
divs = response.xpath("body//div")
sel = None
maxvalue = 0 for d in divs:
ds = len(d.xpath(".//div"))
ps = len(d.xpath(".//p")) value = ps - ds if value > maxvalue:
sel = { "node": d, "value": value }
maxvalue = value print("".join(sel['node'].getall()))
簡單明了,測試了幾個頁面確實挺好。
不過大量提取時發(fā)現(xiàn),很多頁面提取不到數(shù)據(jù)。仔細(xì)查看發(fā)現(xiàn),有兩種情況。
再調(diào)整了一下策略,不再區(qū)分 div,查看所有的元素。
另外優(yōu)先選擇更多的 p,在其基礎(chǔ)上再看更少的 div。調(diào)整后的代碼如下:
divs = response.xpath("body//*")
sels = []
maxvalue = 0 for d in divs:
ds = len(d.xpath(".//div"))
ps = len(d.xpath(".//p")) if ps >= maxvalue:
sel = { "node": d, "ps": ps, "ds": ds
}
maxvalue = ps
sels.append(sel)
sels.sort(lambda x: x.ds)
sel = sels[0] print("".join(sel['node'].getall()))
經(jīng)過這樣修改之后,確實在一定程度上彌補了前面的問題,但是引入了一個更麻煩的問題。
就是找到的文章主體不穩(wěn)定,特別容易受到其他部分有些 p 的影響。
既然直接計算不太合適,需要重新設(shè)計一個算法。
我發(fā)現(xiàn),文字集中的地方是往往是文章主體,而前面的方法中,沒有考慮到這一點,只是機械地找出了最大的 p。
還有一點,網(wǎng)頁結(jié)構(gòu)是個顆 DOM 樹[6]
那么越靠近 p 標(biāo)簽的地方應(yīng)該越可能是文章主體,也就是說,計算是越靠近 p 的節(jié)點權(quán)值應(yīng)該越大,而遠(yuǎn)離 p 的結(jié)點及時擁有很多 p 但是權(quán)值也應(yīng)該小一點。
經(jīng)過試錯,最終代碼如下:
def find(node, sel): value = 0 for n in node.xpath("*"): if n.xpath("local-name()").get() == "p":
t = "".join([s.strip() for s in (n.xpath('text()').getall() + n.xpath("*/text()").getall())]) value += len(t) else: value += find(n, a)*0.5 if value > sel["value"]:
sel["node"] = node
sel["value"] = value return value sel = { 'value': 0, 'node': None
}
find(response.xpath("body"), sel)
通過這樣改造之后,效果特別好。
為什么呢?其實利用了密度原理,就是說越靠近中心的地方,密度越高,遠(yuǎn)離中心的地方密度成倍的降低,這樣就能篩選出密度中心了。
50% 的坡度比率是如何得到的呢?
其實是通過實驗確定的,剛開始時我設(shè)置為 90%,但結(jié)果時 body 節(jié)點總是最優(yōu)的,因為 body 里包含了所有的文字內(nèi)容。
反復(fù)實驗后,確定 50% 是比較好的值,如果在你的應(yīng)用中不合適,可以做調(diào)整。
描述了我如何選取文章主體的方法后,后沒有發(fā)現(xiàn)其實很是很簡單的方法。而這次解決問題的經(jīng)歷,讓我感受到了數(shù)學(xué)的魅力。
一直以來我認(rèn)為只要了解常規(guī)處理問題的方式就足以應(yīng)對日常編程了,可以當(dāng)遇到不確定性問題,沒有辦法抽取出簡單模型的問題時,常規(guī)思維顯然不行。
所以平時我們應(yīng)該多看一些數(shù)學(xué)性強的,解決不確定性問題的方法,以便提高我們的編程適應(yīng)能力,擴展我們的技能范圍。
數(shù)據(jù)分析咨詢請掃描二維碼
若不方便掃碼,搜微信號:CDAshujufenxi
CDA 數(shù)據(jù)分析師:表結(jié)構(gòu)數(shù)據(jù) “獲取 - 加工 - 使用” 全流程的賦能者 表結(jié)構(gòu)數(shù)據(jù)(如數(shù)據(jù)庫表、Excel 表、CSV 文件)是企業(yè)數(shù)字 ...
2025-09-18DSGE 模型中的 Et:理性預(yù)期算子的內(nèi)涵、作用與應(yīng)用解析 動態(tài)隨機一般均衡(Dynamic Stochastic General Equilibrium, DSGE)模 ...
2025-09-17Python 提取 TIF 中地名的完整指南 一、先明確:TIF 中的地名有哪兩種存在形式? 在開始提取前,需先判斷 TIF 文件的類型 —— ...
2025-09-17CDA 數(shù)據(jù)分析師:解鎖表結(jié)構(gòu)數(shù)據(jù)特征價值的專業(yè)核心 表結(jié)構(gòu)數(shù)據(jù)(以 “行 - 列” 規(guī)范存儲的結(jié)構(gòu)化數(shù)據(jù),如數(shù)據(jù)庫表、Excel 表、 ...
2025-09-17Excel 導(dǎo)入數(shù)據(jù)含缺失值?詳解 dropna 函數(shù)的功能與實戰(zhàn)應(yīng)用 在用 Python(如 pandas 庫)處理 Excel 數(shù)據(jù)時,“缺失值” 是高頻 ...
2025-09-16深入解析卡方檢驗與 t 檢驗:差異、適用場景與實踐應(yīng)用 在數(shù)據(jù)分析與統(tǒng)計學(xué)領(lǐng)域,假設(shè)檢驗是驗證研究假設(shè)、判斷數(shù)據(jù)差異是否 “ ...
2025-09-16CDA 數(shù)據(jù)分析師:掌控表格結(jié)構(gòu)數(shù)據(jù)全功能周期的專業(yè)操盤手 表格結(jié)構(gòu)數(shù)據(jù)(以 “行 - 列” 存儲的結(jié)構(gòu)化數(shù)據(jù),如 Excel 表、數(shù)據(jù) ...
2025-09-16MySQL 執(zhí)行計劃中 rows 數(shù)量的準(zhǔn)確性解析:原理、影響因素與優(yōu)化 在 MySQL SQL 調(diào)優(yōu)中,EXPLAIN執(zhí)行計劃是核心工具,而其中的row ...
2025-09-15解析 Python 中 Response 對象的 text 與 content:區(qū)別、場景與實踐指南 在 Python 進(jìn)行 HTTP 網(wǎng)絡(luò)請求開發(fā)時(如使用requests ...
2025-09-15CDA 數(shù)據(jù)分析師:激活表格結(jié)構(gòu)數(shù)據(jù)價值的核心操盤手 表格結(jié)構(gòu)數(shù)據(jù)(如 Excel 表格、數(shù)據(jù)庫表)是企業(yè)最基礎(chǔ)、最核心的數(shù)據(jù)形態(tài) ...
2025-09-15Python HTTP 請求工具對比:urllib.request 與 requests 的核心差異與選擇指南 在 Python 處理 HTTP 請求(如接口調(diào)用、數(shù)據(jù)爬取 ...
2025-09-12解決 pd.read_csv 讀取長浮點數(shù)據(jù)的科學(xué)計數(shù)法問題 為幫助 Python 數(shù)據(jù)從業(yè)者解決pd.read_csv讀取長浮點數(shù)據(jù)時的科學(xué)計數(shù)法問題 ...
2025-09-12CDA 數(shù)據(jù)分析師:業(yè)務(wù)數(shù)據(jù)分析步驟的落地者與價值優(yōu)化者 業(yè)務(wù)數(shù)據(jù)分析是企業(yè)解決日常運營問題、提升執(zhí)行效率的核心手段,其價值 ...
2025-09-12用 SQL 驗證業(yè)務(wù)邏輯:從規(guī)則拆解到數(shù)據(jù)把關(guān)的實戰(zhàn)指南 在業(yè)務(wù)系統(tǒng)落地過程中,“業(yè)務(wù)邏輯” 是連接 “需求設(shè)計” 與 “用戶體驗 ...
2025-09-11塔吉特百貨孕婦營銷案例:數(shù)據(jù)驅(qū)動下的精準(zhǔn)零售革命與啟示 在零售行業(yè) “流量紅利見頂” 的當(dāng)下,精準(zhǔn)營銷成為企業(yè)突圍的核心方 ...
2025-09-11CDA 數(shù)據(jù)分析師與戰(zhàn)略 / 業(yè)務(wù)數(shù)據(jù)分析:概念辨析與協(xié)同價值 在數(shù)據(jù)驅(qū)動決策的體系中,“戰(zhàn)略數(shù)據(jù)分析”“業(yè)務(wù)數(shù)據(jù)分析” 是企業(yè) ...
2025-09-11Excel 數(shù)據(jù)聚類分析:從操作實踐到業(yè)務(wù)價值挖掘 在數(shù)據(jù)分析場景中,聚類分析作為 “無監(jiān)督分組” 的核心工具,能從雜亂數(shù)據(jù)中挖 ...
2025-09-10統(tǒng)計模型的核心目的:從數(shù)據(jù)解讀到?jīng)Q策支撐的價值導(dǎo)向 統(tǒng)計模型作為數(shù)據(jù)分析的核心工具,并非簡單的 “公式堆砌”,而是圍繞特定 ...
2025-09-10CDA 數(shù)據(jù)分析師:商業(yè)數(shù)據(jù)分析實踐的落地者與價值創(chuàng)造者 商業(yè)數(shù)據(jù)分析的價值,最終要在 “實踐” 中體現(xiàn) —— 脫離業(yè)務(wù)場景的分 ...
2025-09-10機器學(xué)習(xí)解決實際問題的核心關(guān)鍵:從業(yè)務(wù)到落地的全流程解析 在人工智能技術(shù)落地的浪潮中,機器學(xué)習(xí)作為核心工具,已廣泛應(yīng)用于 ...
2025-09-09