
信息時代大數據的再認識
大數據已成為媒體與大眾關注的新技術,大數據的應用也預示著信息時代將進入一個新階段,但人們對大數據的認識有一個不斷加深的過程。在當下的信息時代,我們對大數據應有新的再認識。
大數據興起預示信息時代進入新階段
中國已開始進入信息時代,但許多人的思想還停留在工業(yè)時代。經濟和科技工作中出現的許多問題,其根源是對時代的認識不到位。經濟新常態(tài)意味著中國進入了以信息化帶動新型工業(yè)化、城鎮(zhèn)化和農業(yè)現代化的新階段。大數據、移動互聯網、社交網絡、云計算、物聯網等新一代信息技術構成的IT架構“第三平臺”是信息社會進入新階段的標志,對整個經濟的轉型有引領和帶動作用。媒體上經常出現的互聯網+、創(chuàng)客、“第二次機器革命”、“工業(yè)4.0”等都與大數據和云計算有關。大數據和云計算是新常態(tài)下提高生產率的新杠桿,所謂創(chuàng)新驅動發(fā)展就是主要依靠信息技術促進生產率的提高。
中國的大數據企業(yè)已經有相當好的基礎。全球十大互聯網服務企業(yè)中國占有4席(阿里巴巴、騰訊、百度和京東),其他6個Top10 互聯網服務企業(yè)全部是美國企業(yè),歐洲和日本沒有互聯網企業(yè)進入Top10。這說明中國企業(yè)在基于大數據的互聯網服務業(yè)務上已處于世界前列。在發(fā)展大數據技術上,我國有可能改變過去30年技術受制于人的局面,在大數據應用上中國有可能在全世界起到引領作用。我們要吸取過去基礎研究為企業(yè)提供核心技術不夠的教訓,加強大數據基礎研究和前瞻技術研究,努力攻克大數據核心和關鍵技術。
理解大數據需要上升到文化和認識論的高度
數據文化的本質是尊重客觀世界的實事求是精神,數據就是事實。重視數據就是強調用事實說話、按理性思維的科學精神。中國人的傳統(tǒng)習慣是定性思維而不是定量思維。目前許多城市在開展政府數據開放共享工作,但是發(fā)現多數老百姓對政府要開放的數據并不感興趣。要讓大數據走上健康的發(fā)展軌道,首先要大力弘揚數據文化。數據文化不只是大數據用于文藝、出版等文化產業(yè),而是指全民的數據意識。全社會應認識到:信息化的核心是數據,只有政府和大眾都關注數據時,才能真正理解信息化的實質;數據是一種新的生產要素,大數據的利用可以改變資本和土地等傳統(tǒng)要素在經濟中的權重。
提高數據意識的關鍵是要理解大數據的戰(zhàn)略意義。數據是與物質、能源一樣重要的戰(zhàn)略資源,數據的采集和分析涉及每一個行業(yè),是帶有全局性和戰(zhàn)略性的技術。從硬技術到軟技術的轉變是當今全球性的技術發(fā)展趨勢,而從數據中發(fā)現價值的技術正是最有活力的軟技術,數據技術與數據產業(yè)的落后將使我們像錯過工業(yè)革命機會一樣延誤一個時代。
正確認識大數據的價值和效益
人們總是期望從大數據中挖掘出意想不到的“大價值”。實際上大數據的價值主要體現在它的驅動效應,即帶動有關的科研和產業(yè)發(fā)展,提高各行各業(yè)通過數據分析解決困難問題和增值的能力。大數據對經濟的貢獻并不完全反映在大數據公司的直接收入上,應考慮對其他行業(yè)效率和質量提高的貢獻。大數據是典型的通用技術,理解通用技術要采用“蜜蜂模型”:蜜蜂的效益主要不是自己釀的蜂蜜,而是蜜蜂傳粉對農業(yè)的貢獻。
有一個家喻戶曉的寓言可以從一個角度說明大數據的價值:一位老農民臨終前告訴他的3個兒子,他在他家的地中埋藏了一罐金子,但沒有講埋在哪里。他的兒子們把他家所有的地都深挖了一遍,沒有挖到金子,但由于深挖了土地,從此莊稼收成特別好。數據收集、分析的能力提高了,即使沒有發(fā)現什么普適的規(guī)律或令人完全想不到的新知識,大數據的價值也已逐步體現。
大數據研究和應用要改變過去各部門和各學科相互分割、獨立發(fā)展的傳統(tǒng)思路,重點不是支持單項技術和單個方法的發(fā)展,而是強調不同部門、不同學科的協作。數據科學不是垂直的“煙囪”,而是像環(huán)境、能源科學一樣的橫向集成科學。
從復雜性的角度看大數據研究和應用面臨的挑戰(zhàn)
圖文檢索、主題發(fā)現、語義分析、情感分析等數據分析工作十分困難,其原因是大數據涉及復雜的類型、復雜的結構和復雜的模式,數據本身具有很高的復雜性。大數據的復雜性還體現在數據之間的相互關聯。大數據計算不能像處理小樣本數據集那樣做全局數據的統(tǒng)計分析和迭代計算,在分析大數據時,需要重新審視和研究它的可計算性、計算復雜性和求解算法。
大數據應用本質上是在給定的時間、空間限制下,如何“算得多”。從“算得快”到“算得多”,考慮計算復雜性的思維邏輯有很大的轉變。所謂“算得多”并不是計算的數據量越大越好,需要探索從足夠多的數據,到剛剛好的數據,再到有價值的數據的按需約簡方法。
發(fā)展大數據應避免的誤區(qū)
不要一味追求“數據規(guī)模大”。大數據主要難點不是數據量大,而是數據類型多樣、要求及時回應和原始數據真假難辨?,F有數據庫軟件解決不了非結構化數據,要重視數據融合、數據格式的標準化和數據的互操作。采集的數據往往質量不高是大數據的特點之一,但盡可能提高原始數據的質量仍然值得重視。腦科學研究的最大問題就是采集的數據可信度差,基于可信度很差的數據難以分析出有價值的結果。
一味追求數據規(guī)模大不僅會造成浪費,而且效果未必很好。多個來源的小數據的集成融合可能挖掘出單一來源大數據得不到的大價值。應多在數據的融合技術上下功夫,重視數據的開放與共享。所謂數據規(guī)模大與應用領域有密切關系,有些領域幾個PB的數據未必算大,有些領域可能幾十TB已經是很大的規(guī)模。
發(fā)展大數據不能無止境地追求“更大、更多、更快”,要走低成本、低能耗、惠及大眾、公正法治的良性發(fā)展道路。要像現在治理環(huán)境污染一樣,及早關注大數據可能帶來的“污染”和侵犯隱私等各種弊端。
不要“技術驅動”,要“應用為先”。新的信息技術層出不窮,信息領域不斷冒出新概念、新名詞,估計繼“大數據”以后,“認知計算”、“可穿戴設備”、“機器人”等新技術又會進入炒作高峰。我們習慣于跟隨國外的熱潮,往往不自覺地跟著技術潮流走,最容易走上“技術驅動”的道路。實際上發(fā)展信息技術的目的是為人服務,檢驗一切技術的唯一標準是應用。發(fā)展大數據產業(yè)一定要堅持“應用為先”的發(fā)展戰(zhàn)略,堅持應用牽引的技術路線。技術有限,應用無限。各地發(fā)展云計算和大數據,一定要通過政策和各種措施調動應用部門和創(chuàng)新企業(yè)的積極性,通過跨界的組合創(chuàng)新開拓新的應用,從應用中找出路。
不能拋棄“小數據”方法。流行的“大數據”定義是:無法通過目前主流軟件工具在合理時間內采集、存儲、處理的數據集。這是用不能勝任的技術定義問題,可能導致認識的誤區(qū)。按照這種定義,人們可能只會重視目前解決不了的問題,如同走路的人想踩著自己身前的影子。其實,目前各行各業(yè)碰到的數據處理多數還是“小數據”問題。我們應重視實際碰到的問題,不管是大數據還是小數據。
大數據界流行一種看法:大數據不需要分析因果關系、不需要采樣、不需要精確數據。這種觀念不能絕對化,實際工作中要邏輯演繹和歸納相結合、白盒與黑盒研究相結合、大數據方法與小數據方法相結合。
要高度關注構建大數據平臺的成本。目前全國各地都在建設大數據中心,呂梁山下都建立了容量達2 PB以上的數據處理中心,許多城市公安部門要求存儲3個月以上的高清監(jiān)控錄像。這些系統(tǒng)的成本都非常高。數據挖掘的價值是用成本換來的,不能不計成本,盲目建設大數據系統(tǒng)。什么數據需要保存,要保存多少時間,應當根據可能的價值和所需的成本來決定。大數據系統(tǒng)技術還在研究之中,美國的E級超級計算機系統(tǒng)要求能耗降低1000倍,計劃到2024年才能研制出來,用現在的技術構建的巨型系統(tǒng)能耗極高。
我們不要攀比大數據系統(tǒng)的規(guī)模,而是要比實際應用效果,比完成同樣的事消耗更少的資源和能量。先抓老百姓最需要的大數據應用,因地制宜發(fā)展大數據。發(fā)展大數據與實現信息化的策略一樣:目標要遠大、起步要精準、發(fā)展要快速。
數據分析咨詢請掃描二維碼
若不方便掃碼,搜微信號:CDAshujufenxi
CDA 數據分析師報考條件詳解與準備指南? ? 在數據驅動決策的時代浪潮下,CDA 數據分析師認證愈發(fā)受到矚目,成為眾多有志投身數 ...
2025-07-18剛入職場或是在職場正面臨崗位替代、技能更新、人機協作等焦慮的打工人,想要找到一條破解職場焦慮和升職瓶頸的系統(tǒng)化學習提升 ...
2025-07-182025被稱為“AI元年”,而AI,與數據密不可分。網易公司創(chuàng)始人丁磊在《AI思維:從數據中創(chuàng)造價值的煉金術 ...
2025-07-18CDA 數據分析師:數據時代的價值挖掘者 在大數據席卷全球的今天,數據已成為企業(yè)核心競爭力的重要組成部分。從海量數據中提取有 ...
2025-07-18SPSS 賦值后數據不顯示?原因排查與解決指南? 在 SPSS( Statistical Package for the Social Sciences)數據分析過程中,變量 ...
2025-07-18在 DBeaver 中利用 MySQL 實現表數據同步操作指南? ? 在數據庫管理工作中,將一張表的數據同步到另一張表是常見需求,這有助于 ...
2025-07-18數據分析師的技能圖譜:從數據到價值的橋梁? 在數據驅動決策的時代,數據分析師如同 “數據翻譯官”,將冰冷的數字轉化為清晰的 ...
2025-07-17Pandas 寫入指定行數據:數據精細化管理的核心技能? 在數據處理的日常工作中,我們常常需要面對這樣的場景:在龐大的數據集里精 ...
2025-07-17解碼 CDA:數據時代的通行證? 在數字化浪潮席卷全球的今天,當企業(yè)決策者盯著屏幕上跳動的數據曲線尋找增長密碼,當科研人員在 ...
2025-07-17CDA 精益業(yè)務數據分析:數據驅動業(yè)務增長的實戰(zhàn)方法論 在企業(yè)數字化轉型的浪潮中,“數據分析” 已從 “加分項” 成為 “必修課 ...
2025-07-16MySQL 中 ADD KEY 與 ADD INDEX 詳解:用法、差異與優(yōu)化實踐 在 MySQL 數據庫表結構設計中,索引是提升查詢性能的核心手段。無論 ...
2025-07-16解析 MySQL Update 語句中 “query end” 狀態(tài):含義、成因與優(yōu)化指南? 在 MySQL 數據庫的日常運維與開發(fā)中,開發(fā)者和 DBA 常會 ...
2025-07-16如何考取數據分析師證書:以 CDA 為例? ? 在數字化浪潮席卷各行各業(yè)的當下,數據分析師已然成為企業(yè)挖掘數據價值、驅動決策的 ...
2025-07-15CDA 精益業(yè)務數據分析:驅動企業(yè)高效決策的核心引擎? 在數字經濟時代,企業(yè)面臨著前所未有的數據洪流,如何從海量數據中提取有 ...
2025-07-15MySQL 無外鍵關聯表的 JOIN 實戰(zhàn):數據整合的靈活之道? 在 MySQL 數據庫的日常操作中,我們經常會遇到需要整合多張表數據的場景 ...
2025-07-15Python Pandas:數據科學的瑞士軍刀? ? 在數據驅動的時代,面對海量、復雜的數據,如何高效地進行處理、分析和挖掘成為關鍵。 ...
2025-07-15用 SQL 生成逆向回滾 SQL:數據操作的 “后悔藥” 指南? 在數據庫操作中,誤刪數據、錯改字段或誤執(zhí)行批量更新等問題時有發(fā)生。 ...
2025-07-14t檢驗與Wilcoxon檢驗的選擇:何時用t.test,何時用wilcox.test? t 檢驗與 Wilcoxon 檢驗的選擇:何時用 t.test,何時用 wilcox. ...
2025-07-14AI 浪潮下的生存與進階: CDA數據分析師—開啟新時代職業(yè)生涯的鑰匙(深度研究報告、發(fā)展指導白皮書) 發(fā)布機構:CDA數據科 ...
2025-07-13LSTM 模型輸入長度選擇技巧:提升序列建模效能的關鍵? 在循環(huán)神經網絡(RNN)家族中,長短期記憶網絡(LSTM)憑借其解決長序列 ...
2025-07-11