大數(shù)據(jù)準(zhǔn)備度自我評(píng)分表實(shí)驗(yàn)總結(jié)

上傳人：愛*** IP屬地：重慶上傳時(shí)間：2022-07-13 格式：DOCX 頁數(shù)：3 大?。?5.96KB 積分：6 舉報(bào) 版權(quán)申訴

大數(shù)據(jù)準(zhǔn)備度自我評(píng)分表實(shí)驗(yàn)總結(jié)_第2頁

大數(shù)據(jù)準(zhǔn)備度自我評(píng)分表實(shí)驗(yàn)總結(jié)_第3頁

全文預(yù)覽已結(jié)束

下載本文檔

版權(quán)說明：本文檔由用戶提供并上傳，收益歸屬內(nèi)容提供方，若內(nèi)容存在侵權(quán)，請進(jìn)行舉報(bào)或認(rèn)領(lǐng)

文檔簡介

1、大數(shù)據(jù)準(zhǔn)備度自我評(píng)分表實(shí)驗(yàn)總結(jié)一、數(shù)據(jù)挖掘?qū)ο蟾鶕?jù)信息存儲(chǔ)格式，用于挖掘的對象有關(guān)系數(shù)據(jù)庫、面向?qū)ο髷?shù)據(jù)庫、數(shù)據(jù)倉庫、文本數(shù)據(jù)源、多媒體數(shù)據(jù)庫、空間數(shù)據(jù)庫、時(shí)態(tài)數(shù)據(jù)庫、異質(zhì)數(shù)據(jù)庫以及Internet等。二、數(shù)據(jù)挖掘流程定義問題：清晰地定義出業(yè)務(wù)問題，確定數(shù)據(jù)挖掘的目的。數(shù)據(jù)準(zhǔn)備：數(shù)據(jù)準(zhǔn)備包括：選擇數(shù)據(jù)在大型數(shù)據(jù)庫和數(shù)據(jù)倉庫目標(biāo)中提取數(shù)據(jù)挖掘的目標(biāo)數(shù)據(jù)集;數(shù)據(jù)預(yù)處理進(jìn)行數(shù)據(jù)再加工，包括檢查數(shù)據(jù)的完整性及數(shù)據(jù)的一致性、去噪聲，填補(bǔ)丟失的域，刪除無效數(shù)據(jù)等。數(shù)據(jù)挖掘：根據(jù)數(shù)據(jù)功能的類型和和數(shù)據(jù)的特點(diǎn)選擇相應(yīng)的算法，在凈化和轉(zhuǎn)換過的數(shù)據(jù)集上進(jìn)行數(shù)據(jù)挖掘。結(jié)果分析：對數(shù)據(jù)挖掘的結(jié)果進(jìn)行解釋和評(píng)價(jià)，轉(zhuǎn)換

2、成為能夠最終被用戶理解的知識(shí)。三、數(shù)據(jù)挖掘分類直接數(shù)據(jù)挖掘：目標(biāo)是利用可用的數(shù)據(jù)建立一個(gè)模型，這個(gè)模型對剩余的數(shù)據(jù)，對一個(gè)特定的變量(可以理解成數(shù)據(jù)庫中表的屬性，即列)進(jìn)行描述。間接數(shù)據(jù)挖掘：目標(biāo)中沒有選出某一具體的變量，用模型進(jìn)行描述;而是在所有的變量中建立起某種關(guān)系。四、數(shù)據(jù)挖掘的方法神經(jīng)網(wǎng)絡(luò)方法神經(jīng)網(wǎng)絡(luò)由于本身良好的魯棒性、自組織自適應(yīng)性、并行處理、分布存儲(chǔ)和高度容錯(cuò)等特性非常適合解決數(shù)據(jù)挖掘的問題，因此近年來越來越受到人們的關(guān)注。遺傳算法遺傳算法是一種基于生物自然選擇與遺傳機(jī)理的隨機(jī)搜索算法，是一種仿生全局優(yōu)化方法。遺傳算法具有的隱含并行性、易于和其它模型結(jié)合等性質(zhì)使得它在數(shù)據(jù)挖掘中被

3、加以應(yīng)用。決策樹方法決策樹是一種常用于預(yù)測模型的算法，它通過將大量數(shù)據(jù)有目的分類，從中找到一些有價(jià)值的，潛在的信息。它的主要優(yōu)點(diǎn)是描述簡單，分類速度快，特別適合大規(guī)模的數(shù)據(jù)處理。粗集方法粗集理論是一種研究不精確、不確定知識(shí)的數(shù)學(xué)工具。粗集方法有幾個(gè)優(yōu)點(diǎn)：不需要給出額外信息;簡化輸入信息的表達(dá)空間;算法簡單，易于操作。粗集處理的對象是類似二維關(guān)系表的信息表。覆蓋正例排斥反例方法它是利用覆蓋所有正例、排斥所有反例的思想來尋找規(guī)則。首先在正例集合中任選一個(gè)種子，到反例集合中逐個(gè)比較。與字段取值構(gòu)成的選擇子相容則舍去，相反則保留。按此思想循環(huán)所有正例種子，將得到正例的規(guī)則(選擇子的合取式)。統(tǒng)計(jì)分析方

4、法在數(shù)據(jù)庫字段項(xiàng)之間存在兩種關(guān)系：函數(shù)關(guān)系和相關(guān)關(guān)系，對它們的分析可采用統(tǒng)計(jì)學(xué)方法，即利用統(tǒng)計(jì)學(xué)原理對數(shù)據(jù)庫中的信息進(jìn)行分析?？蛇M(jìn)行常用統(tǒng)計(jì)、回歸分析、相關(guān)分析、差異分析等。模糊集方法即利用模糊集合理論對實(shí)際問題進(jìn)行模糊評(píng)判、模糊決策、模糊模式識(shí)別和模糊聚類分析。系統(tǒng)的復(fù)雜性越高，模糊性越強(qiáng)，一般模糊集合理論是用隸屬度來刻畫模糊事物的亦此亦彼性的。五、數(shù)據(jù)挖掘任務(wù)關(guān)聯(lián)分析兩個(gè)或兩個(gè)以上變量的取值之間存在某種規(guī)律性，就稱為關(guān)聯(lián)。數(shù)據(jù)關(guān)聯(lián)是數(shù)據(jù)庫中存在的一類重要的、可被發(fā)現(xiàn)的知識(shí)。關(guān)聯(lián)分為簡單關(guān)聯(lián)、時(shí)序關(guān)聯(lián)和因果關(guān)聯(lián)。關(guān)聯(lián)分析的目的是找出數(shù)據(jù)庫中隱藏的關(guān)聯(lián)網(wǎng)。一般用支持度和可信度兩個(gè)閥值來度量關(guān)聯(lián)規(guī)則的相關(guān)性，還不斷引入興趣度、相關(guān)性等參數(shù)，使得所挖掘的規(guī)則更符合需求。聚類分析聚類是把數(shù)據(jù)按照相似性歸納成若干類別，同一類中的數(shù)據(jù)彼此相似，不同類中的數(shù)據(jù)相異。聚類分析可以建立宏觀的概念，發(fā)現(xiàn)數(shù)據(jù)的分布模式，以及可能的數(shù)據(jù)屬性之間的相互關(guān)系。分類分類就是找出一個(gè)類別的概念描述，它代表了這類數(shù)據(jù)的整體信息，即該類的內(nèi)涵描述，并用這種描述來構(gòu)造模型，一般用規(guī)則或決策樹模式表示。分類是利用訓(xùn)練數(shù)據(jù)集通過一定的算法而求得分類規(guī)則。分類可被用于規(guī)則描述和預(yù)測。預(yù)測預(yù)測是利用歷史數(shù)據(jù)找出變化規(guī)律，建立模型，并由此模型對未來數(shù)據(jù)的種類及特征進(jìn)行預(yù)測。預(yù)測關(guān)心的是精度和不確定性，通常用預(yù)測方

人人文庫> 全部分類> 應(yīng)用文書 > 事務(wù)文書

溫馨提示

1. 本站所有資源如無特殊說明，都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請下載最新的WinRAR軟件解壓。
2. 本站的文檔不包含任何第三方提供的附件圖紙等，如果需要附件，請聯(lián)系上傳者。文件的所有權(quán)益歸上傳用戶所有。
3. 本站RAR壓縮包中若帶圖紙，網(wǎng)頁內(nèi)容里面會(huì)有圖紙預(yù)覽，若沒有圖紙預(yù)覽就沒有圖紙。
4. 未經(jīng)權(quán)益所有人同意不得將文件中的內(nèi)容挪作商業(yè)或盈利用途。
5. 人人文庫網(wǎng)僅提供信息存儲(chǔ)空間，僅對用戶上傳內(nèi)容的表現(xiàn)方式做保護(hù)處理，對用戶上傳分享的文檔內(nèi)容本身不做任何修改或編輯，并不能對任何下載內(nèi)容負(fù)責(zé)。
6. 下載文件中如有侵權(quán)或不適當(dāng)內(nèi)容，請與我們聯(lián)系，我們立即糾正。
7. 本站不保證下載資源的準(zhǔn)確性、安全性和完整性, 同時(shí)也不承擔(dān)用戶因使用這些下載資源對自己和他人造成任何形式的傷害或損失。

大數(shù)據(jù)準(zhǔn)備度自我評(píng)分表實(shí)驗(yàn)總結(jié)

文檔簡介

溫馨提示

最新文檔

評(píng)論

大數(shù)據(jù)準(zhǔn)備度自我評(píng)分表實(shí)驗(yàn)總結(jié)

文檔簡介

溫馨提示

最新文檔

評(píng)論

相關(guān)文檔