版權(quán)說(shuō)明:本文檔由用戶提供并上傳,收益歸屬內(nèi)容提供方,若內(nèi)容存在侵權(quán),請(qǐng)進(jìn)行舉報(bào)或認(rèn)領(lǐng)
文檔簡(jiǎn)介
論搜索引擎中文自動(dòng)分詞技術(shù)【摘要】搜索引擎是應(yīng)用在web上的軟件系統(tǒng),它以一定的策略搜集和發(fā)現(xiàn)信息,再對(duì)信息進(jìn)行處理和組織后為用戶提供web信息查詢服務(wù)。搜索引擎分三個(gè)大模塊:網(wǎng)頁(yè)搜集,預(yù)處理和查詢服務(wù)。其中對(duì)搜索信息的預(yù)處理階段的關(guān)鍵技術(shù)是中文分詞和建立倒排文件,本文主要論述搜索引擎工作過(guò)程中的中文自動(dòng)分詞技術(shù)?!娟P(guān)鍵字】:搜索引擎,中文分詞,分詞方法,分詞難題【正文】信息的飛速增長(zhǎng),使搜索引擎成為人們查找信息的首選工具,Google、百度等大型搜索引擎一直是人們討論的話題。目前在中文搜索引擎領(lǐng)域,國(guó)內(nèi)的搜索引擎已經(jīng)和國(guó)外的搜索引擎效果上相差不遠(yuǎn)。之所以能形成這樣的局面,有一個(gè)重要的原因就在于中文和英文兩種語(yǔ)言自身的書(shū)寫(xiě)方式不同,這其中對(duì)于計(jì)算機(jī)涉及的技術(shù)就是中文分詞。為什么要進(jìn)行分詞?漢語(yǔ)是世界上最古老和最豐富的語(yǔ)言之一,但是漢語(yǔ)語(yǔ)法才有將近一百年的歷史,而且現(xiàn)代漢語(yǔ)白話文的形成歷史也比較短,加上漢語(yǔ)自身的特點(diǎn),因此它的形式化研究更加困難。對(duì)英文而言,是以詞為單位,詞與詞之間有空格隔開(kāi),而中文是以字為單位,多個(gè)字連在一起才能構(gòu)成一個(gè)表達(dá)具體含義的詞,詞與詞之間沒(méi)有分割,因此,對(duì)于支持自然語(yǔ)言檢索的工具,從語(yǔ)句中劃分出具有獨(dú)立意義的詞的過(guò)程即進(jìn)行中文分詞必不可少。什么是中文分詞?中文分詞技術(shù)就是搜索引擎針對(duì)用戶提交查詢的關(guān)鍵串進(jìn)行的查詢處理后,根據(jù)用戶的關(guān)鍵詞串用各種匹配方法進(jìn)行的一種技術(shù)。中文分還可以將上述各種方法相互組合,例如,可以將正向最大匹配方法和逆向最大匹配方法結(jié)合起來(lái)構(gòu)成雙向匹配法。由于漢語(yǔ)單字成詞的特點(diǎn),正向最小匹配和逆向最小匹配一般很少使用。一般說(shuō)來(lái),逆向匹配的切分精度略高于正向匹配,遇到的歧義現(xiàn)象也較少。統(tǒng)計(jì)結(jié)果表明,單純使用正向最大匹配的錯(cuò)誤率為1/169,單純使用逆向最大匹配的錯(cuò)誤率為1/245。但這種精度還遠(yuǎn)遠(yuǎn)不能滿足實(shí)際的需要。實(shí)際使用的分詞系統(tǒng),都是把機(jī)械分詞作為一種初分手段,還需通過(guò)利用各種其它的語(yǔ)言信息來(lái)進(jìn)一步提高切分的準(zhǔn)確率。一種方法是改進(jìn)掃描方式,稱為特征掃描或標(biāo)志切分,優(yōu)先在待分析字符串中識(shí)別和切分出一些帶有明顯特征的詞,以這些詞作為斷點(diǎn),可將原字符串分為較小的串再來(lái)進(jìn)機(jī)械分詞,從而減少匹配的錯(cuò)誤率。另一種方法是將分詞和詞類標(biāo)注結(jié)合起來(lái),利用豐富的詞類信息對(duì)分詞決策提供幫助,并且在標(biāo)注過(guò)程中又反過(guò)來(lái)對(duì)分詞結(jié)果進(jìn)行檢驗(yàn)、調(diào)整,從而極大地提高切分的準(zhǔn)確率。(二)
全切分和基于詞的頻度統(tǒng)計(jì)的分詞方法基于詞的頻度統(tǒng)計(jì)的分詞方法是一種全切分方法。在討論這個(gè)方法之前我們先要明白有關(guān)全切分的相關(guān)內(nèi)容。(1)全切分全切分要求獲得輸入序列的所有可接受的切分形式,而部分切分只取得一種或幾種可接受的切分形式,由于部分切分忽略了可能的其他切分形式,所以建立在部分切分基礎(chǔ)上的分詞方法不管采取何種歧義糾正策略,都可能會(huì)遺漏正確的切分,造成分詞錯(cuò)誤或失敗。而建立在全切分基礎(chǔ)上的分詞方法,由于全切分取得了所有可能的切分形式,因而從根本上避免了可能切分形式的遺漏,克服了部分切分方法的缺陷。全切分算法能取得所有可能的切分形式,它的句子覆蓋率和分詞覆蓋率均為100%,但全切分分詞并沒(méi)有在文本處理中廣泛地采用。(2)基于詞的頻度統(tǒng)計(jì)的分詞方法:這是一種全切分方法。它不依靠詞典,而是將文章中任意兩個(gè)字同時(shí)出現(xiàn)的頻率進(jìn)行統(tǒng)計(jì),次數(shù)越高的就可能是一個(gè)詞。它首先切分出與詞表匹配的所有可能的詞,運(yùn)用統(tǒng)計(jì)語(yǔ)言模型和決策算法決定最優(yōu)的切分結(jié)果。它的優(yōu)點(diǎn)在于可以發(fā)現(xiàn)所有的切分歧義并且容易將新詞提取出來(lái)。(三)基于知識(shí)理解的分詞方法該方法主要基于句法、語(yǔ)法分析,并結(jié)合語(yǔ)義分析,通過(guò)對(duì)上下文內(nèi)容所提供信息的分析對(duì)詞進(jìn)行定界,它通常包括三個(gè)部分:分詞子系統(tǒng)、句法語(yǔ)義子系統(tǒng)、總控部分。在總控部分的協(xié)調(diào)下,分詞子系統(tǒng)可以獲得有關(guān)詞、句子等的句法和語(yǔ)義信息來(lái)對(duì)分詞歧義進(jìn)行判斷。這類方法試圖讓機(jī)器具有人類的理解能力,需要使用大量的語(yǔ)言知識(shí)和信息。由于漢語(yǔ)語(yǔ)言知識(shí)的籠統(tǒng)、復(fù)雜性,難以將各種語(yǔ)言信息組織成機(jī)器可直接讀取的形式。因此目前基于知識(shí)的分詞系統(tǒng)還處在試驗(yàn)階段。(四)一種新的分詞方法并行分詞方法:這種分詞方法借助于一個(gè)含有分詞詞庫(kù)的管道進(jìn)行
,比較匹配過(guò)程是分步進(jìn)行的
,每一步可以對(duì)進(jìn)入管道中的詞同時(shí)與詞庫(kù)中相應(yīng)的詞進(jìn)行比較
,由于同時(shí)有多個(gè)詞進(jìn)行比較匹配
,因而分詞速度可以大幅度提高。這種方法涉及到多級(jí)內(nèi)碼理論和管道的詞典數(shù)據(jù)結(jié)構(gòu)。到底哪種分詞算法的準(zhǔn)確度更高,目前并無(wú)定論。對(duì)于任何一個(gè)成熟的分詞系統(tǒng)來(lái)說(shuō),不可能單獨(dú)依靠某一種算法來(lái)實(shí)現(xiàn),都需要綜合不同的算法。筆者了解,海量科技的分詞算法就采用“復(fù)方分詞法”,所謂復(fù)方,相當(dāng)于用中藥中的復(fù)方概念,即用不同的藥才綜合起來(lái)去醫(yī)治疾病,同樣,對(duì)于中文詞的識(shí)別,需要多種算法來(lái)處理不同的問(wèn)題。分詞中的難題有了成熟的分詞算法,是否就能容易的解決中文分詞的問(wèn)題呢?事實(shí)遠(yuǎn)非如此。中文是一種十分復(fù)雜的語(yǔ)言,讓計(jì)算機(jī)理解中文語(yǔ)言更是困難。在中文分詞過(guò)程中,有兩大難題一直沒(méi)有完全突破。(一)切分歧義就人對(duì)漢語(yǔ)的理解而言,漢語(yǔ)的分詞是一個(gè)理解的過(guò)程,這個(gè)過(guò)程綜合了詞法、語(yǔ)法、語(yǔ)義等各種信息。因此,一個(gè)理想的分詞系統(tǒng)也應(yīng)綜合運(yùn)用這些信息,而在計(jì)算機(jī)處理中這些信息的提取又是以分詞為前提的。所以,分詞與這些信息的運(yùn)用是既相聯(lián)系又相制約的一種相輔相成的關(guān)系,而純粹的機(jī)械切分必然會(huì)帶來(lái)切分歧義。歧義是指同樣的一句話,可能有兩種或者更多的切分方法。例如:學(xué)歷史知識(shí),因?yàn)椤皩W(xué)歷”和“歷史”都是詞,那么這個(gè)短語(yǔ)就可以分成“學(xué)歷”和“歷史”。這種稱為交叉歧義。像這種交叉歧義十分常見(jiàn)由于沒(méi)有人的知識(shí)去理解,計(jì)算機(jī)很難知道到底哪個(gè)方案正確。交叉歧義相對(duì)組合歧義來(lái)說(shuō)是還算比較容易處理,組合歧義就必需根據(jù)整個(gè)句子來(lái)判斷了。例如,在句子“這個(gè)門(mén)把手壞了”中,“把手”是個(gè)詞,但在句子“請(qǐng)把手拿開(kāi)”中,“把手”就不是一個(gè)詞;在句子“將軍任命了一名中將”中,“中將”是個(gè)詞,但在句子“產(chǎn)量三年中將增長(zhǎng)兩倍”中,“中將”就不再是詞。這些詞計(jì)算機(jī)又如何去識(shí)別?如果交叉歧義和組合歧義計(jì)算機(jī)都能解決的話,在歧義中還有一個(gè)難題,是真歧義。真歧義意思是給出一句話,由人去判斷也不知道哪個(gè)應(yīng)該是詞,哪個(gè)應(yīng)該不是詞。例如:“乒乓球拍賣完了”,可以切分成“乒乓球拍賣完了”、也可切分成“乒乓球拍賣完了”,如果沒(méi)有上下文其他的句子,恐怕誰(shuí)也不知道“拍賣”在這里算不算一個(gè)詞。(二)新詞專業(yè)術(shù)語(yǔ)稱為未登錄詞。也就是那些在字典中都沒(méi)有收錄過(guò),但又確實(shí)能稱為詞的那些詞。最典型的是人名,人可以很容易理解句子“張三虎是山東人”中,“張三虎”是個(gè)詞,因?yàn)槭且粋€(gè)人的名字,但要是讓計(jì)算機(jī)去識(shí)別就困難了。如果把“張三虎”做為一個(gè)詞收錄到字典中去,全世界有那么多名字,而且每時(shí)每刻都有新增的人名,收錄這些人名本身就是一項(xiàng)巨大的工程。即使這項(xiàng)工作可以完成,還是會(huì)存在問(wèn)題,例如:在句子“張三虎頭虎腦的”中,“張三虎”還能不能算詞?新詞中除了人名以外,還有機(jī)構(gòu)名、地名、產(chǎn)品名、商標(biāo)名、簡(jiǎn)稱、省略語(yǔ)等,還有目前網(wǎng)絡(luò)流行語(yǔ)詞,如“有沒(méi)有”、“傷不起”“神馬浮云”、“童鞋們”、“蘿莉”等等都是很難處理的問(wèn)題,而且這些又正好是人們經(jīng)常使用的詞,因此對(duì)于搜索引擎來(lái)說(shuō),分詞系統(tǒng)中的新詞識(shí)別十分重要。目前新詞識(shí)別準(zhǔn)確率已經(jīng)成為評(píng)價(jià)一個(gè)分詞系統(tǒng)好壞的重要標(biāo)志之一。判斷一個(gè)系統(tǒng)的中文分詞功能好壞,主要在于消歧功能和對(duì)未登錄詞識(shí)別功能。并且優(yōu)秀的分詞策略應(yīng)該是盡量不拆分,需要拆分時(shí),先把長(zhǎng)的拆成
溫馨提示
- 1. 本站所有資源如無(wú)特殊說(shuō)明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請(qǐng)下載最新的WinRAR軟件解壓。
- 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請(qǐng)聯(lián)系上傳者。文件的所有權(quán)益歸上傳用戶所有。
- 3. 本站RAR壓縮包中若帶圖紙,網(wǎng)頁(yè)內(nèi)容里面會(huì)有圖紙預(yù)覽,若沒(méi)有圖紙預(yù)覽就沒(méi)有圖紙。
- 4. 未經(jīng)權(quán)益所有人同意不得將文件中的內(nèi)容挪作商業(yè)或盈利用途。
- 5. 人人文庫(kù)網(wǎng)僅提供信息存儲(chǔ)空間,僅對(duì)用戶上傳內(nèi)容的表現(xiàn)方式做保護(hù)處理,對(duì)用戶上傳分享的文檔內(nèi)容本身不做任何修改或編輯,并不能對(duì)任何下載內(nèi)容負(fù)責(zé)。
- 6. 下載文件中如有侵權(quán)或不適當(dāng)內(nèi)容,請(qǐng)與我們聯(lián)系,我們立即糾正。
- 7. 本站不保證下載資源的準(zhǔn)確性、安全性和完整性, 同時(shí)也不承擔(dān)用戶因使用這些下載資源對(duì)自己和他人造成任何形式的傷害或損失。
最新文檔
- 基因與遺傳?。焊卸髡n件
- 捷達(dá)品牌感恩有您服務(wù)營(yíng)銷應(yīng)標(biāo)方案
- 2026年旅游規(guī)劃與管理專業(yè)考試題庫(kù)
- 2026年國(guó)際關(guān)系分析國(guó)際政治經(jīng)濟(jì)形勢(shì)預(yù)測(cè)題庫(kù)
- 2026年消防工程師考試實(shí)操題與理論知識(shí)題庫(kù)
- 2026年語(yǔ)言能力提升文學(xué)常識(shí)與翻譯技巧題庫(kù)
- 2026年建筑工程規(guī)范施工安全與質(zhì)量控制標(biāo)準(zhǔn)試題庫(kù)
- 2026年電子商務(wù)平臺(tái)運(yùn)營(yíng)與維護(hù)專業(yè)認(rèn)證題庫(kù)
- 室內(nèi)外改造工程專項(xiàng)施工方案
- 外立面鋁板門(mén)頭安裝施工技術(shù)方案
- 2026年bjt商務(wù)能力考試試題
- 廣東省廣州市番禺區(qū)2026屆高一數(shù)學(xué)第一學(xué)期期末聯(lián)考試題含解析
- 2026年廣東省佛山市高三語(yǔ)文聯(lián)合診斷性考試作文題及3篇范文:可以“重讀”甚至“重構(gòu)”這些過(guò)往
- 老年住院患者非計(jì)劃性拔管分析2026
- (2025)70周歲以上老年人換長(zhǎng)久駕照三力測(cè)試題庫(kù)(含參考答案)
- 2025年汽車駕駛員技師考試試題及答案含答案
- 觀看煤礦警示教育片寫(xiě)心得體會(huì)
- 《2021節(jié)能保溫規(guī)范大全》JGJ353-2017 焊接作業(yè)廠房供暖通風(fēng)與空氣調(diào)節(jié)設(shè)計(jì)規(guī)范
- 2025年國(guó)際中文教師證書(shū)考試真題附答案
- 濕地保護(hù)法宣傳解讀課件
- 倒掛井壁法施工安全技術(shù)保證措施
評(píng)論
0/150
提交評(píng)論