
目前,由于因特網(wǎng)的迅猛發(fā)展,國(guó)際上對(duì)于網(wǎng)絡(luò)內(nèi)容挖掘(Web Content Mining)與網(wǎng)絡(luò)情報(bào)監(jiān)測(cè)(Web Intelligence Monitoring)的研究越來(lái)越重視,研究者也越來(lái)越多。樂(lè)思軟件以應(yīng)用研究的角度,不斷跟蹤最新的理論成果與研究動(dòng)向,不斷學(xué)習(xí)實(shí)驗(yàn)融匯,開(kāi)發(fā)出觀念更新穎、功能更強(qiáng)大的信息處理工具軟件。
我們的網(wǎng)絡(luò)數(shù)據(jù)采集技術(shù)是建立在我們自己的理論與實(shí)踐之上的。 我們自己的理論基于對(duì)全球范圍內(nèi)的網(wǎng)絡(luò)信息采集研究學(xué)術(shù)論文的研究和我們的理論探索。 我們自己的實(shí)踐便是多年從事網(wǎng)絡(luò)數(shù)據(jù)采集服務(wù)分析處理上千個(gè)不同類型網(wǎng)站的實(shí)際經(jīng)驗(yàn)。在研究初期,我們從以下幾篇重要論文得到了啟發(fā):
大規(guī)模超文本搜索引擎Google的技術(shù)原理
The Anatomy of a Large-Scale Hypertextual Web Search Engine
該文為關(guān)于現(xiàn)代搜索引擎的經(jīng)典論文,在1998年由還在Stanford的Google創(chuàng)始人Sergey Brin與Lawrence Page作為博士論文發(fā)表。文中提出兩個(gè)重要技術(shù):其一為將全球分散的因特網(wǎng)網(wǎng)頁(yè)集中存儲(chǔ)與索引的實(shí)現(xiàn)技術(shù),其二為利用網(wǎng)頁(yè)間相互鏈接的信息,網(wǎng)頁(yè)內(nèi)部的文本語(yǔ)義信息與結(jié)構(gòu)信息來(lái)提高檢索結(jié)果的質(zhì)量。
從半結(jié)構(gòu)化文本與自由格式文本中學(xué)習(xí)信息抽取規(guī)則
Learning Infomation Extraction Rules For Semi-Structured and Free Text
作者Stephen
Soderland為華盛頓州立大學(xué)計(jì)算機(jī)科學(xué)系教授。本文的被引用次數(shù)高達(dá)50多次。論文以信息抽取系統(tǒng)WHISK系統(tǒng)為例,描述了如何以機(jī)器學(xué)習(xí)的方式,利用小規(guī)模樣本訓(xùn)練系統(tǒng)自動(dòng)學(xué)習(xí)目標(biāo)文本的抽取模式,從而實(shí)現(xiàn)自動(dòng)化信息抽取的一種技術(shù)。這種技術(shù)不但極具啟發(fā)意義而且很有實(shí)用價(jià)值。
從WWW中抽取模式與關(guān)系
Extracting Patterns and Relations from the World Wide Web
這是Sergey Brin的另外一篇力作。該論文提出一種叫DIPRE的方法,利用機(jī)器學(xué)習(xí)理論從大量文本中自動(dòng)提取模式與關(guān)系。文中利用這種方法從互聯(lián)網(wǎng)上分散的文本中提取圖書信息,即作者,標(biāo)題二元組。結(jié)果僅用了5本書的樣本集,就自動(dòng)擴(kuò)展到了15,000本書,而且有些書是最大的網(wǎng)上書店亞馬遜也沒(méi)有的。
樂(lè)思軟件通過(guò)面向客戶的軟件開(kāi)發(fā)過(guò)程捕獲潛在用戶的真正需求并準(zhǔn)確理解,在開(kāi)發(fā)之前形成系統(tǒng)設(shè)計(jì)模型說(shuō)明書,像建造一棟大廈一樣先勾畫出軟件的功能設(shè)計(jì)藍(lán)圖與界面設(shè)計(jì)藍(lán)圖,便于與用戶一起溝通獲取用戶的反饋意見(jiàn),以精確控制項(xiàng)目的范圍與具體目標(biāo),提高用戶的滿意度。 樂(lè)思軟件的軟件開(kāi)發(fā)流程遵循微軟發(fā)布的微軟解決方案框架,以保證產(chǎn)品研發(fā)的穩(wěn)定進(jìn)行,成功完成。
圖1 微軟解決方案框架
樂(lè)思軟件通過(guò)的層次化組件化的方式設(shè)計(jì)產(chǎn)品應(yīng)用軟件并加以實(shí)現(xiàn)。

圖2 應(yīng)用軟件的層次化組件化模型