久久亚洲视频-成人av免费在线-亚洲免费大片-www.国产精品.com-又黄又爽又色的视频-精品乱子伦一区二区-无码人妻精品一区二区三区66-欧美一级做-国产在线国偷精品免费看-欧美性极品少妇-精品无码久久久久久久久久

樂(lè)思軟件

提交需求|聯(lián)系我們|請(qǐng)電400-603-8000

大數(shù)據(jù)Hadoop應(yīng)用分析案例:電信業(yè)的應(yīng)對(duì)之策


    對(duì)用戶(hù)而言,他也是想知道流量到底什么時(shí)候發(fā)生的,如果手機(jī)的問(wèn)題,他也知道怎么進(jìn)行防范,這樣就不會(huì)發(fā)生類(lèi)似問(wèn)題,根據(jù)客戶(hù)部門(mén)提供的數(shù)據(jù),可能因?yàn)闊o(wú)法提供商網(wǎng)流量詳單造成退費(fèi)和賠付,會(huì)影響到運(yùn)營(yíng)商流量計(jì)費(fèi)商務(wù)模式,所以我們建立這種系統(tǒng)意義非常大,第一,我們的系統(tǒng)供聯(lián)通客服人員使用,提供快速查詢(xún)服務(wù),解決流量投訴的問(wèn)題,另外,我們也準(zhǔn)備向最終用戶(hù)提供異常的大流量查詢(xún)服務(wù)。再一個(gè)問(wèn)題,上網(wǎng)記錄數(shù)據(jù)本身是數(shù)據(jù)的金礦,我們可以通過(guò)獲取上網(wǎng)數(shù)據(jù)記錄對(duì)流量進(jìn)行統(tǒng)計(jì)。


    海量數(shù)據(jù)的應(yīng)對(duì)之策


    對(duì)于以上這些問(wèn)題該如何應(yīng)對(duì)呢?聯(lián)通研究院處長(zhǎng)王志軍分析處理問(wèn)題的難點(diǎn):上網(wǎng)記錄數(shù)據(jù)是海量數(shù)據(jù),經(jīng)過(guò)我們的系統(tǒng)可以分析到,用戶(hù)每個(gè)用上網(wǎng)記錄基本幾萬(wàn)到幾十萬(wàn),有的用戶(hù)五六十萬(wàn),我們現(xiàn)在采用的方案是在網(wǎng)關(guān)所有用戶(hù)流量必經(jīng)地方采集,分析流量數(shù)據(jù),然后上成上網(wǎng)記錄話(huà)單,話(huà)單量非常大。


    聯(lián)通研究院處長(zhǎng)王志軍表示,例如用移動(dòng)手機(jī)訪問(wèn)新浪網(wǎng)首頁(yè),對(duì)流量采集設(shè)備基本能生成20條左右上網(wǎng)記錄話(huà)單,如果點(diǎn)iPad新聞鏈接,恐怕會(huì)產(chǎn)生180條上網(wǎng)記錄,如果訪問(wèn)淘寶網(wǎng)首頁(yè),會(huì)產(chǎn)生60條請(qǐng)求和回應(yīng),在手機(jī)上網(wǎng)記錄當(dāng)中有大量DNS查詢(xún)和推送服務(wù)。以中國(guó)聯(lián)通某一個(gè)中等省份公司為例,日均上網(wǎng)記錄達(dá)到10億條,每個(gè)月的數(shù)據(jù)接近9T,整個(gè)移動(dòng)互聯(lián)網(wǎng)也在快速發(fā)展。


    根據(jù)中國(guó)聯(lián)通統(tǒng)計(jì),每隔6個(gè)月中國(guó)聯(lián)通用戶(hù)整體上網(wǎng)流量會(huì)翻一番,去年平均3G每用戶(hù)的流量一年之內(nèi)翻一番,整個(gè)流量增長(zhǎng)非常迅速,也帶來(lái)了上網(wǎng)記錄的量非常非常大。


    傳統(tǒng)IOE方式,IBM小型機(jī),思科數(shù)據(jù)庫(kù)存儲(chǔ),EMC存儲(chǔ),思科數(shù)據(jù)庫(kù)存儲(chǔ)這么大上網(wǎng)記錄時(shí)候已經(jīng)不可能了,所以,聯(lián)想采用開(kāi)源的Hadoop解決,Hadoop本身是系統(tǒng)架構(gòu),也是開(kāi)源項(xiàng)目,由Apache基金會(huì)開(kāi)發(fā),Hadoop本身最底層是分布式文件系統(tǒng),這個(gè)分布式文件系統(tǒng)叫HDFL,在它之上有分布式處理框架,基于Hadoop整個(gè)開(kāi)源項(xiàng)目,上面構(gòu)建了結(jié)構(gòu)化的訪問(wèn)數(shù)據(jù)庫(kù),在這之上又提供了類(lèi)似的數(shù)據(jù)挖掘工具,另外也提供了一些分布式同步,以及遠(yuǎn)程調(diào)用和序列化工具。


    Hadoop伴隨大數(shù)據(jù)一同火爆起來(lái)。現(xiàn)如今,Hadoop已經(jīng)無(wú)人不知無(wú)人不曉。Hadoop從它一誕生的那天開(kāi)始就與大數(shù)據(jù)深深地關(guān)聯(lián)到了一起。眾所周知,大數(shù)據(jù)多是出現(xiàn)在這些領(lǐng)域,包括金融、電信、保險(xiǎn)以及一些大型互聯(lián)網(wǎng)企業(yè)等。以電信行業(yè)為例,Hadoop在這些領(lǐng)域的應(yīng)用情況是怎么樣的呢?


    Hadoop+HBase+ MapReduce


    對(duì)于Hadoop分布式文件系統(tǒng)本身來(lái)說(shuō),重要的出發(fā)點(diǎn)在于硬件故障是常態(tài),不是非異常的狀態(tài),我們可以摒棄采用IBM小型機(jī)方案,Hadoop中數(shù)據(jù)可以自動(dòng)復(fù)制,一份數(shù)據(jù)可以復(fù)制成三份,第一份在一臺(tái)服務(wù)器上,第二份數(shù)據(jù)在另外一臺(tái)機(jī)架的另外一臺(tái)服務(wù)器上,第三份數(shù)據(jù)可能在另外一臺(tái)機(jī)架的另外一臺(tái)服務(wù)器上,作為分布式文件系統(tǒng),每次請(qǐng)求寫(xiě)入的磁盤(pán)和服務(wù)器物理地點(diǎn)可能不一樣,可以帶來(lái)高并發(fā)的讀寫(xiě)請(qǐng)求。


    MapReduce框架分成很多數(shù)據(jù)級(jí),最后再合并處理。HBase分布式數(shù)據(jù)庫(kù)是分布式存儲(chǔ)系統(tǒng),主要特點(diǎn)在正它是四維存儲(chǔ)系統(tǒng),傳統(tǒng)的數(shù)據(jù)庫(kù)是二維表的結(jié)構(gòu),有行、有列,對(duì)它來(lái)說(shuō),除了有行之外,有列的概念,在列和行之間又可以存放多個(gè)版本,在這種情況下相當(dāng)于四維表結(jié)構(gòu),好處在于可以靈活的表格結(jié)構(gòu),每個(gè)列組里面的列后來(lái)都可以隨機(jī)應(yīng)變,我們的采集系統(tǒng)現(xiàn)在在采集一些字段,未來(lái)的發(fā)展過(guò)程中,為了數(shù)據(jù)挖掘的需要,會(huì)采集更多的字段,方便我們?cè)谝粋€(gè)結(jié)構(gòu)之下進(jìn)行更多信息的存儲(chǔ)以及后續(xù)的處理工作。

集成系統(tǒng)網(wǎng)絡(luò)情報(bào)信息數(shù)據(jù)庫(kù)

CIO頻道人物視窗
CIO頻道方案案例庫(kù)
大數(shù)據(jù)建設(shè)方案案例庫(kù)
電子政務(wù)建設(shè)方案案例庫(kù)
互聯(lián)集成系統(tǒng)構(gòu)建方案案例庫(kù)
商務(wù)智能建設(shè)方案案例庫(kù)
系統(tǒng)集成類(lèi)軟件信息研發(fā)企業(yè)名錄