999精品在线视频,手机成人午夜在线视频,久久不卡国产精品无码,中日无码在线观看,成人av手机在线观看,日韩精品亚洲一区中文字幕,亚洲av无码人妻,四虎国产在线观看 ?

網(wǎng)絡(luò)熱點(diǎn)信息發(fā)現(xiàn)系統(tǒng)的設(shè)計(jì)與實(shí)現(xiàn)

2014-03-08 02:01:45邱海健
自動化與儀表 2014年8期
關(guān)鍵詞:評價檢測信息

邱海健

(南京工業(yè)大學(xué) 電子與信息工程學(xué)院,南京 211816)

隨著計(jì)算機(jī)網(wǎng)絡(luò)技術(shù)的快速發(fā)展,大量網(wǎng)民認(rèn)為互聯(lián)網(wǎng)是獲取信息的最重要的渠道,網(wǎng)絡(luò)信息的爆炸增長和網(wǎng)民參與熱情的空前高漲使得對網(wǎng)絡(luò)內(nèi)容的監(jiān)控和管理變得十分迫切和緊要,而面對海量的互聯(lián)網(wǎng)信息,網(wǎng)絡(luò)輿論信息為其中比較突出的代表,網(wǎng)絡(luò)輿論是在互聯(lián)網(wǎng)上傳播的公眾對某一焦點(diǎn)所表現(xiàn)出的有一定影響力的、帶傾向性的意見,而且網(wǎng)民言論同時具有巨大的信息爆發(fā)力和輿論影響力[1]。

互聯(lián)網(wǎng)上,熱點(diǎn)話題表現(xiàn)為互聯(lián)網(wǎng)用戶閱讀網(wǎng)頁、回帖和跟帖等,隨著網(wǎng)民的關(guān)注和事情的發(fā)展和變化,討論中心也會發(fā)生改變,同時真實(shí)地反映了大多數(shù)網(wǎng)民對該事件的態(tài)度。可見,獲取熱點(diǎn)信息變得更加重要。

根據(jù)某單位的需求,要及時地發(fā)現(xiàn)熱點(diǎn)問題和熱點(diǎn)話題的變化[2],提出熱點(diǎn)信息發(fā)現(xiàn)系統(tǒng)。系統(tǒng)主要功能是利用Web技術(shù)[3]采集頁面信息并且根據(jù)Single Pass算法熱點(diǎn)評價算法[4]檢測網(wǎng)絡(luò)熱點(diǎn)信息。

1 方案設(shè)計(jì)

發(fā)現(xiàn)熱點(diǎn)話題是為熱點(diǎn)信息檢測服務(wù)的,首先把測試信息結(jié)合在一起,分析其中有影響力的話題,為熱點(diǎn)挖掘提供可靠的依據(jù)。

按照處理過程,本系統(tǒng)主要可以分為以下幾個步驟:信息采集、信息挖掘、信息熱度評價。系統(tǒng)流程如圖1所示。

系統(tǒng)主要流程是提取出來用戶可能感興趣的頁面信息,再進(jìn)行處理,將大量的信息整合成為有序的熱點(diǎn)話題,來提高熱點(diǎn)信息發(fā)現(xiàn)系統(tǒng)挖掘熱點(diǎn)信息的準(zhǔn)確度和效率。

圖1 系統(tǒng)流程圖Fig.1 Flow chart of system

2 系統(tǒng)總體設(shè)計(jì)

本系統(tǒng)采用B/S三層體系結(jié)構(gòu),由應(yīng)用層、業(yè)務(wù)邏輯層和數(shù)據(jù)服務(wù)層構(gòu)成,三層之間相互交互來實(shí)現(xiàn)系統(tǒng)的整個功能。用戶通過發(fā)送請求到應(yīng)用層查詢需要處理的頁面,通過Web技術(shù)和相關(guān)算法處理得到信息存儲在數(shù)據(jù)庫中。數(shù)據(jù)服務(wù)層主要提供數(shù)據(jù)存儲服務(wù),由數(shù)據(jù)庫的服務(wù)器和文件系統(tǒng)組成。系統(tǒng)總體框架如圖2所示。

圖2 系統(tǒng)總體框架Fig.2 Modules of system

每個子系統(tǒng)都有自己單獨(dú)功能模塊程序,而且需要不斷地和數(shù)據(jù)庫進(jìn)行交互完成各自的功能。整個系統(tǒng)包含信息采集子系統(tǒng)、熱點(diǎn)挖掘子系統(tǒng)、熱點(diǎn)評價子系統(tǒng)。

信息采集子系統(tǒng) 主要是對網(wǎng)頁的內(nèi)容進(jìn)行篩選,選出網(wǎng)頁的主要內(nèi)容。

熱點(diǎn)挖掘子系統(tǒng) 主要是對信息采集子系統(tǒng)處理過的內(nèi)容進(jìn)行聚類分析,把信息進(jìn)行歸類。

熱點(diǎn)評價子系統(tǒng) 主要是對熱點(diǎn)挖掘子系統(tǒng)的歸類信息進(jìn)行熱點(diǎn)評價,評價并且排行出近期活躍度高的熱點(diǎn)話題。

3 系統(tǒng)的關(guān)鍵算法

3.1 網(wǎng)頁信息采集

本論文所構(gòu)建的熱點(diǎn)信息發(fā)現(xiàn)及分析系統(tǒng)是利用網(wǎng)絡(luò)信息采集和挖掘等相關(guān)技術(shù),將互聯(lián)網(wǎng)上可能引起用戶興趣話題和關(guān)注比較大的信息整理出來,以直觀的數(shù)據(jù)表現(xiàn)方式提供給相關(guān)用戶進(jìn)行特定處理。

信息采集子系統(tǒng)中主要工作:首先處理測試網(wǎng)頁中一些沒有用的信息例如廣告信息等,得到一些干凈的網(wǎng)頁之后,找出相關(guān)信息網(wǎng)頁。

3.2 熱點(diǎn)信息檢測相關(guān)算法3.2.1 Single Pass聚類算法

Single Pass算法主要是根據(jù)輸入內(nèi)容,將內(nèi)容處理為內(nèi)容文本,將內(nèi)容文本與已有話題進(jìn)行相似性比較,根據(jù)相似度的值進(jìn)行匹配選取。如果與某個話題相似度高,則把文本歸入該話題,如果相似度度量均小于某一閾值,則將該文本定義為一個新的話題,創(chuàng)建一個新的話題類型。其Single Pass算法的流程圖如圖3所示。

圖3 Single pass算法Fig.3 Single pass algorithm

3.2.2 話題熱度評價

性能評測一般采用漏檢率(Pm)誤檢率(Pf)來判斷算法存在的問題,而檢測代價[5](Cn)是用來衡量話題發(fā)現(xiàn)的質(zhì)量,Cn一般是越小表示效果越好。如話題i中相關(guān)的文檔數(shù)目為H、不相關(guān)的數(shù)目為H1、與話題i不相關(guān)文本C,其中C中有C1篇被誤放入話題i中,則:

平均漏報率Pm,平均誤報率Pf和檢測代價Cn。其計(jì)算公式為

其中:G1、G2是漏報和誤報的代價;Pm、Pf是漏報和誤報的概率;P是文本話題類的先驗(yàn)概率。根據(jù)熱點(diǎn)評價的標(biāo)準(zhǔn),一般設(shè)定 G1=1,G2=0.1,P=0.02。

4 系統(tǒng)測試

為了驗(yàn)證本系統(tǒng)采用2013年4月新浪、網(wǎng)易、搜狐、新華網(wǎng)、人民網(wǎng)等幾個網(wǎng)站的網(wǎng)頁,首先利用信息采集子系統(tǒng)的Web技術(shù)處理網(wǎng)頁內(nèi)容,得到一些關(guān)鍵信息內(nèi)容;再利用熱點(diǎn)挖掘子系統(tǒng)處理歸類;最后利用熱點(diǎn)話題評價子系統(tǒng)進(jìn)行熱度排行。

頁面信息處理得到四川雅安地震(YA)、H7N9亞型禽流感病毒(H7N9)、明星跳水秀(MX)、復(fù)旦投毒案(FD)、鳳凰古城(FH)、海天盛筵(HT)等 6 個話題,驗(yàn)證系統(tǒng)檢測話題的有效性和準(zhǔn)確性。測試各項(xiàng)數(shù)據(jù)如表1所示。

表1 熱點(diǎn)信息表Tab.1 Information hotspots

測試中各項(xiàng)數(shù)據(jù)根據(jù)式(1)~式(5)得出,漏報率 數(shù) 據(jù) 是 0.253、0.229、0.221、0.222、0.257、0.1875,誤報率數(shù)據(jù)是 0.01125、0.01、0.00875、0.005、0.0038、0.0075,而檢測代價數(shù)據(jù)是 0.0062、0.0056、0.0053、0.0049、0.0055、0.0045。在漏報率和誤報率計(jì)算中,檢測代價越小表示信息的集中程度越高。根據(jù)結(jié)果數(shù)據(jù)可以得出,信息熱度排名為海天盛筵(HT)、復(fù)旦投毒案(FD)、明星跳水秀(MX)、鳳凰古城(FH)、四川雅安地震(YA)、H7N9亞型禽流感病毒(H7N9)。

5 結(jié)語

本系統(tǒng)基本達(dá)到了企業(yè)提出的需求,基于.NET和關(guān)鍵算法構(gòu)建出熱點(diǎn)信息發(fā)現(xiàn)系統(tǒng),實(shí)現(xiàn)了網(wǎng)頁信息熱點(diǎn)檢測。系統(tǒng)在網(wǎng)絡(luò)熱點(diǎn)話題發(fā)現(xiàn)上既保證了一定的準(zhǔn)確性、實(shí)時性,又為某單位對某事件的態(tài)度傾向提供數(shù)據(jù)服務(wù)。

網(wǎng)絡(luò)熱點(diǎn)話題檢測作為輿情信息挖掘的關(guān)鍵任務(wù)也是研究重點(diǎn),同時還有許多問題有待進(jìn)一步的探索與研究。如實(shí)時動態(tài)的信息獲取并發(fā)送分析好的信息給領(lǐng)導(dǎo),作為下個版本開發(fā)的新內(nèi)容。

[1] Leskovec J,Huttenlocher D,Kleinberg J.Signed networks in social media[C]//Proceedings of the SIGCHI Conference on Human Factors in Computing Systems.ACM,2010:1361-1370.

[2] Kitsak M,Gallos L K,Havlin S,et al.Identification of influential spreaders in complex networks[J].Nature Physic,2010,6(11):893-898.

[3] 岳國偉,永全,陳玉娥.ASP.NET中數(shù)據(jù)分頁技術(shù)的研究[J].計(jì)算機(jī)應(yīng)用研究,2007,24(9):159-161.

[4] 洪宇,張宇,范基禮,等.基于話題分治匹配的蜥事件檢測[J].計(jì)算機(jī)學(xué)報,2008,31(4):687-695.

[5] Makkonen J,Ahonen-Myka H,Salmenkivi M.Simple semantics in topic detection and tracking[J].Information Retrieval,2004,7(3-4):347-368. ■

猜你喜歡
評價檢測信息
“不等式”檢測題
“一元一次不等式”檢測題
“一元一次不等式組”檢測題
SBR改性瀝青的穩(wěn)定性評價
石油瀝青(2021年4期)2021-10-14 08:50:44
訂閱信息
中華手工(2017年2期)2017-06-06 23:00:31
小波變換在PCB缺陷檢測中的應(yīng)用
基于Moodle的學(xué)習(xí)評價
展會信息
中外會展(2014年4期)2014-11-27 07:46:46
保加利亞轉(zhuǎn)軌20年評價
多維度巧設(shè)聽課評價表 促進(jìn)聽評課的務(wù)實(shí)有效
體育師友(2012年4期)2012-03-20 15:30:10
主站蜘蛛池模板: 亚洲色图另类| 一级毛片免费高清视频| 中文无码毛片又爽又刺激| 中文字幕有乳无码| 在线免费无码视频| 日韩色图在线观看| 精品国产www| 国产成人福利在线| 欧美成人精品一级在线观看| 午夜国产大片免费观看| 国产一区免费在线观看| 久久国产拍爱| 亚洲一区二区三区香蕉| 91久久国产综合精品女同我| 日本91视频| 亚洲日韩第九十九页| 99久久精品国产自免费| 婷婷综合亚洲| 国产又粗又爽视频| 欧美精品另类| 日韩第九页| 日本一区二区三区精品视频| 国产成+人+综合+亚洲欧美| 亚洲黄色高清| 成人国产精品一级毛片天堂| 2048国产精品原创综合在线| 精品一区二区无码av| 精品一区二区三区无码视频无码| 成人在线不卡视频| 中文字幕在线日韩91| 欧美午夜小视频| 国产伦片中文免费观看| 国产精品短篇二区| 最新精品久久精品| 国产一区二区三区夜色| 人人91人人澡人人妻人人爽 | 日本黄色不卡视频| 91福利免费视频| 久久人妻xunleige无码| 亚洲三级成人| 欧美激情二区三区| 国产欧美视频一区二区三区| 无码久看视频| 国产毛片高清一级国语 | 天天色综合4| 午夜国产大片免费观看| 国产精品入口麻豆| 久久综合九色综合97网| 婷婷在线网站| 日韩毛片视频| 国产xx在线观看| 毛片在线播放网址| 亚洲精品国产自在现线最新| 国产精品黄色片| 亚洲制服丝袜第一页| 72种姿势欧美久久久大黄蕉| 国产精品无码制服丝袜| 四虎综合网| 欧美日韩一区二区在线免费观看 | 国产AV无码专区亚洲精品网站| 国产无码精品在线| 51国产偷自视频区视频手机观看| 久久精品国产91久久综合麻豆自制| 香蕉在线视频网站| 天堂网国产| 日韩中文字幕免费在线观看| 无码内射中文字幕岛国片| 日韩视频免费| 激情综合激情| 国产黑人在线| 一级毛片免费观看不卡视频| 色网站在线视频| 色135综合网| 91系列在线观看| 久视频免费精品6| 欧美一区二区三区香蕉视| 亚洲欧美自拍中文| 黄色网页在线播放| 亚洲第一网站男人都懂| 亚洲国产亚综合在线区| 亚洲欧美在线综合一区二区三区| 国产无吗一区二区三区在线欢|