2008年11月17日

Learning Social Networks from Web Documents Using Support Vector Classifiers

Learning Social Networks from Web Documents Using Support Vector Classifiers出自於IEEE Web Intelligence 2006, 本篇論文主要係透過機器學習的方式自動地去建立social network, 本研究首先假設已經存有不完整關聯 (incomplete relationship), 再透過SVM建立出完整的social network, 其中屬性的建立則是藉由網路文章 (web documents)來產生文件向量. 不難發現作者將判斷social network relationships的問題轉化成傳統的文件分類問題 (text classification problem), 所採用的判斷方法 (亦可視為分類方法) 則是SVM.
此外由於relationships在social network中呈現出不均衡的資料型態 (imbalance data), 此類型資料對於機器學習具有很大的挑戰 (亦即容易傾向將資料判斷成某一特定類別), 作者也採用一般常見的 up-sampling 及 down-sampling 方法來舒緩此議題. 實驗部份採用真實資料集 FOAF (Friend Of A Friend), 評估機制則以Precision, Recall 及 F-measure為主.
以下為投影片:

2008年11月5日

10/21 Data Selection for Support Vector Machine Classifiers

摘要:
本論文介紹MSVM(Minimal Support Vector Machine)分類器,其概念為"基於SVM的架構下,減少其support vectors"。此分類器應用於Fraud detection等含有數以萬計的data points,亦可以增進其他需要大量support vector才能決定的分類器之效能。 
 
內文首先介紹SVM的作用及原理,其後介紹MSVM。此技術使用fast linear programming並加入了error term來減少所使用的vectors。最後提出了SLA(Successive Linearization Algorithm)的演算法來實作MSVM,最後是實驗比較。

將MSVM和FSV以及1-norm SVM對於七個資料集運算的結果做比較,明顯的發現MSVM所使用的support vectors遠低於另外兩個分類器所需要的個數。此外,對於一些資料集來說,MSVM的效能高於另外兩個分類器 。


2008年11月2日

11/11 電腦鑑識程序之研究 A Survey of the Procedure for Computer Forensics

文港主要報告在碩士班的研究,和老師以及同學報告,與否能在資料庫研究上延續,還請老師以及同學多多指教。

摘要
隨著資訊科技的興起與電腦時代的來臨,利用電腦以及網路犯罪的問題,讓執法單位面臨了更大的挑戰與困難,如何利用在電腦上的鑑識工具來取得有效的數位證據,是當前迫切所需要的課題,一般鑑識單位針對無法開機鑑識的電腦主機,大多使用Linux Live CD整合鑑識工具研究,但以目前電腦作業系統來看,以XP作業系統佔有率最高,本文研究提出電腦鑑識程序,利用XP Live CD整合電腦鑑識工具,建置實驗環境,針對電腦犯罪情事,採集相關證據,探討解決方法。通常單一鑑識工具所提出的證據不足,但以測試多套鑑識工具使用,過程中產生的相關癥結,最後彙整鑑識報告,相信能讓調查鑑識人員於數位證據擷取上趨於完善,在法庭呈現上的證據多一分效力。
關鍵字:電腦鑑識、數位證據、Live CD。


電腦鑑識程序之研究
View SlideShare presentation or Upload your own.

資料庫延續
View SlideShare presentation or Upload your own.

2008年10月27日

10/28 Regular Meeting: Monority Report in Fraud Detection Classification of Skewed Data

摘要:
本篇論文提出一個新的詐欺偵測方法,根據現存的詐欺偵測系統以及minority report,處理與skewed data有關的資料探勘問題。

本篇論文提出的方法使用Backpropagation (BP),Naive Bayesian (NB),及C4.5演算法,配合over-sampling的方式。獨特的方在於使用一個meta-classifier (stacking),選擇這些比較performance好的base classifiers,再將這些base classifiers的預測合併 (bagging),用以改善cost savings (stacking-bagging)。

實驗的結果證明stacking-bagging的performance比起傳統的algorithms要來的好。

接著,本篇論文比較新的詐欺偵測方法與C4.5使用undersampling、oversampling、SMOTE。結果顯示當給予一個固定的決策門檻及cost matrix,partitioning和多個演算法的方式會比以整個training data set方式有比較高的cost savings。

以下是論文連結
論文連結


2008年10月12日

10/14 Regular Meeting: Pattern Mining to Chinese Unknown Word Extraction

本次報告為我的論文: Pattern Mining to Chinese Unknown Word Extraction。

摘要如下:
中文的文件資訊處理,由於沒有如歐美語系中有區隔符號(ex:空白)斷開每個辭彙,會遇到兩個大問題: 歧義性 與 未知詞問題。

本篇的論文主要為解決中文的未知詞問題。未知詞又稱為OOV words(Out-Of-Vocabulary),顧名思義,就是字典無法辨識的辭彙。由字典輔助的初步斷詞,會將這些不存在於字典裡的辭彙,錯誤的斷開成多個部份,如人名-王小明會被斷成 王 小 明 三個字。未知詞的任務,就是針對錯誤切割的多個字元部份,重新結合成一個正確的辭彙。

本篇論文的架構,主要分成兩個階段:

1. 第一階段為未知詞偵測部份。文章裡並非所有的字元都是未知詞的候選字元,必須先經過判斷,哪些是屬於未知詞的可能字元。因此一開始我們會找尋可能的未知詞字元,並著重於單音節字元(96%的未知詞經初步斷詞切開後,會包含至少一個單音節字元)。我們使用Prowl這個continuity pattern mining工具,有效率的從語料庫中找出單音節字元屬於已知詞的特徵規則(pattern rule),透過特徵規則,對於落單的中文字,去判斷他是可單獨存在的已知詞,或是未知詞的一部份。

2. 第二階段為未知詞擷取部份,我們針對第一階段所偵測出的未知詞可能字元,運用上下文資訊、POS資訊與統計資訊等,學習並判斷是否該要結合(是否形成一個該結合的未知詞詞彙)。我們使用機器學習(Machine Learning)中的間接式序列學習方法(Sequential Learning),將原本的序列文件資料,轉換為可分類(未知詞與否)的資料格式,再搭配SVM分類演算法進行擷取的訓練與測試。我們設計了三種長度的模型,可用來擷取這三種長度的未知詞。

此外,在擷取的實驗中,本文亦針對資料不均衡問題以及數種模型中的選擇問題提出解決的方法。對資料不均衡問題,本文使用under-sampling產生模型用資料,再使用Ensemble Method的投票方式聚集多個模型的學習能力,以提升擷取的表現。由於我們設計三種長度的模型提供擷取,在甚麼樣的情況下該選擇哪一種模型作為最終的結合方式,我們亦提供了幾種判斷的方式。

報告後大家給我的意見,已經更改於投影片中,只不過有些投影片是用動畫方式呈現,SlideShare好像秀不出來,另外上傳至SlideShare後,有部分地方變得怪怪的,因此我會再寄投影片檔給大家,謝謝。