顯示具有 document classification 標籤的文章。 顯示所有文章
顯示具有 document classification 標籤的文章。 顯示所有文章

2009年8月23日

Detecting Online Commercial Intention (OCI)

本篇文章 (Detecting Online Commercial Intention (OCI)) 出自於WWW'06, 主要的作者為微軟研究團隊.
如果可以瞭解或預測使用者的網路行為, 則可以進一步給予個人化內容, 例如: 呈現使用者喜愛的產品或新聞內容給使用者. 因此對資訊服務提供者 (Information Service Provider) 而言能夠精確的預測使用者行為, 係一項很重要的任務. 本論文主要探討使用者在網路上面的行為是否具有商業意圖, 稱為 Online Commercial Intention (OCI), 作者將網路行為主要分成使用者正在瀏覽的網頁 (web) 和使用者所搜尋的查詢 (query), 因此將線上商業意圖偵測議題分成網頁商業意圖偵測 (Web Page Online Commercial Intention Detection) 及查詢商業意圖偵測 (Query Online Commercial Intention Detection).
Web Page OCI Detector: 作者透過機器學習的方式產生網頁商業意圖偵測器, 此偵測器為二元分類器, 主要任務係將一般網頁分成商業 (commercial) 或是非商業 (non-commercial), 所採用的特徵 (feature) 除了使網頁中所有的文字之外, 也使用feature selection方法挑選了額外較具有鑑別力的特徵, 關於機器學習演算法則為SVM (Support Vector Machine).
Query OCI Detector: 一般查詢均會有相對應的網頁, 例如: 搜尋引擎回傳的網頁. 因此作者將先前訓練好的Web Page OCI Detector對這些網頁進行分類, 判斷所回傳的網頁是否屬於commercial. 由於搜尋引擎所回傳的網頁具有順序性, 為了將rank因素考量在內, 作者採用第二種分類器 (Query OCI Detector), 將查詢判斷成具有商業意圖或者非商業意圖.
實驗部份, 在Web Page OCI部分, 平均F-measure可達92%, 同時也比較了不同的feature size對於結果的影響. 關於Query OCI, 平均 F-measure可達85%, 並且實驗出有趣的發現, 查詢的頻率越高越有可能具有商業意圖, 相對的頻率越短的查詢越不具有商業意圖.
本論文對於欲探討使用者行為除了做個一個基本的介紹外, 亦使用了機器學習演算法來判斷網頁及查詢的意圖, 可讓讀者了解機器學習如何實際應用到網頁領域的基本知識.
以下附上, 閱讀過後所整理的投影片.

2009年2月18日

Emotion Classification Using Massive Examples Extracted from the Web

本篇論文出自於COLING'2008, 其目的在解情緒分類問題 (emotion classification problem),主要方法係將大量的網路資源視為訓練資料進行分類器製作,並將情緒分類議題分解成二階段處理: sentiment classification and emotion classification, 實驗顯示透過兩階段分類的效果比起一階段分類方法效果顯著.

第一階段處理(sentiment classification):採用SVM分類器及特徵集(n-gram and sentiment polarity words),訓練資料則是透過事先定義好的10個情緒類別字及其衍生情緒字詞當作是seed terms,並蒐集網路上相關的句子(稱為emotion provoking event)成為訓練資料集.
第二階段處裡 (emotion classification):採用KNN的方法進行分類.
原文出處: Emotion Classification Using Massive Examples Extracted from the Web
自製投影片:

2008年11月17日

Learning Social Networks from Web Documents Using Support Vector Classifiers

Learning Social Networks from Web Documents Using Support Vector Classifiers出自於IEEE Web Intelligence 2006, 本篇論文主要係透過機器學習的方式自動地去建立social network, 本研究首先假設已經存有不完整關聯 (incomplete relationship), 再透過SVM建立出完整的social network, 其中屬性的建立則是藉由網路文章 (web documents)來產生文件向量. 不難發現作者將判斷social network relationships的問題轉化成傳統的文件分類問題 (text classification problem), 所採用的判斷方法 (亦可視為分類方法) 則是SVM.
此外由於relationships在social network中呈現出不均衡的資料型態 (imbalance data), 此類型資料對於機器學習具有很大的挑戰 (亦即容易傾向將資料判斷成某一特定類別), 作者也採用一般常見的 up-sampling 及 down-sampling 方法來舒緩此議題. 實驗部份採用真實資料集 FOAF (Friend Of A Friend), 評估機制則以Precision, Recall 及 F-measure為主.
以下為投影片:

2008年8月18日

8/20 Regular Meeting: Just-In-Time Contextual Advertising

Just-In-Time Contextual Advertising, CIKM’2007論文和自身的研究有著高度的相關性, 目的同樣都是去解內容廣告配適問題 (Contextual Advertising).

此論文考量到目前的網頁可分為靜態網頁 (static)和動態網頁 (dynamic), 在內容廣告配適技術上可針對靜態網頁做事前的內容分析(offline content analysis), 然而在面臨動態網頁時, 則需透過即時內容分析(online content analysis)方法. 因此該篇論文主要是探討如何在及時的情況下, 快速地針對網頁(動態和靜態)進行廣告配適.

為達到real-time 的廣告配適, 勢必要考量到網頁內容的大小, 如果分析該網頁全部的內容, 則會犧牲了網路傳輸和分析時間; 反之如果僅考量網頁的部分內容, 則可能會因為語意的缺乏, 而造成廣告的不適當配適. 作者引用了文件摘要技術 (text summarization technique)來克服此兩難的問題. [文件摘要 (text summarization) 議題, 研究已有多年的歷史了, 在不失真的情況之下, 希望擷取文章中足夠的重要語句來表達原始文章之涵義], 除了文件摘要技術之外, 作者也透過文件分類系統 (text classification system), 將語意相似的網頁和廣告進行分類, 來加強網頁-廣告間的相關性. 網頁-廣告之間的相似度的比對, 則選用了cosine similarity.

在實驗方面, 兩個資料集分別包含105個一般性網頁以及856個不存在於搜尋引擎索引範圍內的網頁, 作者針對不同的文件摘要片段 (例如: 網頁的title, meta information, URL….), 以precision , mean average precision和bpref-10為度量單位進行評估, 實驗結果數據顯示, 由少量的文件摘要資訊即可達到和使用全文(full-text)資訊的準確率效果.

論文連結: Just-in-Time Contextual Advertising
自製投影片:

2008年5月19日

Automatic Identification of Pro and Con Reason in Online Reviews

Automatic Identification of Pro and Con Reason in Online Reviews 這篇論文主要出自於COLING' 06, 其目的是將線上評價中的語句辨識出是否有含主觀意見, 進而將含主觀意見的句子分成pros 和 cons 兩個類別.

因此, 給定一句使用者評論中的句子, 系統架構主要可以分為兩個階對進行, 分別為subjectivity identification and polarity classification phases:
--subjectivity identification 將關於具有主觀意見的句子辨識出來.
--polarity classification 將主觀意見的句子進行分類.
subjectivity identification和polarity classification均採用supervised machine learning algorithm (Maximum Entropy), 類別主要分為三種 (Neither, Pro and Con), neither類別可視為客觀的類別(即一般的事實描述), 其內容不屬於pros and cons. 而分類時所使用的特徵屬性可分為三大類別:
1. Lexical (uni-gram, bi-gram and tri-gram)
2. Position (該sentence是否出現在review中的首兩句或末兩句)
3. Opinion-bearing words (是先選定好的情緒字集)

此外, 為了簡化標準答案的標註, 本論文提出了一套自動標註系統, 主要係透過目前某些評論網站含有特定的欄位來描述pro和con. 作者假設, 使用者在撰寫評論的時亦會使用相同的字詞(包含在pro's和con's feild) 來描述他對於該產品的優缺點, 藉由此特性, 來建立所需的標準答案.

實驗部份: 透過epinions.com(含有pro and con field)來建立訓練資料, 並且將建立好的model除了應用在此網站之外, 同樣也在Compliant.com上進行實驗, 最後實驗結果顯示, 平均precision 可達66%, recall 可達到76%.

利用目前些評論網站均含有描述pro和con的欄位. 假設user撰寫的pro's and con's所使用的字詞, 也會出現在撰寫整體評論中來描述他對於該產品的優缺點, 我們即可以pro's and con's的資料做為參考答案, 藉由此來建立所需的training data.

附上此論文投影片:

2007年4月11日

A study on automatically extracted keywords in text categorization

A study on automatically extracted keywords in text categorization

本篇文章出自於ACL’2006, 其主要目的是探討 “Keyword” 對文件分類的影響力.
keyword extraction: 列舉出幾個常用的方法, 例如: n-grams, PoS, and Chunking. 在feature value 指派的方面, 描述出幾個常用的方法, 例如: tf, tf*idf, relative position of the first occurrence, PoS tag, 其中PoS tag是作者在 “Improved Automatic Keyword Extraction Given More Linguistic Knowledge”所提出來的方法, 在得到input feature and feature value之後, 採用supervised machine learning method (rule induction) 來訓練prediction models, 來判斷輸入的term, 是否為keywords, 實驗結果顯示, keyword 擷取的F-measure 可達44%.

文件分類部份所用的文件表達方式可分為keyword only 和full-text來探討, 而feature value的指派, 則採用tf*idf or boolean value, 而機器學習方法則係用linear support vector machine,來對文章做分類. 以往文件分類最基本的方式係用全文(full-text)的方式當作是input feature. 本篇針對不同的input feature 以及 feature value作了一系列的試驗, 來說明以full-text + keywords來當作是input feature, 其所得到的分類結果 (F-measure) 是最佳的, 可達到81.07%.

Link: Proceedings of the 21st International Conference on Computational Linguistics and the 44th annual meeting of the ACL

2007年1月25日

Knowing a Web Page By the Company It keeps

這篇取自於 CIKM'2006的論文,內容主要是講如何透過neighboring page的資訊將target page 做分類。 Web page classification可以使用的資訊,包括網頁的內容及鏈結資訊等,這一篇論文則著重在相鄰網頁可以提供的分類效果。作者將相鄰網頁分成Parent,Child,Sibling及Sprouse四種類別,同時依據相鄰網頁是否經過label與否給予權重,再依相鄰網頁與target Page是否係出同門(網站)給予不同權重,最後對所有的參數如何影響分類的表現做了很完整的實驗。整篇的idea不是很困難,不過作者做了深入的研究以及實驗。 結論與直觀想法差距不大:


1. 有label的網頁提供的分類效果總是比沒有label的網頁好(η Eta)。

2. 四種鄰近網頁中屬Sibling的效最佳(β Beta)。

3. 來自同一網站的相鄰網頁提供的資訊比其他網站的相鄰資訊有益於分類(θ Theta)。

4. 鄰近網頁與target page的權重比於0.2與0.8是效果最佳(α Alpha)。

對ODP(Open Directory Project)等品質高的網頁分類效果可達90%,但是對一般網頁效果則降至56%,顯示還有相當的改善空間。