顯示具有 keyword selection 標籤的文章。 顯示所有文章
顯示具有 keyword selection 標籤的文章。 顯示所有文章

2009年10月12日

Matching Task Profiles and User Needs in Personalized Web Search

本篇文章(Matching Task Profiles and User Needs in Personalized Web Search)出自於CIKM'08,
本篇研究提出一套個人化網路搜尋架構, 其主要係透過以統計為基礎的語言模型方法,用它來偵測使用者在網路搜尋時的需求與意圖.

此個人化架構基於使用者個人過往的歷史搜尋紀錄, 並藉此資訊來媒合使用者當前的搜尋需求, 其主要方法如下:
首先, 個人化搜尋架構會將使用者目前的搜尋結果和歷史搜尋記錄進行相似度計算, 計算方法採用Kullback-Leibler (KL) divergence.
接著, 系統會利用 threshold 機制來決定是否要將搜尋查詢實施 query rewritting 或將搜尋結果進行 re-ranking 的動作.有鑒於, 相似度的計算所採用的是KL divergence方法, 因此主要係比較歷史紀錄(tasks)的機率分佈以及當前搜尋結果(facets)的機率分佈.
然而過往歷史搜尋記錄(task)所涉及的行為非常的多元化 (例如: 歷史搜尋,點選的搜尋結果, 閱覽網站行為....), 本論文則是透過混合的方式(mixture)為每一個資料集產生一個語言模型; 同樣的語言模型方式亦應用於當前的搜尋結果(facet)上.

本研究在實驗方面作了一系列詳盡的比較:
1. 採用固定的query expansion 數量 vs. 個人化的query expansion.
2. 不同使用者所計算出來的KL correlation 對個人化結果的改善比較.
3. 不同是使用者所採用的參數實驗.
4. 個人化架構整體的效率分佈.
...
以下提供讀者參閱該論文, 所自行製作的投影片:

2009年8月23日

Detecting Online Commercial Intention (OCI)

本篇文章 (Detecting Online Commercial Intention (OCI)) 出自於WWW'06, 主要的作者為微軟研究團隊.
如果可以瞭解或預測使用者的網路行為, 則可以進一步給予個人化內容, 例如: 呈現使用者喜愛的產品或新聞內容給使用者. 因此對資訊服務提供者 (Information Service Provider) 而言能夠精確的預測使用者行為, 係一項很重要的任務. 本論文主要探討使用者在網路上面的行為是否具有商業意圖, 稱為 Online Commercial Intention (OCI), 作者將網路行為主要分成使用者正在瀏覽的網頁 (web) 和使用者所搜尋的查詢 (query), 因此將線上商業意圖偵測議題分成網頁商業意圖偵測 (Web Page Online Commercial Intention Detection) 及查詢商業意圖偵測 (Query Online Commercial Intention Detection).
Web Page OCI Detector: 作者透過機器學習的方式產生網頁商業意圖偵測器, 此偵測器為二元分類器, 主要任務係將一般網頁分成商業 (commercial) 或是非商業 (non-commercial), 所採用的特徵 (feature) 除了使網頁中所有的文字之外, 也使用feature selection方法挑選了額外較具有鑑別力的特徵, 關於機器學習演算法則為SVM (Support Vector Machine).
Query OCI Detector: 一般查詢均會有相對應的網頁, 例如: 搜尋引擎回傳的網頁. 因此作者將先前訓練好的Web Page OCI Detector對這些網頁進行分類, 判斷所回傳的網頁是否屬於commercial. 由於搜尋引擎所回傳的網頁具有順序性, 為了將rank因素考量在內, 作者採用第二種分類器 (Query OCI Detector), 將查詢判斷成具有商業意圖或者非商業意圖.
實驗部份, 在Web Page OCI部分, 平均F-measure可達92%, 同時也比較了不同的feature size對於結果的影響. 關於Query OCI, 平均 F-measure可達85%, 並且實驗出有趣的發現, 查詢的頻率越高越有可能具有商業意圖, 相對的頻率越短的查詢越不具有商業意圖.
本論文對於欲探討使用者行為除了做個一個基本的介紹外, 亦使用了機器學習演算法來判斷網頁及查詢的意圖, 可讓讀者了解機器學習如何實際應用到網頁領域的基本知識.
以下附上, 閱讀過後所整理的投影片.

2007年4月11日

A study on automatically extracted keywords in text categorization

A study on automatically extracted keywords in text categorization

本篇文章出自於ACL’2006, 其主要目的是探討 “Keyword” 對文件分類的影響力.
keyword extraction: 列舉出幾個常用的方法, 例如: n-grams, PoS, and Chunking. 在feature value 指派的方面, 描述出幾個常用的方法, 例如: tf, tf*idf, relative position of the first occurrence, PoS tag, 其中PoS tag是作者在 “Improved Automatic Keyword Extraction Given More Linguistic Knowledge”所提出來的方法, 在得到input feature and feature value之後, 採用supervised machine learning method (rule induction) 來訓練prediction models, 來判斷輸入的term, 是否為keywords, 實驗結果顯示, keyword 擷取的F-measure 可達44%.

文件分類部份所用的文件表達方式可分為keyword only 和full-text來探討, 而feature value的指派, 則採用tf*idf or boolean value, 而機器學習方法則係用linear support vector machine,來對文章做分類. 以往文件分類最基本的方式係用全文(full-text)的方式當作是input feature. 本篇針對不同的input feature 以及 feature value作了一系列的試驗, 來說明以full-text + keywords來當作是input feature, 其所得到的分類結果 (F-measure) 是最佳的, 可達到81.07%.

Link: Proceedings of the 21st International Conference on Computational Linguistics and the 44th annual meeting of the ACL