「三十而立」or「三十而慄」,寫下了人生感悟以及種種經歷,網路、科技、財經、閱讀、全球化趨勢,寫下這些文字的同時,也讓自己內省做為人生未來的指引... stupid77.com

顯示具有 垂直搜尋 標籤的文章。 顯示所有文章
顯示具有 垂直搜尋 標籤的文章。 顯示所有文章

2009年4月1日 星期三

如何善用搜索引擎的資源…

當你在搜索引擎(search engine)輸入一個關鍵詞的時候,你期望看到的是什麼?而這有立即出現在搜索結果的首頁上嗎?是否經常覺得為什麼我搜索不到資料呢?

拜網路的發達,以及各家網站紛紛免費化的趨勢,所以越來越多人願意在網路上面分享自己的專長,發表諸多經驗談,據統 計,每天全球至少新誕生了數以萬 計的blog,而Google所收錄的網頁數量已經以兆來計算,可以說這個就是一個最大的百科全書,就連同wiki百科都僅僅只是其中一部份…

然而,對於多數的用戶來說,困擾也由此產生,這麼龐大的數量,又不像圖書館有系統的歸類,用戶只能藉由關鍵詞 (keywords)做簡易搜索,或者 是進一步使用高級檢索的功能,對許多不熟悉這些操作的用戶來說,看到這些欄位,一個頭兩個大,此外,因為搜索引擎並不是非營利事業(NGO),也因此通常 出現在一些重點關鍵詞的搜索結果前一兩頁的,不是付費購買的關鍵詞,就是一些經營網站者或是SEO操作公司的傑作,或許這些東西,根本不是用戶真正想要找 的…

所以說,這個如此收錄如此龐大資源的搜索引擎,諸如Google或者百度,對於這些多數的人來說,很可能其所提供的內容「價值性」並不高,用戶很直接,因為找到的內容網頁不是他真正想要的,等於是浪費了時間而已,而這對於用戶或者是搜索引擎的提供者來說,都極其可惜…

主流的搜索引擎都注意到這個問題了,也因此分類主題式的搜索引導越來說備受重視,而也有不少專業化的垂直搜索引擎誕 生,比方說:網路商店搜索、特價 機票搜索、音樂Mp3搜索、電影遊戲搜索、甚至是電子書搜索…等等,他們打出了專業化、方便性的旗號,讓用戶不再需要在搜索結果中大海撈針…

但站在用戶的立場,如果免費提供的資源都無法善用,就如同少了一項必備的求知技能,因為「會用與不會用」差很多,這 也聯想到了之前在《哈佛管理評 論》上的一篇文章「Google是否讓我們越變越傻」,其實能夠善用Google的話,不僅能快速的提昇你的知識,還如同多了一個私人的知識寶庫一般,取 之不盡用之不絕,而不會用的人,至少上知識取得的效率上差了人家一節,在這個分秒必爭的社會中,相形吃虧很多…

說了這麼多,除了前述的改用專業化的垂直搜索引擎之外,我們該如何善用Google找到百分之百我們想要查詢的資料呢?

其實並沒有什麼特別的訣竅,而是幾個小技巧以及關鍵要點提醒大家,其一是做普遍的技巧,使用長一點的關鍵詞,或者是 同時輸入多個關鍵詞(用空 格、&、or來區分等),也善用加法以及減法規則,可以用分號(”")把這些詞包含起來,善用搜索引擎的語法規則,此外,搜索引擎還設計了許多的 查詢功能,比方說搜索檔案文件時,可以根據格式來設定搜索,如此可以省卻很多的時間,也可以很精準的找到想查詢的資料,把我經常查詢規則的一個網頁也奉上給大家做參考,裡面講解的很詳細…

再者,因為大多數的熱門關鍵詞都已經被商業化,變成一個網路行銷的重要手段策略,所以經常搜索結果的前一兩頁其實被 各式的「廣告」填滿,這些可能只 是沾上這個關鍵詞的邊邊而已,根本不是你真正想要的東西,所以有時候可以跳過前幾頁,用這種逆向思考的方式來找資料,或許也是一種不錯的方式…

此外,你可以多試試同義詞,或者一些相關、相似的詞語來作為關鍵詞,因為很可能一開始你所認知的關鍵詞是有偏差的,甚至是非專業的用語,透過更多的關鍵詞,可以讓你在瞎子摸象的過程中,多方的深入到真正的核心資訊…

最後,其實你可以使用不同的語言來設定關鍵詞做查詢,比方說常見用英語的關鍵詞來查詢,或者是透過Google翻譯把你的關鍵詞翻譯成其他國家的語言來做查詢,端看你想查詢的資料是否來自於某一些國家,而這也會有更多元的資料可供參考…

既然這是一個數位時代的趨勢所在,當然我們就應該學會順應潮流,學著使用新的工作來提升自己的知識,善用搜索引擎,不僅可以提昇你的知識,更可以提昇你的學習力、競爭力…

圖片來源:guardain.co.uk

數位科技 By Stupid77

2009年3月11日 星期三

SEO必修課程,搜索引擎中文分詞之邏輯…

曾經有一位Google的科學家說,「如果可以做好中文搜索引擎(或稱搜尋引擎,Search Engine),那麼我們就不怕任何語種的搜索引擎研究了」,引用這段話不是要說明中文有多麼的博大精深,而是當大家都在強調SEO之時,或許更應該了解 這些搜索引擎收錄每個網頁之後,如何將這些網頁歸類,並且透過分詞的技術,讓每個用戶在輸入關鍵詞的同時可以快速找到相關的資料訊息…

尤其是對新進的網站操作人員而言,熱門的關鍵詞不容易被操作成功,除了時間因素之外,這些關鍵詞多半被其他行家所操 控,但換個角度思考,搜索引擎用 戶所輸入的關鍵詞經常有出人意表之舉,因此了解這些搜索引擎的收錄與分類規則,在日常更新網站的時候,就能夠更巧妙的思考到搜索引擎如何的進行中文分詞 (或稱切詞),妥善的利用關鍵詞的長尾理論效益,讓更多搜索引擎用戶更快速的找到你…

工作上,我們也經營著一個垂直式的搜索引擎,這是一種主題式、特定領域的操作方式,這種垂直式搜索引擎的興起,正是 為了彌補Google、 Yahoo這些搜索引擎的不足,因為,當我們想搜找一本書籍時,赫然發現,書名或者作者名的搜尋結果,居然是一些不相幹的網頁,而用戶想要的卻往往落在數 頁之外…

問題就在於,其一,搜索引擎不知道你想找的究竟是什麼,是書籍呢?是影片呢?還是新聞?其二,搜索引擎的分詞出現不 足之處,以blog文章為例,或 許你寫了一句話,其中包含了一些專有名詞、人物名稱甚至是地名等等,然而卻被當成其他的詞彙硬生生被切開當成了不同的詞語,因而導致查看來路之時,發現很 多讓你意料不到甚至百思不解的來路關鍵詞出現…

上述的第一個問題,可以透過各行各業粗略的分類式搜尋獲得某種程度的改善,但以書籍為例,如果剛好同一個書名存在不同的書籍,可能有小說有漫畫有其他類的書籍,那還是只能靠人為的判斷,而第二個問題,則一直還是這些搜索引擎技術人員的重要課題…

或許這跟技術本身沒多大關係,更重要的是中文的使用邏輯以及中文分詞方式的認定,因為中文不像英文或者其他的語言,可以一個個單詞切割的很清楚,中文透過不同的標點符號來區分,同時每句話內又因每一個字的排列方式不同,而產生了不同的意思,比如說:…

一般都會透過幾種方式來解決中文分詞問題,首先透過建立中文詞庫的方式來讓搜索引擎的database作為歸類 index的依據,當遇到詞庫中的關 鍵分詞之時,先行標記歸類起來,方便用戶檢索時可以即時找到,有些比較嚴謹的,在分詞確認這個階段還會分步驟,比如說有一些分詞的權重比較高,會優先被選 中的,然後再進行二次的分詞匹配,但是一些字句當中,經常出現一句話正序(由左到右)來分詞,或者倒序來分詞,所切分出來關鍵詞不一致,或者是一些新增的 詞彙因為沒有在詞庫中,因而無法被匹配到,無法產生index…

所以進一步除了定時的維護詞庫之外,還需要透過統計的分詞方法來彌補針對正序或者倒序所切出不同分詞的合理性、正確 性,同文之中相鄰的字同時出現的 次數越多,就有可能是一個關鍵的分詞,另外透過以整個網頁字詞統計次數來區分權重,消除一些可能存在不合適、歧義的分詞出現;而最終還是需要有網站編輯人 員的抽樣檢驗審核…

從中可以看出,這不僅僅是技術的問題,而是對一個語言系統的研究,真正挑戰搜索引擎技術人員的,只是這些複雜的邏輯 該如何的簡化,應付一個日漸龐大 的詞庫以及index database,以提高搜索的速度以及效能,而真正能夠提高搜索結果準確度的,卻是不斷的研究這一門古老的中文文學,以及最快的速度因應不斷新增出現的 詞彙,以及一些地區性用語的差別…

所以,當我們在經營一個網站,或者編輯自己的blog文章之時,如果更加留意每句詞語的結構與用字遣詞,同時又能夠掌握一些即將發生的趨勢潮流,或許會得到更棒的經營的結果…

數位科技 By Stupid77