最新網站資訊

首頁 » WordPress 教學 » WordPress 部落格(搜尋引擎統一:Robots檔案標準)

WordPress 部落格(搜尋引擎統一:Robots檔案標準)


搜尋引擎三巨頭打的不亦樂乎,但偶爾也合作一下。
去年Google,雅虎,微軟就合作,共同遵守統一的Sitemaps標準。
前兩天三巨頭又同時宣佈,共同遵守的robots.txt檔案標準。Google,雅虎,微軟各自在自己的官方部落格上發了一篇帖子
公佈三家都支援的robots.txt檔案及Meta標籤的標準,以及一些各自特有的標準。
下面做一個總結。

三家都支援的robots檔案記錄內含:
Disallow – 告訴蜘蛛不要抓取某些檔案或目錄。如下面代碼將阻止蜘蛛抓取所有的網站檔案:

User-agent: *
Disallow: /

Allow – 告訴蜘蛛應該抓取某些檔案。Allow和Disallow配合使用,可以告訴蜘蛛某個目錄下,大部分都不抓取,只抓取一部分。如下面代碼將使蜘蛛不抓取ab目錄下其他檔案,而只抓取其中cd下的檔案:

User-agent: *
Disallow: /ab/
Allow: /ab/cd

$通配符 – 符合URL結尾的字元。如下面代碼將容許蜘蛛訪問以.htm為副檔名的URL:

User-agent: *
Allow: .htm$

*通配符 – 告訴蜘蛛符合任意一段字元。如下面一段代碼將禁止蜘蛛抓取所有htm檔案:

User-agent: *
Disallow: /*.htm

Sitemaps位置 – 告訴蜘蛛你的網站地圖在哪裡,格式為:

Sitemap:

三家都支援的Meta標籤內含:

NOINDEX – 告訴蜘蛛不要索引某個網頁。

NOFOLLOW – 告訴蜘蛛不要追蹤網頁上的連結。

NOSNIPPET – 告訴蜘蛛不要在搜尋結果中顯示說明文字。

NOARCHIVE – 告訴蜘蛛不要顯示快照。

NOODP – 告訴蜘蛛不要使用開放目錄中的標題和說明。

上面這些記錄或標籤,現在三家都共同支援。
其中通配符好像以前雅虎微軟並不支援。

——————————————————————————–
【文章標題】: WordPress 部落格(搜尋引擎統一:Robots檔案標準)
【文章作者】: 部落格架站、行銷、賺錢術教學密訓基地
【作者信箱】: ster168ster@gmail.com
【作者首頁】: https://por.tw/blog/
【部落格架站、行銷、賺錢術教學課程】: https://por.tw/blog/E_learning/index.php
【基地主機】: http://goto1688.com/blog/
【版權聲明】: (原創)部落格架站、行銷、賺錢術教學密訓基地,轉載必須保留完整標頭。刪除者依法追究!
——————————————————————————–
百度現在也支援Disallow,Allow及兩種通配符。
Meta標籤我沒有找到百度是否支援的官方說明。

只有Google支援的Meta標籤有:

UNAVAILABLE_AFTER – 告訴蜘蛛網頁什麼時候過期。在這個日期之後,不應該再出現在搜尋結果中。

NOIMAGEINDEX – 告訴蜘蛛不要索引頁面上的圖片。

NOTRANSLATE – 告訴蜘蛛不要翻譯頁面內容。

雅虎還支援Meta標籤:

Crawl-Delay – 容許蜘蛛延時抓取的頻率。

NOYDIR – 和NOODP標籤相似,但是指雅虎目錄,而不是開放目錄。

Robots-nocontent – 告訴蜘蛛被標注的部分html不是網頁內容的一部分,或是換個角度,告訴蜘蛛哪些部分是頁面的主要內容(想被檢索的內容)。

MSN還支援Meta標籤:

Crawl-Delay

另外提醒大家注意的是,robots.txt檔案可以不存在,返回404錯誤,意味著容許蜘蛛抓取所有內容。
但抓取robots.txt檔案時卻發生逾時之類的錯誤,可能導致搜尋引擎不收錄網站
因為蜘蛛不知道robots.txt檔案是否存在或是裡面有什麼內容,這與確認檔案不存在是不一樣的。
——————————————————————————–
你在摸索如何架站部落格?如何展開行銷部落格、甚至賺錢嗎?有【技術顧問服務】可諮詢嗎?
當問題無法解決你要發很多時間處理(或許永遠找出答案)是獨自摸索部落格架站、行銷、賺錢痛苦的開始!
購買【部落格架站、行銷、賺錢術】DVD課程,就可獲得【部落格架站行銷賺錢】技術【顧問諮詢服務】!

發佈留言