史上最全面的百度蜘蛛詳解 你不得不看!

作者:劉宇凡 來源: 2012-11-09 16:56:37 閱讀 我要評論 直達(dá)商品

一、什么是Baiduspider?
Baiduspider百度搜索引擎的一個自動程序,它的作用是訪問互聯(lián)網(wǎng)上的網(wǎng)頁,建立索引數(shù)據(jù)庫,使用戶能在百度搜索引擎中搜索到您網(wǎng)站上的網(wǎng)頁。


11.png

二、Baiduspider的user-agent是什么?
百度各個產(chǎn)品使用不同的user-agent:
產(chǎn)品名稱 對應(yīng)user-agent
無線搜索 Baiduspider
圖片搜索 Baiduspider-image
視頻搜索 Baiduspider-video
新聞搜索 Baiduspider-news
百度搜藏 Baiduspider-favo
百度聯(lián)盟 Baiduspider-cpro
商務(wù)搜索 Baiduspider-ads
網(wǎng)頁以及其他搜索 Baiduspider


三、Baiduspider對一個網(wǎng)站服務(wù)器造成的訪問壓力如何?
為了達(dá)到對目標(biāo)資源較好的檢索效果,Baiduspider需要對您的網(wǎng)站保持一定量 的抓取。我們盡量不給網(wǎng)站帶來不合理的負(fù)擔(dān),并會根據(jù)服務(wù)器承受能力,網(wǎng)站質(zhì)量,網(wǎng)站更新等綜合因素來進(jìn)行調(diào)整。如果您覺得baiduspider的訪問 行為有任何不合理的情況,您可以反饋至百度投訴平臺。


四、為什么Baiduspider不停的抓取我的網(wǎng)站?
對于您網(wǎng)站上新產(chǎn)生的或者持續(xù)更新的頁面,Baiduspider會持續(xù)抓取。此外, 您也可以檢查網(wǎng)站訪問日志中Baiduspider的訪問是否正常,以防止有人惡意冒充Baiduspider來頻繁抓取您的網(wǎng)站。 如果您發(fā)現(xiàn)Baiduspider非正常抓取您的網(wǎng)站,請通過投訴平臺反饋給我們,并請盡量給出Baiduspider對貴站的訪問日志,以便于我們跟蹤 處理。


五、如何判斷是否冒充Baiduspider的抓取?
建議您使用DNS反查方式來確定抓取來源的ip是否屬于百度,根據(jù)平臺不同驗證方法不同,如linux/windows/os三種平臺下的驗證方法分別如下:
1,在linux平臺下,您可以使用host ip命令反解ip來判斷是否來自Baiduspider的抓取。Baiduspider的hostname以 *.baidu.com 或 *.baidu.jp 的格式命名,非 *.baidu.com 或 *.baidu.jp 即為冒充。
$ host 123.125.66.120
120.66.125.123.in-addr.arpa domain name pointer
baiduspider-123-125-66-120.crawl.baidu.com.
host 119.63.195.254
254.195.63.119.in-addr.arpa domain name pointer
BaiduMobaider-119-63-195-254.crawl.baidu.jp.
2,在windows平臺或者IBM OS/2平臺下,您可以使用nslookup ip命令反解ip來 判斷是否來自Baiduspider的抓取。打開命令處理器 輸入nslookup xxx.xxx.xxx.xxx(IP地 址)就能解析ip, 來判斷是否來自Baiduspider的抓取,Baiduspider的hostname以 *.baidu.com 或 *.baidu.jp 的格式命名,非 *.baidu.com 或 *.baidu.jp 即為冒充。
3,在mac os平臺下,您可以使用dig 命令反解ip來 判斷是否來自Baiduspider的抓取。打開命令處理器 輸入dig xxx.xxx.xxx.xxx(IP地 址)就能解析ip,來判斷是否來自Baiduspider的抓取,Baiduspider的hostname以 *.baidu.com 或 *.baidu.jp 的格式命名,非 *.baidu.com 或 *.baidu.jp 即為冒充。


六、我不想我的網(wǎng)站被Baiduspider訪問,我該怎么做?
Baiduspider遵守互聯(lián)網(wǎng)robots協(xié)議。您可以利用robots.txt 文件完全禁止Baiduspider訪問您的網(wǎng)站,或者禁止Baiduspider訪問您網(wǎng)站上的部分文件。 注意:禁止Baiduspider訪問您的網(wǎng)站,將使您的網(wǎng)站上的網(wǎng)頁,在百度搜索引擎以及所有百度提供搜索引擎服務(wù)的搜索引擎中無法被搜索到。關(guān)于 robots.txt的寫作方法,請參看我們的介紹:robots.txt寫作方法
您可以根據(jù)各產(chǎn)品不同的user-agent設(shè)置不同的抓取規(guī)則,如果您想完全禁止百度所有的產(chǎn)品收錄,可以直接對Baiduspider設(shè)置禁止抓取。
以下robots實現(xiàn)禁止所有來自百度的抓取:
User-agent: Baiduspider
Disallow: /
以下robots實現(xiàn)禁止所有來自百度的抓取但允許圖片搜索抓取/image/目錄:
User-agent: Baiduspider
Disallow: /
User-agent: Baiduspider-image
Allow: /image/
請注意:Baiduspider-cpro抓取的網(wǎng)頁并不會建入索引,只是執(zhí)行與客戶約定的操作,所以不遵守robots協(xié)議,如果Baiduspider-cpro給您造成了困擾,請聯(lián)系union1@baidu.com
Baiduspider-ads抓取的網(wǎng)頁并不會建入索引,只是執(zhí)行與客戶約定的操作,所以不遵守robots協(xié)議,如果Baiduspider-ads給您造成了困擾,請聯(lián)系您的客戶服務(wù)專員。


七、為什么我的網(wǎng)站已經(jīng)加了robots.txt,還能在百度搜索出來?
因為搜索引擎索引數(shù)據(jù)庫的更新需要時間。雖然Baiduspider已經(jīng)停止訪問您網(wǎng)站上的網(wǎng)頁,但百度搜索引擎數(shù)據(jù)庫中已經(jīng)建立的網(wǎng)頁索引信息,可能需要數(shù)月時間才會清除。另外也請檢查您的robots配置是否正確。
如果您的拒絕被收錄需求非常急迫,也可以通過投訴平臺反饋請求處理。


八、我希望我的網(wǎng)站內(nèi)容被百度索引但不被保存快照,我該怎么做?
Baiduspider遵守互聯(lián)網(wǎng)meta robots協(xié)議。您可以利用網(wǎng)頁meta的設(shè)置,使百度顯示只對該網(wǎng)頁建索引,但并不在搜索結(jié)果中顯示該網(wǎng)頁的快照。
和robots的更新一樣,因為搜索引擎索引數(shù)據(jù)庫的更新需要時間,所以雖然您已經(jīng)在網(wǎng)頁中通過meta禁止了百度在搜索結(jié)果中顯示該網(wǎng)頁的快照,但百度搜索引擎數(shù)據(jù)庫中如果已經(jīng)建立了網(wǎng)頁索引信息,可能需要二至四周才會在線上生效。


九、Baiduspider抓取造成的帶寬堵塞?
Baiduspider的正常抓取并不會造成您網(wǎng)站的帶寬堵塞,造成此現(xiàn)象可能是由于 有人冒充Baiduspider惡意抓取。如果您發(fā)現(xiàn)有名為Baiduspider的agent抓取并且造成帶寬堵塞,請盡快和我們聯(lián)系。您可以將信息反 饋至投訴平臺,如果能夠提供您網(wǎng)站該時段的訪問日志將更加有利于我們的分析。
本文由壓力開關(guān)(http://www.shmind.com)網(wǎng)編整理發(fā)表,轉(zhuǎn)載請保留!

  推薦閱讀

  深圳客資訊網(wǎng)CEO崔頌:我眼中的鼎能移動電源

在生活之中,出去旅游,工作,出差的時候,人們都遇到手機(jī)充電的難題,然而,誕生了移動電源,在移動電源行業(yè)硝煙四起,行業(yè)老大都想成為移動電源的贏家的時候,突然半路殺出了由聯(lián)創(chuàng)社,中國大學(xué)教父孫斌領(lǐng)導(dǎo)的《鼎>>>詳細(xì)閱讀


本文標(biāo)題:史上最全面的百度蜘蛛詳解 你不得不看!

地址:http://www.sdlzkt.com/a/xie/20121109/88068.html

樂購科技部分新聞及文章轉(zhuǎn)載自互聯(lián)網(wǎng),供讀者交流和學(xué)習(xí),若有涉及作者版權(quán)等問題請及時與我們聯(lián)系,以便更正、刪除或按規(guī)定辦理。感謝所有提供資訊的網(wǎng)站,歡迎各類媒體與樂購科技進(jìn)行文章共享合作。

網(wǎng)友點評
我的評論: 人參與評論
驗證碼: 匿名回答
網(wǎng)友評論(點擊查看更多條評論)
友情提示: 登錄后發(fā)表評論,可以直接從評論中的用戶名進(jìn)入您的個人空間,讓更多網(wǎng)友認(rèn)識您。
自媒體專欄

評論

熱度

主站蜘蛛池模板: 窝窝视频成人影院午夜在线| 免费无码成人av在线播放不卡| 欧美成人aa久久狼窝动画| 四虎国产精品成人免费久久| 免费在线成人网| 亚洲国产成人精品电影| 亚洲人成人无码网www国产| 久久久久成人精品一区二区| 欧美在线成人午夜网站| 18岁日韩内射颜射午夜久久成人| 欧美成人黄色片| 成人A级视频在线播放| 国产成人无码一区二区三区| 久久亚洲色www成人欧美| 成人精品一区久久久久| 国产成人综合欧美精品久久| 久久亚洲国产成人精品无码区| 久久国产成人精品国产成人亚洲| 成人网视频免费播放| 国产精品成人久久久久| 久久亚洲国产成人精品性色| 成人精品一区二区三区中文字幕 | 国产成人精品综合| 国产成人AV免费观看| 成人福利视频app| 全彩成人18h漫画在线| 国产成人高清在线播放| 欧美亚洲国产成人综合在线| 亚洲欧洲成人精品香蕉网| 成人窝窝午夜看片| 最新69堂国产成人精品视频| 欧洲成人在线视频| 四虎www成人影院| 国产成人精选视频69堂| 成人午夜免费福利视频| 欧美成人性动漫在线观看| 999影院成人在线影院| 亚洲国产成人久久一区www| 四虎影视永久地址www成人 | 免费h成人黄漫画嘿咻破解版| 成人免费在线播放|