• <strike id="msesi"><s id="msesi"></s></strike>
    
    
    <samp id="msesi"></samp>
    <strike id="msesi"><s id="msesi"></s></strike><ul id="msesi"><pre id="msesi"></pre></ul>
  • 首頁服務(wù)案例新聞公司聯(lián)系

    這里有我們最新的簽約信息及相關(guān)公司活動!

    最近我們都在干什么?

    什么叫網(wǎng)絡(luò)爬蟲又有何作用

    類目:行業(yè)資訊 發(fā)布日期:2015-09-11 點擊:7738 次

    網(wǎng)絡(luò)爬蟲(又被稱為網(wǎng)頁蜘蛛,網(wǎng)絡(luò)機(jī)器人,在FOAF社區(qū)中間,更經(jīng)常的稱為網(wǎng)頁追逐者),是一種按照一定的規(guī)則,自動的抓取萬維網(wǎng)信息的程序或者腳本。另外一些不常使用的名字還有螞蟻,自動索引,模擬程序或者蠕蟲。

    網(wǎng)絡(luò)爬蟲是一個自動提取網(wǎng)頁的程序,它為搜索引擎從萬維網(wǎng)上下載網(wǎng)頁,是搜索引擎的重要組成。傳統(tǒng)爬蟲從一個或若干初始網(wǎng)頁的URL開始,獲得初始網(wǎng)頁上的URL,在抓取網(wǎng)頁的過程中,不斷從當(dāng)前頁面上抽取新的URL放入隊列,直到滿足系統(tǒng)的一定停止條件。聚焦爬蟲的工作流程較為復(fù)雜,需要根據(jù)一定的網(wǎng)頁分析算法過濾與主題無關(guān)的鏈接,保留有用的鏈接并將其放入等待抓取的URL隊列。

    相對于通用網(wǎng)絡(luò)爬蟲,聚焦爬蟲還需要解決三個主要問題:

    (1) 對抓取目標(biāo)的描述或定義;

    (2) 對網(wǎng)頁或數(shù)據(jù)的分析與過濾;

    (3) 對URL的搜索策略。

    抓取目標(biāo)的描述和定義是決定網(wǎng)頁分析算法與URL搜索策略如何制訂的基礎(chǔ)。而網(wǎng)頁分析算法和候選URL排序算法是決定搜索引擎所提供的服務(wù)形式和爬蟲網(wǎng)頁抓取行為的關(guān)鍵所在。這兩個部分的算法又是緊密相關(guān)的。


    二区久久国产乱子伦免费精品| 国产精品V亚洲精品V日韩精品| 久久精品视频久久| 久久精品国产一区二区三区| 精品大臿蕉视频在线观看| 国产午夜亚洲精品不卡免下载| 国产精品午夜无码AV天美传媒| 国产精品亚洲午夜一区二区三区| 精品无码AV一区二区三区不卡| 久久99精品波多结衣一区| 精品精品国产自在久久高清| 中国精品一级毛片免费播放| 精品国产黑色丝袜高跟鞋| 亚洲精品无码久久不卡| 无码8090精品久久一区| 日韩在线看片中文字幕不卡| 日韩人妻一区二区三区免费| 日韩福利视频导航| 国产亚洲蜜芽精品久久| 国产精品一区二区资源| 情侣视频精品免费的国产| 精品国产品香蕉在线观看| www亚洲精品久久久乳| 国产成人无码精品久久久小说| 亚洲精品av无码喷奶水糖心| 国内精品伊人久久久影院| 97久久国产亚洲精品超碰热| 精品国产无限资源免费观看| 国产精品亚洲精品青青青| 国产精品va一级二级三级| 97精品人妻系列无码人妻| 999久久久无码国产精品| 国产精品香蕉一区二区三区| 免费精品国产自产拍在线观看图片| 99re最新这里只有精品| 国产精品福利电影| 成人无码精品一区二区三区 | 国产精品亚洲精品日韩电影| 国产精品视频视频久久| 国产一精品一aⅴ一免费| 日韩一区二区电影|