PHP實現最簡單爬蟲原型

<?php
/**
 * 爬蟲程序 -- 原型
 *
 * BookMoth 2009-02-21
 */

/**
 * 從給定的url獲取html內容
 *
 * @param string $url
 * @return string
 */
function _getUrlContent($url) {
    $handle = fopen($url, "r");
    if ($handle) {
        $content = stream_get_contents($handle, 1024 * 1024);
        return $content;
    } else {
        return false;
    }
}

/**
 * 從html內容中篩選鏈接
 *
 * @param string $web_content
 * @return array
 */
function _filterUrl($web_content) {
    $reg_tag_a = '/<[a|A].*?href=[\'\"]{0,1}([^>\'\"\ ]*).*?>/';
    $result = preg_match_all($reg_tag_a, $web_content, $match_result);
    if ($result) {
        return $match_result[1];
    }
}

/**
 * 修正相對路徑
 *
 * @param string $base_url
 * @param array $url_list
 * @return array
 */
function _reviseUrl($base_url, $url_list) {
    $url_info = parse_url($base_url);
    $base_url = $url_info["scheme"] . '://';
    if ($url_info["user"] && $url_info["pass"]) {
        $base_url .= $url_info["user"] . ":" . $url_info["pass"] . "@";
    }
    $base_url .= $url_info["host"];
    if ($url_info["port"]) {
        $base_url .= ":" . $url_info["port"];
    }
    $base_url .= $url_info["path"];
    print_r($base_url);
    if (is_array($url_list)) {
        foreach ($url_list as $url_item) {
            if (preg_match('/^http/', $url_item)) {
                //已經是完整的url
                $result[] = $url_item;
            } else {
                //不完整的url
                $real_url = $base_url . '/' . $url_item;
                $result[] = $real_url;
            }
        }
        return $result;
    } else {
        return;
    }
}

/**
 * 爬蟲
 *
 * @param string $url
 * @return array
 */
function crawler($url) {
    $content = _getUrlContent($url);
    if ($content) {
        $url_list = _reviseUrl($url, _filterUrl($content));
        if ($url_list) {
            return $url_list;
        } else {
            return;
        }
    } else {
        return;
    }
}

/**
 * 測試用主程序
 *
 */
function main() {
    $current_url = "http://hao123.com/"; //初始url
    $fp_puts = fopen("url.txt", "ab"); //記錄url列表
    $fp_gets = fopen("url.txt", "r"); //保存url列表
    do {
        $result_url_arr = crawler($current_url);
        if ($result_url_arr) {
            foreach ($result_url_arr as $url) {
                fputs($fp_puts, $url . "\r\n");
            }
        }
    } while ($current_url = fgets($fp_gets, 1024)); //不斷獲得url
}

main();
?> 


最簡單的爬蟲模型應該是這樣的:給一個初始url,爬蟲把內容扒下拉,找頁面裏的url,在以這些url爲起點,開始爬。


上面是一個最簡單的php實現的爬蟲模型。


當然這隻爬蟲還需要進行下面的進化纔可以:

1、拼接更準確的url鏈接。現在的鏈接有可能是格式錯誤的。

2、能夠去掉重複的url鏈接。現在的爬蟲會做非常多非常多的重複工作。

3、避免爬蟲怕成環路,一個永遠右轉的車,只能是300內環,它只會跑在三環路上,去不了別的地方。

4、多線程或者多進程。因爲php沒有線程的概念,所以可能需要shell這樣的東西來模擬了。

5、……略去2的N次方個漢字。

反正是意思一下就好了~


轉自:http://www.xjq123.com/html/33/n-13433.html點擊打開鏈接

發表評論
所有評論
還沒有人評論,想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.
相關文章