麻豆小视频在线观看_中文黄色一级片_久久久成人精品_成片免费观看视频大全_午夜精品久久久久久久99热浪潮_成人一区二区三区四区

首頁 > 網站 > 建站經驗 > 正文

PHP實現簡單爬蟲的方法

2024-04-25 20:40:18
字體:
來源:轉載
供稿:網友

本文實例講述了PHP實現簡單爬蟲的方法。分享給大家供大家參考。具體如下:

<?php

/**

* 爬蟲程序 -- 原型

*

* 從給定的url獲取html內容

*

* @param string $url

* @return string

*/

function _getUrlContent($url) {

$handle = fopen($url, "r");

if ($handle) {

$content = stream_get_contents($handle, 1024 * 1024);

return $content;

} else {

return false;

}

}

/**

* 從html內容中篩選鏈接

*

* @param string $web_content

* @return array

*/

function _filterUrl($web_content) {

$reg_tag_a = '/<[a|A].*?href=[/'/"]{0,1}([^>/'/"/ ]*).*?>/';

$result = preg_match_all($reg_tag_a, $web_content, $match_result);

if ($result) {

return $match_result[1];

}

}

/**

* 修正相對路徑

*

* @param string $base_url

* @param array $url_list

* @return array

*/

function _reviseUrl($base_url, $url_list) {

$url_info = parse_url($base_url);

$base_url = $url_info["scheme"] . '://';

if ($url_info["user"] && $url_info["pass"]) {

$base_url .= $url_info["user"] . ":" . $url_info["pass"] . "@";

}

$base_url .= $url_info["host"];

if ($url_info["port"]) {

$base_url .= ":" . $url_info["port"];

}

$base_url .= $url_info["path"];

print_r($base_url);

if (is_array($url_list)) {

foreach ($url_list as $url_item) {

if (preg_match('/^http/', $url_item)) {

// 已經是完整的url

$result[] = $url_item;

} else {

// 不完整的url

$real_url = $base_url . '/' . $url_item;

$result[] = $real_url;

}

}

return $result;

} else {

return;

}

}

/**

* 爬蟲

*

* @param string $url

* @return array

*/

function crawler($url) {

$content = _getUrlContent($url);

if ($content) {

$url_list = _reviseUrl($url, _filterUrl($content));

if ($url_list) {

return $url_list;

} else {

return ;

}

} else {

return ;

}

}

/**

* 測試用主程序

*/

function main() {

$current_url = "http://hao123.com/"; //初始url

$fp_puts = fopen("url.txt", "ab"); //記錄url列表

$fp_gets = fopen("url.txt", "r"); //保存url列表

do {

$result_url_arr = crawler($current_url);

if ($result_url_arr) {

foreach ($result_url_arr as $url) {

fputs($fp_puts, $url . "/r/n");

}

}

} while ($current_url = fgets($fp_gets, 1024)); //不斷獲得url

}

main();

?>

希望本文所述對大家的php程序設計有所幫助。

發表評論 共有條評論
用戶名: 密碼:
驗證碼: 匿名發表
主站蜘蛛池模板: 污视频在线免费播放 | 午夜男人在线观看 | 成人午夜一区 | 91福利免费观看 | 国产乱淫av| 污在线观看网站 | 在线观看中文字幕国产 | 爽成人777777婷婷 | 巨乳毛片| 午夜在线视频一区二区三区 | 91网站永久免费看 | 久久久鲁| 免费a级网站 | av人人| 精国产品一区二区三区四季综 | 日韩一级成人 | 日韩精品中文字幕一区二区 | 在线免费观看精品 | 精品在线观看一区二区三区 | 黄色毛片视频在线观看 | 狠狠操精品视频 | 牛牛a级毛片在线播放 | 成人在线视频国产 | 国人精品视频在线观看 | 91看片成人 | 成人一区二区三区四区 | 亚洲精品av在线 | 精品一区二区三区欧美 | 亚洲第一黄色网 | 一级电影免费在线观看 | 久久午夜免费视频 | 亚洲黑人在线观看 | 日韩黄在线观看 | 正在播放91视频 | 欧美成人精品欧美一级乱黄 | 久草在线视频精品 | 爱操成人网| 日韩黄色片在线观看 | sese在线视频 | 久久精品视频7 | 欧美一级毛片美99毛片 |