PHPが簡単な爬虫類を実現する方法
2889 ワード
PHPが簡単な爬虫類を実現する方法を例に挙げた.皆さんの参考にしてください.具体的には以下の通りです.
本稿で述べたphpプログラム設計に役立つことを願っています.
\'\"\ ]*).*?>/';
$result = preg_match_all($reg_tag_a, $web_content, $match_result);
if ($result) {
return $match_result[1];
}
}
/**
*
*
* @param string $base_url
* @param array $url_list
* @return array
*/
function _reviseUrl($base_url, $url_list) {
$url_info = parse_url($base_url);
$base_url = $url_info["scheme"] . '://';
if ($url_info["user"] && $url_info["pass"]) {
$base_url .= $url_info["user"] . ":" . $url_info["pass"] . "@";
}
$base_url .= $url_info["host"];
if ($url_info["port"]) {
$base_url .= ":" . $url_info["port"];
}
$base_url .= $url_info["path"];
print_r($base_url);
if (is_array($url_list)) {
foreach ($url_list as $url_item) {
if (preg_match('/^http/', $url_item)) {
// url
$result[] = $url_item;
} else {
// url
$real_url = $base_url . '/' . $url_item;
$result[] = $real_url;
}
}
return $result;
} else {
return;
}
}
/**
*
*
* @param string $url
* @return array
*/
function crawler($url) {
$content = _getUrlContent($url);
if ($content) {
$url_list = _reviseUrl($url, _filterUrl($content));
if ($url_list) {
return $url_list;
} else {
return ;
}
} else {
return ;
}
}
/**
*
*/
function main() {
$current_url = "http://hao123.com/"; // url
$fp_puts = fopen("url.txt", "ab"); // url
$fp_gets = fopen("url.txt", "r"); // url
do {
$result_url_arr = crawler($current_url);
if ($result_url_arr) {
foreach ($result_url_arr as $url) {
fputs($fp_puts, $url . "\r
");
}
}
} while ($current_url = fgets($fp_gets, 1024)); // url
}
main();
?>
本稿で述べたphpプログラム設計に役立つことを願っています.