本篇文章给大家分享的内容是详细介绍PHP+JavaScript如何爬取网页内容,有着一定的参考价值,有需要的朋友可以参考一下
php+js爬取网页内容—–先看下效果
如何做到的呢?
我们一直以为只有Python才能爬取网页内容,那是因为Python本身集合很多类库用来爬取网页很方便,但是我们使用PHP+js的方法一样很方便,一样可以拿到我们想要的网页内容,而且也不用很繁琐。
首先我们需要PHP来模拟请求获取整个网站的HTML
// 允许所有域访问
header("Access-Control-Allow-Origin: *");
/ 接收一个参数,参数名叫parm
$parm=$_GET['mod'];
if (empty($parm)) {
$url = 'http://m.80s.tw/';//目标网站
$html = file_get_contents($url);
}else{
$url = 'http://m.80s.tw/'.$parm;
$html = file_get_contents($url);
}
preg_match("/]*?>(.*\s*?)<\/body>/is",$html,$match1);//正则匹配body里面的内容
echo $match1[0];//输出网页注意:如果遇到 file_get_contents报错请尝试在 php.ini中找到extension=php_openssl.dll 开启就OK了
然后就是前端来获取数据进行处理了
首先写个异步请求
动态WEB网站中的PHP和MySQL详细反映实际程序的需求,仔细地探讨外部数据的验证(例如信用卡卡号的格式)、用户登录以及如何使用模板建立网页的标准外观。动态WEB网站中的PHP和MySQL的内容不仅仅是这些。书中还提到如何串联JavaScript与PHP让用户操作时更快、更方便。还有正确处理用户输入错误的方法,让网站看起来更专业。另外还引入大量来自PEAR外挂函数库的强大功能,对常用的、强大的包
$.ajax({
type:'get',
url: '.././admin/test.php',
success: function(data) {
console.log(data)//可以看到获取的HTML,很简单吧,很兴奋吧
}
});获取HTML后我们就可以随心所欲了
怎么来使用这些HTML呢?这是问题吗?不是
//首先创建一个容器
var p = document.createElement('p');
// 把整个html的字符串存到这个p节点里
p.innerHTML = data;
//然后就可以对p一顿检查了
//比如获取类list_mov_title下所有的a标签
var list = p.querySelectorAll('.list_mov_title a');
//赶紧打印出来看一下
console.log(list)
//想要的东西都在吧
//然后就把想要的东西往自己的页面里面塞吧一个爬取网页内容的教程就这样结束了,如果你豁然开朗了就转发一下吧,不明白的就留言吧










