PHP用curl抓取网站数据，仿造IP、伪造来源等，防屏蔽解决方案教程

1、伪造客户端IP地址，伪造访问referer:（一般情况下这就可以访问到数据了）

curl_setopt($curl, CURLOPT_HTTPHEADER, ['X-FORWARDED-FOR:110.85.108.185', 'CLIENT-IP:110.85.108.185']);

curl_setopt($curl, CURLOPT_REFERER, 'http://www.demo.com/test.php');

2、如是上面的还是不行，可能是别人抓到了真实IP，这时候我们就使用代理访问。

#  详细方式

curl_setopt($curl, CURLOPT_PROXY, '112.85.209.72');    //代理服务器地址

curl_setopt($curl, CURLOPT_PROXYPORT, 80);             //代理服务器端口

//curl_setopt($curl, CURLOPT_PROXYUSERPWD, ':'');      //http代理认证帐号，username:password的格式

curl_setopt($curl, CURLOPT_PROXYTYPE, CURLPROXY_HTTP); //使用http代理模式

#  简写方式

curl_setopt($curl, CURLOPT_PROXY, 'http://112.85.209.72:80');

3、还有一种就是用浏览器可以访问，用curl不行。（对方检查了useragent，如果没有就认为是非法来源等验证了）

$useragent = 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 ';

$useragent.= '(KHTML, like Gecko) Chrome/70.0.3538.110 Safari/537.36';

curl_setopt($curl, CURLOPT_USERAGENT, $useragent);

PHP完整Curl抓取数据函数：

/**

 * 请求接口

 * @access public

 * @param string $url 请求地址

 * @param array $data 提交参数 没有get 有post

 * @return bean|array

 */

public function send($url='')

{

    set_time_limit(0);

    $curl = curl_init();

    curl_setopt($curl, CURLOPT_URL, $url);

    curl_setopt($curl, CURLOPT_RETURNTRANSFER, 1);

    curl_setopt($curl, CURLOPT_CONNECTTIMEOUT, 10);

    curl_setopt($curl, CURLOPT_FOLLOWLOCATION, 1);

    curl_setopt($curl, CURLOPT_HTTPHEADER, ['X-FORWARDED-FOR:127.0.1.1', 'CLIENT-IP:127.0.1.1']);

    curl_setopt($curl, CURLOPT_REFERER, 'http://www.demo.com/demo.php');

    curl_setopt($curl, CURLOPT_PROXY, 'http://127.0.0.1:80');

    $useragent = 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 ';

    $useragent.= '(KHTML, like Gecko) Chrome/70.0.3538.110 Safari/537.36';

    curl_setopt($curl, CURLOPT_USERAGENT, $useragent);

    if(!empty($data) && is_array($data)){

        curl_setopt($curl, CURLOPT_POST, true);

        curl_setopt($curl, CURLOPT_POSTFIELDS, $data);

    }

    $html = curl_exec($curl);

    if($error=curl_errno($curl)){

        return false;

    }

    curl_close($curl);

    return $html;

}

PHP用curl抓取网站数据，仿造IP、伪造来源等，防屏蔽解决方案教程的更多相关文章

用curl抓取网站数据，仿造IP、防屏蔽终极强悍解决方式
最近在做一些抓取其它网站数据的工作,当然别人不会乖乖免费给你抓数据的,有各种防抓取的方法.不过道高一尺,魔高一丈,通过研究都是有漏洞可以钻的.下面的例子都是用PHP写的,不会用PHP来curl的孩纸先 ...
抓取网站数据不再是难事了，Fizzler（So Easy）全能搞定
首先从标题说起,为啥说抓取网站数据不再难(其实抓取网站数据有一定难度),SO EASY!!!使用Fizzler全搞定,我相信大多数人或公司应该都有抓取别人网站数据的经历,比如说我们博客园每次发表完文章 ...
利用linux curl爬取网站数据
看到一个看球网站的以下截图红色框数据,想爬取下来,通常爬取网站数据一般都会从java或者python爬取,但本人这两个都不会,只会shell脚本,于是硬着头皮试一下用shell爬取,方法很笨重,但旨在 ...
C# 抓取网站数据
项目主管说这是项目中的一个亮点(无语...), 类似于爬虫一类的东西,模拟登陆后台系统,获取需要的数据.然后就开始研究这个. 之前有一些数据抓取的经验,抓取流程无非:设置参数->服务端发送请求- ...
pythonのscrapy抓取网站数据
(1)安装Scrapy环境步骤请参考:https://blog.csdn.net/c406495762/article/details/60156205 需要注意的是,安装的时候需要根据自己的pyt ...
利用nodejs的cheerio抓取网站数据
/*引入模块*/ var http = require('http') var url = 'http://www.cnblogs.com/txxt' var cheerio = require('c ...
shell用curl抓取页面乱码，参考一下2方面（转）
1.是用curl抓取的数据是用类似gzip压缩后的数据导致的乱码.乱码:curl www.1ting.com |more乱码:curl -H "Accept-Encoding: gzip&q ...
Node.js的学习--使用cheerio抓取网页数据
打算要写一个公开课网站,缺少数据,就决定去网易公开课去抓取一些数据. 前一阵子看过一段时间的Node.js,而且Node.js也比较适合做这个事情,就打算用Node.js去抓取数据. 关键是抓取到网页 ...
爬虫抓取页面数据原理（php爬虫框架有很多）
爬虫抓取页面数据原理(php爬虫框架有很多 ) 一.总结 1.php爬虫框架有很多,包括很多傻瓜式的软件 2.照以前写过java爬虫的例子来看,真的非常简单,就是一个获取网页数据的类或者方法(这里的话 ...

随机推荐

centos7 ipython安装
##下载yum源(Centos 7 为例)[root@localhost ~]# wget http://mirror.centos.org/centos/7/extras/x86_64/Packag ...
Python的csv文件（csv模块）和ini文件（configparser模块）处理
Python的csv文本文件(csv模块)和ini文本文件(configparser模块)处理作者:尹正杰版权声明:原创作品,谢绝转载!否则将追究法律责任. 一.csv文件 1>.CSV文件 ...
日志聚合工具loki
目录 1.loki是什么 2.loki特点 3.loki组成 4.loki安装 4.1.添加helm的chart库 4.2.安装loki及promtail 4.3.安装grafana 5.配置和使用 ...
解决windows下合上、掀开笔记本盖子后屏幕黑屏的问题
我在macbook上安装了windows10,但是由于驱动问题,虽然我设置的是关闭盖子仅息屏,但是在关闭盖子后一段时间,再掀开,屏幕就怎么样都唤不醒了. 我找到一个方法,虽然治标不治本,但是起码能解决 ...
石子归并（区间dp 模板）
区间dp入门 #include<iostream> #include<cstdio> #include <cctype> #include<algorithm ...
《Maven在Java项目开发中的应用》论文笔记（十七）
标题:Maven在Java项目开发中的应用一.基本信息时间:2019 来源:山西农业大学关键词:Maven:Java Web:仓库:开发人员:极限编程; 二.研究内容 1.Maven 基本原理概 ...
Topcoder10566 IncreasingNumber
IncreasingNumber 一个数是Increasing当且仅当它的十进制表示是不降的,$1123579$. 求 $n$ 位不降十进制数中被 $d$ 整除的有多少个. \(n\leq ...
Java内存区域与内存溢出异常（jdk 6,7,8）
运行时数据区域 Java虚拟机在执行Java程序的过程中会把它关联的内存划分为若干个不同的数据区域.这些区域都有各自的用途,以及创建和销毁的时间,有的区域随着虚拟机进程的启动而存在,有些区域则依赖用户 ...
async-validator 表单验证注意事项
1. this.$refs[formName].validate()里面的内容不执行解决问题出处:https://segmentfault.com/q/1010000009679079 问题描述:1 ...
手机代理调试Charles Proxy和Fiddler
一.Charles Proxy Charles是一个HTTP代理/HTTP监控/反向代理的工具. 使用它开发者可以查看设备的HTTP和SSL/HTTPS网络请求.返回.HTTP头信息 (cookies ...

PHP用curl抓取网站数据，仿造IP、伪造来源等，防屏蔽解决方案教程

PHP用curl抓取网站数据，仿造IP、伪造来源等，防屏蔽解决方案教程的更多相关文章

随机推荐

热门专题