使用Post方法模拟登陆爬取网页

最近弄爬虫，遇到的一个问题就是如何使用post方法模拟登陆爬取网页。下面是极简版的代码：



import java.io.BufferedReader;

import java.io.InputStreamReader;

import java.io.OutputStreamWriter;

import java.io.PrintWriter;

import java.net.HttpURLConnection;

import java.net.URL;

import java.util.HashMap;

public class test {

	//post请求地址

	private static final String POST_URL = "";

	//模拟谷歌浏览器请求

	private static final String USER_AGENT = "";

	//用账号登录某网站后 请求POST_URL链接获取cookie

	private static final String COOKIE = "";

	//用账号登录某网站后 请求POST_URL链接获取数据包

	private static final String REQUEST_DATA =  "";

	public static void main(String[] args) throws Exception {

		HashMap<String, String> map = postCapture(REQUEST_DATA);

		String responseCode = map.get("responseCode");

		String value = map.get("value");

		while(!responseCode.equals("200")){

			map =  postCapture(REQUEST_DATA);

			responseCode = map.get("responseCode");

			value = map.get("value");

		}

		//打印爬取结果

		System.out.println(value);

	}

	private static HashMap<String, String> postCapture(String requestData) throws Exception{

		HashMap<String, String> map = new HashMap<>();

		URL url = new URL(POST_URL);

		HttpURLConnection httpConn = (HttpURLConnection) url.openConnection();

		httpConn.setDoInput(true); // 设置输入流采用字节流

		httpConn.setDoOutput(true); // 设置输出流采用字节流

		httpConn.setUseCaches(false); //设置缓存

		httpConn.setRequestMethod("POST");//POST请求

		httpConn.setRequestProperty("User-Agent", USER_AGENT);

		httpConn.setRequestProperty("Cookie", COOKIE);

		PrintWriter out = new PrintWriter(new OutputStreamWriter(httpConn.getOutputStream(), "UTF-8"));

		out.println(requestData);

		out.close();

		int responseCode = httpConn.getResponseCode();

		StringBuffer buffer = new StringBuffer();

		if (responseCode == 200) {

			BufferedReader reader = new BufferedReader(new InputStreamReader(httpConn.getInputStream(), "UTF-8"));

			String line = null;

			while ((line = reader.readLine()) != null) {

				buffer.append(line);

			}

			reader.close();

			httpConn.disconnect();

		}

		map.put("responseCode", new Integer(responseCode).toString());

		map.put("value", buffer.toString());

		return map;

	}

}

原文地址：

http://wangxin123.com/2016/12/19/使用Post方法模拟登陆爬取网页/

使用Post方法模拟登陆爬取网页的更多相关文章

使用Post方法模拟登陆爬取网页(转)
使用Post方法模拟登陆爬取网页最近弄爬虫,遇到的一个问题就是如何使用post方法模拟登陆爬取网页.下面是极简版的代码: import java.io.BufferedReader; impor ...
selenium自动化测试工具模拟登陆爬取当当网top500畅销书单
selenium自动化测试工具可谓是爬虫的利器,基本动态加载的网页都能抓取,当然随着大型网站的更新,也出现针对selenium的反爬,有些网站可以识别你是否用的是selenium访问,然后对你加以限制 ...
使用进程池模拟多进程爬取url获取数据，使用进程绑定的回调函数去处理数据
1 # 使用requests请求网页,爬取网页的内容 2 3 # 模拟使用进程池模拟多进程爬取网页获取数据,使用进程绑定的回调函数去处理数据 4 5 import requests 6 from mu ...
使用webdriver+urllib爬取网页数据(模拟登陆，过验证码)
urilib是python的标准库,当我们使用Python爬取网页数据时,往往用的是urllib模块,通过调用urllib模块的urlopen(url)方法返回网页对象,并使用read()方法获得ur ...
PHP爬取网页的主要方法，你掌握了吗
这篇文章讲的是PHP爬取网页的主要方法,主要流程就是获取整个网页,然后正则匹配(关键的). PHP抓取页面的主要方法,有几种方法是网上前辈的经验,现在还没有用到的,先存下来以后试试. file()函数 ...
python（27）requests 爬取网页乱码，解决方法
最近遇到爬取网页乱码的情况,找了好久找到了种解决的办法: html = requests.get(url,headers = head) html.apparent_encoding html.enc ...
Selenium+Chrome/phantomJS模拟浏览器爬取淘宝商品信息
#使用selenium+Carome/phantomJS模拟浏览器爬取淘宝商品信息 # 思路: # 第一步:利用selenium驱动浏览器,搜索商品信息,得到商品列表 # 第二步:分析商品页数,驱动浏 ...
python3爬虫爬取网页思路及常见问题（原创）
学习爬虫有一段时间了,对遇到的一些问题进行一下总结. 爬虫流程可大致分为:请求网页(request),获取响应(response),解析(parse),保存(save). 下面分别说下这几个过程中可以 ...
[python] 常用正则表达式爬取网页信息及分析HTML标签总结【转】
[python] 常用正则表达式爬取网页信息及分析HTML标签总结转http://blog.csdn.net/Eastmount/article/details/51082253 标签: pytho ...

随机推荐

jquery template.js前端模板引擎
作为现代应用,ajax的大量使用,使得前端工程师们日常的开发少不了拼装模板,渲染模板在刚有web的时候,前端与后端的交互,非常直白,浏览器端发出URL,后端返回一张拼好了的HTML串.浏览器对其进行 ...
SQL模糊查询条件的四种匹配模式
执行数据库查询时,有完整查询和模糊查询之分. 一般模糊语句格式如下: SELECT 字段 FROM 表 WHERE 某字段 LIKE 条件其中关于条件,SQL提供了四种匹配模式: 1.% :表示任意 ...
jsel、tl是什么
el 表达式是什么? * sun 制订的一种用于计算的一种规则,可以给元素赋值,也可以直接输出 el表达式:${el表达式}实验1:简单的使用el表达式获取值<%request.setAttri ...
Java Script 数组操作
常用几种数组操作方法: concat() join() toString() pop() push() shift() unshift() slice() splice() sort() revers ...
.NET插件技术-应用程序热升级
今天说一说.NET 中的插件技术,即应用程序热升级.在很多情况下.我们希望用户对应用程序的升级是无感知的,并且尽可能不打断用户操作的. 虽然在Web 或者 WebAPI上,由于多点的存在可以逐个停用 ...
Javascript中call和apply
在上一章http://www.cnblogs.com/meiyh/p/6207671.html 我有提到javascript很重要的this关键字,现在我们结合这个关键字使用的下面的两个关键字: ca ...
【代码学习】PHP 正则表达式
一.正则表达式介绍正则表达式是用于描述字符排列和匹配模式的一种规则,主要用于字符串的匹配.查找.替换.分割等操作 ------------------------------------------ ...
【解决问题】解决python安装模块时UnicodeDecodeError
安装模块时,出现报错: UnicodeDecodeError: 'ascii' codec can't decode byte 0xcb in position 68: ordinal not in ...
分布式锁与实现（二）——基于ZooKeeper实现
引言 ZooKeeper是一个分布式的,开放源码的分布式应用程序协调服务,是Google的Chubby一个开源的实现,是Hadoop和Hbase的重要组件.它是一个为分布式应用提供一致性服务的软件,提 ...

使用Post方法模拟登陆爬取网页

使用Post方法模拟登陆爬取网页的更多相关文章

随机推荐

热门专题