爬行百度标题&URL案例

思路：

　　先将需要获取的匹配出，然后可以用"永真"（即while True:）来遍历使得URL可以一直自增变化（百度点击下一页URL的pn参数就增加10）每增加10就爬行一遍URL然后提取一次数据。

#-*-coding:UTF-8-*-

import sys,re,requests,graphics,Tkinter

import easygui as gui

string = raw_input("string is :")

pn = 0

while True:

    url = "http://www.baidu.com/s?wd=%s&pn=%d" % (string, pn)

    pn += 10

    html = requests.get(url).text

    # html = """

    # <div class="c-tools" id="tools_2269957611132062659_2" data-tools='{"title":"织梦CMS 官方网站 - 内容管理系统 - 上海卓卓网络科技有限公司","url":"http://www.baidu.com/link?url=gXtstOFbadX8Lia_Fwwl_AS8VUgXEfqcHe4bpP6Paj-BIGvrYgaUwI4BXvB2M4vg"}'><a class="c-tip-icon"><i class="c-icon c-icon-triangle-down-g"></i></a></div>

    # """

    res = "<div .*? data-tools=(.*?)>.*?</div>"

    con = re.findall(res, html)

    for i in con:

        d = eval(i.strip("'"))#将正则匹配到的json格式的数据转换为字典，eval即为转换。

        print "title:" + d[u'title'] + "  " + d['url']

    num = raw_input(u"e or q:")

    if num == "q":

        exit()

后期又修改了一下．

 #!/usr/bin/env python

 #encoding:utf-8

 #by i3ekr

 import sys,re,requests,time,json

 print """

                        #G

                        #K

                       .Et

                       :#

                     : ##

                     ##Dj K

                    .####G###

                    E;#####f;

                     ########

                     #######.

                     .i#L#,t

                     DEDECMS               

 """

 string = raw_input("string is :")

 pn = 0

 nn = 0

 r = requests.session()

 head = {'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; Trident/7.0; rv:11.0) like Gecko'}

 while True:

     url = "http://www.baidu.com/s?wd=%s&pn=%d" % (string, pn)

     html = r.get(url, headers=head).text

     res = "<div .*? data-tools=(.*?)>.*?</div>"

     con = re.findall(res, html)

     pn += 10

     nn += 1

     try:

       for i in con:

           a = eval(eval(i))

           b = r.get(a.get("url"), headers=head)

           print "[%s] %s"%(nn,b.url)

     except Exception as e:

       pass

爬行百度标题&URL案例的更多相关文章

百度搜索URL中的参数都是什么
最近,点石排名更新了一个新功能——站内搜索.其实理解起来也很简单,就是通过URL限定搜索结果为某个网站,从而参与点击(例如:https://www.baidu.com/s?wd=SEO&si= ...
零基础学习java------23---------动态代理，ip，url案例
1. 动态代理 2. ip,url案例给定的access.log是电信运营商的用户上网数据,第一个字段是时间, 第二个字段是ip地址,第三个字段是访问的网站,其他字段可以忽略不计. 第一个字段是网段 ...
百度UEditor开发案例（JSP）
本案例的开发环境:MyEclipse+tomcat+jdk 本案例的开发内容: 用百度编辑器发布新闻(UEditor的初始化开发部署) 编辑已发过的新闻(UEditor的应用——编辑旧文章) ...
百度搜索URL参数搜索关键字
http://www.baidu.com/s?wd=关键字 wd(Keyword):查询的关键词: http://www.baidu.com/s?wd=关键字&cl=3 cl(Class):搜 ...
百度搜索URL参数你知道多少
http://www.baidu.com/s?wd=关键字 wd(Keyword):查询的关键词: http://www.baidu.com/s?wd=关键字&cl=3 cl(Class):搜 ...
百度搜索URL参数
http://www.baidu.com/s?wd=关键字wd(Keyword):查询的关键词:http://www.baidu.com/s?wd=关键字&cl=3cl(Class):搜索类型 ...
百度搜索URL参数含义
序号参数含义 1 tn 搜索框所属网站.比如 tn=sitehao123,就是 http://www.hao123.com/ 左上那个搜索框(指通过什么方式到达百度首页搜索界面;) 2 s?wd ...
百度搜索结果页url参数详解
在百度首页输入任意关键词搜索之后,我们跳转到搜索结果页面,在浏览器的网址栏我们可以看到很长的一串url地址.那么,你真的了解这一串url的含义吗? s?:搜索百度搜索结果页使用了重定向,因此我们看到 ...
B站标题/子标题/url爬取示例(requests+re)
#coding:utf-8 __author__ = "zhoumi" 3 import requests import re import urllib ''' 本文档目的在于获 ...

随机推荐

Android性能测试工具：Emmagee介绍
简介 Emmagee是监控指定被测应用在使用过程中占用机器的CPU.内存.流量资源的性能测试小工具.该工具的优势在于如同windows系统性能监视器类似,它提供的是数据采集的功能,而行为则基于用户真实 ...
Fiddler绕过前端直接和后台进行交互
测试需求:有一个功能,允许用钻石兑换金币,假设1钻石=1金币,前端控制一次至少兑换10个,最多100个,后台不做验证. 测试方案:输入10,也就是告诉前端我要兑换10个金币,等前端验证通过之后,截取要 ...
【前端学习笔记01】JavaScript源生判断数据类型的方法
原始类型(值类型):Undefined.Null.Number.String.Boolean: 对象类型(引用类型):Object: typeof 可以识别标准类型,null外(返回Object): ...
SDOI2017 解题报告
数字表格 \(T\)次询问,每次给出\(n,m(n,m\le 10^6)\),\(f\)为斐波那契数列,\(f_0=0,f_1=1\),求: \[ \prod _{i=1}^n\prod _{j=1} ...
ssh-keygen的使用方法及配置authorized_keys两台linux机器相互认证
一.概述 1.就是为了让两个linux机器之间使用ssh不需要用户名和密码.采用了数字签名RSA或者DSA来完成这个操作 2.模型分析假设 A (192.168.20.59)为客户机器,B(192. ...
BZOJ3782 上学路线【dp + Lucas + CRT】
题目链接 BZOJ3782 题解我们把终点也加入障碍点中,将点排序,令\(f[i]\)表示从\((0,0)\)出发,不经过其它障碍,直接到达\((x_i,y_i)\)的方案数首先我们有个大致的方案 ...
Linux 查询命令
which 查看可执行文件的位置 whereis 查看文件的位置 locate 配合数据库查看文件位置 find 实际搜寻硬盘查询文件名称 (find也 ...
二型错误和功效（Type II Errors and Test Power）
sklearn实战-乳腺癌细胞数据挖掘(博主亲自录制视频教程) https://study.163.com/course/introduction.htm?courseId=1005269003&am ...
LINUX下时间类API
(1)常用的时间相关的API和C库函数有9个:time/ctime/localtime/gmtime/mktime/asctime/strftime/gettimeofday/settimeofday ...
Mac(Linux)上安装memcached步骤
Mac上安装memcached类似于在Linux平台上安装memcached. 主要需要做两块: 一.安装libevent库: 二.安装memcached; 一.安装libevent库 libeven ...

爬行百度标题&URL案例

爬行百度标题&URL案例的更多相关文章

随机推荐

热门专题