获取搜索结果的真实URL、描述、标题

1、场景

爬虫练手代码

2、代码

Python2：

#!/usr/bin/python

# -*- coding:utf-8 -*-

import requests

from lxml import etree

import BeautifulSoup

import sys

reload(sys)

sys.setdefaultencoding("utf-8")

def getfromBaidu(word):

    list=[]

    headers = {

        'Accept': 'text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8',

        'Accept-Encoding': 'gzip, deflate, compress',

        'Accept-Language': 'en-us;q=0.5,en;q=0.3',

        'Cache-Control': 'max-age=0',

        'Connection': 'keep-alive',

        'User-Agent': 'Mozilla/5.0 (X11; Ubuntu; Linux x86_64; rv:22.0) Gecko/20100101 Firefox/22.0'

        }

    baiduurl = 'http://www.baidu.com'

    url = 'http://www.baidu.com.cn/s?wd=' + word + '&cl=3'

    html = requests.get(url=url,headers=headers)

    path = etree.HTML(html.content)

    #用k来控制爬取的页码范围

    for k in range(1, 20):

        # 取出内容

        path = etree.HTML(requests.get(url, headers).content)

        flag = 11

        if k == 1:

            flag = 10

        for i in range(1, flag):

            # 获取标题

            sentence = ""

            for j in path.xpath('//*[@id="%d"]/h3/a//text()'%((k-1)*10+i)):

                sentence+=j

            print sentence                # 打印标题

            # 获取真实URL

            try:

                url_href =  path.xpath('//*[@id="%d"]/h3/a/@href'%((k-1)*10+i))

                url_href = ''.join(url_href)

                baidu_url = requests.get(url=url_href, headers=headers, allow_redirects=False)

                real_url = baidu_url.headers['Location']  # 得到网页原始地址

                print real_url               # 打印URL

            except:

                print "error",sentence,url_href

            # 获取描述

            res_abstract =  path.xpath('//*[@id="%d"]/div[@class="c-abstract"]'%((k-1)*10+i))

            if res_abstract:

                abstract = res_abstract[0].xpath('string(.)')

            else:

                res_abstract = path.xpath('//*[@id="%d"]/div/div[2]/div[@class="c-abstract"]' % ((k - 1) * 10 + i))

                if res_abstract:

                    abstract = res_abstract[0].xpath('string(.)')

            print abstract                  # 打印描述

        url = baiduurl+path.xpath('//*[@id="page"]/a[%d]/@href'%flag)[0]

    return

#主程序测试函数

if __name__ == '__main__':

    print getfromBaidu('上网')

3、效果

获取搜索结果的真实URL、描述、标题的更多相关文章

获取百度搜索结果的真实url以及摘要和时间
利用requests库和bs4实现,demo如下: #coding:utf- import requests from bs4 import BeautifulSoup import bs4 impo ...
songtaste网站歌曲真实URL获取
个人挺喜欢songtaste网站的歌曲的,下载方法也层出不穷,可是作为程序员如果不知其中原理的方法真是羞愧.首先简单点的方法当然有google插件这样的嗅探器了,不过这种工具的原理还不是很了解.今天先 ...
Java 获取网络重定向文件的真实URL
其实Java 使用HttpURLConnection下载的的时候,会自动下载重定向后的文件,但是我们无法获知目标文件的真实文件名,文件类型,用下面的方法可以得到真实的URL,下面是一个YOUKU视频的 ...
多级反向代理下，Java获取请求客户端的真实IP地址多中方法整合
在JSP里,获取客户端的IP地址的方法是:request.getRemoteAddr(),这种方法在大部分情况下都是有效的.但是在通过了Apache,Squid等反向代理软件就不能获取到客户端的真实I ...
spring中获取当前项目的真实路径
总结: 方法1: WebApplicationContext webApplicationContext = ContextLoader.getCurrentWebApplicationContext ...
Java获取请求客户端的真实IP地址
整理网友的材料,最后有源码,亲测能解决所有java获取IP真实地址的问题整理的这里: 1.链接1 2.链接2 JSP里,获取客户端的IP地址的方法是: request.getRemoteAddr() ...
使用CDN后配置nginx自定义日志获取访问用户的真实IP
问题描述: 新上线了一个项目,架构如下(简单画的理解就好): 问题是:负载前面加上CDN后负载这里无法获取客户的真实访问IP,只能过去到CDN的IP地址: 问题解决: 修改nginx日 ...
用Head方法获得百度搜索结果的真实地址
用Head方法获得百度搜索结果的真实地址在百度中搜索"Java",第一条结果的链接为: https://www.baidu.com/link?url=HBOOMbhPKH4SfI ...
获取HTML中所有图片的 URL
/// <summary> /// 获取HTML中所有图片的 URL /// </summary> /// <param name="strHtml" ...

随机推荐

ansible 与 Jinja2的结合
1.文件架构 [root@master template]# tree . ├── jinj2_test.yml ├── meta ├── tasks ├── templates │ └── te ...
Linux下Power Management开发总结
本文作为一个提纲挈领的介绍性文档,后面会以此展开,逐渐丰富. 1. 前言在 <开发流程>中介绍了PM开发的一般流程,重点是好的模型.简单有效的接口参数.可量化的测试环境以及可独性强的输出 ...
Java实现动态修改Jar包内文件内容
import java.io.*; import java.util.Enumeration; import java.util.LinkedList; import java.util.List; ...
SpringCloud（3）服务消费者（Feign）
上一篇文章,讲述了如何通过 RestTemplate+Ribbon 去消费服务,这篇文章主要讲述如何通过Feign去消费服务. 1.Feign简介 Feign是一个声明式的伪Http客户端,它使得写H ...
微信小程序开发教程 #043 - 在小程序开发中使用 npm
本文介绍了如何在微信小程序开发中使用 npm 中包的功能,大大提高微信小程序的开发效率,同时也是微信小程序系列教程的视频版更新. 微信小程序在发布之初没有对 npm 的支持功能,这也是目前很多前端开发 ...
分享：大型Web网站架构演变之9大阶段
前言我们以Java Web为例,来搭建一个简单的电商系统,看看这个系统可以如何一步步演变. 该系统具备的功能: 用户模块:用户注册和管理商品模块:商品展示和管理交易模块:创建交易和管理正文阶 ...
选择语句--switch
switch语句格式: 执行流程首先计算出表达式的值其次,和case依次比较,一旦有对应的值,就会执行相应的语句,在执行的过程中,遇到break就会结束. 最后,如果所有的case都和表达式的值 ...
synchronized详解
关于synchronized,本文从使用方法,底层原理和锁的升级优化这几个方面来介绍. 1.synchronized的使用: synchronized可以保证在同一时刻,只有一个线程可以操作共享变量, ...
洛谷P3806 点分治
点分治第一次写点分治..感觉是一个神奇而又暴力的东西orz 点分治大概就是用来处理树上链的信息,把路径分成过点x和不过点x的两种,不过点x的路径可以变成过点x的子树中一点的路径,递归处理 #incl ...
hihoCoder #1770 : 单调数（数位dp）
题面我们定义一个数是单调数,当且仅当构成这个数每一个数位都是单调不降或不增的. 例如 \(123\) 和 \(321\) 和 \(221\) 和 \(111\) 是单调的,而 \(312\) 不是单 ...

获取搜索结果的真实URL、描述、标题

1、场景

2、代码

3、效果

获取搜索结果的真实URL、描述、标题的更多相关文章

随机推荐

热门专题