用 Python 获取百度搜索结果链接

前言

近期有许多项目需要这个功能，由于Python实现起来比较简单就这么做了，代码贴下来觉得好点个赞吧~

代码

# coding: utf-8

import os

import time

import requests

import urllib.parse

from bs4 import BeautifulSoup

from urllib.parse import urlparse

from fake_useragent import UserAgent

from multiprocessing.pool import ThreadPool

LOCATIONS = {}

GLOBAL_THREAD = 500

GLOBAL_TIMEOUT = 50

def get_links(keyword, generator, pages):

    links = []

    for page in range(int(pages.split("-")[0]), int(pages.split("-")[1]) + 1):

        for genera in range(int(generator.split("-")[0]), int(generator.split("-")[1]) + 1):

            links.append(

                "http://www.baidu.com.cn/s?wd=" + urllib.parse.quote(keyword + str(genera)) + "&pn=" + str(page * 10))

    return links

def get_page(url):

    headers = {"user-agent": UserAgent().chrome}

    req = requests.get(url, headers=headers)

    req.encoding = "utf-8"

    soup = BeautifulSoup(req.text, "lxml")

    for link in soup.select("div.result > h3.t > a"):

        req = requests.get(link.get("href"), headers=headers, allow_redirects=False)

        if "=" in req.headers["location"]:

            root = urlparse(req.headers["location"]).netloc

            LOCATIONS[root] = req.headers["location"]

def baidu_search():

    try:

        os.system("cls")

        print("-" * 56 + "\n")

        print("| BaiduSearch Engine By 美图博客[https://www.meitubk.com/] |\n")

        print("-" * 56 + "\n")

        keyword = input("Keyword: ")

        generator = input("Generator(1-10): ")

        pages = input("Pages(0-10): ")

        start = time.time()

        pool = ThreadPool(processes=GLOBAL_THREAD)

        pool.map(get_page, get_links(keyword, generator, pages))

        pool.close()

        pool.join()

        end = time.time()

        path = r"D:\Desktop\result.txt"

        save_result(path)

        print("\nSava in %s" % path)

        print("Result count: %d" % len(LOCATIONS.values()))

        print("Running time: %ds" % (end - start))

    except:

        print("\nInput Error!")

        exit(0)

def save_result(path):

    with open(path, "w") as file:

        for url in list(LOCATIONS.values()):

            file.write(url + "\n")

baidu_search()

使用

用 Python 获取百度搜索结果链接的更多相关文章

【Python学习笔记六】获取百度搜索结果以及百度返回“百度安全验证”问题解决
1.获取百度搜索结果页面主要是修改百度搜索url中的参数实现,例如查询的关键字为wd: 举例:https://www.baidu.com/s?wd=python",这样就可以查询到‘pyth ...
python采集百度搜索结果带有特定URL的链接
#coding utf-8 import requests from bs4 import BeautifulSoup as bs import re from Queue import Queue ...
Python获取百度浏览记录
Python模拟百度登录实例详解 http://www.jb51.net/article/78406.htm Python实战计划学习作业2-1 http://blog.csdn.net/python ...
js 获取百度搜索关键词的代码
有可能有时候我们会用到在百度搜什么关键词进来我们的网站的,所有我们又想拿到用户搜索的关键词. 这是我研究了半天所得出的办法.话不多说直接贴代码 <script> function quer ...
jsonp模拟获取百度搜索相关词汇
随便写了个jsonp模拟百度搜索相关词汇的小demo,帮助新手理解jsonp的用法. <!DOCTYPE html><html lang="en">< ...
Python实现百度搜索并保存到本地示例，Python实现百度搜索
实现百度搜索并保存到本地 User_Agent = 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko ...
解析百度搜索结果链接的url，获取真正的url
通常,在百度输入关键词搜索出现的列表页,点击目标链接,然而跳转的时候却是百度地址,经过百度解析,才真的跳到目标页面. 在SEO中,经常需要看下自己的网站排名,又不想手动每天手动去点,可用以下方法去得到 ...
Python 版百度站长平台链接主动推送脚本
如果自己的网站需要被百度收录,可以在搜索结果中找到,就需要将网站的链接提交给百度.依靠百度的爬虫可能无法检索到网站所有的内容,因此可以主动将链接提交给百度. 在百度的站长平台上介绍了链接提交方法,目前 ...
python 模拟百度搜索
import urllib.request def Url(url): flag = input("请输入要搜索的关键字:") headers_ = { "User-Ag ...

随机推荐

coding++：Java 获取request中的参数
第一种: private Map<String,Object> mapParameters(HttpServletRequest request) { //封装查询条件参数 Map< ...
coding++ ：MySQL 使用 SQL 语句查询数据库所有表注释已经表字段注释
1.要查询数据库 "mammothcode" 下所有表名以及表注释 /* 查询数据库 ‘mammothcode’ 所有表注释 */ SELECT TABLE_NAME,TABLE_ ...
数据库(sqlserver 2005)优化排查之路
查找问题过程是痛苦的,解决完问题是快乐! 兄弟帮助一个公司开发了一个旅游网站(asp.net+sqlsever2005),一直还算稳定,但是最近网站却慢的可以,让人头疼.登录服务器,进入任务管理器,发 ...
Spring - 数据库开发概述
Spring 数据库开发 Spring 的 JDBC 模块负责数据库资源管理和镨误处理,大大简化了开发人员对数据库的操作,使得开发人员可以从繁琐的数据库操作中解脱出来,从而将更多的精力投入到编写业 ...
【线段树基础】NKOJ 1321 数列操作
时间限制 : 10000 MS 空间限制 : 165536 KB 问题描述假设有一列数{Ai}(1≤i≤n),支持如下两种操作:将Ak的值加D.(k, D是输入的数)输出As+As+1+…+At ...
# H - H HDU - 2066 （多起点、多终点问题）
H - H HDU - 2066 (多源点.多汇点问题) 一个图上,有M条边,Z个出发点,Y个终止点.求一条最短路,其中起点是Z中的任意一点,终点是Y中任意一点. Input 输入数据有多组,输入直到 ...
轻轻松松了解Java的初始化方法（含对象数组的小问题）
Java基础复习6-初始化之前讲过了类的一些基础,想必大家都知道了类的定义什么?你忘了? 下面给你一个例子快速复习 class AClass{ int a; boolean b; void get ...
C++中的map
c++中的map类型变量不能为const类型示例 struct INST{ string name; string type; string func; }; map<string, INST ...
MTK Android Driver ：Memory
型号配置: 1.CUSTOM_MEMORY_HDR(需要确认是否是MTK认证的flash ic) mediatek\custom\$(PROJECT)\preloader\inc\custom_Mem ...
Serverless无服务器云函数入门唠叨
B站录了个视频: https://www.bilibili.com/video/av59020925/

用 Python 获取百度搜索结果链接

前言

代码

使用

用 Python 获取百度搜索结果链接的更多相关文章

随机推荐

热门专题