python 爬取乌云所有厂商名字，url，漏洞总数并存入数据库

需要：MySQLdb
下面是数据表结构：

/*

Navicat MySQL Data Transfer

Source Server         : 127.0.0.1

Source Server Version : 50509

Source Host           : 127.0.0.1:3306

Source Database       : wooyun

Target Server Type    : MYSQL

Target Server Version : 50509

File Encoding         : 65001

Date: 2015-09-24 17:38:14

*/

SET FOREIGN_KEY_CHECKS=0;

-- ----------------------------

-- Table structure for wooyun_vul

-- ----------------------------

DROP TABLE IF EXISTS `wooyun_vul`;

CREATE TABLE `wooyun_vul` (

  `id` int(8) NOT NULL AUTO_INCREMENT,

  `corpsname` varchar(255) DEFAULT NULL,

  `corpsurl` varchar(255) DEFAULT NULL,

  `vulcount` int(255) DEFAULT NULL,

  PRIMARY KEY (`id`)

) ENGINE=InnoDB DEFAULT CHARSET=latin1;

python 脚本：

#conding=utf-8

import urllib2

import urllib

import re

import MySQLdb

url = "http://wooyun.org/corps/page/"

def getWooyuncorps(url):

    request = urllib2.Request(url)

    request.add_header('User-Agent','Mozilla/5.0 (Windows NT 6.1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/41.0.2272.89 Safari/537.36')

    reponse = urllib2.urlopen(request)

    content = reponse.read()

    pattern1 = re.compile(r'<td width="370"><a href="\/corps\/(.*?)">.*?<\/a><\/td>')

    pattern2 = re.compile(r'<a rel="nofollow" href="(.*?)" target=')

    corps = pattern1.findall(content)

    corpsUrl = pattern2.findall(content)

    return corps,corpsUrl

def getcorpscount(url):

    request = urllib2.Request(url)

    request.add_header('User-Agent','Mozilla/5.0 (Windows NT 6.1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/41.0.2272.89 Safari/537.36')

    reponse = urllib2.urlopen(request)

    content = reponse.read()

    pattern = re.compile(r'<p class="page">.*?(\d+).*')

    count = pattern.findall(content)

    return count

corpslist = []

corpsurllist = []

countlist = []

for i in range(1,37):

    corps,corpsUrl = getWooyuncorps(url+str(i))

    for corp in corps:

        corpslist.append(corp)

    for urls in corpsUrl:

        corpsurllist.append(urls)

print len(corpslist),len(corpsurllist)

for i in range(0,len(corpslist)):

    newurl = "http://www.wooyun.org/corps/"+urllib.quote(corpslist[i])

    #print newurl

    count = getcorpscount(newurl)

    #print count

    for countA in count:

        countlist.append(countA)

#print len(countlist)

conn = MySQLdb.connect('localhost','root','','wooyun')

cur = conn.cursor()

sql = "set names 'utf8'"

cur.execute(sql)

conn.commit()

for s in range(0,len(countlist)):

    sql = 'insert into wooyun_vul(corpsname,corpsurl,vulcount) values("%s","%s",%d)' %(corpslist[s],corpsurllist[s],int(countlist[s]))

    print sql

    cur.execute(sql)

    conn.commit()

conn.close()

print "success"

python 爬取乌云所有厂商名字，url，漏洞总数并存入数据库的更多相关文章

Python:爬取乌云厂商列表，使用BeautifulSoup解析
在SSS论坛看到有人写的Python爬取乌云厂商,想练一下手,就照着重新写了一遍原帖:http://bbs.sssie.com/thread-965-1-1.html #coding:utf- im ...
用selenium 自动爬取某一本小说章节及其内容，并存入数据库中
from selenium import webdriver import pymysql from selenium.webdriver.support.ui import WebDriverWai ...
利用Python爬取豆瓣电影
目标:使用Python爬取豆瓣电影并保存MongoDB数据库中我们先来看一下通过浏览器的方式来筛选某些特定的电影: 我们把URL来复制出来分析分析: https://movie.douban.com ...
Python爬取LOL英雄皮肤
Python爬取LOL英雄皮肤 Python 爬虫一实现分析在官网上找到英雄皮肤的真实链接,查看多个后发现前缀相同,后面对应为英雄的ID和皮肤的ID,皮肤的ID从00开始顺序递增,而英雄ID跟 ...
利用python爬取58同城简历数据
利用python爬取58同城简历数据利用python爬取58同城简历数据最近接到一个工作,需要获取58同城上面的简历信息(http://gz.58.com/qzyewu/).最开始想到是用pyth ...
Python爬取网页信息
Python爬取网页信息的步骤以爬取英文名字网站(https://nameberry.com/)中每个名字的评论内容,包括英文名,用户名,评论的时间和评论的内容为例. 1.确认网址在浏览器中输入初 ...
steam夏日促销悄然开始，用Python爬取排行榜上的游戏打折信息
前言本文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理. 不知不觉,一年一度如火如荼的steam夏日促销悄然开始了.每年通过大大小小 ...
Python爬取 | 唯美女生图片
这里只是代码展示,且复制后不能直接运行,需要配置一些设置才行,具体请查看下方链接介绍: Python爬取 | 唯美女生图片 from selenium import webdriver from fa ...
Python爬取 | 王者荣耀英雄皮肤海报
这里只展示代码,具体介绍请点击下方链接. Python爬取 | 王者荣耀英雄皮肤海报 import requests import re import os import time import wi ...

随机推荐

java HelloWorld 提示“错误: 找不到或无法加载主类 HelloWorld“解决方案
在检查环境变量等前提工作准确无误后,注意要配好CLASSPATH,仍然报“错误: 找不到或无法加载主类 HelloWorld“. 本人工程目录:mygs-maven/src/main/java/hel ...
SQL SERVER 作业浅析
作业介绍 SQL SERVER的作业是一系列由SQL SERVER代理按顺序执行的指定操作.作业可以执行一系列活动,包括运行Transact-SQL脚本.命令行应用程序.Microsoft Activ ...
C# Attribute学习
由于项目中需要使用到序列化相关的技术,从而想到是否可以使用C#中的特性,特此花了近两小时学习了一下. 对于特性的学习,主要参考了两篇博文,特此感谢.以下附链接: http://www.cnblogs. ...
[MySQL] Buffer Pool Adaptive Flush
Buffer Pool Adaptive Flush 在MySQL的帮助文档中Tuning InnoDB Buffer Pool Flushing提到, innodb_adaptive_flushin ...
MYSQL介绍安装及一些问题解决
一.简介 MySQL是最流行的开放源码SQL数据库管理系统,它是由MySQL AB公司开发.发布并支持的.有以下特点: MySQL是一种数据库管理系统. MySQL是一种关联数据库管理系统. MySQ ...
kmeans算法c语言实现，能对不同维度的数据进行聚类
最近在苦于思考kmeans算法的MPI并行化,花了两天的时间把该算法看懂和实现了串行版. 聚类问题就是给定一个元素集合V,其中每个元素具有d个可观察属性,使用某种算法将V划分成k个子集,要求每个子集内 ...
使用 python 获取 httpd 程序所占用物理内存
#!/usr/bin/env python #encoding: utf-8 ''' 思路: /proc/xx_pid/status 文件中的关键字段 VmRSS 来获取某个进程占用的物理内存步骤: ...
Linux shell 通配符 / glob 模式
概念 glob 模式(globbing)也被称之为 shell 通配符,名字的起源来自于 Unix V6 中的 /etc/glob (详见 man 文档).glob 是一种特殊的模式匹配,最常见的是通 ...
Si2155
http://www.edom.com.tw/cn/index.jsp?m=prodview&id=1702 Description:新型的Si2155 电视调谐器IC扩展了Silicon L ...
【转】What is an SDET? Part 2 – Skill Matrix of SDET
What is an SDET? Part 2 ---- Skill Matrix of SDET (Instead of naming it as part 2 of What is an SDET ...

python 爬取乌云所有厂商名字，url，漏洞总数 并存入数据库

python 爬取乌云所有厂商名字，url，漏洞总数 并存入数据库的更多相关文章

随机推荐

热门专题

python 爬取乌云所有厂商名字，url，漏洞总数并存入数据库

python 爬取乌云所有厂商名字，url，漏洞总数并存入数据库的更多相关文章