批量文本读取URL获取正常访问且保留对应IP

#coding=utf-8

import sys

import requests

for i in range(3000,4999,1):

  url = 'http://192.168.88.139:8888/20150602'+str(i)+'.html'

  r = requests.get(url)

  if r.status_code == 200:

    print url

    print r.content

原文

http://zone.wooyun.org/content/20885

多线程+文本逐行读取+URL的IP转换+写入

# -*-coding:utf-8-*-

import os

import sys

import Queue

import getopt

import logging

import requests

import threading

import time

import socket

print "start:" + (time.strftime("%H:%M:%S"))

logging.basicConfig(

    level=logging.WARNING,

    format="[%(asctime)s] %(message)s"

)

class BatchThreads(threading.Thread):

    def __init__(self, queue):

        super(BatchThreads, self).__init__()

        self.queue = queue

    def run(self):

        while True:

            if self.queue.empty():

                break

            else:

                tempurl = self.queue.get()

                #print tempurl

                try:

                    url = 'http://'+tempurl

                    #print url

                    r = requests.get(url, timeout=5)

                    if r.status_code == 200 :

                        print url+' '+'access-comman:200'

                        #print tempurl

                        ip = socket.gethostbyname(tempurl)

                        #print ip

                        yes = open('yes.txt','a')

                        yes.write(url+'    ')

                        yes.write('    '+ip+'\n')

                        yes.close()

                except:

                    pass

                    print url+" error"

                    noaccess = open('noaccess.txt','a')

                    noaccess.write(url+'\n')

                    noaccess.close()

def batch_queue(_queue, _thread_number):

    with open('url-hz.txt') as f:

        urls = [line.strip() for line in f.readlines()]

    urls = set(filter(lambda url: url and not url.startswith("#"), urls))

    if urls:

        for url in urls:

            queue.put(url)

        if _thread_number > (queue.qsize() / 2):

            _thread_number = (queue.qsize())

        for _ in xrange(_thread_number):

            threads.append(BatchThreads(_queue))

        for t in threads:

            t.start()

        for t in threads:

            t.join()

threads = []

queue = Queue.Queue()

thread_number = 20

batch_queue(queue, thread_number)

print"end:" + (time.strftime("%H:%M:%S"))

批量文本读取URL获取正常访问且保留对应IP的更多相关文章

js进阶ajax读取json数据（ajax读取json和读取普通文本，和获取服务器返回数据（链接）都是一样的，在url处放上json文件的地址即可）
js进阶ajax读取json数据(ajax读取json和读取普通文本,和获取服务器返回数据(链接)都是一样的,在url处放上json文件的地址即可) 一.总结 ajax读取json和读取普通文本,和获 ...
java正则读取html 获取标题/超链接/链接文本/内容
java正则读取html 获取标题/超链接/链接文本/内容参考链接:http://yijianfengvip.blog.163.com/blog/static/175273432201142785 ...
js javascript 获取url，获得当前页面的url，静态html文件js读取url参数
获得当前页面的url window.location.href 静态html文件js读取url参数 location.search; //获取url中"?"符后的字串下边为转载的 ...
PHP 获取当前访问的完整URL
代码如下: <?php // php 获取当前访问的完整url function GetCurUrl() { $url = 'http://'; if(isset($_SERVER['HTTPS ...
Linux分析日志获取最多访问的前10个IP
原文地址:http://xuqq999.blog.51cto.com/3357083/774714 apache日志分析可以获得很多有用的信息,现在来试试最基本的,获取最多访问的前10个IP地址及访问 ...
linux分析apache日志获取最多访问的前10个IP
apache日志分析可以获得很多有用的信息,现在来试试最基本的,获取最多访问的前10个IP地址及访问次数. 既然是统计,那么awk是必不可少的,好用而高效. 命令如下: awk '{a[$1] += ...
更改一个链接的文本、URL 以及 target
<html> <head> <script type="text/javascript"> function changeLink() { do ...
根据URL获取图片
背景:今天因为生产环境的系统界面图片无法显示被领导叼了一波,之前用Hutool工具类解析URL获取图片的,在生产环境上跑了一个多月都正常,嘣,今天突然发现周六下午后的图片统统显示异常,之后改为用jav ...
Java从URL获取PDF内容
Java直接URL获取PDF内容题外话网上很多Java通过pdf转 HTML,转文本的,可是通过URL直接获取PDF内容,缺没有,浪费时间,本人最近工作中刚好用到,花了时间整理下,分享出来,防止浪 ...

随机推荐

mysql和oracle 分页查询（转）
最近简单的对oracle,mysql,sqlserver2005的数据分页查询作了研究,把各自的查询的语句贴出来供大家学习..... (一). mysql的分页查询 mysql的分页查询是最简单的,借 ...
Error:(12) No resource identifier found for attribute 'titles' in package 'com.itheima52.mobilesafe5
http://stackoverflow.com/questions/5819369/error-no-resource-identifier-found-for-attribute-adsize-i ...
java Direct Buffer
public static ByteBuffer allocate (int capacity) //性能低于下面的Direct,因为是把内存建立在JVM堆上,容易被GC回收,可能需要多次 ...
duplicate symbol _OBJC_CLASS 错误处理方法
错误: ld: duplicate symbol _OBJC_CLASS_$_************ in **************** 一种可能性是你的项目的不同group里有着相同名称的类 ...
iOS简单排序--字母排序、NSDictionary排序
// 数组用系统方法compare做字母的简单排序 NSArray *oldArray = @[@"bac",@"bzd",@"azc",@ ...
FW:使用weave管理docker网络
Posted on 2014-11-12 22:20 feisky 阅读(1761) 评论(0) 编辑收藏 weave简介 Weave creates a virtual network that ...
Java线程池的原理及几类线程池的介绍
刚刚研究了一下线程池,如果有不足之处,请大家不吝赐教,大家共同学习.共同交流. 在什么情况下使用线程池? 单个任务处理的时间比较短将需处理的任务的数量大使用线程池的好处: 减少在创建和销毁线程上所 ...
HBase的属性
一:基本属性 1.查看属性 2.解释属性 NAME:列簇名 BLOOMFILTER:布隆过滤器,用于对storefile的过滤共有三种类型: ROW:行健过滤 ROWCOL:行列过滤 NONE:无 ...
Qt中sleep()的实现（耳目一新的两种方法）
在Qt中并没有Sleep函数可以调用,在程序编写时往往需要休眠几秒,这里举出两个方法,不知道是否啥不良隐患没~~ 方法一: class SleeperThread : public QThread{p ...
Ajax如何实现跨域问题
一个域名的组成 http:// www . abc.com : 8080 /scripts/jquery.js 协议子域名主域名端口号请求资源地址当协议.子域名.主域名.端口号中任意一个不同 ...

批量文本读取URL获取正常访问且保留对应IP

批量文本读取URL获取正常访问且保留对应IP的更多相关文章

随机推荐

热门专题