【Python项目篇】【爬妹子图】

 #-*- coding:utf-8 -*-

 import urllib

 import urllib2

 from bs4 import beautifulsoup4 #获取标签下的内容

 #打开网页，获取源码

 x=0

 url='http://www.dbmeinv.com/?pager_offset=1'

 def crawl(url): #取名字，最好见名思义

     headers={'User-Agent':'Mozilla/5.0 (Windows NT 6.1; Win64; x64; rv:57.0) Gecko/20100101 Firefox/57.0'}

     req=urllib2.Request(url,headers=headers) #浏览器帽子

     page=urllib2.urlopen(req,timeout=20) #打开网页

     contents=page.read()#获取源码

     #print contents

     #html.parser是自带的解析方式，lxml功能大

     soup=BeautifulSoup(contents,'html.parser')#创建一个soup对象

     my_girl=soup.find_all('img')#找到所有的标签

     print(my_girl)

     for girl in my_girl:#遍历list,选取属性

         link=girl.get('src')#获取src图片路径

         print(link)

         #下载的文件，取名字

         global x

         urllib.urlretrieve(link,'image\%s.jpg'%x)

         x+=1

         print

 crawl(url)

以上代码在3.5环境下运行一下代码可以成功爬到各图片链接

 #-*- coding:utf-8 -*-

 import urllib.request

 from bs4 import BeautifulSoup #获取标签下的内容

 #打开网页，获取源码

 x = 0

 url = 'http://www.dbmeinv.com/?pager_offset=1'

 def crawl(url):

     print('')

     headers = {'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; Win64; x64; rv:57.0) Gecko/20100101 Firefox/57.0'}

     print('')

     req = urllib.request.Request(url, headers=headers)

     page = urllib.request.urlopen(req)

     #req = urllib3.request(url, headers=headers) #浏览器帽子

     print('')

     #page = urllib3.urlopen(req, timeout=20) #打开网页

     contents = page.read()#获取源码

     soup = BeautifulSoup(contents,'html.parser')#创建一个soup对象

     my_girl = soup.find_all('img')#找到所有的标签

     print(my_girl)

     for girl in my_girl:

         link = girl.get('src')

         print(link)

         print('')

 print('')

 crawl(url)

【Python项目篇】【爬妹子图】的更多相关文章

python3 爬妹子图
Beautiful Soup 是一个可以从HTML或XML文件中提取数据的Python库.它能够通过你喜欢的转换器实现惯用的文档导航,查找,修改文档的方式 Beautiful Soup 4 通过PyP ...
【Python项目】爬取新浪微博个人用户信息页
微博用户信息爬虫项目链接:https://github.com/RealIvyWong/WeiboCrawler/tree/master/WeiboUserInfoCrawler 1 实现功能这个 ...
【Python项目】爬取新浪微博签到页
基于微博签到页的微博爬虫项目链接:https://github.com/RealIvyWong/WeiboCrawler/tree/master/WeiboLocationCrawler 1 实现功 ...
python爬虫之一---------豆瓣妹子图
#-*- coding:utf-8 -*- __author__ = "carry" import urllib import urllib2 from bs4 import Be ...
老王Python培训视频教程（价值500元）【基础进阶项目篇 – 完整版】
老王Python培训视频教程(价值500元)[基础进阶项目篇 – 完整版] 教学大纲python基础篇1-25课时1.虚拟机安装ubuntu开发环境,第一个程序:hello python! (配置开发 ...
「玩转Python」突破封锁继续爬取百万妹子图
前言从零学 Python 案例,自从提交第一个妹子图版本引来了不少小伙伴的兴趣.最近,很多小伙伴发来私信说,妹子图不能爬了!? 趁着周末试了一把,果然爬不动了,爬下来的都是些 0kb 的假图片,然后 ...
Python使用Scrapy爬虫框架全站爬取图片并保存本地(妹子图)
大家可以在Github上clone全部源码. Github:https://github.com/williamzxl/Scrapy_CrawlMeiziTu Scrapy官方文档:http://sc ...
Python 爬虫入门(二)——爬取妹子图
Python 爬虫入门听说你写代码没动力?本文就给你动力,爬取妹子图.如果这也没动力那就没救了. GitHub 地址: https://github.com/injetlee/Python/blob ...
Python 爬虫入门之爬取妹子图
Python 爬虫入门之爬取妹子图来源:李英杰链接: https://segmentfault.com/a/1190000015798452 听说你写代码没动力?本文就给你动力,爬取妹子图.如果 ...

随机推荐

haproxy+tomcat实现负载均衡以及session共享(linux centos7环境)
一.安装HAProxy 1.进入home目录,下载最新haproxy安装包. cd /home wget http://haproxy.1wt.eu/download/1.4/src/haproxy- ...
模拟Excel中SUBSTITUTE函数
Excel中的SUBSTITUTE是一个很有用的字符串替换函数,其说明如下: 说明在文本字符串中用 new_text 替换 old_text. 如果需要在某一文本字符串中替换指定的文本,请使用函数 ...
创建SQL语句_面试
创建一个表:create table if not exists Teachaers(tea_id integer primary key autoincrement,tea_name text,t ...
Oracle 添加主键和索引
数据的主键和索引一般情况下都是必须的,特别是表有大量数据的时候,索引和主键更是必不可少,这样可以提供数据的查询效率: 一.创建表的同时创建主键约束 (1)无命名 create table studen ...
linux系统中RPM包的通用命名规则
http://blog.csdn.net/kexiuyi/article/details/53292358
[kfaka] Apache Kafka：下一代分布式消息系统
简介 Apache Kafka是分布式发布-订阅消息系统.它最初由LinkedIn公司开发,之后成为Apache项目的一部分.Kafka是一种快速.可扩展的.设计内在就是分布式的,分区的和可复制的提交 ...
oracle函数学习_根据用户id获取用户角色
create or replace function FN_GET_ROLES(v_user_id varchar2) return varchar2 istype zy_emp_cursor is ...
JBOSS-EAP-6.2集群部署
1 概述应用的合理部署即能提高系统的可靠性和稳定性,又能提高系统的可维护性和扩展性.本文档详细阐述基于Apache负载均衡和JBOSS7集群的应用系统部署方案和配置步骤.内容涉及部署方案.环境配置. ...
ios开发之--pop到指定页面
1 推出到根视图控制器 [self.navigationController popToRootViewControllerAnimated:YES]; 2 推出到指定的视图控制器 for (UIVi ...
Windows7 64bits下安装TensorFlow CPU版本（图文详解）
不多说,直接上干货! Installing TensorFlow on Windows的官网 https://www.tensorflow.org/install/install_windows 首先 ...

【Python项目篇】【爬妹子图】

【Python项目篇】【爬妹子图】的更多相关文章

随机推荐

热门专题