1)③爬取网易It方面部分新闻

 __author__ = 'minmin'

 #coding:utf-8

 import re,urllib,sgmllib,os

 #根据当前的url获取html

 def getHtml(url):

     page = urllib.urlopen(url)

     html = page.read()

     page.close()

     return html

 #根据html获取想要的文章内容

 def func(str):

      result= re.findall(r"<p>([^<>]*)</p>",getHtml(url),re.M)

      artical =''

      for j in result:

          if len(j)<>0:

              j = j.replace("&nbsp;","")

              j = j.replace("<STRONG>","   ")#去掉<STRONG>,换成"     "

              j = j.replace("</STRONG>","   ")#去掉</STROGN>换成"     "

              temp = re.findall(r"Copyright.*?",j,re.M);

              if temp == []:

                  artical = artical + j + '\n'

      return  artical

 #html链接的标签是“a”，链接的属性是“href”，也就是要获得html中所有tag=a，attrs=href 值。

 class URLPaser(sgmllib.SGMLParser):

     def reset(self):

         sgmllib.SGMLParser.reset(self)

         self.urls = []

     def start_a(self,attrs):

         href = [v for k,v in attrs if k == 'href']

         if href:

             self.urls.extend(href)

 IParser = URLPaser()

 socket = urllib.urlopen("http://tech.sina.com.cn/it/")#打开这个网页

 #fout = file('qq_art_urls.txt','w')#要把这个链接写到这个文件中

 IParser.feed(socket.read())#分析啦

 reg = 'http://tech.sina.com.cn/it/.*'#这个是用来匹配符合条件的链接，使用正则表达式匹配

 pattern = re.compile(reg)

 os.getcwd()#获得当前文件夹路径

 os.path.sep#当前系统路径分隔符

 #判断文件是否存在

 if os.path.exists('news163_it')==False:

      os.makedirs('news163_it')

 i = 0

 url2 = []

 for url in IParser.urls:#链接都存在urls里

     if pattern.match(url):

         if url not in url2:

             url2.append(url)

             artical = func(url)

             if len(artical)<>0:

                  print url

                  print artical

                  i = i + 1

                  f = open("news163_it/"+ str(i) + '.txt','a+')

                  f.write(artical)

                  f.close()

1)③爬取网易It方面部分新闻的更多相关文章

Python爬虫实战教程：爬取网易新闻
前言本文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理. 作者: Amauri PS:如有需要Python学习资料的小伙伴可以加点击 ...
如何利用python爬取网易新闻
前言本文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理. 作者: LSGOGroup PS:如有需要Python学习资料的小伙伴可以 ...
Python爬虫实战教程：爬取网易新闻；爬虫精选高手技巧
前言本文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理. stars声明很多小伙伴学习Python过程中会遇到各种烦恼问题解决不了.为 ...
使用Jsoup 爬取网易首页所有的图片
package com.enation.newtest; import java.io.File; import java.io.FileNotFoundException; import java. ...
Python 爬虫实例（4）—— 爬取网易新闻
自己闲来无聊,就爬取了网易信息,重点是分析网页,使用抓包工具详细的分析网页的每个链接,数据存储在sqllite中,这里只是简单的解析了新闻页面的文字信息,并未对图片信息进行解析仅供参考,不足之处请指 ...
selenium+谷歌无头浏览器爬取网易新闻国内板块
网页分析首先来看下要爬取的网站的页面查看网页源代码:你会发现它是由js动态加载显示的所以采用selenium+谷歌无头浏览器来爬取它 1 加载网站,并拖动到底,发现其还有个加载更多 2 模拟点击 ...
使用scrapy爬虫,爬取今日头条首页推荐新闻（scrapy+selenium+PhantomJS）
爬取今日头条https://www.toutiao.com/首页推荐的新闻,打开网址得到如下界面查看源代码你会发现全是js代码,说明今日头条的内容是通过js动态生成的. 用火狐浏览器F12查看得知 ...
java爬虫入门--用jsoup爬取汽车之家的新闻
概述使用jsoup来进行网页数据爬取.jsoup 是一款Java 的HTML解析器,可直接解析某个URL地址.HTML文本内容.它提供了一套非常省力的API,可通过DOM,CSS以及类似于jQuer ...
用 Python 爬取网易严选妹子内衣信息，探究妹纸们的偏好
网易商品评论爬取分析网页评论分析进入到网易精选官网,搜索“文胸”后,先随便点进一个商品. 在商品页面,打开 Chrome 的控制台,切换至 Network 页,再把商品页Python入门到精通学 ...

随机推荐

Java 获取文件md5校验码
讯雷下载的核心思想是校验文件的md5值,两个文件若md5相同则为同一文件. 当得到用户下载某个文件的请求后它根据数据库中保留的文件md5比对出拥有此文件的url, 将用户请求挂接到此url上并仿造一个 ...
EC读书笔记系列之10：条款16、17
条款18 让接口容易被正确使用,不易被误用记住: ★“促进正确使用”的办法包括接口的一致性,以及与内置类型的行为兼容 ★“阻止误用”的办法包括建立新类型.限制类型上的操作,束缚对象值,以及消除客户的 ...
C/C++输入输出
一. cin>>当碰到空格或换行符'\n'时,输入结束该操作符是根据后面变量的类型读取数据. 输入结束条件 :遇到Enter.Space.Tab键. 对结束符的处理 :丢弃缓冲区中使得输 ...
leetcode Linked List Cycle II python
# Definition for singly-linked list. # class ListNode(object): # def __init__(self, x): # self.val = ...
zabbix监控服务器部署
1.服务器安装lamp环境 [root@monitor ~]# yum install gcc gcc-c++ autoconf httpd php mysql mysql-server php-m ...
js实现表格
主要方法如下,然后今天学到了js的几个函数知识点. 1.eval()函数: 定义和用法eval() 函数可计算某个字符串,并执行其中的的 JavaScript 代码. 语法eval(string) 其 ...
Matlab插值计算各时刻磁法勘探日变观测值
Matlab插值计算各时刻磁法勘探日变观测值在磁法勘探中,消日变影响的改正称为日变改正.进行日变改正时必须设立日变站,观测日变情况.根据日变数据和测点观测时间,对观测数据进行改正. 在本次磁法实习中 ...
android DatePickerDialog theme
网上搜索了下没有找到DatePickerDialog的各种 Theme 的样例.我就一个一个试了下,传上图片 DatePickerDiaolog有两个构造函数分别是: DatePickerDialog ...
git Bug分支
Bug分支软件开发中,bug就像家常便饭一样.有了bug就需要修复,在Git中,由于分支是如此的强大,所以,每个bug都可以通过一个新的临时分支来修复,修复后,合并分支,然后将临时分支删除. 当你接 ...
JS 网页打印解决方案
这些日子真是太忙了,项目太多了公司总是加班,而且这些项目中好多都用到的打印,所以学习了一段时间js的打印. 其实原来只是用到了简单的功能,现在要深入的了解才发现原来ie的网页打印也是如此的强大. 以下 ...

1)③爬取网易It方面部分新闻

1)③爬取网易It方面部分新闻的更多相关文章

随机推荐

热门专题