day 18 - 2 正则与 re 模块练习

1、爬虫的例子

#爬虫的例子（方法一）

import re

import urllib,request import urlopen

def getPage(url):

    response = urlopen(url)

    return response.read().decode('utf-8')

def parsePage(s):

    ret = re.findall(

        '<div class="item">.*?<div class="pic">.*?<em .*?>(?P<id>\d+).*?<span class="title">(?P<title>.*?)</span>'

       '.*?<span class="rating_num" .*?>(?P<rating_num>.*?)</span>.*?<span>(?P<comment_num>.*?)评价</span>',s,re.S)

    return ret

def main(num):

    url = 'https://movie.douban.com/top250?start=%s&filter=' % num

    response_html = getPage(url)

    ret = parsePage(response_html)

    print(ret)

count = 0

for i in range(10):   # 10页

    main(count)

    count += 25

# url 从网页上把代码搞下来

# bytes decode ——> utf-8 网页内容就是我的待匹配字符串

# ret = re.findall(正则，带匹配的字符串)  #ret是所有匹配到的内容组成的列表

#爬虫的例子（方法一）

import requests

import re

import json

def getPage(url):

    response=requests.get(url)

    return response.text

def parsePage(s):

    com=re.compile('<div class="item">.*?<div class="pic">.*?<em .*?>(?P<id>\d+).*?<span class="title">(?P<title>.*?)</span>'

                   '.*?<span class="rating_num" .*?>(?P<rating_num>.*?)</span>.*?<span>(?P<comment_num>.*?)评价</span>',re.S)

    ret=com.finditer(s)

    for i in ret:

        yield {

            "id":i.group("id"),

            "title":i.group("title"),

            "rating_num":i.group("rating_num"),

            "comment_num":i.group("comment_num"),

        }

def main(num):

    url='https://movie.douban.com/top250?start=%s&filter='%num

    response_html=getPage(url)

    ret=parsePage(response_html)

    print(ret)

    f=open("move_info7","a",encoding="utf8")

    for obj in ret:

        print(obj)

        data=json.dumps(obj,ensure_ascii=False)

        f.write(data+"\n")

if __name__ == '__main__':

    count=0

    for i in range(10):

        main(count)

        count+=25

1、计算器

#计算下面式子

a = '1 - 2 * ( ( 6 0 -3 0  +(-40/5) * (9-2*5/3 + 7 /3*99/4*2998 +10 * 568/14 )) - (-4*3)/ (16-3*2) )'

import re

def format(new_equation):

    new_equation = new_equation.replace('+-','-')

    new_equation = new_equation.replace('--', '+')

    return new_equation

def cal(val_son):

    '''加减乘除的计算'''

    #print(new_val)

    if '/' in val_son:

        a,b = val_son.split('/')

        return str(float(a)/float(b))

    elif '*' in val_son:

        a,b = val_son.split('*')

        return str(float(a)*float(b))

def no_brackets(val):

    '''去括号'''

    new_val = val.strip('()')

    while True:

        ret = re.search('\d+\.?\d*[*/]-?\d+\.?\d*',new_val) #匹配第一个乘除

        if ret: #说明 表达式中海油乘除法

            val_son = ret.group()  #子表达式

            ret = cal(val_son)

            new_val = new_val.replace(val_son,ret)

            new_val = format(new_val)

        else:

            ret = re.findall('-?\d+\.?\d*',new_val)

            sum =

            for i in ret:

                sum += float(i)

            return str(sum)

def func(new_equation):

    while True:

        val = re.search('\([^()]+\)',new_equation)

        if val:

            val = val.group()

            ret = no_brackets(val)

            new_equation = new_equation.replace(val,ret)

            new_equation = format(new_equation)

        else:

            return no_brackets(new_equation)

a = input("请输入要计算的式子>>>")

new_equation = a.replace(' ','')

print(func(new_equation))

day 18 - 2 正则与 re 模块练习的更多相关文章

day 18 - 1 正则与 re 模块
正则表达式官方定义:正则表达式是对字符串操作的一种逻辑公式,就是用事先定义好的一些特定字符.及这些特定字符的组合,组成一个 “规则字符串”,这个 “规则字符串” 用来表达对字符串的一种过滤逻辑. 我 ...
day19 正则，re模块
http://www.cnblogs.com/Eva-J/articles/7228075.html 所有常用模块的用法正则的规则: 在一个字符组里面枚举合法的所有字符,字符组里面的任意一个字符和 ...
正则，re模块
一.正则表达式(精准匹配) 匹配字符串内容的一种规则二.字符组在同一个位置可能出现的各种字符组成了一个字符组,在正则表达式中用[]表示常见字符组格式如下:[0123456789],[0-9],[ ...
python正则以及collections模块
正则一.认识模块什么是模块:一个模块就是一个包含了python定义和声明的文件,文件名就是加上.py的后缀,但其实import加载的模块分为四个通用类别 : 1.使用python编写的代码(.p ...
Python 正则处理_re模块
正则表达式动机文本处理成为计算机常见工作之一对文本内容搜索,定位,提取是逻辑比较复杂的工作为了快速方便的解决上述问题,产生了正则表达式技术定义文本的高级匹配模式, 提供搜索, 替换, 本质 ...
Learning-Python【18】：Python常用模块（1）—— time、datetime、randrom
time 模块:与时间相关的功能的模块在 Python 中,时间分为三种: 1.时间戳:是一个时间的表示,根据不同的语言,可以是整数或浮点数,是从1970年1月1日0时0分0秒到现在经历的秒数 2. ...
day23 正则，re模块
一. 简谈正则表达式元字符 . 除了换行符外任意字符. \w 数字.字母.下划线 \s 空白符 \b 单词的末尾 \d 数字 \n 匹配换行符 \t 匹配制表符 \W 除了数字. 字母下划线 \D ...
python 基础之第十二天（re正则，socket模块）
In [14]: 'hello-wold.tar.gz'.split('.') Out[14]: ['hello-wold', 'tar', 'gz'] In [15]: import re In [ ...
Python正则、re模块
正则的概念 findall match search 方法元字符的用法和作用正则表达式概念正则表达式是对字符串操作的一种逻辑公式,就是对字符串的一种过滤可以判断是 ...

随机推荐

MyBatis学习日记（二）： MyBatis Say Hello
首先在Eclipse中创建一个maven工程: 在maven工程下的pom.xml文件中添加MyBatis.MySQL.Junit依赖: <project xmlns="http:// ...
[LeetCode] 17. 电话号码的字母组合
题目描述:https://leetcode-cn.com/problems/letter-combinations-of-a-phone-number/ 题目描述: 给定一个仅包含数字 2-9 的字符 ...
commons-lang3 事件机制 <EventListenerSupport>
俗话说,站在巨人肩上,可以使我们走的更远使用已有的java组件,可以提高我们的开发效率,减少出错几率,apache commons中包含有很多这样的组将,commons-lang3就是其中的一个,当 ...
毕业设计5：基于MicroPython的智能火灾报警器系统的设计与实现
随着现代家庭用火.用电量的增加,家庭火灾发生的频率越来越高.家里一旦发生火灾,如果出现扑救不及时.灭火器材缺乏.以及在场人惊慌失措.逃生迟缓等不利情况下,最终就会导致产生重大的生命财产的损失. 消防部 ...
django开发新手教程(原创)
为了帮助新手简单高效解决django开发的问题,从而写了这么一篇,随便转载! 本人用的是windows10操作系统 #联网安装 ==指定版本号我在自定义的www文件夹安装C:\Users\ ...
EasyUI的Datagrid鼠标悬停显示单元格内容
功能描述:table鼠标悬停显示单元格内容 1.js函数 function hoveringShow(value) { return "<span title='" + va ...
关于win7+VS2017环境下的opencv-contirb配置的一个坑
问题出现背景: 由于课题需要用到SURF detector, 我依照网上的一下教程,把opencv-contrib的配置了一遍.但是,当我写了一个小demo来测试模块是否能正常使用的时候,程序能正常编 ...
Hive基础知识
一.产生背景 1.MapReudce编程繁琐,需要编写大量的代码 2.HDFS中存放的都是文件,在HDFS中没有Scheme的概念,无法用SQL进行快速的查询. 二.Hive的概念 Hive是基于Ha ...
（八）jdk8学习心得之Optional类
八.Optional 类 1. 作用:可以存放空指针null,主要用于解决空指针问题. 2. 使用方法 1) 创建对象(2种方法) Optional optional = Optional.of(非n ...
C#中 SQL语句
SQL语句 SELECT STUFF(( (SELECT ',{' ),)) ),)) ),)) +'}' FROM ZSJTTD_HouseBuilding hb ,,'' ) HouseBuild ...

day 18 - 2 正则与 re 模块练习

day 18 - 2 正则与 re 模块练习的更多相关文章

随机推荐

热门专题