python的即时标记项目练习笔记


Posted in Python onSeptember 18, 2014

这是《python基础教程》后面的实践,照着写写,一方面是来熟悉python的代码方式,另一方面是练习使用python中的基本的以及非基本的语法,做到熟能生巧。

这个项目一开始比较简单,不过重构之后就有些复杂了,但是更灵活了。

按照书上所说,重构之后的程序,分为四个模块:处理程序模块,过滤器模块,规则(其实应该是处理规则),语法分析器。

先来说处理程序模块,这个模块的作用有两个,一个是提供那些固定的html标记的输出(每一个标记都有start和end),另一个是对这个标记输出的开始和结束提供了一个友好的访问接口。来看下程序handlers.py:

class Handler:

    '''

    '''

    def callback(self, prefix, name, *args):

        method = getattr(self,prefix+name,None)

        if callable(method): return method(*args)

    def start(self, name):

        self.callback('start_', name)

    def end(self, name):

        self.callback('end_', name)

    def sub(self, name):

        def substitution(match):

            result = self.callback('sub_', name, match)

            if result is None: match.group(0)

            return result

        return substitution
class HTMLRenderer(Handler):

    '''
    '''

    def start_document(self):

        print '<html><head><title>...</title></head><body>'

    def end_document(self):

        print '</body></html>'

    def start_paragraph(self):

        print '<p>'

    def end_paragraph(self):

        print '</p>'

    def start_heading(self):

        print '<h2>'

    def end_heading(self):

        print '</h2>'

    def start_list(self):

        print '<ul>'

    def end_list(self):

        print '</ul>'

    def start_listitem(self):

        print '<li>'

    def end_listitem(self):

        print '</li>'

    def start_title(self):

        print '<h1>'

    def end_title(self):

        print '</h1>'

    def sub_emphasis(self, match):

        return '<em>%s</em>' % match.group(1)

    def sub_url(self,  match):

        return '<a href="%s">%s</a>' % (match.group(1),match.group(1))

    def sub_mail(self,  match):

        return '<a href="mailto:%s">%s</a>' % (match.group(1),match.group(1))

    def feed(self, data):

        print data

这个程序堪称是整个“项目”的基石所在:提供了标签的输出,以及字符串的替换。理解起来也比较简单。

再来看第二个模块“过滤器”,这个模块更为简单,其实就是一个正则表达式的字符串。相关代码如下:

self.addFilter(r'\*(.+?)\*', 'emphasis')

self.addFilter(r'(http://[\.a-z0-9A-Z/]+)', 'url')

self.addFilter(r'([\.a-zA-Z]+@[\.a-zA-Z]+[a-zA-Z]+)','mail')

这就是三个过滤器了,分别是:强调牌过滤器(用×号标出的),url牌过滤器,email牌过滤器。熟悉正则表达式的同学理解起来是没有压力的。

再来看第三个模块“规则”,这个模块,抛开那祖父类不说,其他类应该有的两个方法是condition和action,前者是用来判断读进来的字符串是不是符合自家规则,后者是用来执行操作的,所谓的执行操作就是指调用“处理程序模块”,输出前标签、内容、后标签。 来看下这个模块的代码,其实这个里面几个类的关系,画到类图里面看会比较清晰。 rules.py:

class Rule:

    def action(self, block, handler):

        handler.start(self.type)

        handler.feed(block)

        handler.end(self.type)

        return True
class HeadingRule(Rule):

    type = 'heading'

    def condition(self, block):

        return not '\n' in block and len(block) <= 70 and not block[-1] == ':'
class TitleRule(HeadingRule):

    type = 'title'

    first = True
    def condition(self, block):

        if not self.first: return False

        self.first = False

        return HeadingRule.condition(self, block)
class ListItemRule(Rule):

    type = 'listitem'

    def condition(self, block):

        return block[0] == '-'

    def action(self,block,handler):

        handler.start(self.type)

        handler.feed(block[1:].strip())

        handler.end(self.type)

        return True
class ListRule(ListItemRule):

    type = 'list'

    inside = False

    def condition(self, block):

        return True

    def action(self,block, handler):

        if not self.inside and ListItemRule.condition(self,block):

            handler.start(self.type)

            self.inside = True

        elif self.inside and not ListItemRule.condition(self,block):

            handler.end(self.type)

            self.inside = False

        return False
class ParagraphRule(Rule):

    type = 'paragraph'

    def condition(self, block):

        return True

补充utils.py:

def line(file):

    for line in file:yield line

    yield '\n'
def blocks(file):

    block = []

    for line in lines(file):

        if line.strip():

            block.append(line)

        elif block:

            yield ''.join(block).strip()

            block = []

最后隆重的来看下“语法分析器模块”,这个模块的作用其实就是协调读入的文本和其他模块的关系。在往重点说就是,提供了两个存放“规则”和“过滤器”的列表,这么做的好处就是使得整个程序的灵活性得到了极大的提高,使得规则和过滤器变成的热插拔的方式,当然这个也归功于前面在写规则和过滤器时每一种类型的规则(过滤器)都单独的写成了一个类,而不是用if..else来区分。 看代码:

import sys, re

from handlers import *

from util import *

from rules import *
class Parser:

    def __init__(self,handler):

        self.handler = handler

        self.rules = []

        self.filters = []
    def addRule(self, rule):

        self.rules.append(rule)
    def addFilter(self,pattern,name):

        def filter(block, handler):

            return re.sub(pattern, handler.sub(name),block)

        self.filters.append(filter)
    def parse(self, file):

        self.handler.start('document')

        for block in blocks(file):

            for filter in self.filters:

                block = filter(block, self.handler)

            for rule in self.rules:

                if rule.condition(block):

                    last = rule.action(block, self.handler)

                    if last:break

        self.handler.end('document')
class BasicTextParser(Parser):

    def __init__(self,handler):

        Parser.__init__(self,handler)

        self.addRule(ListRule())

        self.addRule(ListItemRule())

        self.addRule(TitleRule())

        self.addRule(HeadingRule())

        self.addRule(ParagraphRule())
        self.addFilter(r'\*(.+?)\*', 'emphasis')

        self.addFilter(r'(http://[\.a-z0-9A-Z/]+)', 'url')

        self.addFilter(r'([\.a-zA-Z]+@[\.a-zA-Z]+[a-zA-Z]+)','mail')
handler = HTMLRenderer()

parser = BasicTextParser(handler)
parser.parse(sys.stdin)

这个模块里面的处理思路是,遍历客户端(也就是程序执行的入口)给插进去的所有的规则和过滤器,来处理读进来的文本。

有一个细节的地方也要说一下,其实是和前面写的呼应一下,就是在遍历规则的时候通过调用condition这个东西来判断是否符合当前规则。

我觉得这个程序很像是命令行模式,有空可以复习一下该模式,以保持记忆网节点的牢固性。

最后说一下我以为的这个程序的用途:

1、用来做代码高亮分析,如果改写成js版的话,可以做一个在线代码编辑器。
2、可以用来学习,供我写博文用。

还有其他的思路,可以留下您的真知灼见。
补充一个类图,很简陋,但是应该能说明之间的关系。另外我还是建议如果看代码捋不清关系最好自己画图,自己画图才能熟悉整个结构。

python的即时标记项目练习笔记

Python 相关文章推荐
Python循环语句中else的用法总结
Sep 11 Python
Python基于递归算法实现的走迷宫问题
Aug 04 Python
对Django 中request.get和request.post的区别详解
Aug 12 Python
安装PyInstaller失败问题解决
Dec 14 Python
python 项目目录结构设置
Feb 14 Python
python Django 反向访问器的外键冲突解决
May 20 Python
基于python实现查询ip地址来源
Jun 02 Python
Python Django路径配置实现过程解析
Nov 05 Python
如何创建一个Flask项目并进行简单配置
Nov 18 Python
python热力图实现简单方法
Jan 29 Python
基于Python 函数和方法的区别说明
Mar 24 Python
tensorflow学习笔记之tfrecord文件的生成与读取
Mar 31 Python
python脚本实现分析dns日志并对受访域名排行
Sep 18 #Python
python中的字典详细介绍
Sep 18 #Python
python中执行shell命令的几个方法小结
Sep 18 #Python
python处理PHP数组文本文件实例
Sep 18 #Python
Python threading多线程编程实例
Sep 18 #Python
Python中捕捉详细异常信息的代码示例
Sep 18 #Python
python字符串连接的N种方式总结
Sep 17 #Python
You might like
IP138 IP地址查询小偷实现代码
2010/02/15 PHP
php的常量和变量实例详解
2017/06/27 PHP
图片按比例缩放函数
2006/06/26 Javascript
Zero Clipboard js+swf实现的复制功能使用方法
2010/03/07 Javascript
jQuery 核心函数以及jQuery对象
2010/03/23 Javascript
16个最流行的JavaScript框架[推荐]
2011/05/29 Javascript
很好用的js日历算法详细代码
2013/03/07 Javascript
Express.JS使用详解
2014/07/17 Javascript
浅谈JavaScript事件的属性列表
2015/03/01 Javascript
JavaScript数据结构与算法之栈详解
2015/03/12 Javascript
jQuery使用CSS()方法给指定元素同时设置多个样式
2015/03/26 Javascript
Angular.js与Bootstrap相结合实现表格分页代码
2016/04/12 Javascript
老生常谈JavaScript中的this关键字
2016/10/01 Javascript
微信小程序 本地存储及登录页面处理实例详解
2017/01/11 Javascript
jquery仿ps颜色拾取功能
2017/03/08 Javascript
vue2.0 自定义日期时间过滤器
2017/06/07 Javascript
seajs模块压缩问题与解决方法实例分析
2017/10/10 Javascript
React BootStrap用户体验框架快速上手
2018/03/06 Javascript
Vue动态组件与异步组件实例详解
2019/02/23 Javascript
Vue 动态添加路由及生成菜单的方法示例
2019/06/20 Javascript
layui递归实现动态左侧菜单
2019/07/26 Javascript
[43:26]完美世界DOTA2联赛PWL S2 Forest vs Rebirth 第二场 11.20
2020/11/23 DOTA
详解Django框架中的视图级缓存
2015/07/23 Python
python 下 CMake 安装配置 OPENCV 4.1.1的方法
2019/09/30 Python
英国派对礼服和连衣裙购物网站:TFNC London
2018/07/07 全球购物
老公爱的承诺书
2014/03/31 职场文书
商业项目策划方案
2014/06/05 职场文书
计算机多媒体专业自荐信
2014/07/04 职场文书
个人欠款协议书范本2014
2014/11/02 职场文书
春节慰问信范文
2015/02/15 职场文书
2015年艾滋病宣传活动总结
2015/03/27 职场文书
css 中多种边框的实现小窍门
2021/04/07 HTML / CSS
Python如何把不同类型数据的json序列化
2021/04/30 Python
Python源码解析之List
2021/05/21 Python
python基础之函数的定义和调用
2021/10/24 Python
Python之Matplotlib绘制热力图和面积图
2022/04/13 Python