喵了个喵～

2020-04-02 11:33 已编辑中国农业银行_软件研发中心_软件开发工程师

关注

使用HTMLParser解析SGML文件

一.简介

在做FASPell复现时候需要多搜集一些训练语料。我把目光转向了SIGHAN举行的CSC比赛当中，其中SIGHAN14和SIGHAN15提供了共5000条训练语句，而且他们的格式一样，使用了相同的SGML语言来标记。

二.提醒

网络上较多的是使用sgmllib包中的SGMLParser来进行SGML文件的解析，但由于sgmillib只在Python2中可用，且sgmllib包的下载也成问题，因此最后选择使用HTMLParser。

三.HTMLParser使用

HtmlParser是一个类，在使用时一般继承它然后重载它的方法，来达到解析所需数据的目的。

1.常用属性

　lasttag，保存上一个解析的标签名，是字符串。

2.常用方法：

handle_starttag(tag, attrs) ，处理开始标签，比如<div>这里的attrs获取到的是属性列表，属性以元组的方式展示handle_endtag(tag) ，处理结束标签,比如</div>。
　handle_startendtag(tag, attrs) ，处理自己结束的标签，如<img />。
　handle_data(data) ，处理数据，标签之间的文本。
　handle_comment(data) ，处理注释，之间的文本。

3.基本使用

　HTMLParse官方代码示例

from html.parser import HTMLParser

class MyHTMLParser(HTMLParser):
    def handle_starttag(self, tag, attrs):
        print("Encountered a start tag:", tag)

    def handle_endtag(self, tag):
        print("Encountered an end tag :", tag)

    def handle_data(self, data):
        print("Encountered some data  :", data)

parser = MyHTMLParser()
parser.feed('<html><head><title>Test</title></head>'
            '<body><h1>Parse me!</h1></body></html>')

输出为

Encountered a start tag: html
Encountered a start tag: head
Encountered a start tag: title
Encountered some data  : Test
Encountered an end tag : title
Encountered an end tag : head
Encountered a start tag: body
Encountered a start tag: h1
Encountered some data  : Parse me!
Encountered an end tag : h1
Encountered an end tag : body
Encountered an end tag : html

4.实用案例

　　以下的实用案例均在上面的代码中修改对应函数，每个实例都是单独的。
　　解析的sgml文件如下：

<ESSAY title="给卫生局的信-有机蔬菜的食品安全">
<TEXT>
<PASSAGE id="B2-1443-1">我希望以他们的安全保証书来解决这个问题。不能提出安全保証书的话，应该停止营业。</PASSAGE>
</TEXT>
<MISTAKE id="B2-1443-1" location="11">
<WRONG>保証书</WRONG>
<CORRECTION>保证书</CORRECTION>
</MISTAKE>
</ESSAY>

获取属性的函数，是个静态函数，新增的。直接定义在类中，返回属性名对应的属性

def _attr(attrlist, attrname):
 for attr in attrlist:
     if attr[0] == attrname:
         return attr[1]
 return None

获取所有WRONG标签的文本，最简单方法只修改handle_data

def handle_data(self, data):
 # 此处标签不区分大小写，统一用小写字母即可，大写字母会报错
 if self.lasttag == 'wrong':
     print("Encountered WRONG data  :", data)

获取PASSAGE编号（id）为B2-1443-1的PASSAGE标签的文本。使用了案例1，增加一个实例属性作为标志，选取需要的标签

def __init__(self):
 HTMLParser.__init__(self)
 self.flag = False
def handle_starttag(self, tag, attrs):
 if tag == 'passage' and _attr(attrs, 'id') == 'B2-1443-1':
     self.flag = True   
def handle_data(self, data):
 if self.flag == True:
     print("Encountered PASSAGE OF B2-1443-1 data  :", data)

获取MISTAKE标签的属性列表

def handle_starttag(self, tag, attrs):
 if tag == 'mistake':
     print("Encountered MISTAKE attrs  :", attrs)

获取PASSAGE标签的id属性

def handle_starttag(self, tag, attrs):
 if tag == 'passage' and _attr(attrs, 'id'):
     print("Encountered p class  :", _attr(attrs, 'id'))

获取TEXT标签下的PASSAGE标签的文本

def __init__(self):
 HTMLParser.__init__(self)
 self.in_text = False
def handle_starttag(self, tag, attrs):
 if tag == 'text':
     self.in_text = True
def handle_data(self, data):
 if self.in_text == True and self.lasttag == 'passage':
     print("Encountered PASSAGE data  :", data)

四. 完整代码

这是用来处理SIGHAN15中SGML数据的完整代码，主要是解析SGML文件将他们转化成FASPell中使用的训练数据格式。

待处理sgml文件格式

"""
<ESSAY title="给卫生局的信-有机蔬菜的食品安全">
<TEXT>
<PASSAGE id="B2-1443-1">我希望以他们的安全保証书来解决这个问题。不能提出安全保证书的话，应该停止营业。</PASSAGE>
</TEXT>
<MISTAKE id="B2-1443-1" location="11">
<WRONG>保証书</WRONG>
<CORRECTION>保证书</CORRECTION>
</MISTAKE>
</ESSAY>
"""

目标格式

num    wrong_string    correct_string
1    我希望以他们的安全保証书来解决这个问题。不能提出安全保证书的话，应该停止营业。    我希望以他们的安全保证书来解决这个问题。不能提出安全保证书的话，应该停止营业。

代码块

from html.parser import HTMLParser
import re

def attr(attrlist, attrname):
    for attr in attrlist:
        if attr[0] == attrname:
            return attr[1]
    return None

class MyHTMLParser(HTMLParser):

    def __init__(self):
        HTMLParser.__init__(self)
        self.in_text = False
        self.in_mistake = False
        self.passage = {}
        self.wrong = {}
        self.correction = {}
        self.listid = []
        self.id = ""

    def handle_starttag(self, tag, attrs):
        if tag == 'text':
            self.in_text = True
        if tag == 'passage' and attr(attrs, 'id'):
            self.id = attr(attrs, 'id')
            if self.passage.get(self.id) == None:
                 self.passage[self.id] = []
        if tag == 'mistake':
            self.in_mistake = True
        if tag == 'mistake' and attr(attrs, 'id'):
            self.id = attr(attrs, 'id')
            if self.wrong.get(self.id) == None:
                self.wrong[self.id] = []
            if self.correction.get(self.id) == None:
                self.correction[self.id] = []  

    def handle_data(self, data):
        if self.in_text == True and self.lasttag == 'passage':
            if len(str(data)) >= 2:
                self.passage[self.id].append(data)
        if self.in_mistake == True and self.lasttag == 'wrong':
            if len(str(data)) >= 2 and str(data) not in self.wrong[self.id]:
                self.wrong[self.id].append(data)
        if self.in_mistake == True and self.lasttag == 'correction':
            if len(str(data)) >= 2 and str(data) not in self.correction[self.id]:
                self.correction[self.id].append(data)
            print(self.correction)

    def handle_endtag(self, tag):
        if tag == 'text':
            self.in_text = False
            self.id = ""

        if tag == 'mistake':
            self.in_mistake = False
            self.id = ""

def write_to_file(correction,wrong,passage):
    with open('median_file.txt','a',encoding='utf-8') as file:
        for k,v in passage.items():
            origin_string = str(v[0])
            wrong_list = []
            correct_list = []
            if k in wrong and k in correction:
                wrong_list.extend(wrong[k])
                correct_list.extend(correction[k])
            count = len(wrong_list)
            if count == 0:
                continue
            if count == len(correct_list):
                tmp_string = origin_string
                for i in range(count):
                    corr_string = re.sub(wrong_list[i],correct_list[i],tmp_string)
                    tmp_string = corr_string
                num = 0
                if len(corr_string) != len(origin_string):
                    continue
                for i in range(len(corr_string)):
                    if corr_string[i] != origin_string[i]:
                        num += 1
                file.write('{}\t{}\t{}\n'.format(num,origin_string,corr_string))

if __name__ == "__main__":
    files = open('sighan15.sgml','r', encoding='utf-8')
    myhtmlparser = MyHTMLParser()
    myhtmlparser.feed(files.read())
    write_to_file(myhtmlparser.correction,myhtmlparser.wrong,myhtmlparser.passage)

五. 参考

全部评论

推荐最新楼层

12-24 16:05

百度_感知算法工程师(准入职员工)

图拉斯内推，图拉斯内推码

面经：蓝禾的流程推得很快，基本上投完两天就接到了hr的初试电话，直接进行了初试。初试全程大概三十分钟，hr小哥态度很和善。主要问了实践经历获奖的情况最有成就感的事情对电商运营的理解选择公司的标准等，都是比较常规的问题。图拉斯2026届校招启动，今年HC翻倍，抓紧投递~【我们是】图拉斯（原蓝禾） 是一家集产品、设计、研发、品牌、营销和大数据运营于一体的创新型科技公司，总部位于中国深圳，全球员工规模超3000人。【base】深圳【岗位】运营(国内)、运营(国外)、营销、设计、研发技术、职能内推链接：https://lanhevip.jobs.feishu.cn/s/gAwh1MlZJsw内推码：H...

点赞评论收藏

分享

12-23 21:41

广州希音国际进出口有限公司_供应链管理(准入职员工)

shein内推，shein内推码

整体的感受还是拆分四个板块吧 1.个人成长-目前业务也在快速扩张期，有很多空白板块可以继续进行搭建，所以在背靠跨境的业务的同时也是可以积累非常可视化的经验，数据分析，项目管理，团队管理，绩效达成落地方案，都是必须需要掌握的技能 2.工作氛围-没有PUA也没有精神内耗，团队偏年轻化领导接近一线业务，没有精神鸿沟的同时具有亲和力的，下班时间和同事相处十分融洽，所以从整体感受来讲会比较轻松 3.福利待遇-位置在四海城附近整体周围的基础设施还是比较齐全，附近大型商场，免费下午茶 4.思维转变-从怕犯错再到勇于去尝试，只要在shein能够有想法且方案足够落地，即使会有踩坑，环境上大家还是比较包容，且结果...

SHEIN希音公司福利 278人发布

点赞评论收藏

分享

12-19 18:05

字节跳动_TT图文_研发(实习员工)

字节实习生涨薪啦！！！！

如图，那我将是第一批吃到红利的实习生啦，哈哈哈哈哈哈zi

牛马人的牛马人生：500一天吗？香麻了

投递字节跳动等公司6个岗位

点赞评论收藏

分享

11-28 16:45

门头沟学院 Java

求大佬点评一下简历

鼠鼠顶不住了，想找开发岗，但是投了简历都没有下文了，是不是简历太烂了，学院本要不要考虑转测试了

简历中的项目经历要怎么写

点赞评论收藏

分享

今天 09:47

门头沟学院 Java

同事查日志太慢，我现场教他一套 awk、tail、grep、sed 组合拳

昨天临下班，生产环境出现了一个偶发的报错预警。旁边的同事正~~准备排查，只见他输入命令 cat application.log ，一个 2GB 大小文本啊，日志哗哗刷啥也看不清，crtl + c 也停不下来了，最后轻轻的关闭连接，又重新打开了一个～后端开发来说，熟练掌握 Linux 的日志分析命令是基本功，整理几一些基于 tail、less、grep、sed、awk 的日志查询场景，希望能帮你快速定位问题。同名公众号：程序员小富，欢迎关注tail很多新手习惯用 cat，但对于大文件，cat 会导致屏幕刷屏，还容易把终端卡死。tail 才是实时监控的神器。真实场景 A：服务发版启动监控每次发版重...

点赞评论收藏

分享

评论

点赞

收藏

全站热榜

更多

创作者周榜

更多

正在热议

更多

# 牛客2025仙途报告 #

4600次浏览 138人参与

# 礼物开箱Plog #

1657次浏览 73人参与

# 2025年终总结 #

177588次浏览 3001人参与

# 工作两年，想和老板谈涨薪怎么说 #

38798次浏览 175人参与

# 你面试体验感最差/最好的公司 #

22388次浏览 365人参与

# 秋招落幕，你是He or Be #

15738次浏览 290人参与

# 一人说一个提前实习的好处 #

14145次浏览 228人参与

# 考公VS就业，你怎么选？ #

88114次浏览 497人参与

# 今年你最想重开的一场面试是？ #

5759次浏览 76人参与

# 离家近房租贵VS离家远但房租低，怎么选 #

13712次浏览 130人参与

# 重来一次，你会对开始求职的自己说 #

6962次浏览 177人参与

# 找工作，行业重要还是岗位重要？ #

85830次浏览 1699人参与

# 实习没事做是福还是祸？ #

18870次浏览 272人参与

# 机械制造秋招总结 #

97363次浏览 878人参与

# 职场新人体验 #

156934次浏览 1121人参与

# 工作中听到最受打击的一句话 #

8401次浏览 131人参与

# 团建是“福利”还是是 “渡劫” #

8124次浏览 160人参与

# 反问环节如何提问 #

126460次浏览 2670人参与

# 移动求职进展汇总 #

17920次浏览 143人参与

# 比亚迪线下宣讲会 #

17190次浏览 50人参与

牛客网
牛客网在线编程
牛客网题解
牛客企业服务