计算与软件工程第四次作业

这个作业要求在哪里	https://edu.cnblogs.com/campus/jssf/infor_computation17-31/homework/10534
我在这个课程的目标是	代码规范复审和两人合作结对编程
此作业在哪个具体方面帮我实现目标	实现类，测试运行
其他参考文献	https://www.csdn.net/gather_26/MtjacgysNDk2LWJsb2cO0O0O.html
作业正文	码云：https://gitee.com/yuanaj/yaj1355

作业一
代码复审：

1.注释（包括所有源代码）应只用ASCII字符，不要用中文或其他特殊字符，它们会极大地影响程序的可移植性。
代码复审可以帮助团队成员更好的互相了解，能够更早的发现代码中所存在的一些问题，严格贯彻了做中学”（Learning by Doing）思想

作业二
两人自由组队进行结对编程
参考结对编程的方法、过程（https://www.cnblogs.com/xinz/archive/2011/08/07/2130332.html）开展两人合作完成本项目
针对小说《红楼梦》要求能分析得出各个人物在每一个章回中各自出现的次数，将这些统计结果能写入到一个csv格式的文件。实现一个简单而完整的软件工具（中文文本文件人物统计程序）：
进行单元测试、回归测试、效能测试，在实现上述程序的过程中使用相关的工具。
进行个人软件过程（PSP）的实践，逐步记录自己在每个软件工程环节花费的时间。
使用源代码管理系统 (GitHub, Gitee， Coding.net, 等)；
针对上述形成的软件程序，对于新的文本小说《水浒传》分析各个章节人物出现次数，来考察代码。
将上述程序开发结对编程过程记录到新的博客中，尤其是需要通过各种形式展现结对编程过程，并将程序获得的《红楼梦》与《水浒传》各个章节人物出现次数与全本人物出现总次数，通过柱状图、饼图、表格等形式展现。
《红楼梦》与《水浒传》的文本小说将会发到群里。
注意，要求能够分章节自动获得人物出现次数
结对人链接：https://www.cnblogs.com/wangyan1067/p/12637374.html
通过网上查阅资料了解到进行词频统计需安装jieba第三方库：
jieba库是优秀的中文分词库，它能够将句子分成词语。

import jieba
import re 

f=open('红楼梦.txt',encoding='utf-8')
txt=f.read()
f.close()

txt1=re.sub('奶奶','贾母',txt)     #替换词组
txt2=re.sub('老太太','贾母',txt1)
txt3=re.sub('林黛玉','黛玉',txt2)
txt4=re.sub('凤姐儿','凤姐',txt3)

segs=jieba.lcut(txt4)

segments={}
for seg in segs:
    if len(seg)==1:
        continue
    else:
        segments[seg]=segments.get(seg,0)+1

       

#print(segments)
       

stopwords={'什么','一个','我们','那里','你们','如今','说道','起来','这里','知道','他们','众人','姑娘','一面','自己','只见','太太','不是','没有','两个','怎么','出来','不知','这个','听见','这样','进来','咱们','告诉','就是','东西','回来','只是','大家','老爷','只得','丫头','这些','不敢','出去','所以'}

for word in stopwords:
    del(segments[word])          #删除停用词
     
#print(segments)

alies1={'黛玉','林姑娘','林妹妹'}
for e in alies1:
    for seg in segments:
        if e==seg:
            segments[seg]=segments[seg]+segments.get(e)

alies2={'袭人','花袭人'}
for e in alies2:
    for seg in segments:
        if e==seg:
            segments[seg]=segments[seg]+segments.get(e)            
          
alies3={'凤姐','王熙凤','辣妹子 ','熙凤'}
for e in alies3:
    for seg in segments:
        if e==seg:
            segments[seg]=segments[seg]+segments.get(e)
           
items=list(segments.items())
items.sort(key=lambda x:x[1],reverse=True)
for i in range(10):
    word,segment=items[i]
print('{0:<10}{1:>5}'.format(word,segment))

运行结果示意：

柱状图、饼图、表格等形式展现

码云链接：https://gitee.com/yuanaj/yaj1355/issues/I1DN52

posted on 2020-04-05 14:20 Yajdt 阅读(224) 评论(0) 收藏举报

刷新页面返回顶部

袁安杰

导航

公告

计算与软件工程第四次作业