08 2017 档案
摘要:转自 http://www.cnblogs.com/dolphin0520/p/3933551.html 在前面一篇文章中提到,对Vector、ArrayList在迭代的时候如果同时对其进行修改就会抛出java.util.ConcurrentModificationException异常。下面我们就
阅读全文
摘要:动态规划 + viterbi最短路径 + 1阶马尔可夫链 最短路径分词是将可能性最大的句子切分出来。首先对句子进行全切分,找出所有可能的字词,利用动态规划生成词图,并利用1阶马尔可夫链计算出所有的路径权值,找出图中最短的路径,属于机械式规则+统计的分词方法。 在句子头尾分别加上B 和 E,找出B和E
阅读全文
摘要:分三步1、先分词2、做BEMS标注,同时做词性标注3、训练模型 1、对语料进行分词 拿到测试部的语料或者其他渠道的语料,先对语料进行分词,我刚刚开始是用NS分词的,等CRF模型训练好后,可以直接用CRF进行分词,分完词后要人工核对分词结果,将分词分得不正确的地方修改好 2、标注词性,标注BEMS B
阅读全文
摘要:1、正向最大匹配算法:MaximumMatching 正:北京大学生前来应聘反:研究生命的起源1)从左向右取待切分汉语句的m个字符作为匹配字段,m为大机器词典中最长词条个数。2)查找大机器词典并进行匹配。若匹配成功,则将这个匹配字段作为一个词切分出来。若匹配不成功,则将这个匹配字段的最后一个字去掉,
阅读全文
摘要:统计语言模型是用来计算一个句子产生概率的概率模型。句子S由w1 , w2 , … , Wn组成,我们将S这个序列出现的概率表示为P(S),既然S=w1 , w2 , … , Wn,那么就有P(S)=P(w1 , w2 , … , Wn). 利用条件概率有 P(S)=P(W1 , W2 , … , W
阅读全文
摘要:历史 人工神经网络诞生于20世纪50年代,那时她叫感知机。 1969年,Marvin Minsky出版的《Perceptrons》将她打入了冷宫。 1974年,暗恋她的Paul Werbos在博士毕业论文中深刻分析了将BP算法运用于神经网络方面的可能性 1986年,BP算法开始流行开来 1989年,
阅读全文
摘要:2016年1月27日,国际顶尖期刊《自然》封面文章报道,谷歌研究者开发的名为“阿尔法围棋”(AlphaGo)的人工智能机器人,在没有任何让子的情况下,以5:0完胜欧洲围棋冠军、职业二段选手樊麾。在围棋人工智能领域,实现了一次史无前例的突破。计算机程序能在不让子的情况下,在完整的围棋竞技中击败专业选手
阅读全文
摘要:用到的技术 条件概率、动态规划、贝叶斯、最短路径(viterbi)、EM、MM、HMM、CRF、RNN大数定理 术语 语言模型 词向量 一阶HMM 二元模型 Term 词语 Chunk 词块 参考 《数学之美》,吴军 著 《统计自然语言处理》,宗成庆 著 《统计学习方法》,李航 著 NLP系统 ht
阅读全文
摘要:自然语言处理在20世纪50年代就开始有人研究,然后真正有着较大的进步是在20世纪70年代引入统计之后了。很多人都听说过图灵测试(去年有部电影《模仿游戏》是说图灵的),计算机最高奖项就是图灵奖,简单地说,你和机器进行对话时,无法判断这个是机器还是人类,就说明这个机器的智能的了。 如果你想让计算机来分词
阅读全文
摘要:NLP是什么?有哪些应用 NLP即自然语言处理。主要应用在语音识别、分词、词性标注、关键词提取、概要、句法分析、语义理解与提取、机器翻译、印刷体或手写体识别、拼写错误、汉字输入、文献查询 为什么要分词——词是语义的基本单位 罗马拼音系语言的字词之间天生具有空格,所以分词大多用于象形文件上面,随着欧洲
阅读全文

浙公网安备 33010602011771号