《机器翻译 统计建模与深度学习方法》 __肖桐 学习第一天 【机器翻译基础】
1、机器翻译系统包括两部分:资源和系统,资源如翻译规则、知识库,系统是机器翻译算法的程序实现。
2、语料:双(单)语数据,目前已有大量高质量的双语和单语数据被整理并电子化存储。
3、机器翻译面临的挑战:(1)自然语言翻译问题的复杂性极高;
(2)计算机的“理解”与人类的“理解”存在鸿沟;
(3)单一的方法无法解决多样的翻译问题;
4、机器翻译框架
(1)基于规则的机器翻译:主要思想是以词典和人工书写的规则库作为翻译知识,用一系列规则的组合完成翻译;
优点:符合人类翻译的思维过程;
缺点:书写规则消耗大量人力,规则库的维护代价高;规则难以涵盖所有语言现象;自然语言存在的歧义现象导致规则冲突;
(2)基于实例的机器翻译:基本思想是在双语库中找到与待翻译句子相似的实例;
优点:当遇到新句子时,会用以前的实例和模板做对比,举一反三;
缺点:翻译实例的精确程度对翻译结果有着巨大的影响;实例维护较为困难;实例覆盖程度有限;
(3)统计机器翻译:使用单语语料学习语言模型,使用双语平行语料学习翻译模型,并使用这些统计模型完成对翻译过程的建模;
优点:较为灵活,能够处理更加多样的句子;
缺点:需要人工定义翻译特征;人工特征设计的好坏直接影响系统;系统研发复杂;训练数据增多的情况下,对系统存储资源要求较高;
(4)神经机器翻译:序列到序列的转化过程由编码器-解码器框架实现;
优点:不需要特征工程;词和句子的分布式连续空间为建模提供更为丰富的信息;存储需求较小,适合小设备上的应用;
缺点:虽然脱离了特征工程,但神经网络的结构需要人工设计,包括结构、系统调优、超参数设置等;缺乏可解释性;对数据的依赖较大;
5、不同机器翻译方法的对比分析:
• 规则系统需要人工书写规则并维护,人工代价较高。统计和神经网络方法仅需要设计特征或者神经网络结构,对人工依赖较少(语言相关的)。
• 基于实例、统计和神经网络的方法都需要依赖语料库(数据),其中统计和神经网络方法具有一定的抗噪能力,因此也更适合大规模数据情况下的机器翻译系统研发。
• 基于规则和基于实例的方法在受限场景下有较好的精度,但是在开放领域的翻译上统计和神经网络方法更具优势。

6、可对不同方法进行融合,如:无指导机器翻译中还是会同时使用统计机器翻译和神经机器翻译方法。

浙公网安备 33010602011771号