随笔分类 -  机器学习理论

凸优化,信息论,矩阵论,统计学
摘要: 阅读全文
posted @ 2018-07-13 15:56 佟学强 阅读(817) 评论(0) 推荐(0)
摘要:矩阵论是对线性代数的延伸,很有必要深入研究。研究矩阵论可以加深对PCA,SVD,矩阵分解的理解,尤其是第一章入门的线性空间的理解,在知识图谱向量化,self_attention等论文中会涉及大量的矩阵论的知识。本文对此做一个总结,分为以下结构: 第一部分:矩阵的线性空间,矩阵的意义; 第二部分:矩阵 阅读全文
posted @ 2018-06-07 23:18 佟学强 阅读(13219) 评论(0) 推荐(1)
摘要:这篇文章,专门讲语义相似度问题。 先看场景: scene(一):用户通过大众点评,线上约了餐馆,就餐后在上面发表了很多评论,评论中涉及了大量的餐馆的问题,比如菜品质量,酒店卫生,服务等等。现在需要抽取之中的要点,然后反馈给商家。 scene(二):KB_QA的两个问题:①获取question的语义表 阅读全文
posted @ 2018-05-01 12:10 佟学强 阅读(3769) 评论(0) 推荐(0)
摘要:随着中国改革开放程度的加深,互联网行业也逐渐出现变革,典型的变化就是由原来的低端重复性造轮子,逐步转向高端,以技术创新为主导。一个有力的证明就是近年来以技术驱动的创业公司越来越多,这在10年前是不可想象的。在人才要求上,对工作经验不再那么看重,而更加重视求职者的学历,专业,背景。 在这样的背景下,一 阅读全文
posted @ 2018-04-17 12:55 佟学强 阅读(1256) 评论(0) 推荐(0)
摘要:前面的博客进行了总述,这篇博客细化深入,主要结合知识图谱,KB_QA,语义表示的丰富性方面来论述,但是仍然会很宽泛,因为讲具体的技术细节,会有很多人蒙圈的,没有太大意义。 前面提到,语义理解,一方面要获取丰富,灵活的语义表示,另一方面要与知识图谱融合。要想获取精准的语义理解,比如谁是第一个为纸牌屋里 阅读全文
posted @ 2018-02-12 20:53 佟学强 阅读(2296) 评论(0) 推荐(0)
摘要:2017年就这么悄无声息地过去了。在工业界,2016年是推荐的元年,2017年是中国的AI元年,这意味着路漫漫其修远兮~,而学术界永远会超前于工业界,有些时候难免也会有些一厢情愿……这些线索表明:①AI的发展非常迅速②学术界和工业界不同步的现象是共存的。过去的一年在nlp领域里,知识图谱的发展是最为 阅读全文
posted @ 2018-02-02 12:55 佟学强 阅读(5554) 评论(4) 推荐(2)
摘要:author:XueQiang Tong mail:niurenai@outlook.com v:txq130 先引入一个例子: bush这个词有灌木丛和总统两个意思。给你一句话,如果其中含有bush这个词,如何判断他的语义? 这是一个经典又古老的nlp话题。解决他的方案,有很多。其中有一个方案是这 阅读全文
posted @ 2017-12-04 15:48 佟学强 阅读(688) 评论(0) 推荐(0)
摘要:Page 1Published as a conference paper at ICLR 2017AS IMPLE BUT T OUGH - TO -B EAT B ASELINE FOR S EN -TENCE E MBEDDINGSSanjeev Arora, Yingyu Liang, Te 阅读全文
posted @ 2017-11-11 15:37 佟学强 阅读(3016) 评论(0) 推荐(0)
摘要:nlp领域里,语义理解仍然是难题! 给你一篇文章或者一个句子,人们在理解这些句子时,头脑中会进行上下文的搜索和知识联想。通常情况下,人在理解语义时头脑中会搜寻与之相关的知识。知识图谱的创始人人为,构成这个世界的是实体,而不是字符串,这从根本上改变了过去搜索的体系。语义理解其实是基于知识,概念和这些概 阅读全文
posted @ 2017-09-20 16:27 佟学强 阅读(6875) 评论(0) 推荐(1)
摘要:import collections import math import os import random import zipfile import numpy as np import urllib.request as request import tensorflow as tf url = 'http://mattmahoney.net/dc/' def maybe_downlo... 阅读全文
posted @ 2017-09-13 17:40 佟学强 阅读(1427) 评论(0) 推荐(0)
摘要:知识图谱与语义相似度的关系 阅读全文
posted @ 2017-08-24 23:11 佟学强 阅读(8807) 评论(0) 推荐(1)
摘要:导语 提升一个模型的表现有时很困难。如果你们曾经纠结于相似的问题,那我相信你们中很多人会同意我的看法。你会尝试所有曾学习过的策略和算法,但模型正确率并没有改善。你会觉得无助和困顿,这是 90% 的数据科学家开始放弃的时候。 不过,这才是考验真本领的时候!这也是普通的数据科学家跟大师级数据科学家的差距 阅读全文
posted @ 2017-07-21 10:34 佟学强 阅读(790) 评论(0) 推荐(0)
摘要:tensorflow中自带的mnist手写数字识别,运用最简单的单层神经网络,softmax激活函数,极客学院上说准确率有91%,我今天调整到了92%!import tensorflow as tfimport numpy as npimport mathimport tensorflow.exam 阅读全文
posted @ 2017-07-13 23:39 佟学强
摘要:中文分词有很多方法,比如N-最短路径法,N元语言模型,CRF模型等等。大致可以分为两类:一是机械化的分词,二是用机器学习方法分词。最短路径算法可以划分到第一种。这个算法效果并不是最好的,大体和IK分词打成平手。今天用最简洁语言描述一下:这个算法主要分两步:第一,构造DAG(有向无环图),第二找出最优 阅读全文
posted @ 2017-05-13 19:44 佟学强 阅读(1195) 评论(0) 推荐(0)
摘要:机器学习十大算法之一:EM算法。能评得上十大之一,让人听起来觉得挺NB的。什么是NB啊,我们一般说某个人很NB,是因为他能解决一些别人解决不了的问题。神为什么是神,因为神能做很多人做不了的事。那么EM算法能解决什么问题呢?或者说EM算法是因为什么而来到这个世界上,还吸引了那么多世人的目光。 我希望自 阅读全文
posted @ 2017-04-25 17:50 佟学强 阅读(630) 评论(1) 推荐(0)
摘要:看了宗成庆博士的《统计自然语言处理(中文信息处理)》的第六章,对维特比算法有着非常精辟的讲解。把其中的讲解上传上来,个人感觉比较正统。 今天用Java实现了这个算法,也可以转换为C代码: 测试文件: 输出结果为1,0,0,就是sunny,rainy,rainy。对比了一下,结果没问题,逻辑也没问题。 阅读全文
posted @ 2017-04-25 13:10 佟学强 阅读(906) 评论(0) 推荐(0)
摘要:苏伟峰 李绍滋 厦门大学计算机科学系 厦门 361005 摘 要 本文提出一个电子文档的自动分类的模型:基于《知网》之上,经过对文档的关键词的抽取和排岐, 进而得到关键词的概念,再对关键词的概念进行综合而得到该文本的所属的类别,实验证明该模型有较好的效果。 关键词 文本分类 概念 《知网》 全信息 阅读全文
posted @ 2017-04-21 11:04 佟学强 阅读(1467) 评论(0) 推荐(0)
摘要:基于《知网》的词汇语义相似度计算[1] 刘群†‡李素建† {liuqun,lisujian}@ict.ac.cn † 中国科学院计算技术研究所 ‡ 北京大学计算语言学研究所 摘要: 《知网》是一部比较详尽的语义知识词典。在基于实例的机器翻译中,词语相似度计算是一个重要的环节。不过,由于《知网》中对于 阅读全文
posted @ 2017-04-21 10:57 佟学强 阅读(1929) 评论(0) 推荐(0)
摘要:一日下课,遇见几名学生问我:虫老师,控制系统的稳定性、鲁棒性、与非脆弱性本质上是否一回事呢?好像都是对不确定性的抵御能力,划分的这样细,实在有些费解。虫老师,你能用我们一听就明白的话给我们说一说么? 这个问题是控制系统的三个最为重要的基本概念。其中,稳定性一百多年前就有了十分完善的数学理论了,鲁棒性 阅读全文
posted @ 2017-04-17 21:39 佟学强 阅读(834) 评论(0) 推荐(0)
摘要:今天开始学习tensorflow框架,从极客学院下载了官方中文教程(15年翻译的),第一天开始学习第一章ng基本流程和原理,作为前奏。然后写了代码,验证一下,准确率确实非常高,非常好用。把代码上传,作为以后备用。 1 import tensorflow as tf 2 import numpy as 阅读全文
posted @ 2017-04-14 11:51 佟学强 阅读(473) 评论(4) 推荐(0)