LDA Plsa word2vec 的区别
LDA vs Word2Vec:
LDA 假设是 bags of words,词之间是没有顺序的,而Word2Vec具有方向性。
LDA 用户是词的文章之间所有词共现关系,Word2Vec是词与上下文共现的关系。
LDA 偏向于high-level(topic)的语义,Word2Vec偏向于low-level(semantic/syntactic)的,比如”I love you. You love me.“,那LDA的结果是关于情感的话题,word2vec得到的结果会说明两句话表达的语义不同。Word2Vec的一些应用LDA做不了,比如词的相似度,词的类比关系。
Word2vec并没有考虑语法层面的信息,一篇文章被看成一个word sequences,只考虑了词语之间的位置/边界关系。在Word2vec考虑语法信息后,输入HTC:
普通的word2vec:Android,cellphone,Taiwan,Google...
考虑语法后:Moto,Apple,Nokia,Xiaomi...
LDA vs Plsa:
两者最主要的一个区别是,LDA在plsa的基础上,doc-topic这一层加了一个先验信息。Plsa把doc-topic当作一个变量,有多少doc,就有多少|doc|*k个参数,k是topic的个数,而LDA只有一个超参数。
LDA在大数据量的情况下和Plsa的结果差不多,并且Plsa更容易并行化一些,并行的角度主要有数据并行(切分文章)和模型并行(切分词)。
LDA引入label的两个变形是Label-LDA和S-LDA,前者只是从文档label对应的topic中,采样文档中word对应的topic,而后者是找到最好的能预测lable变量的latent topics,往往是(rating,classification label)
概率主题模型是观测随机变量和隐藏随机变量的联合概率分布,通过联合概率分布求得隐藏变量的后验分布,比较难求,有两种方法,gibbs sampling和变分法。
可以通过扩展lda以下的假设来发现文本中更复杂的结构:
1. 文档中词的顺序是无关的
2. 语料库中文档的顺序是无关的
3. 主题的个数是固定的
浙公网安备 33010602011771号