如何看待前 OpenAI 研究员发布的新模型「Jev」 ?这不就是SimCSE的翻版吗?
你要找的是不是 SimCSE:
SimCSE(Simple Contrastive Learning of Sentence Embeddings)是一种用于学习句子向量表示的对比学习方法,核心思想是让语义相似的句子在向量空间中靠近、不相似的句子远离。它在无监督和有监督两种场景下都能使用,常用于语义匹配、检索和相似度计算等任务。
只是有一点区别,SimCSE让语义相似的句子在向量空间中靠近,不相似的句子原理。而Jev是让问题与正确回答在向量空间中靠近,不正确的回答远离。
原理上简单来说就是,问题经过 Transformer 得到一个向量,回答也得到一个向量,两个向量算余弦相似度,然后训练的时候一个问题和多个回答的余弦相似度算softmax交叉熵当损失函数。
由于Tranformer的功能是输出嵌入向量,所以纯编码器和纯解码器模型都可以。解码器取最后一层隐藏状态的最后一个向量就可以了。
几年前我就这么玩过了,把 Qwen1.5的自回归头去掉,换上SimCSE的对比学习头微调,然后输出特定几个回答的概率。微调之后完全能回答特定领域内的问题。
https://github.com/DracoUnion/Qwen1.5-0.5B-CL
这里有点启发,就是回答的嵌入向量相当于分类器的参数,Tranformer相当于生成了分类器的参数,如果其他神经网络的参数也可以这么生成,比如 Transformer 自身的其它层,那么预训练和SFT环节可以省很多工作量,甚至想要个更小的大模型,直接从更大的大模型采样就可以了。

浙公网安备 33010602011771号