如何看待前 OpenAI 研究员发布的新模型「Jev」 ?这不就是SimCSE的翻版吗?

你要找的是不是 SimCSE:

SimCSE(Simple Contrastive Learning of Sentence Embeddings)是一种用于学习句子向量表示的对比学习方法,核心思想是让语义相似的句子在向量空间中靠近、不相似的句子远离。它在无监督和有监督两种场景下都能使用,常用于语义匹配、检索和相似度计算等任务。‌‌‌

只是有一点区别,SimCSE让语义相似的句子在向量空间中靠近,不相似的句子原理。而Jev是让问题与正确回答在向量空间中靠近,不正确的回答远离。

原理上简单来说就是,问题经过 Transformer 得到一个向量,回答也得到一个向量,两个向量算余弦相似度,然后训练的时候一个问题和多个回答的余弦相似度算softmax交叉熵当损失函数。

由于Tranformer的功能是输出嵌入向量,所以纯编码器和纯解码器模型都可以。解码器取最后一层隐藏状态的最后一个向量就可以了。

几年前我就这么玩过了,把 Qwen1.5的自回归头去掉,换上SimCSE的对比学习头微调,然后输出特定几个回答的概率。微调之后完全能回答特定领域内的问题。

https://github.com/DracoUnion/Qwen1.5-0.5B-CL

这里有点启发,就是回答的嵌入向量相当于分类器的参数,Tranformer相当于生成了分类器的参数,如果其他神经网络的参数也可以这么生成,比如 Transformer 自身的其它层,那么预训练和SFT环节可以省很多工作量,甚至想要个更小的大模型,直接从更大的大模型采样就可以了。

posted @ 2026-09-21 19:15  绝不原创的飞龙  阅读(0)  评论(0)    收藏  举报