从 BLEU 到 ROUGE,恰好是从机器翻译的视角切换到文本摘要的视角。ROUGE 和 BLEU 就像一对镜面指标:一个侧重精确,一个侧重召回。


一、ROUGE 是什么?

ROUGE 全称 Recall-Oriented Understudy for Gisting Evaluation,意思是“面向召回率的要点评估替补”。它是一套用于自动评估文本摘要质量的指标。

核心思想与 BLEU 很像——都是基于 n-gram 重叠来打分,但 BLEU 的核心是精确率(生成的内容有多少是参考里有的),而 ROUGE 的核心是召回率(参考里的关键内容有多少被生成出来了)。这个差异源于:摘要任务看重把原文的所有要点都覆盖到。


二、ROUGE-N:n-gram 召回率

最基础的变体,计算参考摘要和候选摘要之间 n-gram 的重叠,通常报告召回率、精确率和 F1 值。

image

常用的是 ROUGE-1(单词重叠)和 ROUGE-2(双词组重叠),分别衡量用词准确性和短语流畅性。


三、ROUGE-L:最长公共子序列 (LCS)

ROUGE-L 不再机械地数 n-gram,而是寻找候选摘要和参考摘要的最长公共子序列 (LCS)。子序列不要求连续,只要词按相同顺序出现即可。

image

LCS 的优势是能自动捕获句法上的变体,不需要预先设定 n 的大小,对语序变化的容忍性更好。计算 F1 时仍然是精确率和召回率的调和平均。


四、其他变体简介

  • ROUGE-W:加权最长公共子序列,对连续的匹配(更长的连续公共子串)给予更高权重,奖励短语的连贯性。

  • ROUGE-S:跳字二元组 (skip-bigram),允许配对的两个词中间可以跳过任意距离。这能捕捉到“增长”和“经济”这样隔着词的语义搭配。通常会限制最大跳跃距离。


五、与 BLEU 的镜像关系

BLEU 和 ROUGE 对比:

 
指标BLEUROUGE
核心倾向 精确率(有简短惩罚抑制过短输出) 召回率(希望覆盖参考的所有要点)
适用任务 机器翻译(译文不能多词、不能自己编造) 文本摘要(生成精简内容,但不能丢信息)
对长度的态度 惩罚过短,防止投机;对过长也通过精确率自然惩罚 鼓励充分覆盖,但精确率项会抑制过长
计算核心 修正的 n-gram 精确率的几何平均 n-gram 召回率 / LCS 召回率的调和平均
典型取值 语料级 BLEU-4 ROUGE-1, ROUGE-2, ROUGE-L 的 F1

可以说,BLEU 问“你说对了几分话”,ROUGE 问“该说的话你说了几分”。


六、计算实例

参考摘要:Police killed the gunman.
候选摘要:Police kill the gunman.

ROUGE-1:

  • 共现 1-gram:Police, the, gunman(3个),参考总数 4,候选总数 4。

  • R = 3/4 = 0.75, P = 3/4 = 0.75, F1 = 0.75。

ROUGE-2:

  • 参考 2-gram:Police killed, killed the, the gunman

  • 候选 2-gram:Police kill, kill the, the gunman

  • 共现 2-gram:the gunman(1个)

  • R = 1/3 ≈ 0.33, P = 1/3 ≈ 0.33, F1 ≈ 0.33。

ROUGE-L:最长公共子序列可以是 “Police the gunman” 或 “Police kill the gunman” 中的 “Police the gunman”(LCS=3)。

  • R = 3/4 = 0.75, P = 3/4 = 0.75, F1 = 0.75。


七、使用方式与局限

通常会同时报告 ROUGE-1、ROUGE-2 和 ROUGE-L 的 F1 值,以分别衡量内容覆盖和流畅度。

它的优点是自动化、计算快、与人工评价有一定相关性。

局限与 BLEU 类似:只靠字面匹配,不理解语义,对改写、同义词替换无能为力。

而且 ROUGE 分数严重依赖参考摘要的数量和质量,单参考时容易低估好摘要。