C-ReD 解读:中文AIGC检测基准里哪种最难检测

来源:论文首页
先说结论:中文 AIGC 检测基准 C-ReD 今年发了,数据量不小(12.8 万条),覆盖了新闻、问答、影评、作文、学术写作五个域和九个模型。论文里最有意思的三条发现——新闻和学术写作最难检测、DeepSeek-R1 是九个模型里最难测的、微调可以迁移到没见过的模型但做不到完美。
1. 这篇论文做了什么
它不提出新算法,只做一件事:给中文 AIGC 检测造一把统一的尺子。
| 项 | 内容 |
|---|---|
| 论文 | C-ReD:A Comprehensive Chinese Benchmark for AI-Generated Text Detection |
| 作者单位 | 清华大学 / 南开大学 / 哈尔滨工业大学(深圳)/ 鹏城实验室 |
| 发表 | ACL 2026 Findings(预印本 2026-04-13 首发、2026-05-19 更新 v2) |
| 要解决的三个问题 | 模型单一(多为 ChatGPT 生成)· 格式同质(多为简单问答)· 提示词不真实 |
| 做法 | 人类原文(5 个域)与 AI 文本(9 个模型、同一批提示词)成对组织 |
| 规模 | 128,610 条:人类 12,997 + AI 生成 115,613 |
2. 它指出的三个老问题
论文在引言里点名了此前中文数据集的三个限制:
- 模型多样性不足:大多只用 ChatGPT 生成,漏掉了国产中文大模型;
- 数据同质:文本多是简单问答格式,缺少新闻、学术写作这类专业域;
- 提示词不真实:没有反映 LLM 在真实场景里被怎么用。
这三条不是笼统的"数据集不够好",而是可以直接拿去核对的标准。
3. 它造了什么:5 个域 × 9 个模型 × 5 类提示词
人类原文来自五个域,AI 文本由九个模型生成:
| 维度 | 内容 |
|---|---|
| 人类文本(5 域) | 新闻 3,000(THUCNews)· 问答 2,956(知乎 KOL)· 影评 2,960(豆瓣)· 作文 1,081(高考作文)· 学术写作 500(ChinaXiv 论文的题名/关键词/摘要/引言) |
| 繁体补充 | 繁体新闻 2,000 |
| 生成模型(9 个) | gpt-3.5-turbo、gpt-4o、Gemini-2.5-Flash、Claude-3.5-Haiku、Deepseek-V3、Deepseek-R1(思维链模式)、Qwen2.5、Qwen3、Doubao-1.5-Pro |
| 提示词策略 | 每个域一套贴近真实用法的模板(新闻给分类模板+真实标题;学术写作融合题名/关键词/摘要) |
| 总量 | 128,610 条:人类 12,997 + AI 生成 115,613 |

来源:C-ReD 论文(arXiv:2604.11796)
4. 它怎么测的
论文测了三类检测器,指标是 Accuracy 与 AUROC,共七种设定:零样本方法(Log-Likelihood、Entropy、Log-Rank、LRR、Fast-DetectGPT、Lastde/Lastde++、DNA-DetectLLM);有监督检测器(OpenAI Detector、RADAR、ReMoDetect、IMBD);以及让 8 个大模型自己当检测器,配三种提示策略(普通、给上下文、给风格描述)。设定覆盖:域与生成器都不给标签的通用评测、在 C-ReD 上微调后的分布内/分布外、固定生成器的跨域迁移、提示词复杂度消融、繁体新闻测试,以及迁移到外部 M4 中文问答。

来源:C-ReD 论文(arXiv:2604.11796)
5. 论文自己给出的七条结论
- 难度和"域"强相关,问答、影评这些结构化的域更容易测;新闻与学术写作最难,现代LLM写得流畅连贯,反而抹去了典型的机器痕迹。
- 难度同"模型"密切相关,Deepseek-R1最难测,论文认为这是由于它的思维链风格使输出更加连贯、更像人的推理造成的。
- 零样本会认生,依赖固定参考模型的零样本方法,遇到没见过的LLM会出现架构、风格错配,老的有监督RoBERTa检测器在新模型上失效。因为它是用较旧、质量低下的AI文本训练出来的。
- 在 C-ReD 上微调提升明显,而且能迁移:微调后不仅各域大幅提升,对训练时未见的两个模型(Claude-3.5-Haiku、Gemini-2.5-Flash)也有效;但分布内与分布外仍有小差距——「完美迁移做不到」。
- LLM 自己当检测器,零样本基本不行:连自己生成的文本都难判;一旦给上下文或风格描述,准确率明显上升。
- 提示词简化,检测难度几乎不变:说明强模型即便指令变少,也能写出人味的学术文本。
- 迁移到外部中文数据有效:只用 C-ReD 的问答域训练,迁移到 M4 的中文问答也有提升;对 davinci-003 的样本提升小些,论文认为这是风格差异更大所致。
6. 我们的评论
亮点一:把国产模型放进了基准。 与之前中文数据集最大的不同就是DeepSeek、Qwen、豆包都在测试集中。对于面向中文用户检测生态而言,只有“只测ChatGPT”的基准才有参考价值,C-ReD填补了这个空白。
亮点二:把「域」和「生成器」拆开测。很多检测器宣称高准确率,但没有说明是在什么域、对哪个模型。C-ReD用七种设定把这两个变量分开,结论也更接近真实使用——检测器不是一个固定分数,而是一张随域和模型变化的表。
亮点三:OOD 与外部迁移都做了。 微调后对未见模型仍有效、并迁移到 M4,这是判断一个基准"有没有资格当基础设施"的关键动作。
但是也存在局限,而且论文自己承认了以下几点:
- 只有中文,多语言是未来的工作;
- 9个模型会过时——模型迭代快,今天在榜的模型明天可能不是最难的;
- 提示词不能覆盖对抗式用法,论文中明确指出,为了防止被检测到而精心设计的提示不在覆盖范围内,这正是检测最困难的地方;
- 人类文本来源有限(THUCNews、知乎、豆瓣、高考作文、ChinaXiv),不能代表中文写作的所有风格。
一个作者没强调、但更值得读的点:检测率不是一个可以跨域、跨模型直接引用的数字。同一个检测器,在不同的领域、不同的生成模型下,表现也会相差很大。这和我们在站内反复写的“自测分数只作参考、终检以学校/期刊指定系统为准”是一样的。对写论文的人来说,实际含义就是不能把某个检测器的分数当作安全证明,而应该把精力放在规范引用、AI使用披露和写作留痕上。
7. 可以自己做的三件事
论文的结论对写论文的人其实很直接——检测器不是一个固定分数,那就别把宝押在"过检测"上。三件事更值得做:
- 引用逐条可检索:把每条参考文献放进数据库核一遍。AI 生成的假引用正在导致撤稿,这不是远处的新闻。
- AI 使用按口径披露:学校或期刊要求披露的,按其要求写清楚;不要求披露的,也保留使用记录。
- 保存写作留痕:大纲、草稿版本、文献笔记,在申诉与核查里是最直接的证据。
8. 边界与声明
本文没有做论文的复现实验,正文没有给出逐项AUROC数值,在附录或者图表中也没有出现,所以本稿不会复述具体的分数。论文的联盟、资助信息(国家自然科学基金62301189、62576122、62571298,广东省基础与应用基础研究基金2026A1515011139)照录,不代表我们对结论的背书。机构和作者单位以论文全文页署名为准。
9. 来源与声明
| 项 | 内容 |
|---|---|
| 论文 | C-ReD: A Comprehensive Chinese Benchmark for AI-Generated Text Detection |
| 发表 | ACL 2026 Findings,arXiv 编号 2604.11796 |
| 作者单位 | 清华大学 / 南开大学 / 哈尔滨工业大学(深圳)/ 鹏城实验室 |
| 引用量数据 | Semantic Scholar,查询日 2026-10-04 |
本文所有事实均来自论文正文或公开报道,不代表我们对结论的背书;机构顺序不代表排名。
利益声明:本文出自 pcpass123.com,提供AIGC检测。

浙公网安备 33010602011771号