关于AI辅助下科研论文最小闭环的思考
绪论
最近面临毕业压力,开始尝试一切能够提高发paper的效率的手段。经过对前几年的反思和复盘后总结了如下几个卡手点:
- Idea的构思;
- Demo代码的开发;
- 实验的执行;
- 论文的写作。
在刚入门的时候,我最大的卡手点是“论文的写作”,因为前三个点都有师兄和导师带着做,不需要自己全权负责。此时卡手体现在于我像个畜生一样,在思路、大纲、数据都齐全的情况下一篇论文可以写2-3个月。最开始的时候,主要原因是没写过学术论文,不知道该怎么写。后面慢慢转变成了追求完美,往往写了一半发现不对又回去删掉之前的部分重写甚至重做对应的实验再重写,这一阶段的主要原因是写作大纲的设计经验不足以及爱钻牛角尖。
到了第二阶段,最大的卡手点变成了“实验的执行”。此时已经开始自己主要设计Idea、实现代码然后做实验,由于Idea仍然有师兄和导师把关,编程技术也不再是小白,所以前两个环节一般都很快,最多一个月就搞定。但是此时的我又会陷入“做实验-认为数据不完美-改实现”的循环中,往往一拖就是几个月。并且此时写论文也不是不卡手了,而是写作技能有所提升,一般最多只卡1-2个月,成为了次要卡手点。
到了第三阶段,最大的卡手点又变成了“Demo代码的开发”。这里主要是因我要准备毕业了,想给导师留下几个能干的师弟师妹,于是会带着他们一起参与我的论文代码开发,便开发边教一些编程规范、工程思维、设计模式之类的东西。此时一篇论文的代码实现往往也会和科研项目结合起来,并且我个人又比较喜欢打磨代码(反复折磨自己和师弟师妹),因此一篇论文的全流程可能花半年到一年在项目级别的实现上。
现在我博四了,实现了个人的项目自由,师弟师妹也已经出师。我开始思考单枪匹马发一篇paper的最小闭环时间可以是多少?
以论文写作开刀
最开始的尝试是写论文,当时刚好折磨完一篇论文对应的实验,做出了我自己觉得满意的实验效果,然后发现马上要中期了,于是需要赶紧投稿,定了个小目标:这次写作怎么都不能超过三周。
最后的完成时间刚好是三周,这个过程我自己摸索出了一套“代码补全式的学术论文写作技巧”。灵感来源于项目的我个人总结的工程实现:
项目的工程实现抽象流程
- 确定需求和指标
- 设计测试用例
- 设计数据结构、模块UML类、模块关联、典型流程
- 敲定总体框架与技术选型
- 开始实现
- debug与迭代
- 交付
然后我发现写论文类似:
论文写作抽象流程
- 确定核心问题和研究挑战
- 设计创新点实现打靶,已有代码与创新点建立关联
- 设计实验,已有数据与核心问题的解决程度关联
- 敲定写作大纲与参考文献
- 开始写作
- 内部评审与迭代
- 投稿
在“代码补全式的学术论文写作技巧”阶段,我只利用AI完成“开始写作”这一环节。
- 抛弃textstudio和overleaf,搭建一个vscode+textlive+copilot的latex写作环境。
- 为写作大纲的每一个分支都写好中文版本的“写作意图”,必要的部分提供更详细的句子和段落(用于强制矫正幻觉)。
- 写出第一句话。
- tab,观察AI补全内容与自己真实意图的匹配程度,如果匹配程度较低,人工介入修改。
基于上述流程,我第一次完成了大部分内容都由AI输入的论文,此文完全表达了我的意图又没有引入任何幻觉内容,我个人认为其等价于人工完成初稿后由AI润色的效果。导师也评价为“没看出来AI生成痕迹”,我心甚慰。
后来我又摸索出了针对写作大纲的AI辅助方法,那就是拷问法。先人工写一版大纲,尽可能考虑周全(这里的周全是几乎不会写到一半觉得自己当初没设计好于是重写的程度)。然后发给AI让它找茬,觉得它找的有道理的,就改正甚至重构,知道自己被折磨到极限或者它挑不出问题为止。
此处推荐一个快速获得高质量反馈的Prompt生成的idea:
授人以鱼不如授人以渔
session 1: 先跟AI聊一下什么是苏格拉底式教育,让它先在上下文里固化好足够的相关知识,然后描述自己的需求(设计论文写作大纲),然后让它帮忙生成一个system prompt,用来指导另一个大模型扮演苏格拉底对你进行各种拷问。
session 2: 复制session 1得到的prompt作为系统提示词,把你认为杰作的大纲发给它,开始接受折磨,等你出院了,这份大纲基本不会太差。
至此,一篇论文的写作完全可以先从做代码实现和做实验开始。当实验有一半都比较理想的时候,就可以开始写论文了,此时,你应该有把握完成在三周之内从写作大纲的设计到形成初稿(你知道的,从初稿到终稿,那是另一码AI不能控制的事情)。
现在论文写作还剩下最后一个小卡手点,那就是参考文献。不知道你们是否遇到过以下问题:
- 这个点子到底有没有人已经做过发表了啊?
- 我这里的论述有没有可能引用两篇参考文献,从而脱离自嗨的范畴?
- “你这里的参考文献太少了,加一下”
我宣布,在2026年,这个问题消失了。你只需要买一个Gemini Pro会员,然后打开Deep Research,把你的需求发给它,然后它就会指定研究计划,开始“定点打靶”式的调研,论文和网页博客都能给你搜出来。
注意:不要直接使用它的结果,根据“上下文越长,模型越愚蠢”的定理,它在“读”了几十篇论文博客后给你写的调研总结,其幻觉含量将会非常惊人。所以你还是自己大致读一下它的总结,然后按照1-2-3区、CCF A-B-C的顺序挑几篇论文逐篇让AI在新的会话中总结解读,然后再加到你自己的论文里面去。
此时,我相信一篇论文从0到初稿,最快一周就能搞定。
防杠声明:我们不跟纯AI生成比,现在讨论的也不是AI自动科研,而是AI辅助科研,所以一周的时间用来写作,我觉得是保证质量的情况下的最小时间。毕竟你还要睡觉、吃饭、打游戏以恢复SAN值。
AI自动实现Idea的初步探索
这一板块,一度让我心灰意冷,从“对AI抱有过度幻想”的极端直接走到“对AI完全质疑”的极端。此时必须感谢老婆有一天半夜不睡觉跟我讨论这个方面的话题,最后我又走了出来。
既不充满幻想,也不彻底质疑。硬要说的话,有点回到前人的箴言了。我改编一下赘述一遍:
大胆假设,勇于实践,反思复盘,再接再厉
AI没有什么都行,也没有什么都不行,它到底什么行,需要你自己去试,同一个AI对于不同的人也有不同的行与不行。没有固定的最优解,但是每个人都有自己的AI用法的最合适的解。
废话说了这么多,我目前已经可以稳定让AI自动实现DEMO了,时间周期大概是1-3天(取决于复杂度)。
具体而言,其实跟平时人开发一样。一个最小的开发流程(个人理解,并非真理)应该先写需求分析文档、然后出系统分析文档、然后出开发计划(排期)文档、然后实施开发、然后迭代与维护。
最开始的“人类幻想”在于认为AI可以完成上述所有5个环节,实际上是AI可以参与上述所有5个环节,能够执行其中几个环节。
我最开始的失败就在于在幻想中将上述所有环节全权交给了AI,然后就经历了如下心路历程:
- 一开始看着AI讲的头头是道感觉兴奋不已;
- 然后发现设计哲学、代码美学跟自己平时不一样,看着不舒服,于是写了一个完善的开发规则,果然有所好转,继续兴奋;
- 中期发现AI犯傻于是自认是管理不到位,提出了复盘和写日报的规则,看着AI一步一步推进,我只用看日报,继续兴奋;
- AI陷入自己生成的海量文档和屎山代码中无法自拔,拯救不能,此时意识到事情有点不对;
- 简单复盘后,开始利用社会工程学PUA AI,让它专注于交付结果,发现它开始交付第一批数据,重新兴奋;
- 发现AI一直在交付差别很小的数据,一直在优化毫无意义的代码细节,开始暂停AI,人工审查代码;
- 发现AI在被迫“交差”,代码里面充满了过度MOCK与硬编码返回字符串,之前的数据和日报全是“新闻”;
- 心如死灰。
AI自动实现Idea的成熟方案
经过老婆的开解、指导与复盘。最后我得出了以下方案:
- 文档先行。需求分析文档、系统分析文档必须人类重度参与与把控。开发计划文档可以在前两个文档的基础上由AI生成,并由人类矫正。
- PLAN优先。实施开发的时候,永远不要直接让AI开始干活,请切换到PLAN模式,然后输入“现在推进Task X.X”,人工确认它生成的PLAN,然后让它开工。这里推荐你审核PLAN的时间不要低于它开工后写代码的时间,PLAN花费的时间越多,它一次性写到位的概率越大。
- 临时最优解就是
/clear。在目前的AI智能水平下,请放弃它能自己管理好长对话,能保证不从历史对话中偷取结果的幻想。每完成一个最小Task,立马让它写开发报告,commit代码,然后在/clear后推荐下一个Task。 - 蒸馏自己的分身。“同事.skill”不仅是一个鲁迅式的讽刺,也是现代打工人的分身绝技。把你辛辛苦苦的人类劳动成果(你的项目代码)交给AI,让它帮你蒸馏出“我.skill”。这个过程并不简单,也不能自动化,但是一劳永逸。请主要关注“设计哲学、代码美学、工程决策倾向”三个维度。
- 先自己做实验。上述3个步骤用好了,你可以一边海克斯乱斗,一边监工,在死亡的间隙回到VSCode输入“推进XXX”,检查开发报告。
以下是一些细节经验:
- 需求分析文档就是你论文的核心Idea,应该至少包含【背景】、【核心问题】、【研究挑战】、【创新点(解决方案)】、【理论模型】、【实验方案】这几个环节。可以在跟Gemini Pro的对话中完成,但一定会经过多轮修改,人机相互挑刺之后,才能形成高可靠版本。
- 核心Idea怎么来?以前需要你大量阅读同行论文入门,然后经历一个长期的“俺寻思-俺是小丑-我好像能行-我好像真是专家”的成长过程。现在Gemini Pro神教带你领略邪修路线:“请调研XX方向近几年的研究热点、局限性、可能的研究忽略点、共同的难题。。。”。
友情提示:即便同为邪修,先将正道走到头才转修邪法的邪修也远远强于从凡人直接成为邪修,因为它们知道自己为什么要用邪道手段,也知道邪道手段只是手段,自己仍然是一个正道修士。(天才请无视此提示)
- 系统分析文档就是你论文的代码框架设计与技术选型,请先蒸馏出“我.skill”,然后配合需求分析文档一起生成,并且也适度与AI进行讨论。主要讨论技术成熟度、可靠性、风险、静态数据可访问性。
- 开发计划文档在前两个文档和“我.skill”的基础上直接让AI生成,然后人工过一遍,把不合理的节奏安排以及由于幻觉产生的不需要的部分剔除掉。
上述三个文档,在熟练的情况下半天就能完成。我的师弟评价为:把这三个文档给他,他都能自己完成开发了。我心里想的是:给你要至少一个月才能写完,你倒是想得美。
实施开发这个环节在我一个晚上的海斗中完成了,并且达到了DEMO级的标准:你别管他性能如何,他所有数据模型都正确、逻辑功能全部通过预先想好的输入输出约束、生成的实验脚本跑完确实可以认为是初步实验数据。
该放弃的幻想
- AI现在只是能完成DEMO,不代表他能做到这个Idea对应的性能极限。具体怎么达到极限,需要人读完DEMO的初步实验数据之后,通过“PLAN-TO IT”的循环来完成。请不要寄希望于它真的能理解你在这个方向的专业性上作出的“极限”的判断。(虽然有些问题它能)
- Claude Code、Codex这些工具应该只被用于DEMO开发和迭代维护,如果想无人监管自动实验,请考虑龙虾或者hermes(新手推荐hermes,虽然它最近被曝抄袭国内一个agent的代码,但是它目前确实上手极快)。
总结
上述内容基本涵盖了找Idea、代码实现、执行实验、写论文这一研究生科研最小闭环,但也只是本人个人的心得体会,不一定全对也不一定全错。
本人只是想记录并顺便分享。
题外话:关于“大胆假设,勇于实践,反思复盘,再接再厉”的具体解释
- 大胆假设:每隔几个月,就请重新对AI抱有充分的不切实际的幻想,然后开始尝试当前AI的新特性;
- 勇于实践:别只做小实验和chat级别的思维实验,用最新的AI去做项目级别的开发实践;
- 反思复盘:在上述过程中逐渐放弃对当前阶段的AI技术而言不切实际的幻想,得到目前的个人最优harness;
- 再接再厉:失败才是常态,但只要成功一次就是爽,所以不要那么容易心灰意冷。

浙公网安备 33010602011771号