Prompt | 存档使用 coding agent 过程中 work 和不 work 的 prompt
正样本
20260403,复现 agent-r1 过程中脚本报错,修脚本。
上下文:1. 报错的那个 bash 脚本,2. kimi 对两个报错的分析与解决方案。
现在,我正在跑这个程序,总是遇到显存不足的问题。给你看我与 kimi 的交互,这是我遇到的两个显存不足的问题。
现在,请回答我这些问题:
- gpu_memory_utilization 到底是什么参数,它是如何 work 的,太高或太低会发生什么,我应该参考哪些指标和现象来调整这个指标。
- 在这份代码里,我应该如何降低 max_model_len、使用 Tensor Parallelism、Pipeline Parallelism,启用 KV Cache 量化?(要确保你给我信息是正确的,你自己先跑代码检查一下,确保能正常运行,跑好几个 epoch 这种)
- 我目前的代码里,gpu_memory_utilization 从 0.6 到 0.95 都试过了。太高就会报下面的错误,太低则会爆上面的错误。5 6 7 卡都可以用,都有 80GB,按理来说是可以跑这个 3B 小模型的(我给你的 bash 脚本)。请帮我 debug 一下,看看到底怎么回事,要确保这个脚本要能跑。
交付标准:
- 请把以上内容总结为一个或多个 详尽的 markdown 文件,存放在这个库的根目录下。文件内容需要清晰、详细,并且易于理解。
- 请确保文档包含以上所有信息,以及所有必要的信息。请确保你交付的信息都是正确的。允许你执行代码或上网反复查证。我使用的 conda(/home/yyq/miniconda3/condabin/conda)环境是 mn_verl,它已经配好了 可以直接跑,你可以复制一个 mn_verl_copy 来跑代码。
- 如果你所获取的信息仍未达到交付标准,请继续获取信息、进行迭代和必要的 debug,直到达到交付标准为止。
20260330
为 collie icml 生产审稿人要的可视化结果。
请参考 plot_potential_metra.py 文件的实现,为我实现这样一个功能:
- 从给定目录(就是我们在 plot_potential_metra.py 里写死的这个目录)中读出 state encoder 和 query;
- 找到 query 中的一批好点和一批坏点,分别画 3 个图:这些好点和坏点的 1 仅取 xy 坐标的可视化、2 使用全部 state 维度但使用(比如说 pca 或 tsne,可以都试试,看看哪种方便我们做出来第三步的效果)降维方法得到的 二维可视化、3 这些 state 进入 encoder 后得到的 embedding 再降维成二维 得到的可视化。这些可视化图我希望以 pdf 形式存下来,好点是绿色,坏点是红色。
- 分析以上结果,并找到我想要的两种点:1 好点和坏点在 state space 里离得近,但因为人类的评价不同,在 embedding space 里离得远;2 好点好点 或 坏点坏点 在 state space 里离得远,但因为人类的评价相同,它们在 embedding space 里离得近。尽可能多找几组这种结果。找到后,呈现它们对应的 state space + embedding space 可视化。这些可视化图我希望以 pdf 形式存下来,好点是绿色,坏点是红色。
交付标准:存下来第 2 步、第 3 步我要的 pdf 格式的图片,并能清晰说明其中的实验结果。如果未达到交付标准,请你分析原因,修改代码,继续迭代。
我使用的 conda 环境是 mn_metra,使用的 conda 是 /data/yyq_mn/miniconda3/condabin/conda,通过 which conda 命令确定。
20260330
需求有变,进一步为 collie icml 生产审稿人要的可视化结果。
现在,需要在上一版的基础上实现新功能,具体需求是:
- 降维方式的更改:我现在希望我们 高维 → 低维(二维 为了方便可视化)的这个降维的映射,是一个尽可能在距离上保序的映射,即,两个高维点在高维空间中的 L2 距离 这种点两两之间的距离,在降维后的低维空间(二维空间)中,相互离得远的点仍然离得远,离得近的点仍然离得近;或者我能接受 原始高维空间中 scale 各个维度的数值大小后(也就是等比例缩放),是保序的。这两种映射的需求,请都尝试一下,分别实现一下,我要看效果对比。
- 可使用的参考降维方式: 经典多维缩放 (Classic MDS)、非度量多维缩放 (Non-metric MDS)、 Isomap (等距映射)、UMAP。请优先实现计算量较小的,但如果当前的降维方式不 work,即 不能挑出来足够符合我需求的数据,可以尝试下一种降维方式,也要注意保存当前降维方式的实验结果图。
(补充:确实,我所说的好点实际上指 neutral 点,请使用 neutral 点作为好点。)
交付标准:仍然存下来 我上次所要求的 第 2 步、第 3 步我要的 pdf 格式的图片(注意不要把之前存的图片覆盖掉),并能清晰说明为什么你的降维方式可以实现我的需求,以及清晰说明其中的实验结果。如果未达到交付标准,请你分析原因,修改代码,继续迭代。
负样本
20260401,让 codex 直接帮我复现 agent-r1。
失败原因:codex 不会装 flash-attention。
我希望复现这个 repo 的实验结果。请你开始进行复现。
首先,你可能需要安装环境。我使用的 conda 是 /home/yyq/miniconda3/condabin/conda(which conda 的运行结果)。
然后,请你开始复现这个 repo 的实验结果。请参考 REPRODUCTION_GUIDE_ZH.md 这个文件中的说明,按照其中的步骤进行复现。
交付标准:
- 跑通所有测试脚本,并得到有意义的、(如果 repo 文档或原论文中有说明)与 repo 文档或原论文结果对齐的结果。
- 请观测、记录复现的实验结果。请记录你使用的观测方法,如 wandb、tensorboard 等;请记录结果的数值大小,并且在复现完成后进行总结,形成一个详尽的 markdown 文件,存放在这个库的根目录下。文件内容需要清晰、详细,并且易于理解。
- 复现过程中遇到的任何问题,都需要进行记录,并且在复现完成后进行总结,形成一个详尽的 markdown 文件,存放在这个库的根目录下。文件内容需要清晰、详细,并且易于理解。
- 如果你所获取的信息仍未达到交付标准,请继续获取信息、进行迭代,直到达到交付标准为止。
我们的计算资源有 8 卡 80G A800,你可以考虑在多张卡上并行进行实验。优先从 7 卡开始用,从 7 卡到 0 卡这样用。比如,如果只需要 4 张卡,就使用 4 5 6 7 卡。
请注意,我的账号有 sudo 权限,如果有什么需要安装的包,请说明原因后运行命令,我会允许。如果发现有其他非 yyq 的用户(比如 root zzyy,而非 yyq yyq2 yyq3 等)正在占用 gpu,请为我汇报情况,并执行 kill 他们进程的命令,我会允许。如果有 yyq 用户正在占用 gpu,请为我汇报情况,而不执行 kill 他们进程的命令。

浙公网安备 33010602011771号