AIGC标识 ResearchStudio-Reel: Automate the Last Mile of Research from Paper to Poster, Video, and Blog

阅读笔记:ResearchStudio-Reel: Automate the Last Mile of Research from Paper to Poster, Video, and Blog

TL;DR

这篇论文用 5 个可组合的 agent skill(跑在 Claude Code 与 Codex 上) 把一个论文 PDF 自动转成三种传播产物——会议海报、演讲视频、双语博客——再用一个交互式 viewer 把三者按章节绑定成可导航的整体,且全部交付原生可编辑源文件(PowerPoint / Word)。核心结论是:研究传播“最后一公里”的真正缺口不是“能不能生成多种格式”,而是“产出是否原生可编辑 + 能否统一导航”(native editability + experience-level convergence);在这个 delivery contract 下,其海报在 Paper2Poster benchmark 100 篇上美学分列自动系统最佳(3.56 vs 作者自做 3.03),并在两套 VLM 评委下分别赢 74/100、95/100 篇。主要 caveat:只有海报被量化评估,视频/博客仅有能力清单(capability audit),且美学分由 VLM 评委代理、与阅读理解指标(PaperQuiz)呈反向关系——“好看”不等于“更利于理解”。

1. 研究内容

1.1 研究问题、痛点与动机

  • 研究问题:如何把研究传播的“最后一公里”——把一篇已发表论文变成海报、演讲视频、博客——自动化,同时满足两个被现有工作忽视的约束:(1)产出保持原生可编辑(作者能在 PowerPoint/Word 里继续改,而不只是拿到一张扁平图);(2)多个产物能统一导航(读者能从一个海报区块跳到对应的视频片段和博客段落)。
  • 痛点:传播层与论文本身在结构上是分离的,却恰好消耗作者在 acceptance 之后时间最紧的那几天;现有自动化文献(paper-to-poster / -video / -blog)多为单一产物,组合使用时会重复抽取图片、caption、元数据(G1 shared grounding 缺失),产出往往不可编辑(G2 native editability 缺失),且多产物之间无法绑定成一个可交互整体(G3 experience-level convergence 缺失)。
  • 动机 / 为什么重要:这些产物不只服务原作者一个人——工业实验室的对外传播、研究生课程的“每周一篇”导读包、多语言研究组织的跨区域推广都需要它;一个可用的 last-mile pipeline 因此能服务远超单个作者的用户群。
  • 领域定位:agent/skill 驱动的文档生成系统,处于 paper-to-poster、paper-to-video、paper-to-blog 三条研究线的交汇处,并与并发出现的多产物统一套件(PaperX、OmniPresent)直接竞争定位。

1.2 核心贡献

  • 实现 ResearchStudio-Reel:一个 native-editable 传播工作区,通过可组合 skill 把一个 PDF 变成 print-ready 会议海报 + 配讲视频 + 双语博客(系统级构建,非单点算法)。
  • 提出 Paper2Reel:experience-level 收敛层,在一个可导航 HTML 面里把海报区域、视频片段、博客段落绑定(这是论文真正的差异化点)。
  • 提出 delivery contract:一个共享 Paper2Assets bundle + 每个产物的原生可编辑源文件(PowerPoint 给海报/视频 deck,Word 给双语博客),并用 artifact-specific release check 让这个契约可测试
  • 海报在 Paper2Poster benchmark 上美学三项子指标全列自动系统最佳、信息三项中两项最佳/并列最佳,美学超作者自做海报约 17.5%(3.56 vs 3.03),两套评委下分别赢 74、95 篇。

定位判断:前三条是“新范式/工程范式”级(把多产物传播重构为 native-editable + section-aligned workspace),第四条是“增量实证”(在已有 benchmark 上刷分)。论文的重点明显在前三条的 delivery contract,而非单纯刷海报分。

1.3 相关工作脉络

flowchart LR
    paper2poster_bench["Paper2Poster<br/>Pang et al., 2026<br/>(benchmark + 可编辑 PPTX 基线)"] --> reel["ResearchStudio-Reel<br/>本文, 2026"]
    postergen["PosterGen / P2P<br/>Zhang / Sun, 2026<br/>(多 agent 海报流水线)"] --> reel
    papers_to_posts["Papers-to-Posts<br/>Radensky et al., 2024<br/>(交互式博客摘要)"] --> reel
    papertalker["PaperTalker / PresentAgent<br/>Zhu / Shi, 2025<br/>(论文→视频)"] --> reel
    paperx["PaperX / OmniPresent<br/>Yu / Ma, 2026<br/>(并发多产物套件) --> 定位对比"]
    skill_runtime["Claude Code / Codex Skills<br/>Anthropic / OpenAI, 2025<br/>(skill 运行时)"] --> reel
  • 关键传承:Paper2Poster(Pang 等,2026)既提供了本文直接沿用的 100 篇 benchmark、六维 rubric、PaperQuiz 探针,也确立了“可编辑 PPTX 输出”这一交付范式;Papers-to-Posts(2024)是博客写作的最近前身(交互式 source outline)。skill 运行时(Claude Code / Codex)提供了执行基底,但论文明确声明运行时本身不是其贡献。
  • 分歧:与并发多产物套件 PaperX(Scholar DAG 出 PPT/海报/PR 文)、OmniPresent(中心化 HTML 表示 + 跨模态 verify-and-repair)相比,本文不争“第一个多产物生成器”,而是聚焦 native editability + section-level alignment contract——OmniPresent 仅作定性讨论、未纳入实验 baseline。

2. 方法概要

  • 方法路线:系统构建(agent skill 编排 + 确定性文档/媒体原语),非纯理论或纯实验论文。
  • 关键假设
    • 显式:论文的图片、caption、元数据可被一次性抽取并共享给所有下游产物(single-owner extraction 优于每个 renderer 各自重做)。
    • 显式:海报的“填满程度”可用一个几何密度比率(content 高 / card 高)量化为离散类别,从而把版式填充变成可收敛的 categorical fixed point。
    • 隐式(读者识别):ML/CV/NLP 会议论文的版式、图惯例、claim-evidence 结构相对统一(论文自承系统只在这类 venue 上校准,跨域未测)。
    • 隐式(读者识别):VLM 评委的美学打分能代理人类设计偏好(论文自己在分析中警告这只是 proxy)。
  • 数据 / 实验设置:Paper2Poster benchmark 100 篇论文;两套 VLM 评委(claude-opus-4.8、gpt-5.5);沿用原 benchmark 的六维美学/信息 rubric + PaperQuiz 阅读理解探针(exact-match);每张海报降到 ≤2560 px 再评、并按真实内容尺寸渲染后评分(防止某配置把 60 英寸内容塞进 48 英寸 @page 导致裁掉五分之一)。baseline 三家:single-shot 前沿 LLM(Claude-4.8 Opus、GPT-5.5、Gemini-3.1 Pro,共用附录 G 的统一 prompt)、poster pipeline(Paper2Poster tool、P2P、PosterGen,best-effort 复现)、作者 ground-truth;本文在两种 harness 下跑同一套 skill(Claude Code + claude-opus-4.8 / Codex + gpt-5.5)。
  • 训练目标:n/a——本文不训练模型,所有生成由现成 LLM(claude-opus-4.8 / gpt-5.5)+ 确定性原语(headless Chromium、LibreOffice+ffmpeg、python-docx、Edge TTS)完成。

整体处理流程(一段鸟瞰):一个 PDF 进入 Paper2Assets,被抽取一次得到 bundle(保留分页的全文 + 检测到的 figure caption + 逐图 manifest + 清洗后的图 + 元数据 + 九段式结构化摘要 + 尽力而为的机构 logo 与 QR);三个生成器 Paper2Poster / Paper2Video / Paper2Blog 各自把这个 bundle 原样消费,分别产出海报(HTML+PDF+PNG+可编辑 PowerPoint)、视频包(video.pptx + video.mp4 + 无字幕版 + timeline.json)、双语博客(中英文 Word 各一份);最后 Paper2Reel 读取三者的完成交付物 + 一份 alignment sidecar,把海报区块、视频起止时间、字幕、slide 缩略图、博客段落按同一套 section id 对齐,打包成单一可导航的 HTML viewer。贯穿全程的不变量是:所有产物共享同一套 section 标识符、figure handle、claim anchor,所以三者是互相引用而非各自孤立——海报方法卡里嵌的图,就是视频对应 slide 引用的图、也是博客 evidence map 里引用的图。

2.1 架构图

ResearchStudio-Reel 流水线架构
ResearchStudio-Reel 流水线架构

(对应原文 Figure 2:一个 PDF 进、三种 editor-ready 产物出,中间一个共享抽取阶段。一次 Paper2Assets 产出 bundle,被 Paper2Poster / Paper2Video / Paper2Blog 各自原样消费,Paper2Reel 再把三者绑成一个可导航面。共享 section 标识符、figure handle、claim anchor 让三者互相交叉引用。)

2.2 模块详解

  • Paper2Assets(共享抽取层):输入论文 PDF → 输出唯一 bundle(下游 skill 的唯一接口,下游不再重开 PDF)。

    • 处理流程:
      1. 抽取全文与 caption,按列感知边距裁每张图;
      2. 从首页(arXiv 论文则从 abstract 页)合成元数据;
      3. 写九段式摘要(Problem / Motivation / Contribution / Method / Dataset·Benchmark / Key Result / Ablation / Headline Numbers / Takeaway),每段携带一个 essential 条目、一个备选 supplementary 条目、一段口播 audio script;
      4. 尽力从 Wikimedia Commons(机构 logo,筛 logo/seal/wordmark 类型、取全分辨率上传)与 Wikidata(venue logo)抓取,下载字节校验,取不到就隐藏该 titlebar 槽而非显示占位符;渲染 QR;
      5. 二次扫描补 inventory manifest(源 PDF checksum + 逐段 record 带 stable id + 按阅读顺序的 narration 片段清单),emit 下游读取的 canonical record。
    • 最耗时、最 load-bearing 的是图片清洗链(每张抽取的图跑一次,而非每个下游 renderer 各做一遍):确定性前缀先剥 chrome 残留、baked-in caption strip、统一白边(处理简单情形)→ visual-AI 步骤判定紧边界框 → 一个 fresh-context sub-agent verifier 独立重读原图对照提议裁剪 → 只有干净通过才 commit,若一张光栅图实际装了两张独立图则切分。
    • 设计理由:把昂贵的图片清洗折叠进单一 owner,下游复用同一 figure reference 就不必重复清洗,避免每个 renderer 要么重复 verifier loop、要么发出可见缺陷(正文文字漏进裁剪、caption 烤进图里)。每个 step 是独立幂等脚本,某阶段失败/改进可单独重跑而不必重抽整篇。
  • Paper2Poster(海报生成器):输入 bundle → 输出海报四种耦合格式(自包含 HTML、精确画布尺寸的 print-resolution PDF、缩略图 PNG、原生可编辑 PowerPoint)+ 可选逐段 narration 音频。核心是 measured-fill loop(分级填充循环)

    • 构图优于固定模板(A1):不从模板库组合(列布局×视觉风格×表头×底部 QR 的组合爆炸),而在 build time 从四个正交轴组装——列布局(full/half/三栏)、视觉风格(一族可互换 CSS 主题)、表头排布(五种 venue logo+机构 logo+QR 组合)、底部 Scan-to-Read 块;只有布局由硬规则定(Method 图的形状决定走合并列网格还是半宽默认),其余轴可复现地采样,让一批海报有稳定分散而不靠“随机挑风格”。
    • 分级填充循环(A2,核心算法,详见 2.3):海报从只含 essential 文本 + 少量选中图(必有 Method 图 + 至少一张关键结果/teaser)的精简草稿起步,循环测量每个 section 的 fullRatio( painted 内容高 / card 内高),量化为五类 verdict,verdict 单独决定 remediation,直到所有 section 落 FULL 带、且每张图至少在一轴上填满 ≥90%。
    • loose gate + render-time expand:fill gate 刻意松(90% 算满而非 98%),因为最后几个百分点正是离散编辑循环振荡处(收紧到 98% 会令轮数激增,过 0.94 尤甚);为补回这几个百分点,渲染时一次性把每个欠满 card 的行间距撑向 98%,但不动图、且任何会把固定画布撑高的 card 增长都被回退。
    • 编辑页但不重读(A3):refinement 循环从不把整张海报(约 100 KB HTML)拉进 context;每次测量除返回 verdict,还只返回恰好 off-target 的那些 section 的逐字源码,agent 就地改这些片段,大文件从不进窗口、不触发 compaction 抹掉循环已有进度;文件也间接生成、从不经输出通道打印回(避免 per-turn token cap 溢出直接 kill 运行)。
    • 图按真实杠杆调(A4):图所在列的高度不响应文本,所以循环通过图的高度 cap(而非周围文字)调图,并给每张图一个硬 floor;于是两种 regime——图低于 cap 且下方留白则抬 cap 放大,列拥挤则削文本(图不会缩过 floor)。
    • 可编辑 PowerPoint 桥(A5):不把成品页栅格化再从像素反推 shape(通用 PDF→PPT 转换器的做法),而是从 live DOM 直接重建每张 slide——读每个元素的屏上位置/尺寸/样式,按角色转成对应 native PowerPoint 对象(文本块→保留粗斜体的可编辑文本框、图→可替换图片、公式→原生可编辑公式对象而非扁平图、section card→带样式 shape)。作者因此能在 PowerPoint 里改错字、换图、改配色再导出,而不必重跑 fill loop。
    • 作者偏好对齐:多处默认非技术必需、而是匹配真实海报惯例——机构 logo 放大到一个共享慷慨高度(作者海报倾向于放大自己机构 logo)、图多论文用宽三栏、按 venue 定画布尺寸(ICML/NeurIPS/CVPR 用 60×36 英寸横版、ACL 系用 A0 竖版)、默认浅色 title band + sparingly 用的强调色、QR 当家具(无对应链接或会太空则不渲染)。
    • 质量门(release gate):海报只在 fill loop 自身的收敛出口达标(每 section 落 90–98% FULL 带、每图填满 ≥90% 一轴)+ 四种产物齐备且无截断 + 渲染 PDF 匹配目标固定画布尺寸(非 advisory 门,否则模型会以“别的门都过了”为由跳过渲染)时才放行;离散循环未必能让所有 section 入带,on-disk 电路断路器限轮数,不收敛则发最优测量态并标 degraded;可选 RRP(Reader-Reconstruction Preference)门:仅当 held-out reader 模型仍能从海报答出问题时才接受编辑,防止“好看但损害可答性”的美学编辑。

    分级填充循环可视化(论文 Latent Diffusion Models 海报)
    分级填充循环可视化(论文 Latent Diffusion Models 海报)

    (对应原文 Figure 4:debug 覆盖层给每个 section 上色标 verdict——红/黄=EMPTY/SPARSE、绿=FULL、橙/品红=SPILLAGE/OVERFLOW。左:初始草稿参差不齐;中:循环逐 section 测量、每轮改一个,card 在 OVERFLOW/SPARSE 间穿过;右:每 section 读 FULL 且图够大后停。)

  • Paper2Video(视频生成器):输入 bundle → 输出三个用户面交付物(video.pptxvideo.mp4video_no_subtitles.mp4),中间文件(narration 音频、字幕 sidecar、slide 帧、duration 报告、visual-cue 计划、timeline、QA 报告)放 assets/ 目录。deck 创作委托 ppt-master 全流程(slide 设计当依赖而非本文 claim)。

    • 处理流程(五个媒体级要求 B1–B5):
      1. narration 与时长规划(B1):把共享 section narration 转成带 stable section id 的视频脚本;用户要目标时长时,planner 在 TTS 前估算、过长/过短则要求语义改写;渲染后 duration 报告比对实测与计划,小残差用有界语速计划修、大误差回 narration 重写(目标时长靠内容规划而非截最终视频);
      2. deck 创作委托 ppt-master(B2):把共享 paper assets + section 脚本 + 可选 visual-anchor 要求喂进该流程,导出的 PPTX 作渲染源(video.pptx 是用户面 artifact 而非一次性中间件);
      3. narration 对齐的视觉高亮(B3):脚本转成 visual-cue 需求文件,deck 流程给 narration 点名的可见对象(图面板、公式块、表格行、方法卡)附语义 anchor,cue resolver 合并脚本+词级时间+slide 几何+authored anchor 产 visual_cues.json(归一化几何,同一 cue 计划能在不同分辨率存活;默认风格 spotlight_laser,柔和高亮目标区域并标当前焦点);
      4. 音频/字幕/双 MP4(B3/B4):每段脚本合成一个 narration clip、从同一时间模型写字幕 sidecar;先渲 video_no_subtitles.mp4(保留 slide 帧+narration+高亮、无烧字幕),再把字幕层烧进 video.mp4,两者共享相同 slide 帧/音频对齐/高亮时间,唯一差别是是否烧字幕;写 timeline.json 作下游导航的 canonical sidecar(每条 entry 把 section/叙述块映射到音频窗口+字幕 cue+slide 帧+接受的 visual cue);
      5. 确定性媒体检查(B5):缺音频、字幕空/加倍、高亮框畸形/词级大小、timeline 漂移、空白帧、不安全时长修正,各由一个 mandatory package gate 抓(如 check_video_package.py 验证三 MP4 存在可放、有音频流、时长在容差内;字幕要求非空 sidecar + 原始无字幕版与最终字幕版都在 + 两者非字节相同;高亮要求 cue 覆盖+归一化几何+语义目标 id+时序在匹配音频段内,拒词级高亮框;时长控制要求 TTS rate plan 且拒不安全变速)。
    • 设计理由:好 slide 不等于可靠 paper video——deck 出了 slide 创作流程后,系统还得同步时间/声音/字幕/高亮/下游导航,所以 skill 的角色是把 deck + 共享 assets 变成可审计的媒体包而非又一个生成 claim。

    Paper2Video 概览
    Paper2Video 概览

    (对应原文 Figure 5:复用 Paper2Assets bundle → 规划 narration 与时长 → deck 创作委托 ppt-master → 合成对齐音频与字幕 → 渲染视觉注意 cue → 打包可编辑 deck + 字幕版/无字幕版视频。)

  • Paper2Blog(双语博客生成器):输入 bundle → 输出两个根交付物:中文文章(定位微信公众号体)+ 英文文章(定位 research blog 体);两文共享同样的事实/图/数字/claim/源链接,但为不同阅读习惯而写。

    • 处理流程(五个要求 C1–C5):
      1. 共享 evidence map(C1):从 bundle 建一份 evidence map(记录 paper 的 hook/problem/method 组件/main claims/量化结果/limitations/源链接/figure 角色),两语草稿都读它;硬事实(code link、DOI、venue、affiliation、acceptance 状态)缺失则省略而非猜测
      2. 语言特定大纲与语气(C2):两文分开写而非逐句互译;draft 前读语言特定编辑风格指南(中文走克制公众号体、必要英文术语保留并解释;英文走中性 research blog 体),语气在生成时通过风格指南+分离大纲控制(风格无法事后用确定性脚本可靠检查);
      3. 共享文章图集(C3):只选有助解释论文的图,同一选中集用于两语,每张图放在为其铺陈的段落旁——这不是第二轮图抽取,而是为文章用做的选中图复核(查图在 DOCX 缩放后可读、文章 caption 不与残留源 caption 冲突、图位不造成明显布局失衡);
      4. DOCX 装配与 bundle 契约(C4):assembler 写中英两文(固定文件名 + 嵌入图 + 匹配语种 caption + 源链接 + 编辑友好字体);固定根文件名是契约的一部分(下游 upload/zip/CMS/Paper2Reel 工具不必解析论文标题或非 ASCII 文件名即可找到文档);
      5. 版式当渲染产物对待(C5):assembler 与门像编辑看页面那样检查 DOCX——从文档内部结构读图 fit/分页/orphan tail,严格模式下还渲染页图检查近空白页/稀疏页/非末页大块底部留白;门直接读两个 Word 包(验存在/可读/够长/图嵌入而非链接/无占位符残留/字体声明含拉丁正文体+中文回退体),双语检查比对嵌入图数量·顺序·数字 claim·技术术语(抓“图只出现在一个语种版本”这类两文发散的具体失败)。
    • 设计理由:Paper2Blog 不是双语摘要器——它要产两篇编辑就绪、科学上一致但读感自然的文章,所以把“版式”也当一等交付物检查,而不只检查文字。

    Paper2Blog 流水线
    Paper2Blog 流水线

    (对应原文 Figure 7:复用 bundle → 建一份共享 evidence map → 选共享文章图集 → 写两份语言特定大纲与 DOCX → 跑严格 package gate;根交付物为中/英文章,大纲/预览/QA 报告留在可审计中间件目录。)

  • Paper2Reel(收敛与呈现层):输入三个生成器的完成交付物 → 输出一个自包含交互 viewer + 一份 alignment record(记录 poster section / slide 缩略图 / video 时间 / 字幕 / blog block 如何对齐)。原生 poster/slide/video/document 文件仍可下载,reel 在其上加一层 section 级阅读面。

    • 交互设计(2.5.1):viewer poster-first(海报是论文最紧凑的地图,首屏即生成的海报而非 dashboard 或 tab 报告);hover poster section 给即时反馈、双击开 section modal(标题区开全文 modal);section modal 是主阅读单元——左视频右博客、中间可拖分割条,视频 pane 用无字幕视频源播放(字幕来自 caption sidecar、由 viewer 的字幕 toggle 控制,避免双重字幕),slide 缩略图在视频下方、点击 seek 到对应时间,进度条直接 seek 用同一时间契约,博客 pane 显示匹配文章块并支持中英切换。
    • 内容对齐(2.5.2):load-bearing 对象是 alignment sidecar——每个 canonical section id 映射到对应 poster block、一个或多个 slide target、video 起止时间、字幕轨、slide 缩略图、blog block;viewer 读这份 sidecar 而非猜文件名/刮海报/从视频推时间。于是 poster block、video 片段、slide 缩略图、blog 段落成为同一 paper section 的不同视图。Paper2Reel 还用 bundle 契约处理不完整输入(用户只给 PDF/arXiv 链接/部分 bundle 时,先查缺哪些上游交付物、跑完整 Paper2Assets/Poster/Blog/Video 补齐再装配 viewer,保持全包 section id 与 asset path 一致)。
    • 质量门(2.5.3):Paper2Reel 当作交互式浏览器产物而非文件集合来验证。静态门查 viewer/alignment record/manifest/拷贝的 poster 资源/媒体目录/slide 帧/blog block/wordmark/下载包存在,拒陈旧 tabbed-viewer 标记、机器本地路径泄漏、备份文件、缺 poster 资源/section slide/section 片段/字幕 sidecar/中英 blog block/blog 图,并验 reel 用原始 pre-subtitle 视频作播放源。浏览器门用支持 range 的本地预览服务器 serve 包(video seeking 与 slide 缩略图跳转依赖 partial-content 响应),确认支持后在 headless 浏览器开 viewer,查 poster-first 加载、hover、section modal 开、标题 modal 开、分割条布局、字幕 toggle、slide 缩略图 seek、直接视频 seek、顶栏布局、下载、快捷键控制、blog 渲染;另有一 file-browser 门验同一 viewer 页也能在包目录完整时直接从磁盘打开。

    Paper2Reel 交互展示
    Paper2Reel 交互展示

    (对应原文 Figure 9:1. hover 一个 poster section 时该块高亮、邻块淡出;2. 双击该 section 打开同步 modal——左侧视频播放+字幕控制+slide 缩略图,顶部语言切换,右侧对齐的博客段落。)

2.3 算法 / 伪代码

原文未给出编号 Algorithm 块,但 Paper2Poster 的 measured-fill loop(分级填充循环) 是全文核心算法,原文 §2.2.2 以文字描述。下面是基于该描述转述的逻辑(非原文编号伪代码,标注以求诚实):

输入:精简海报草稿(每 section 仅 essential 文本 + 少量选中图,必有 Method 图);每 section 的备选 supplementary 段落( withheld,供 EMPTY 时补入)。

循环直到收敛或触发电路断路器:
  1. 在 headless 浏览器渲染当前海报页
  2. 对每个 section i,测量 fullRatio_i = h_content_i / h_card_i
     (h_content = 该 section 最低渲染元素底边,由 getBoundingClientRect 读出;
       h_card = 其 card 的内高)
  3. 把 fullRatio_i 量化为五类 verdict 之一,按下表选 remediation:
        EMPTY      (fullRatio < 0.70)  → 追加一段 withheld supplementary 段落,或把一个可选 section 提升进列
        SPARSE     (0.70 ~ 0.90)       → polish up:给现有散文加衬 / 放大 widget,直到内容够到 card 底
        FULL       (0.90 ~ 0.98)       → 目标带,不动
        SPILLAGE   (0.98 ~ 1.10)       → polish down:收紧散文直到重回带内
        OVERFLOW   (> 1.10)            → 丢一段 supplementary 段落或整个可选 section
  4. 同一轮内,对 Method 图单独跑 figure-fill 门:要求它至少在一轴上绘出 ≥90% 的 card;
     若不满足,按高度 cap 调图(图低于 cap 且下方留白 → 抬 cap 放大;列拥挤 → 削文本,图不缩过 floor)
  5. 每轮只改一个 off-target section(测量同时只返回该 section 的逐字源码,整页不进 context)
  6. 防振荡三机制:
     - 每个 move 的步长按测量报告的有符号像素 delta 定,而非猜
     - 拒绝对一个 section 重新施加已在该 section 上过冲的 move
     - on-disk round 计数器超阈值 → 电路断路器:发最优测量态、标 degraded、停
收敛判定(categorical fixed point):每个 section 都读 FULL  且  没有图触发 figure-fill 门
收敛后:单次 render-time pass 把每个欠满 card 的行间距撑向 98%(不动图、不撑高固定画布),
       一次性烘进海报,使 HTML / PDF / PNG / PowerPoint 显示同一填充布局。

关键设计点解读:之所以用离散类别而非连续优化,是因为海报填充带很窄、而一次离散文本编辑会让 section 远跳过带,连续 refine 会在太空与太满之间振荡几十轮;类别化让“下一步该做什么”由 verdict 单独决定、且终止是一个 categorical fixed point(而非学习分数的平台期),于是失败可诊断(每轮日志记哪个 move 施加于哪个 section),而非“agent 做了什么”的黑箱。loose gate(90%)是为了避开最后几个百分点的振荡高成本区,再用渲染期 expand 廉价补回视觉填充。

3. 关键结果

  • 主要发现
    • Reel(Claude Code)在美学三项子指标(Element / Engagement / Layout)上全列自动系统最佳,信息三项子指标(Low-level / Logic / Content)中两项最佳或并列最佳;美学 Overall 3.56,为全表最高,超作者自做海报 3.03 约 17.5%。
    • 逐篇 head-to-head win rate:Claude judge 下赢 74/100、GPT judge 下赢 95/100(对应非平局论文的 85% / 100%)。
    • 两个 Overall 均值(Aesthetic + Information)Claude Code 以 3.69 领先全表;三个 single-shot LLM(3.41–3.56)与 Codex 配置(3.47)构成紧密的第二梯队,均领先复现的 poster pipeline(3.06–3.26)。
    • 同一 skill 换 harness/模型仍强:Codex + gpt-5.5 跑同一套 skill 达美学 3.27(第二高),超所有 single-shot baseline 与作者参考,仅落后 Claude Code 配置约 0.3——证明 measured-fill loop 跨 harness/模型可迁移。
    • PaperQuiz 排序与美学近乎反向:P2P(满版竖排、几乎逐字搬论文散文)与 Paper2Poster tool(内容直接来自 benchmark 自身 QA 抽取)PaperQuiz 最高,但美学最低;作者海报相反(剪到几个 headline 结果、读得干净、美学好但 PaperQuiz 垫底);Reel 刻意居中——fill loop 填到目标密度而非塞满。
    • 视频/博客仅做 capability audit(表 2、表 3),未做量化质量评分
  • 证据强度:效应量清晰(美学 Δ0.53 vs 作者、Δ0.41 vs 最强 single-shot);100 篇 × 2 judge、逐篇 head-to-head 计 win rate;未报告置信区间或统计显著性检验。最支撑“fill loop 有价值”的是受控对照(见下),但作者同时承认该对照也改了 prompting、模型调用次数、inference budget,未隔离 fill loop 本身。
  • 最支撑结论的一条证据:受控对照 (i)——同一个 claude-opus-4.8,single-shot 一次性吐整张海报美学仅 2.92、Layout 2.97;包进 compose 步骤 + measured-fill loop 后(即 Claude Code 配置)美学 3.56、Layout 3.99,Layout 涨逾 1 分、美学涨 0.64。这是 fill loop 价值最直接的证据(尽管未完全隔离变量)。

3.1 关键结果图 / 表

Table 1(主表,markdown 重现;每个质量格为 Claude + GPT 两 judge 均值;见原文 Table 1 / 附录 D Table 5 的逐 judge 分解)

System 美学 Overall 信息 Overall Quiz·Detail % Quiz·Underst. % 交付(PPTX/Video/Blog)
Claude-4.8 Opus(single-shot) 2.92 3.91 69.86 93.67 ✗/✗/✗
GPT-5.5(single-shot) 3.15 3.97 70.89 94.25 ✗/✗/✗
Gemini-3.1 Pro(single-shot) 3.08 3.87 65.36 93.59 ✗/✗/✗
Paper2Poster tool(复现) 2.72 3.40 69.95 95.02 ✓/✗/✗
P2P(复现) 2.72 3.80 75.40 95.60 ✗/✗/✗
PosterGen(复现) 2.71 3.64 57.45 91.85 ✓/✗/✗
Reel(Codex) 3.27 3.67 55.55 92.01 ✓/✓/✓
Reel(Claude Code) 3.56 3.81 56.79 92.16 ✓/✓/✓
作者 ground-truth(人类参考) 3.03 3.60 54.73 91.40

重点解读:读这张表最该注意的是美学列与 Quiz 列的反向关系。P2P 的 Quiz Detail 75.40% 全场最高,但它满版竖排塞满逐字论文文本、美学 2.72 倒数;作者海报美学尚可(3.03)但 Quiz 两项都垫底(人把论文剪到几个 headline 结果)。Reel(Claude Code)美学 3.56 全场最高、信息 Overall 3.81 也最高,但 Quiz Detail 56.79% 仅略高于作者——这正是 fill loop“填到目标密度而非塞满”的直接体现:它在美学/信息综合上领先,代价是放弃了靠堆文本刷理解分。delivery 列(最右)是论文真正的卖点:只有 Reel 同时产出 PPTX+Video+Blog 三种可编辑产物。

Figure 11 单篇海报横向对比(同一篇 benchmark 论文 “A Context-Integrated Transformer-Based Neural Network for Auction Design”,同一源 PDF 渲染)

人类作者海报
人类作者海报
ResearchStudio-Reel 海报
ResearchStudio-Reel 海报
Claude-4.8 Opus single-shot 海报
Claude-4.8 Opus single-shot 海报

重点解读:三张图直观说明了 Table 1 的美学差距从哪来。single-shot(最下图)能找回标题/贡献/headline 数字并选合理的图(所以 PaperQuiz 与 Reel 接近),但一次性吐整张 A0 时退回刚性网格——列不等宽、长段无差异文本、图不顾留白地放置,在海报尺度上读起来扁平。Reel(中图)的 compose-then-fill 循环则平衡列密度、把关键结果提升为 typed widget,这正是 Layout 与美学 margin 的来源。人类海报(上图)常加论文里没有的 bespoke 方法/总览示意图来承叙事——这是系统只用论文已有图、无法复现的维度(论文诚实承认这一不公平点)。

4. 批判性评估与价值

4.1 批判性评估

评估:论文工程扎实、自我诚实度高,但核心 claim 与被严格评估的部分存在错位——它真正想卖的是“native-editable + experience-level convergence”这个工作区范式,可量化的却只有海报美学分这一个 proxy。

评估口径只覆盖海报,卖点缺乏量化证据。 视频、博客只有 capability audit(表 2/3 列“能产出哪些对象”),没有质量评分、没有人工编辑成本测量、没有“section 级导航是否真的比开三个文件更帮人理解论文”的证据。也就是说,论文用海报美学分(一个侧面 proxy)证明了系统的一个角,却把 native editability 与 convergence 的收益几乎全部留给 future work(论文自己在 Future Work 与附录 A 都承认)。读者若只信被严格评估的部分,这篇更接近“一个很强的 agentic 海报生成器 + 一个未充分评估的多产物工程”。

美学分是 VLM proxy,且两个 judge 同源偏好风险未排除。 论文诚实到值得肯定——它明确写“aesthetic numbers should be read as a proxy signal rather than proof that our posters are genuinely better-looking”。但值得进一步追问:两个 judge 都是前沿大模型(claude-opus-4.8、gpt-5.5),它们可能系统性地偏好某种“LLM 友好”的版式(规整网格、特定配色与留白),而这种偏好未必等于真实会议观众或人类设计师的判断。一个更强的人证(third-party human rater across all three artifacts)论文承认留作 future work,目前缺位。

PaperQuiz 反向排序暴露目标冲突,而 fill loop 优化的是密度不是理解。 Quiz 排序几乎与美学相反,说明“好看”与“利于理解”在此任务上存在张力。measured-fill loop 优化的是一个几何密度目标(section 填到 90–98%),而非读者真正吸收了多少——论文诚实地指出“the honest next step is to close the loop on a controlled human reading-and-recall signal”。这意味着当前“美学最佳”不直接等于“传播效果最佳”,一个更密但更丑的海报在让人记住论文这件事上未必更差。

受控对照未隔离变量,baseline 设置有结构性偏向。 受控对照 (i) 同时改了 prompting、模型调用次数、inference budget,Δ0.64(美学)不能干净地归因于 fill loop——论文自己也声明这一点。single-shot baseline 用统一 prompt(附录 G)要求“一次性吐整张 A0 HTML”,这本身对 single-shot 不利,而恰恰是论文要论证的命题(agentic loop > single-shot),存在一定自我印证的循环。复现的三个 poster pipeline 标注“best efforts”,其中 P2P 与 Paper2Poster tool 的 PaperQuiz 偏高部分源于它们直接基于 benchmark 自身的 QA 抽取组装(接近 by construction),对照并不完全干净。

与作者 ground-truth 比较不完全公平(论文已诚实标注)。 作者海报常加论文里没有的 bespoke 视觉(方法/总览示意图、解释性图标)来承叙事,而 pipeline 只用论文实际出现的图、不臆造——所以系统在“原创视觉”这个维度上注定不可能追平作者。这个限制论文说得清楚,但读者解读“赢 74/95 篇”时应记得:比的是同一源 PDF 能产出的东西,不含人类设计师的外加创作。

设计假设的领域依赖。 系统在 ML/CV/NLP venue 上校准(版式、图惯例、claim-evidence DAG 相对统一),跨域(biomed/physics/design-heavy)未测,每个 skill 的 move catalogue 可能要扩展。底层原语(PDF 抽取、HTML 布局、DOCX 渲染、Edge TTS)领域无关,“skills-as-architecture 模式”预计可泛化,但每个新 venue 族需端到端验证。

正面(值得给的具体肯定):工程质量高且透明——categorical fixed point 带来的可诊断性、on-disk 电路断路器、幂等可单独重跑的 stage、deterministic release gate 都是扎实的工程实践;per-stage token/time profile(表 4,全流程约 89 分钟、2.6M input / 276K output tokens)透明公开;MIT 开源(aka.ms/ResearchStudio);对 proxy 边界与局限的诚实标注在全论文随处可见,这一点显著高于一般系统论文。

综合可信度:中 —— 海报部分的对照实验扎实但 proxy-bound(VLM judge、未隔离变量、未做人评),真正的差异化卖点(native editability + convergence)缺乏量化证据,主要靠工程质量与设计论证的说服力支撑;但作为系统论文其工程完成度与可复现性是强的。

4.2 Limitations 与复现性

  • 论文自承:评估 proxy-bound(美学 vs Quiz 张力、均非真实阅读吸收);仅海报量化、视频博客未评;跨域未测;不能生成 bespoke 图;五种反复 failure mode(L1 图清洗残留 / L2 fill loop 不收敛 / L3 slide-narration 指代漂移 / L4 双语博客漂移 / L5 TTS 声音不匹配)。
  • 读者发现:两 VLM judge 同源偏好风险未排除;editability 与 convergence 的收益(核心卖点)未量化;受控对照未隔离 fill loop 变量;single-shot baseline 设置存在结构性自我印证倾向。
  • 复现性:代码 (MIT,aka.ms/ResearchStudio,每 skill 有 requirements.txt + SKILL.md 作真相源) · 数据 (Paper2Poster benchmark 公开 100 篇) · 超参 (per-skill 依赖 + SKILL.md) · 模型 claude-opus-4.8 / gpt-5.5,narration 用 Edge TTS 免凭证;作者自报 run 经 Copilot API 代理而非厂商一方端点。

4.3 可复用与后续

  • 可借鉴:categorical verdict + fixed-point 收敛 loop(可迁移到任何“离散编辑要收敛到目标区间”的版式/排版任务);single-owner 共享抽取避免下游重复处理;artifact-specific release gate 作可测试 delivery contract 的范式;从 live DOM 重建 native shape 的 PowerPoint 桥(含原生公式对象)。
  • 引用场景:做 paper-to-X 生成系统、agent skill 编排、文档版式自动化、多产物统一交付时引用;BibTeX key 候选 Xiao2026ResearchStudioReel
  • 下一步:[ ] 若要复用其海报 loop,先用目标受众(非 VLM)做一轮人评验证 judge 偏好是否一致;[ ] 若走视频/博客方向,需自建质量评估协议(论文未给)。

Verdict

推荐深读(对做文档生成 / agent skill 编排 / 多产物自动化交付的人)—— 它是“把 agent skill 当工程范式来组织多产物生成”的一个高质量、可复现、诚实标注边界的范例,measured-fill loop 的 categorical 收敛设计与 release-gate-as-contract 值得直接借鉴。若只关心海报生成质量本身,选读 §2.2(fill loop)+ §3(实验与分析)即可,视频/博客/Reel 可按需扫读。

作者:lusca | 版本:lusca-paper-read v1.10.1 | 出处:https://github.com/yjmm10/lusca-skill/tree/main/skills/lusca-paper-read

posted @ 2026-07-22 09:35  Lusca2026  阅读(4)  评论(0)    收藏  举报