论文
端到端系统
背景
Spark-to-Paper: End-to-End Research Paper Generation as a Composable Skill
Spark-to-Paper:把端到端论文生成拆成可组合的 Claude Code 技能
Zhuoyang Qian, Biao Wu, Yiran Wang, et al. · 多机构合作 · arXiv · 2026-08 · 被引 0
一句话 把"从一句话想法到编译好的 PDF"整个流程实现为 Claude Code 里的 1 个 orchestrator + 13 个可组合 skill,不需要独立 agent 平台;8 个受控题目上自测得到 99.5% 引用有效率、96.4% 图元素可编辑率,单篇平均 11.9M tokens、$8.1、3.2 小时。
这是什么 AI Scientist、Agent Laboratory 这类端到端科研系统通常是独立的多 agent 平台,自带编排服务。这篇工作反其道而行:整个论文生成流水线就是一组 Claude Code skills(Markdown 指令 + 确定性脚本),共享一个项目目录,靠文件系统里的中间产物(blueprint、BibTeX、LaTeX 稿、图)在 skill 之间传递状态。设计上把"需要判断的事"交给模型(论证组织、文献取舍、证据是否支撑结论),把"有明确规则的事"交给确定性脚本(引用校验、LaTeX 编译、结构检查、按数据画图),每个 stage 过完都有 deterministic gate 把关。
系统区分两种输入模式:Proposal Mode(没有实测结果,结果表必须留空,不许编数字)和 Data-Aware Mode(有实测数据,定量表述必须有数据支撑),实验执行(Stage 8)负责把两者接起来——先写出需要什么证据,跑完实验再回头修正摘要/引言/结论里的 claim。论文还命名了一个失败模式 Self-Refutation Loop:系统反复做实验、反复判定证据不足、又不肯放弃原假设;对策是把实验-批判-修订循环封顶 7 轮,超限就产出 failure report 换题重跑,而不是硬把失败写成一篇"成功"的论文。
系统总览:Stage 0 根据是否有实测数据选择 Proposal / Data-Aware 模式;Stage 1-7(Plan→Cite→Write→Refine→Review→Figure→Assemble)是每次必跑的核心流水线,每个 stage 后有 deterministic gate;下方是按需触发的辅助 skill(数据转表图、raster 转可编辑矢量、自动跑实验)和四种质检机制。 机制与做法 流水线:Stage 0-8 + 三层质检
Stage 0 路由输入(短想法可先经 idea2story 扩成 proposal,并选定 integrity mode);Stage 1-7 依次是 Plan(blueprint)、Cite(经 DOI/arXiv 元数据核验的 BibTeX)、Write、Refine、Review、Figure、Assemble,每个 stage 后跑确定性检查;Stage 8 在有代码/数据时真跑实验并回写结果。质检分三层:deterministic gates(可机械验证的性质)、Self-Review(局部编辑后的一致性修复)、Adversarial Review(多个隔离视角审稿,每条 issue 必须引用具体段落,再从"问题是否真实存在/是否已被解决/是否超出范围"三个方向反驳过滤,反驳不掉的才返回修订)。消融显示这一叠加把注入的 36 条伪造 claim 的检出率从单遍生成的 14% 提到 92%,adversarial review 精度 74%。
可编辑图:按角色分两条路
实验结果图不走图像生成模型,直接从实测数据写 plotting 代码出矢量 PDF,保证数字和数据绑定。方法图/架构图则先用图像生成模型出一张 raster 当"视觉规格",再用 coding assistant 把它重建成 HTML(可编辑的文本、形状、连线),渲染后与原图迭代比对收敛,最后导出矢量 PDF;重建失败就回退到 raster。这条路线让他们报出 96.4% 的图元素可编辑率,对比之下 AI Scientist 系列公开论文的图基本是 0% 可编辑。
关键结果 8 个预注册题目上:引用有效率 99.5%(384 条引用中解析成功,[98.4, 100]),对比其审计的 AI Scientist 93%、AI Scientist-v2 91%、Agent Laboratory 96%、同底座单遍生成 81%。 图元素可编辑率 96.4%(约 1900 个 ground-truth 图元素),先前系统公开论文基本为 0-3%。 伪造检出消融(36 条 seeded probes,3 题):单遍 14% → 只加 gates 69% → +self-review 81% → +adversarial review 92%;gates 是最大开销项(+8.1M tokens / +$5.3),后两层增量小。 成本:单篇平均 11.9M tokens、$8.1、3.2 小时;单遍基线 $0.66、16 分钟但引用有效率掉到 81%。 Self-Refutation Loop 封顶 7 轮,超限产出 failure report 而非强行成稿;失败轨迹作为研究产出保留。 实证核查
扎实 代码真实开源且与论文描述一致,repo 有 7 篇端到端生成的展示论文;主要数字全部是自测(8 个题目),与先前系统的对比是审计对方公开产物而非同条件重跑——论文对这些局限倒是写得很坦白。
系统由 13 个可组合 skill 组成,作为 Claude Code 插件运行,无需独立 agent 平台。
GitHub repo Spark-To-Paper-Skills/spark-to-paper-skills(MIT,841 stars,2026-06 创建、2026-08 仍在更新)的 skills/ 目录确有 ts-paper orchestrator + 13 个 skill(ts-paper-plan/cite/write/refine/review/figure/latex/data/experiment、ts-idea2story、ts-figure-optimize、ts-figure-svg、ts-kg-build),且有 .claude-plugin/plugin.json 插件结构,与论文描述一致。docs/showcase/ 有 7 篇跨 6 个领域的生成论文样例。
引用有效率 99.5%、图可编辑率 96.4%,优于 AI Scientist 等先前系统。
对比表(source/sections/evaluation.tex tab:main_results)中先前系统的数字是审计其公开发布的论文产物得来,作者明确写了不重跑、不对齐 backbone/题目/定价;自身数字来自 8 个自选题目的自测运行,无第三方复现报告。数字本身给了置信区间和分母(384 条引用、约 1900 个图元素),方法论披露算诚实,但量级上属于小样本自评。
"Across eight controlled research topics…"(受控评测)。
细看正文有个耐人寻味的细节:showcase 统计图的 caption 写的是"self-reported by the system's maintainers, not an independent measurement"——论文用第三人称称呼"该项目的维护者",加上这套系统本身就是论文生成器,这份稿件很可能有相当部分是系统自产(dogfooding)。repo issues 只有 1 条(安装文档问题),暂无复现相关的公开讨论;上过 HF Daily Papers #1(2026-08-13),但热度不等于验证。
与我们方向的关系 对课题组最有用的不是它的评测数字,而是模块拆分方式:plan/cite/write/refine/review/figure/assemble/experiment 各成一个 skill、靠共享项目目录传状态、每个 stage 后跑确定性 gate——这套"模型管判断、脚本管校验"的分工可以直接抄到自己的写作流水线上。Proposal Mode / Data-Aware Mode 的区分(没数据就留空、有数据才许写数字)是防伪造的最简单机制,成本极低。可编辑图那条"图像模型出 raster 当视觉规格 → 代码重建 HTML/SVG → 迭代比对 → 导出矢量"的路线,以及 Self-Refutation Loop 的 7 轮封顶 + failure report,都是可以单独借鉴的工程件。注意它的科学发现能力没有被认真评测(评的是引用、图、伪造检出这些工件质量),定位就是写作流水线而非 AI Scientist 的替代。
阅读笔记 论文自己承认与先前系统的对比不是同条件;消融的成本增量只在 3 个题目上测。repo 的 v1.2.0 引入了论文里没细写的 ts-figure-svg(基于 PaperBanana 渲染 + SVG 几何审计),说明代码比论文版本走得更靠前。
材料清单 TeX 源码 已存档:Raw/spark-to-paper/source/
同类条目