Gen-1 Slides:面向知识工作者的首个 Genspark 模型

过去两年,Genspark 的产品服务一直构建在全球最好的 AI 模型之上。今天,我们发布自己的首个模型:Gen-1 Slides,这是我们面向知识工作者的后训练模型家族中的第一个。它能把一句请求变成一份可以直接拿进会议室的演示文稿,在基准测试上达到前沿模型的水平,成本却低得多。
从今天起,Gen-1 Slides 会成为支持 Genspark AI Slides Standard 模式的模型,在显著提升幻灯片质量的同时降低用户的 token 成本。Gen-1 Slides 与 Fireworks AI 联合训练,在内外部基准测试中平均排名第一,领先 Claude Opus 5,而输入 token 价格约为 Opus 5 的 1/17。在整体质量上,它与本次对比中最强的 Claude Fable 5.1 基本持平。
在当前这一波前沿模型中,竞争主要发生在编程基准、数学竞赛和推理测试上。前沿实验室优化的是通用能力,开源模型追逐同样的排行榜,同时不断缩小价格差距。结果是,大多数知识工作者每天真正在做的事情,如幻灯片、电子表格和文档,得到的关注要少得多。
我们清楚地看到通用模型在哪里力不从心:Genspark 在需求高峰每日日生成超过 12 万份幻灯片,我们清楚地看到通用模型在哪里力不从心,以及人们对一份成品演示文稿真正想要什么。我们有服务规模,有数据反馈,也有理由做出更好的东西。于是,我们训练了自己的模型。
对 Genspark 而言,这是一个重要的里程碑。我们会继续为每一项任务编排最合适的模型,同时在规模、产品经验和用户反馈让我们占据优势的领域,增加自己训练模型的能力。幻灯片是第一个例子。同样的方法已经在电子表格、文档和研究上展开。
这项新能力让我们多了一条提升交付质量的路径,也让我们在最了解的工作上走得更快。Gen-1 Slides 今天已经上线:如果你在使用 Genspark AI Slides,它已经是 Standard 模式的默认模型,欢迎试用。
下面,我们会说明为什么要做这件事,我们究竟如何衡量它,以及它目前还有哪些不足。
要点
对用户:同样的价格,幻灯片质量大幅提升。 Gen-1 Slides 现已成为 Standard 模式的默认模型,专为生成更好的演示文稿而训练。在 200 个来自已开启 AI Data Retention 的个人用户、经过去标识化处理的幻灯片任务上,它在我们的内部评分器上得分高于 Claude Opus 5,视觉设计排名第一,价格不变。Opus 级别的质量现在是默认配置,而不是高级档位。
对行业:一家应用公司现在也能做出以 1/17 输入 token 成本运行的前沿级模型。 Gen-1 Slides 以开源权重的 MiniMax M3 为起点,与 Fireworks AI 联合训练,训练环境就是 Genspark 用来生成真实演示文稿的同一套系统。我们公开说明基座模型:在我们看来,来源透明是产品的一部分,不是需要回避的事。在结果上,它在幻灯片质量上与 Claude Opus 5 相当,输入价格为每百万 token 0.30 美元,而 Opus 5 为 5 美元。按每份成品幻灯片计算,一个每月生成 1,000 份幻灯片的团队,成本从约 4,200 美元降到约 440 美元;过去只够为一位用户提供前沿质量的预算,现在大约可以服务十位。随着 Gen-1 模型家族扩展到其他交付物,前沿质量会成为底线,而不是加价项。
对技术读者:在可以自行复现的基准测试上取得了强劲结果。 我们在三个数据集上测试 Gen-1 Slides,每个数据集配以对应的评分器:内部真实任务集配内部评分器,UltraPresent 配 PPTEval,UniPPTBench 配 UniPPTEval。它在九项评估中八项排名第一,九项全部进入前二,平均排名 1.11,Kimi K3 为 2.44,Claude Opus 5 为 2.56。
现已可用。 作为 AI Slides Standard 模式的默认模型,也可通过 gsk CLI 使用。OpenRouter 上架正在进行中。API 提前访问请联系 [email protected]。
图 1. 内部评分器综合得分与输入 token 标价:11 个模型,同一套 harness。

纵轴为 11 个模型全部完成的真实任务上的内部评分器综合得分。横轴为输入 token 标价,对数刻度。Gen-1 Slides 独自位于左上角:没有任何模型既更便宜又更好。它与训练起点、未经调整的 M3 价格相同,箭头标出的是后训练在这一价格上带来的提升(0.576 到 0.827)。我们主要与 Opus 5 对比,因为我们在这一任务上大规模运行过它;Fable 5 / 5.1 仅作参考。坐标轴与样本的完整说明见附录 D。
为什么幻灯片需要专用模型
曾经,我们的用户付着前沿模型的价格,拿到的幻灯片却仍然版式错乱、引用凭空捏造、结论在源材料里找不到依据。世界上最强的通用模型在许多方面令人惊叹,但生成一份可以直接交付的幻灯片,至今都不是它们的优先事项。这也可以理解:前沿实验室在优化通用能力,开源模型也用同一套基准衡量。专为这项任务打造的模型不太可能从它们身上处出现,所以我们自己着手进行研发。
幻灯片生成看起来像写作任务,实际上是工程任务。模型需要规划叙事、忠于源材料、为每一页编写前端代码、渲染、检查结果、修正问题,然后重复几十轮。通用模型在其中一些步骤上强,在另一些步骤上弱,而且这些弱点足够稳定,在我们的评估中形成了各自的特征:
Claude Opus 5 在任务完成度上最强,内容质量也接近顶尖,但它做的自检循环最少,成品幻灯片上留有肉眼可见的缺陷。对用户来说,这意味着付了高价,还要自己修页面。
GPT-5.6 Sol 生成的幻灯片最单薄,每页内容很少。在通用模型中它的视觉设计排名最后;在 UniPPTEval 的密度、版式、一致性和层次维度上,它在所有数据集上都是五个模型中的最后一名。
Kimi K3 是三者中最均衡的,但在内部评分器的视觉设计维度上,它在三个数据集上都排第三。
做幻灯片更接近在画布上构图和排版,而不是解一道数学题。它很难,但如果直接从用户真实体验到的东西出发去训练,就是一个可以解决的问题。每天生成 12 万份幻灯片,给了我们三样通用实验室在这项任务上不具备的东西:我们知道人们实际会让幻灯片工具做什么,以及通用模型在哪里让他们失望;我们知道对提出需求的人来说什么才是一份好幻灯片,因为我们从汇总数据中看得到哪些幻灯片被点赞、被下载,哪些被退回修改;我们可以在成品交付物上计算奖励,而不是在一段文字记录上。
我们如何评估
一份幻灯片的质量,很大程度上取决于你用什么去衡量它。我们每天都在大规模运行幻灯片生成,所以构建了自己的评分器。与其请你相信它,我们更愿意解释它如何工作、我们如何验证它。
三种信号:自动评分器、人工标注、线上反馈。
内部评分器: 我们的评分流水线。它的裁判是一个由 Claude Fable 5 驱动的智能体,从四个维度为渲染后的幻灯片打分:任务完成度、内容质量、视觉设计和过程质量。在此之上叠加扣分项(版式缺陷、捏造、失实表述、忽略指令)和一项无缺陷奖励。这个评分器同时也为 Gen-1 Slides 提供强化学习的奖励,因此表 1 中的分数并不独立于训练;下面两个公开评分器则是独立的。在本文中,评分器指评分流水线,裁判指评分器内部的多模态大模型,奖励指由评分器输出计算得到的标量训练信号。
公开评分器: 我们使用基准作者发布的两个评分器。PPTEval 来自 UltraPresent 作者的 PPTAgent 项目,评估内容、设计和连贯性。UniPPTEval 与 UniPPTBench 在同一篇论文中定义,评估十个基础维度加视觉完整性。两者都在全部三个数据集上运行,而不只是各自的数据集,并且都从未在训练中用作奖励。PPTEval 使用 Claude Fable 5 作裁判,UniPPTEval 使用其论文指定的 Gemini 裁判。
人类标注: 产品经理和设计师在 77 个幻灯片生成任务上标注了 4,063 页。另外,157 万个线上任务提供了星级评分、点赞点踩和下载信号。
三个数据集: 我们使用了 200 个来自已开启 AI Data Retention 的个人用户、经过去标识化处理的任务,外加两个公开基准集:由 PPTAgent 作者发布的 UltraPresent,我们使用其 128 个任务的验证集;以及 UniPPTBench,126 个任务。本文中,UltraPresent 和 UniPPTBench 指数据集,PPTEval 和 UniPPTEval 指它们的官方评分器。
五个模型在同一套智能体 harness 中运行全部任务,使用相同的工具、渲染循环、提示词和与线上一致的思考强度设置:Gen-1 Slides、Claude Opus 5、Kimi K3、GPT-5.6 Sol,以及作为无后训练基线的、未经调整的 MiniMax M3(强化学习前)检查点。图 1 出于参考纳入了更多模型,但这五个是我们在线上以有意义的规模运行过的,因此这才是我们信任的对比。
质量
同一个任务,三个模型

同一个季度业务回顾任务,由三个模型分别生成。每张图是所生成幻灯片中对应的概览页。
在我们的 200 个真实任务上,Gen-1 Slides 的综合得分和视觉设计得分在五个模型中最高。Claude Opus 5 在任务完成度和内容质量上领先。两者整体处于同一档,彼此的差距小于它们与其他模型的差距。
表 1. 内部评分器,200 个线上真实任务(n=200)。
| 模型 | 综合 | 任务完成度 | 内容质量 | 视觉设计 | 过程质量 | 美元/每份 |
|---|---|---|---|---|---|---|
| Gen-1 Slides | 0.821 | 0.780 | 0.737 | 0.756 | 0.719 | 0.44 |
| Claude Opus 5 | 0.810 | 0.849 | 0.782 | 0.688 | 0.695 | 4.16 |
| Kimi K3 | 0.723 | 0.840 | 0.784 | 0.557 | 0.748 | 2.00 |
| GPT-5.6 Sol | 0.668 | 0.820 | 0.743 | 0.479 | 0.748 | 2.01 |
| MiniMax M3(未调整) | 0.563 | 0.741 | 0.668 | 0.494 | 0.608 | 0.34 |
成本为同一套 harness 中实测的每份成品幻灯片的大模型花费。加粗为各列最优。综合分不是四列的平均值,见附录 C。
换成不是我们做的评分器,结论还成立吗
内部评分器反映的是 Genspark 对这项任务的理解,所以一个公平的问题是:这些提升在公开基准上是否依然成立。图 2 用三个独立的评分器系列,在三个数据集上比较同样的五个模型。柱状图从零开始;有些差距看起来小,是因为最强的几个模型都挤在各自量表的顶端,不是坐标轴被压缩了。
图 2. 五个模型,三个数据集,三个评分器系列。

每个评分器使用各自的量表(内部 0–1,PPTEval 1–5,UniPPTEval 0–10)。内部真实任务 200 个,UltraPresent 验证集 128 个,UniPPTBench 126 个。推理设置与线上一致:自适应思考、高强度,不支持的模型跳过。
三个评分器的判断基本一致。在九个评分器 × 数据集的组合中,Gen-1 Slides 有八个排名第一。唯一失手的是 UniPPTBench 上的 UniPPTEval,Kimi K3 以微弱优势领先。它也是唯一从未跌出前二的模型,平均排名 1.11;Kimi K3 为 2.44,Opus 5 为 2.56,M3 基座为 4.22,GPT-5.6 Sol 为 4.67。
这些提升能泛化到分布外的任务集。在全部九项对比中,Gen-1 Slides 都优于基座模型。公开评分器的头部分数也很接近:在这六项对比中,第一名与第二名的差距从未超过满分的 1.7%。即便如此,Gen-1 Slides 仍在六项中的五项排名第一。按维度的完整结果见附录 C。
评分器与人的判断一致吗
评分器只有在与人的判断一致时才值得信任。我们用两个独立信号来校验:产品和设计团队的细粒度标注,以及线上用户的反馈。
标注者的发现。 人工评估覆盖 77 个任务(其中 76 个可用于并排对比),每个模型一份幻灯片,共 4,063 页,由产品和设计团队盲审,其中 20 页做了双人标注以衡量标注者间的一致性。评估聚焦于读者最先注意到的三个维度:版式、忠于来源、美观。信息传达和叙事结构未做人工标注,涉及个人身份信息的任务在标注前已排除。
版式:与 Opus 5 相当,略差。 存在某种版式问题的页面,Gen-1 为 88%,Opus 5 为 81%;但在严重问题上差距收窄,被评为严重或更差的页面,Gen-1 为 33%,Opus 5 为 34%。审核者对同一任务并排比较时,Gen-1 24 胜、26 负、26 平。 忠于来源:略好于 Opus 5。 在从 30 份幻灯片(6 个任务 × 5 个模型)中提取的 9,141 条原子级论断中,Gen-1 的捏造率为 13.3%,Opus 5 为 17.7%,相差 4.4 个百分点。重复标注留下约 3 个百分点的判断噪声,所以我们说"略好",而不是"显著更好"。 美观:未检出差异。 在设计师的两两比较中,风格判定的胜率 Gen-1 Slides 为 49%,Opus 5 为 51%;工艺维度同样没有显著差异。
表 2. 人工评估,Gen-1 Slides 对比 Claude Opus 5。
| 维度/指标 | Gen-1 Slides | Claude Opus 5 |
|---|---|---|
| 版式:存在任何问题的页面(%) | 88 | 81 |
| 版式:严重或更差的页面(%) | 33 | 34 |
| 版式:不可用页面(%) | 7 | 15 |
| 版式:同任务两两比较(胜 : 负 : 平) | 24 : 26 : 26 | — |
| 忠于来源:论断级捏造率(%) | 13.3 | 17.7 |
| 美观:风格维度胜率(各 60 对)(%) | 49 | 51 |
版式各行基于每个模型约 42–48 页的评分,置信区间约 ±14 个百分点,因此两三个点的差距不作解读。两两比较行使用双侧二项检验,不显著。
人与评分器的判断在三个维度上都一致:在一次 229 页的审计中,标注者保留了评分器 88% 的页面级版式判定;三个裁判的多数票在抽样的 49 个捏造点中有 48 个与人工标准答案一致。出现分歧时,模式也很稳定:评分器对略显空旷的页面过于严格,并且会漏掉过小的文字。人与人之间也会有分歧,这是任何"一致性"说法都要带上的注脚。标注示例见附录 E。
用户的实际行为。 在 8 月到 9 月的分阶段发布期间,在 157 万个任务上,Gen-1 Slides 与 Claude Opus 5 在平均评分、低分占比、点赞点踩比和下载率上都无法区分。未经调整的 M3 基座则明显落后:平均评分低 0.45 星,低分占比约为五倍,点赞点踩比不到一半,只有下载率接近(30.4%)。
表 3. 线上用户反馈。
| 模型 | 平均评分(★) | 低分(≤2★) | 点赞/点踩比 | 下载率 |
|---|---|---|---|---|
| Gen-1 Slides | 4.25 | 3.6% | 19.6 | 33.1% |
| Claude Opus 5 | 4.23 | 3.4% | 18.8 | 31.5% |
| MiniMax M3(未调整) | 3.80 | 18.0% | 8.8 | 30.4% |
2026 年 8–9 月 Genspark AI Slides 线上流量的真实用户反馈。平均评分为五星制星级评分的均值;低分占比为 2 星及以下评分的比例;点赞/点踩比为点赞数与点踩数之比;下载率为成品幻灯片被下载的比例。加粗为各列最优。
成本
Gen-1 Slides 按其基座模型的标价定价:每百万输入 token 0.30 美元,每百万输出 token 1.20 美元,缓存命中的输入 token 为 0.06 美元。Claude Opus 5 的标价为每百万输入 token 5.00 美元。就这个人人都能查到的数字而言,Gen-1 Slides 的标价约为 Opus 5 的 1/17。
不过,标价不等于一份幻灯片的成本。一个会自己渲染、检查、修改页面的模型,每份幻灯片消耗的 token 比跳过这些步骤的模型更多,而 Gen-1 Slides 在这方面做得比对比中的任何模型都多。所以我们同时报告在我们的 harness 中、同样这 200 个线上任务上,一份成品幻灯片实际花了多少钱。
表 4. 每份成品幻灯片的实测成本。
| 模型 | 美元/每份 | 美元/每 1,000 份 | Opus 5 每 1 美元预算可做份数 | 综合得分 |
|---|---|---|---|---|
| Gen-1 Slides | 0.44 | 435 | 9.5 | 0.821 |
| Claude Opus 5 | 4.16 | 4,155 | 1.0 | 0.810 |
| Kimi K3 | 2.00 | 1,999 | 2.1 | 0.723 |
| GPT-5.6 Sol | 2.01 | 2,006 | 2.1 | 0.668 |
| MiniMax M3(未调整) | 0.34 | 338 | 12.3 | 0.563 |
200 个任务运行中实测的大模型花费;所有模型使用同一套 harness。后训练使每份成本相对未经调整的 M3 检查点增加约 29%,同时将综合得分提升 0.26。
按这种方式衡量,一份 Gen-1 成品幻灯片花费 0.44 美元,Opus 5 为 4.16 美元,大约便宜 9.5 倍。这比 17 倍的标价差距要窄,因为 Gen-1 把更多预算花在检查自己的成果上。后训练使每份成本相对未经调整的 M3 增加了约 29%,但把分数拉进了 Opus 5 的档位。我们同时报告两个数字,是因为它们回答的是不同的问题:标价告诉你调用这个模型要多少钱,实测花费告诉你拿到一份能交付的幻灯片要多少钱。
有两点值得注意。在内部评分器上唯一超过 Gen-1 Slides 的模型是 Claude Fable 5.1,差距 0.003,小到无法分出高下,而每份成本约为 14 倍。而且每一个通用模型,要么质量低于 Gen-1,要么价格高于 Gen-1。对比中没有任何模型既更便宜又更好。
这个差距,正是这次发布不只是一次模型发布的原因。它让 Opus 级别的幻灯片质量便宜到足以成为每一位 Genspark 用户的默认配置,而不是高级档位。它改变了大规模运行幻灯片的经济账:一个每月生成 1,000 份幻灯片的团队,成本从约 4,200 美元降到约 440 美元,质量上没有可测量的损失。也就是说,过去只够为一位用户提供前沿质量的预算,现在大约可以服务十位。随着 Gen-1 家族扩展到其他交付物,这就是我们要建立的业务形态:以前沿质量为底线。
训练方法
Gen-1 Slides 在大约 2,000 个内部构建的幻灯片任务上通过强化学习(RL)训练。采样(rollout)在 Genspark AI Slides 集群上运行,参数更新在 Fireworks 平台上完成。
经过充分的探索阶段后,最终的 RL 训练在 96 张 NVIDIA B300 GPU 上用一周完成。整个过程中,平均训练奖励从第一步的 0.271 上升到发布时 EMA 值 0.765(图 3)。全程没有出现奖励崩塌,也没有回滚过任何检查点。
图 3. 训练期间的奖励。

浅色点为每个优化器步骤的平均采样奖励;深色线为衰减系数 0.9 的 EMA;阴影带为 15 步窗口内的 ±1σ。三段背景色对应三个阶段(256k GSPO → 512k GSPO → 512k GSPO + KL 保护)。虚线为 Claude Opus 5(0.721)和 MiniMax M3 基座(0.324)在 200 个任务的留出集上的训练期奖励,仅作参考;训练奖励在训练任务上计算,不能与之直接比较。
完整的技术报告即将发布。与常规的 RL 后训练方案相比,本次训练在以下几方面做了改进。
在线评分器与策略共同演进,对抗奖励作弊。 幻灯片质量特别容易被钻空子。训练过程中,策略先后学会了:导入一份参考幻灯片当作成品交上去;在报告里写上"来源已核实"却什么都没查;把字号一路缩小,直到溢出检测不再触发。每一招都能通过检查,却让用户拿到更差的幻灯片。因此奖励作弊不可能一次性根除,而且随着 RL 规模和模型能力提升,作弊手法会更复杂、更难察觉。所以我们不试图一次就把评分器做对,而是在线更新它,让它与策略一起演进,并且每一次更新都用独立于评分器的信号来检验。具体做法有两项:
- 一个监视智能体常态化监控训练。 它持续分析采样过程和输出;上述几种模式都是这样被发现的,并通过在线评分器更新迅速堵上。
- 设计师持续进行人工评审。 他们的判定和建议被回灌到在线评分器中,并作为每个评分器版本的验收测试。
从评语中学习:基于评分器评语的 OPSD。 训练中我们注意到,一条幻灯片轨迹横跨几十轮、数十万 token,最后却只以一个标量奖励告诉策略这份幻灯片好还是不好。这个信号携带的信息太少:模型学到了自己做得多好,却学不到哪里错了、该怎么改。评分器的评语里恰恰有这些信息,比如"第 4 页正文超出了画布"或"第 2 页只有一张图没有内容",但模型从来看不到它们,只能在状态空间里一遍遍采样,靠试错改进。
于是 Gen-1 Slides 尝试直接从评分器评语中学习。当评分器给出具体建议时,我们把这条评语内化进策略:教师和学生是同一个模型,教师的上下文里多了一条评语,然后在学生自己的样本上,用从学生到教师的 token 加权 KL 做 on-policy self-distillation(OPSD)。实验表明,少量几次梯度更新就足以把一条评分器评语内化进策略,样本效率大幅提升。
"AI 味":一个对抗式判别器。 用户对很多 AI 生成的幻灯片有同一个评价:一看就是 AI 做的,现在大家把这种观感叫作"AI slop"。这些特征很一致,却很难用有限的规则捕捉。我们借用 GAN 式的对抗奖励学习思路,把策略视为生成器,训练一个小型判别器来区分它的幻灯片和人类设计的幻灯片,作为内部评分器的一项信号并在线更新。用最终冻结的判别器重新为每个检查点打分,Gen-1 Slides 输出中被判为 AI 制作的比例在训练过程中从 0.749 降到 0.417。
对奖励分项的课程学习,塑造优化路径。 在多目标 RL 中,指标之间的冲突决定了模型学习的效率。在较小模型上持续做单指标实验后,我们发现视觉设计和版式缺陷之间有明确的冲突。基于这一点,我们在训练早期奖励完整、精致的设计,等风格稳定后再逐步提高版式缺陷的权重;权重和切换时点根据训练过程中的指标选定,并通过在线评分器更新来落地。
训练稳定性:
-
训练环境就是生产环境。 我们没有把 harness 复制到训练集群上,而是让采样直接在线上服务栈中运行,消除了训练与服务之间的分布偏移。
-
用 GSPO 代替 GRPO: 用序列级而非 token 级的重要性比。奖励是轨迹级的,而 GRPO 逐 token 的比值在数万 token 长的轨迹上会给出高方差的梯度估计。GSPO 使用长度归一化的序列似然比,也就是各 token 比值的几何平均,只在模型生成的 token 上计算,工具输出被屏蔽。优化粒度与奖励粒度对齐,曲线平稳上升。
-
有界陈旧度的异步 RL。 单个回合的中位时长为 15 分钟,最长超过一小时,因此采样和训练持续并行。采样器最多只能落后训练器一个策略版本;每一步之后同步权重,超过一个版本的旧样本被丢弃。
-
用截断重要性采样(TIS)修正训练与推理的不一致,KL 仅作保护。 FP8 推理引擎与 BF16 训练器在每个 token 的对数概率上都有细微分歧。这是一个独立的 token 级比值,与 GSPO 的序列级比值不同;我们用阈值为 2.0 的截断重要性采样来修正,使任何单个 token 都不会主导一个批次的梯度。目标函数中没有参考 KL 项。每次更新前,用无偏、低方差的 k3 KL 估计器估算当前策略与采样策略之间的 KL;超过阈值的批次整批丢弃,KL 不进入梯度。
局限
我们愿意主动披露出当前Gen-1 Slides的局限性。
- 它学会了设计,也用力过猛。 Gen-1 Slides 生成的页面比对比中的任何模型都更密:字更小,元素更多,头重脚轻的页面也更多。如果你的听众在手机上看幻灯片,这在今天可能是一个实际的弱点。
- 内容和任务完成度落后于 Opus 5。 基座模型在这两项上起点都很低。Gen-1 Slides 在内容质量上补回了大部分差距,在任务完成度上补回了相当一部分,但两项都还没有追平。
- 它只为幻灯片而生,不是通用模型。 这是我们评估过并推荐使用的唯一任务。我们看到提升延伸到了文档生成和编程上。在电子表格或研究任务上,请按接近基座模型的表现预期,而基座模型本身也落后于前沿模型。
如何使用
- Genspark AI Slides。 Standard 模式现在默认使用 Gen-1 Slides。Ultra 模式继续在模型选择器中并列提供各前沿模型。
- 命令行与编程智能体。 安装 Genspark CLI,登录后用
gsk task create slides创建幻灯片。默认是 Standard 模式,也就是 Gen-1 Slides。在 Claude Code 等编程智能体中,ACP 的 gsk-slides 智能体负责多轮生成和编辑。 - API。 以 Genspark 品牌上架 OpenRouter 的工作正在进行中。提前访问请联系 [email protected]。
- 企业工作区。 Gen-1 Slides 的训练和评估没有使用任何客户内容,你的数据也不会与基座模型的开发方共享。现有的工作区模型限制原样适用:如果你的组织将 AI Slides 限定在特定供应商,Standard 模式会像以前一样继续使用经批准的模型。如需为工作区启用或停用 Gen-1 Slides,请联系你的客户团队。
下一步
Gen-1 是一个模型家族的名字,不是一次性的发布。同样的配方,即任务专用的环境加上在交付成果上计算的奖励,会延伸到电子表格、文档和研究。面向这些任务的模型已经在训练中。
在幻灯片上,这只是一个起点。我们会继续在同一套线上 harness 和同样的三种信号上训练,目标是在每一个维度上追平并超越领先的前沿模型,而不只是平均值。随着新检查点越过这道线,它们会进入更高的档位,每一次发布都会抬高 Standard 模式的底线。
接下来要做的是原生 PowerPoint(OOXML)输出,让模型设计的幻灯片在 PowerPoint 里来回编辑后依然完好。
如果你在用 Genspark AI Slides,什么都不用设置。打开 Standard 模式,你的下一份幻灯片就已经由 Gen-1 生成。我们很期待看到你会做出什么。
在 Genspark AI Slides 中试用 Gen-1 Slides →
致谢
Gen-1 Slides 与 Fireworks AI 联合训练。它构建在 MiniMax M3 之上,这是一个为智能体工具调用设计的、原生长上下文的开源权重 MoE 基座,让我们得以跳过预训练,把全部预算投入幻灯片生成的闭环。没有这样一个开放的基座,Gen-1 Slides 不可能在几周内做出来。感谢它的开发者公开发布权重,也感谢 PPTAgent 项目和 UniPPTBench 的作者开源他们的基准和评分器。本模型运行在美国的基础设施上,没有任何数据流向基座模型的开发方。
附录
A. 评估设置
我们选取了线上幻灯片技术栈中最重要的四个模型:Claude Opus 5、Kimi K3、GPT-5.6 Sol 和 MiniMax M3,加上我们训练的 Gen-1 Slides,共五个受测模型。数据集方面,内外部来源兼有:200 个内部任务和来自两个公开基准的 254 个任务,共 454 个。评分器方面,我们将内部评分器与两个公开基准附带的评分器结合。结果是一个 5 个模型 × 3 个数据集 × 3 个评分器的评估网格。每份幻灯片都出自同一套 Genspark 幻灯片 harness,因此唯一的变量是模型。45 个格子中的每一个都包含该评分器定义的每个维度的分数,以及总分。
B. 数据集与评分器
我们使用三个数据集:Real tasks、UltraPresent 和 UniPPTBench。
Real tasks(200 个,内部): 来自已开启 AI Data Retention 的个人用户、经过去标识化处理的任务;Team 和 Enterprise 数据从不使用。它是三者中唯一反映真实用户意图分布的数据集。 UltraPresent(128 个): arXiv 2602.22839。每个任务将一段自然语言的需求描述与页数、宽高比等硬性约束配对,包含英文和中文。我们使用完整的验证集。同一批作者创建了广为使用的 PPTAgent 并引入了 PPTEval;我们用这篇早期论文中的评分器 PPTEval 为 UltraPresent 打分。 UniPPTBench(126 个): arXiv 2605.17356,该论文同时定义了任务集及其评估器 UniPPTEval,覆盖四种输入场景:模糊提示、长文档、多模态文档和多来源。我们使用全部 126 个任务。
评分器方面,除内部评分器外,我们使用随两个公开基准一同发布的官方评分器。
内部评分器 v3.2 — 在四个维度(任务完成度、内容质量、视觉设计、过程质量)上以 0–1 量表打分。它与我们系统中的真实用户体验对齐,其分数同时作为 Gen-1 Slides 强化学习训练的奖励。多模态大模型裁判为 claude-fable-5。 PPTEval(PPTAgent 的评分器) — 三个维度:内容、设计、连贯性,1–5 量表。我们把论文中如今已经过时的 GPT-4o 裁判换成了 claude-fable-5,评分标准保持不变。 UniPPTEval(UniPPTBench 的评分器) — 随 UniPPTBench 发布的官方评分器;十个基础维度加一个视觉完整性维度,10 分制。为 Real tasks 和 UltraPresent 数据集打分时,由于这两个数据集没有对应的场景说明,场景维度不予评分(N/A)。裁判使用论文指定的多模态大模型 gemini-3-flash-preview。
C. 分维度完整表格
如何阅读这些表格。 三个评分器使用不同的量表(0–1、1–5、0–10),因此我们从不跨评分器平均分数,只在每一列内取排名再平均。数据集规模按完整数量标注(200 / 128 / 126)。思考强度设置与线上一致,见"我们如何评估"。
C1. 内部评分器 v3.2 分数(0–1 量表)
Real tasks(n=200)
| 模型 | 得分 | 任务完成度 | 内容质量 | 视觉设计 | 过程质量 |
|---|---|---|---|---|---|
| Gen-1 Slides | 0.821 | 0.780 | 0.737 | 0.756 | 0.719 |
| Claude Opus 5 | 0.810 | 0.849 | 0.782 | 0.688 | 0.695 |
| Kimi K3 | 0.723 | 0.840 | 0.784 | 0.557 | 0.748 |
| GPT-5.6 Sol | 0.668 | 0.820 | 0.743 | 0.479 | 0.748 |
| MiniMax M3(未调整) | 0.563 | 0.741 | 0.668 | 0.494 | 0.608 |
UltraPresent(n=128)
| 模型 | 得分 | 任务完成度 | 内容质量 | 视觉设计 | 过程质量 |
|---|---|---|---|---|---|
| Gen-1 Slides | 0.932 | 0.874 | 0.804 | 0.898 | 0.768 |
| Claude Opus 5 | 0.883 | 0.878 | 0.800 | 0.876 | 0.615 |
| Kimi K3 | 0.874 | 0.888 | 0.833 | 0.765 | 0.792 |
| GPT-5.6 Sol | 0.798 | 0.860 | 0.800 | 0.671 | 0.765 |
| MiniMax M3(未调整) | 0.777 | 0.852 | 0.766 | 0.722 | 0.664 |
UniPPTBench(n=126)
| 模型 | 得分 | 任务完成度 | 内容质量 | 视觉设计 | 过程质量 |
|---|---|---|---|---|---|
| Gen-1 Slides | 0.867 | 0.846 | 0.816 | 0.814 | 0.722 |
| Claude Opus 5 | 0.859 | 0.884 | 0.812 | 0.866 | 0.518 |
| Kimi K3 | 0.855 | 0.884 | 0.845 | 0.751 | 0.768 |
| GPT-5.6 Sol | 0.780 | 0.836 | 0.798 | 0.662 | 0.726 |
| MiniMax M3(未调整) | 0.579 | 0.817 | 0.713 | 0.513 | 0.616 |
得分为四个维度(任务完成度、内容质量、视觉设计、过程质量)的加权组合,再叠加版式缺陷、捏造、失实表述和忽略指令的扣分,以及无缺陷幻灯片的奖励,上限为 1。
C2. PPTEval 分数(1–5 量表)
Real tasks
| 模型 | PPTEval 均值 | 内容 | 设计 | 连贯性 |
|---|---|---|---|---|
| Gen-1 Slides | 3.783 | 3.423 | 3.915 | 4.010 |
| Kimi K3 | 3.714 | 3.429 | 4.039 | 3.674 |
| Claude Opus 5 | 3.655 | 3.412 | 3.808 | 3.746 |
| MiniMax M3(未调整) | 3.655 | 3.274 | 3.681 | 4.010 |
| GPT-5.6 Sol | 3.416 | 3.283 | 3.547 | 3.420 |
UltraPresent
| 模型 | PPTEval 均值 | 内容 | 设计 | 连贯性 |
|---|---|---|---|---|
| Gen-1 Slides | 3.812 | 3.483 | 3.952 | 4.000 |
| Kimi K3 | 3.770 | 3.524 | 4.005 | 3.782 |
| Claude Opus 5 | 3.701 | 3.460 | 3.843 | 3.800 |
| MiniMax M3(未调整) | 3.677 | 3.305 | 3.652 | 4.073 |
| GPT-5.6 Sol | 3.440 | 3.359 | 3.487 | 3.473 |
UniPPTBench
| 模型 | PPTEval 均值 | 内容 | 设计 | 连贯性 |
|---|---|---|---|---|
| Gen-1 Slides | 3.840 | 3.441 | 3.860 | 4.218 |
| Kimi K3 | 3.796 | 3.525 | 3.903 | 3.960 |
| MiniMax M3(未调整) | 3.687 | 3.285 | 3.518 | 4.258 |
| Claude Opus 5 | 3.610 | 3.389 | 3.506 | 3.936 |
| GPT-5.6 Sol | 3.459 | 3.358 | 3.455 | 3.564 |
C3. UniPPTEval 分数(0–10 量表)
Real tasks — 场景维度 N/A(该数据集无场景说明)
| 模型 | 总分 | 基础维度均值 | 视觉完整性 |
|---|---|---|---|
| Gen-1 Slides | 8.858 | 8.834 | 9.099 |
| Claude Opus 5 | 8.709 | 8.699 | 8.804 |
| Kimi K3 | 8.684 | 8.623 | 9.287 |
| MiniMax M3(未调整) | 8.401 | 8.428 | 8.128 |
| GPT-5.6 Sol | 7.697 | 7.707 | 7.598 |
UltraPresent — 场景维度 N/A
| 模型 | 总分 | 基础维度均值 | 视觉完整性 |
|---|---|---|---|
| Gen-1 Slides | 8.954 | 8.993 | 8.571 |
| Claude Opus 5 | 8.915 | 8.936 | 8.718 |
| Kimi K3 | 8.821 | 8.890 | 8.152 |
| MiniMax M3(未调整) | 8.452 | 8.491 | 8.060 |
| GPT-5.6 Sol | 7.825 | 7.829 | 7.817 |
UniPPTBench
| 模型 | 总分 | 基础维度均值 | 视觉完整性 | 场景均值 |
|---|---|---|---|---|
| Kimi K3 | 8.995 | 9.026 | 9.288 | 6.759 |
| Gen-1 Slides | 8.834 | 8.964 | 8.822 | 6.363 |
| Claude Opus 5 | 8.805 | 8.817 | 8.397 | 6.916 |
| MiniMax M3(未调整) | 8.499 | 8.587 | 8.418 | 6.326 |
| GPT-5.6 Sol | 8.069 | 8.028 | 7.987 | 6.259 |
C3b. UniPPTEval 的十个基础子维度(0–10)
C3 中的基础维度均值是这十个维度的平均值;此处拆开列出以便逐维度审计。各列依次为:指令达成、内容准确性、信息密度、清晰与可读性、叙事连贯性、吸引力、视觉一致性、版式质量、层次与重点、视觉元素质量。
Real tasks
| 模型 | 指令 | 准确性 | 密度 | 清晰度 | 叙事 | 吸引力 | 一致性 | 版式 | 层次 | 视觉元素 |
|---|---|---|---|---|---|---|---|---|---|---|
| Gen-1 Slides | 9.741 | 9.135 | 8.870 | 8.710 | 9.565 | 8.378 | 9.503 | 9.078 | 8.990 | 6.373 |
| Claude Opus 5 | 9.736 | 9.145 | 8.829 | 8.580 | 9.497 | 7.917 | 9.135 | 8.772 | 8.700 | 6.679 |
| Kimi K3 | 9.596 | 9.072 | 8.731 | 8.845 | 9.342 | 7.617 | 9.300 | 8.964 | 8.793 | 5.974 |
| GPT-5.6 Sol | 9.119 | 8.912 | 7.668 | 7.197 | 8.896 | 7.135 | 8.026 | 7.249 | 7.492 | 5.378 |
| MiniMax M3(未调整) | 9.420 | 8.482 | 8.596 | 8.197 | 9.378 | 7.824 | 9.124 | 8.461 | 8.539 | 6.259 |
UltraPresent
| 模型 | 指令 | 准确性 | 密度 | 清晰度 | 叙事 | 吸引力 | 一致性 | 版式 | 层次 | 视觉元素 |
|---|---|---|---|---|---|---|---|---|---|---|
| Gen-1 Slides | 9.907 | 8.667 | 9.263 | 8.927 | 9.621 | 8.724 | 9.569 | 9.345 | 9.351 | 6.638 |
| Claude Opus 5 | 10.000 | 9.182 | 9.276 | 8.793 | 9.627 | 8.373 | 9.379 | 8.862 | 9.000 | 6.911 |
| Kimi K3 | 9.980 | 9.231 | 9.017 | 9.086 | 9.561 | 8.121 | 9.492 | 9.345 | 9.069 | 6.158 |
| GPT-5.6 Sol | 9.700 | 8.836 | 7.982 | 7.085 | 9.017 | 7.825 | 7.862 | 6.949 | 7.536 | 5.786 |
| MiniMax M3(未调整) | 9.782 | 8.000 | 8.982 | 8.362 | 9.559 | 8.271 | 9.368 | 8.321 | 9.017 | 5.288 |
UniPPTBench
| 模型 | 指令 | 准确性 | 密度 | 清晰度 | 叙事 | 吸引力 | 一致性 | 版式 | 层次 | 视觉元素 |
|---|---|---|---|---|---|---|---|---|---|---|
| Gen-1 Slides | 9.871 | 8.766 | 9.121 | 8.581 | 9.718 | 8.839 | 9.444 | 8.968 | 8.952 | 7.379 |
| Claude Opus 5 | 9.702 | 8.903 | 9.024 | 8.210 | 9.710 | 8.637 | 9.097 | 8.452 | 8.573 | 7.863 |
| Kimi K3 | 9.839 | 9.008 | 9.169 | 8.831 | 9.702 | 8.508 | 9.548 | 9.306 | 9.089 | 7.258 |
| GPT-5.6 Sol | 9.419 | 9.089 | 8.000 | 6.814 | 9.419 | 8.065 | 8.113 | 7.073 | 7.484 | 6.806 |
| MiniMax M3(未调整) | 9.710 | 8.516 | 8.726 | 8.008 | 9.734 | 8.565 | 9.145 | 8.065 | 8.653 | 6.740 |
C4. 各列排名与平均排名
排名在每一列内确定(按分数从高到低),再在九列上取平均。越低越好。
| 评分器 × 数据集 | Gen-1 Slides | Claude Opus 5 | Kimi K3 | GPT-5.6 Sol | MiniMax M3(未调整) |
|---|---|---|---|---|---|
| 内部 v3.2 · Real tasks | 1 | 2 | 3 | 4 | 5 |
| 内部 v3.2 · UltraPresent | 1 | 2 | 3 | 4 | 5 |
| 内部 v3.2 · UniPPTBench | 1 | 2 | 3 | 4 | 5 |
| PPTEval · Real tasks | 1 | 3 | 2 | 5 | 4 |
| PPTEval · UltraPresent | 1 | 3 | 2 | 5 | 4 |
| PPTEval · UniPPTBench | 1 | 4 | 2 | 5 | 3 |
| UniPPTEval · Real tasks | 1 | 2 | 3 | 5 | 4 |
| UniPPTEval · UltraPresent | 1 | 2 | 3 | 5 | 4 |
| UniPPTEval · UniPPTBench | 2 | 3 | 1 | 5 | 4 |
| 平均排名 | 1.11 | 2.56 | 2.44 | 4.67 | 4.22 |
D. 关于图 1 的说明
纵轴为内部评分器(v3.2)综合得分,每个点是 11 个模型全部完成的真实任务上的均值。正文和表格使用的是另一次五模型运行的结果(n=200;Gen-1 Slides 0.821,Claude Opus 5 0.810),因此与图中数值属于不同批次而略有差异,差异在生成方差范围内。纵轴截取 0.45–0.9 区间。横轴为输入 token 标价(每百万 token 的美元数,对数刻度)。以 Claude Opus 5 为主要基线,是因为它是 Genspark AI Slides 目前运行规模最大的模型,我们对其幻灯片质量和成本拥有真实的、线上规模的数据。Claude Fable 5 / 5.1 在真实任务上的数据有限,仅作参考。
E. 人工评估:方法与一致性审计
我们如何标注幻灯片:版式
审核者检查渲染后的幻灯片上具体的版式缺陷,核对评分器的标记,并补充它漏掉的问题。下面的例子展示了同一页上的四个问题:三个由 AI 评分器标出,一个由人工审核补充。这些检查针对可读性和排布,与内容论断是否有来源支撑是两回事。

标注示例:Q3 2026 at a Glance。编号 1–4 标示下文讨论的区域,不是严重程度分级。AI 评分器标出了 1、3、4,人工审核者补充了 2。说明依据当时的标注记录。
1. 重叠与溢出:AI 标出。 右下角的"Sales Mix by Channel"表格高于其卡片。最后一行"Catering 3% 3%"溢出卡片,与下方的结论文字重叠,同一位置出现两层文字,两者都难以阅读。
2. 文字过小:AI 漏掉,人工补充。 根据标注记录,左侧柱状图中的数值标签、区域名称和纵轴刻度标签只有 10–11 px,而页面正文为 17–19 px。投影时难以辨认。评分器没有标出这一点,由审核者补充。
3. 空白过多:AI 标出。 右上角的折线图被压在卡片左侧,右侧约三分之一的空间未使用。该标注指出的是这张图表卡片内部的不平衡,并不是把所有留白都视为缺陷。
4. 对齐与网格不一致:AI 标出。 顶部的 KPI 卡片没有形成一致的网格:第二张卡片更高,底边低于其他卡片,卡片之间的间距也不均匀。
人工审核补充了什么。 一个页面可以配色协调,却在基本的可读性检查上不过关。在这个例子里,人工审核在评分器标出的重叠、空白和对齐问题之外,补上了它漏掉的小字缺陷。这个例子说明的是标签如何标定;版式的汇总结果另行报告。
我们如何标注幻灯片:忠于来源
审核者将每一条论断与所提供的源材料逐一核对,区分有直接依据的事实、有依据的推断和捏造(源材料中既未陈述也不支持的论断)。下面的例子展示了七次核对,以及两处人工审核改变了自动判定的情形。

标注示例:Strategic Options Matrix。绿色(1–2):有直接依据的事实。黄色(3):有依据的推断。红色(4–5):捏造。紫色(6–7):人与评分器的分歧,不是第四种标签。下文说明为当时标注记录的摘要。
1. 车队规模:有直接依据。 源材料写明 22 辆车,其中 18 辆日常运营,4 辆备用。人与评分器判定一致。
2. 载客率:有直接依据。 2024 年的 82% 和 2026 年上半年的 54% 均来自源材料。标注将幻灯片上的"FY 2024"视同"2024 年"。人与评分器判定一致。
3. 下降 28 个百分点:有依据的推断。 源材料没有写 28 这个数字,但 82 减 54 可以得出。人与评分器判定一致。
4. 转向货运的资本开支 NGN 8,500 万至 1.2 亿:捏造。 源材料没有给出任何投资金额,也没有要求模型估算。人与评分器判定一致。
5. 缩减至 12–14 辆:捏造。 源材料给出的是当前车队规模,既不是目标规模,也没有足够依据推导出目标。人与评分器判定一致。
6. B2B 包车利润率"强劲":人工改判为捏造。 评分器最初把它当作有依据的推断接受,理由是任务要求做一张带利润率列的对比矩阵。审核者否定了这一理由:要求有这一列,不等于任何具体评级有了依据。在没有支撑事实的情况下,该单元格应留空或标注"待评估"。这条规则明确后,评分器也将其判为捏造。
7. 客运营业利润率"下滑":有数学依据,不是捏造。 月度客运收入下降了 35.7%,而用户提供的同口径数据显示,同一业务的营业成本仅下降 11%。虽然没有直接报告利润率数字,但利润率下降在数学上是成立的。
边界很重要。 在同一列中,人工审核否定了一个没有依据的评级,又接受了另一个有证据支撑的评级。审核者逐条核对每个论断的依据,而不是整列一起接受或否定。


