Gen-1 Slides:面向知识工作者的首个 Genspark 模型

product·
GensparkGenspark
Gen-1 Slides:面向知识工作者的首个 Genspark 模型

过去两年,Genspark 的产品服务一直构建在全球最好的 AI 模型之上。今天,我们发布自己的首个模型:Gen-1 Slides,这是我们面向知识工作者的后训练模型家族中的第一个。它能把一句请求变成一份可以直接拿进会议室的演示文稿,在基准测试上达到前沿模型的水平,成本却低得多。

从今天起,Gen-1 Slides 会成为支持 Genspark AI Slides Standard 模式的模型,在显著提升幻灯片质量的同时降低用户的 token 成本。Gen-1 Slides 与 Fireworks AI 联合训练,在内外部基准测试中平均排名第一,领先 Claude Opus 5,而输入 token 价格约为 Opus 5 的 1/17。在整体质量上,它与本次对比中最强的 Claude Fable 5.1 基本持平。

在当前这一波前沿模型中,竞争主要发生在编程基准、数学竞赛和推理测试上。前沿实验室优化的是通用能力,开源模型追逐同样的排行榜,同时不断缩小价格差距。结果是,大多数知识工作者每天真正在做的事情,如幻灯片、电子表格和文档,得到的关注要少得多。

我们清楚地看到通用模型在哪里力不从心:Genspark 在需求高峰每日日生成超过 12 万份幻灯片,我们清楚地看到通用模型在哪里力不从心,以及人们对一份成品演示文稿真正想要什么。我们有服务规模,有数据反馈,也有理由做出更好的东西。于是,我们训练了自己的模型。

对 Genspark 而言,这是一个重要的里程碑。我们会继续为每一项任务编排最合适的模型,同时在规模、产品经验和用户反馈让我们占据优势的领域,增加自己训练模型的能力。幻灯片是第一个例子。同样的方法已经在电子表格、文档和研究上展开。

这项新能力让我们多了一条提升交付质量的路径,也让我们在最了解的工作上走得更快。Gen-1 Slides 今天已经上线:如果你在使用 Genspark AI Slides,它已经是 Standard 模式的默认模型,欢迎试用。

下面,我们会说明为什么要做这件事,我们究竟如何衡量它,以及它目前还有哪些不足。

要点

对用户:同样的价格,幻灯片质量大幅提升。 Gen-1 Slides 现已成为 Standard 模式的默认模型,专为生成更好的演示文稿而训练。在 200 个来自已开启 AI Data Retention 的个人用户、经过去标识化处理的幻灯片任务上,它在我们的内部评分器上得分高于 Claude Opus 5,视觉设计排名第一,价格不变。Opus 级别的质量现在是默认配置,而不是高级档位。

对行业:一家应用公司现在也能做出以 1/17 输入 token 成本运行的前沿级模型。 Gen-1 Slides 以开源权重的 MiniMax M3 为起点,与 Fireworks AI 联合训练,训练环境就是 Genspark 用来生成真实演示文稿的同一套系统。我们公开说明基座模型:在我们看来,来源透明是产品的一部分,不是需要回避的事。在结果上,它在幻灯片质量上与 Claude Opus 5 相当,输入价格为每百万 token 0.30 美元,而 Opus 5 为 5 美元。按每份成品幻灯片计算,一个每月生成 1,000 份幻灯片的团队,成本从约 4,200 美元降到约 440 美元;过去只够为一位用户提供前沿质量的预算,现在大约可以服务十位。随着 Gen-1 模型家族扩展到其他交付物,前沿质量会成为底线,而不是加价项。

对技术读者:在可以自行复现的基准测试上取得了强劲结果。 我们在三个数据集上测试 Gen-1 Slides,每个数据集配以对应的评分器:内部真实任务集配内部评分器,UltraPresent 配 PPTEval,UniPPTBench 配 UniPPTEval。它在九项评估中八项排名第一,九项全部进入前二,平均排名 1.11,Kimi K3 为 2.44,Claude Opus 5 为 2.56。

现已可用。 作为 AI Slides Standard 模式的默认模型,也可通过 gsk CLI 使用。OpenRouter 上架正在进行中。API 提前访问请联系 [email protected]

图 1. 内部评分器综合得分与输入 token 标价:11 个模型,同一套 harness。

纵轴为 11 个模型全部完成的真实任务上的内部评分器综合得分。横轴为输入 token 标价,对数刻度。Gen-1 Slides 独自位于左上角:没有任何模型既更便宜又更好。它与训练起点、未经调整的 M3 价格相同,箭头标出的是后训练在这一价格上带来的提升(0.576 到 0.827)。我们主要与 Opus 5 对比,因为我们在这一任务上大规模运行过它;Fable 5 / 5.1 仅作参考。坐标轴与样本的完整说明见附录 D。

为什么幻灯片需要专用模型

曾经,我们的用户付着前沿模型的价格,拿到的幻灯片却仍然版式错乱、引用凭空捏造、结论在源材料里找不到依据。世界上最强的通用模型在许多方面令人惊叹,但生成一份可以直接交付的幻灯片,至今都不是它们的优先事项。这也可以理解:前沿实验室在优化通用能力,开源模型也用同一套基准衡量。专为这项任务打造的模型不太可能从它们身上处出现,所以我们自己着手进行研发。

幻灯片生成看起来像写作任务,实际上是工程任务。模型需要规划叙事、忠于源材料、为每一页编写前端代码、渲染、检查结果、修正问题,然后重复几十轮。通用模型在其中一些步骤上强,在另一些步骤上弱,而且这些弱点足够稳定,在我们的评估中形成了各自的特征:

Claude Opus 5 在任务完成度上最强,内容质量也接近顶尖,但它做的自检循环最少,成品幻灯片上留有肉眼可见的缺陷。对用户来说,这意味着付了高价,还要自己修页面。

GPT-5.6 Sol 生成的幻灯片最单薄,每页内容很少。在通用模型中它的视觉设计排名最后;在 UniPPTEval 的密度、版式、一致性和层次维度上,它在所有数据集上都是五个模型中的最后一名。

Kimi K3 是三者中最均衡的,但在内部评分器的视觉设计维度上,它在三个数据集上都排第三。

做幻灯片更接近在画布上构图和排版,而不是解一道数学题。它很难,但如果直接从用户真实体验到的东西出发去训练,就是一个可以解决的问题。每天生成 12 万份幻灯片,给了我们三样通用实验室在这项任务上不具备的东西:我们知道人们实际会让幻灯片工具做什么,以及通用模型在哪里让他们失望;我们知道对提出需求的人来说什么才是一份好幻灯片,因为我们从汇总数据中看得到哪些幻灯片被点赞、被下载,哪些被退回修改;我们可以在成品交付物上计算奖励,而不是在一段文字记录上。

我们如何评估

一份幻灯片的质量,很大程度上取决于你用什么去衡量它。我们每天都在大规模运行幻灯片生成,所以构建了自己的评分器。与其请你相信它,我们更愿意解释它如何工作、我们如何验证它。

三种信号:自动评分器、人工标注、线上反馈。

内部评分器: 我们的评分流水线。它的裁判是一个由 Claude Fable 5 驱动的智能体,从四个维度为渲染后的幻灯片打分:任务完成度、内容质量、视觉设计和过程质量。在此之上叠加扣分项(版式缺陷、捏造、失实表述、忽略指令)和一项无缺陷奖励。这个评分器同时也为 Gen-1 Slides 提供强化学习的奖励,因此表 1 中的分数并不独立于训练;下面两个公开评分器则是独立的。在本文中,评分器指评分流水线,裁判指评分器内部的多模态大模型,奖励指由评分器输出计算得到的标量训练信号。

公开评分器: 我们使用基准作者发布的两个评分器。PPTEval 来自 UltraPresent 作者的 PPTAgent 项目,评估内容、设计和连贯性。UniPPTEval 与 UniPPTBench 在同一篇论文中定义,评估十个基础维度加视觉完整性。两者都在全部三个数据集上运行,而不只是各自的数据集,并且都从未在训练中用作奖励。PPTEval 使用 Claude Fable 5 作裁判,UniPPTEval 使用其论文指定的 Gemini 裁判。

人类标注: 产品经理和设计师在 77 个幻灯片生成任务上标注了 4,063 页。另外,157 万个线上任务提供了星级评分、点赞点踩和下载信号。

三个数据集: 我们使用了 200 个来自已开启 AI Data Retention 的个人用户、经过去标识化处理的任务,外加两个公开基准集:由 PPTAgent 作者发布的 UltraPresent,我们使用其 128 个任务的验证集;以及 UniPPTBench,126 个任务。本文中,UltraPresent 和 UniPPTBench 指数据集,PPTEval 和 UniPPTEval 指它们的官方评分器。

五个模型在同一套智能体 harness 中运行全部任务,使用相同的工具、渲染循环、提示词和与线上一致的思考强度设置:Gen-1 Slides、Claude Opus 5、Kimi K3、GPT-5.6 Sol,以及作为无后训练基线的、未经调整的 MiniMax M3(强化学习前)检查点。图 1 出于参考纳入了更多模型,但这五个是我们在线上以有意义的规模运行过的,因此这才是我们信任的对比。

质量

同一个任务,三个模型

同一个季度业务回顾任务,由三个模型分别生成。每张图是所生成幻灯片中对应的概览页。

在我们的 200 个真实任务上,Gen-1 Slides 的综合得分和视觉设计得分在五个模型中最高。Claude Opus 5 在任务完成度和内容质量上领先。两者整体处于同一档,彼此的差距小于它们与其他模型的差距。

表 1. 内部评分器,200 个线上真实任务(n=200)。

模型 综合 任务完成度 内容质量 视觉设计 过程质量 美元/每份
Gen-1 Slides 0.821 0.780 0.737 0.756 0.719 0.44
Claude Opus 5 0.810 0.849 0.782 0.688 0.695 4.16
Kimi K3 0.723 0.840 0.784 0.557 0.748 2.00
GPT-5.6 Sol 0.668 0.820 0.743 0.479 0.748 2.01
MiniMax M3(未调整) 0.563 0.741 0.668 0.494 0.608 0.34

成本为同一套 harness 中实测的每份成品幻灯片的大模型花费。加粗为各列最优。综合分不是四列的平均值,见附录 C。

换成不是我们做的评分器,结论还成立吗

内部评分器反映的是 Genspark 对这项任务的理解,所以一个公平的问题是:这些提升在公开基准上是否依然成立。图 2 用三个独立的评分器系列,在三个数据集上比较同样的五个模型。柱状图从零开始;有些差距看起来小,是因为最强的几个模型都挤在各自量表的顶端,不是坐标轴被压缩了。

图 2. 五个模型,三个数据集,三个评分器系列。

每个评分器使用各自的量表(内部 0–1,PPTEval 1–5,UniPPTEval 0–10)。内部真实任务 200 个,UltraPresent 验证集 128 个,UniPPTBench 126 个。推理设置与线上一致:自适应思考、高强度,不支持的模型跳过。

三个评分器的判断基本一致。在九个评分器 × 数据集的组合中,Gen-1 Slides 有八个排名第一。唯一失手的是 UniPPTBench 上的 UniPPTEval,Kimi K3 以微弱优势领先。它也是唯一从未跌出前二的模型,平均排名 1.11;Kimi K3 为 2.44,Opus 5 为 2.56,M3 基座为 4.22,GPT-5.6 Sol 为 4.67。

这些提升能泛化到分布外的任务集。在全部九项对比中,Gen-1 Slides 都优于基座模型。公开评分器的头部分数也很接近:在这六项对比中,第一名与第二名的差距从未超过满分的 1.7%。即便如此,Gen-1 Slides 仍在六项中的五项排名第一。按维度的完整结果见附录 C。

评分器与人的判断一致吗

评分器只有在与人的判断一致时才值得信任。我们用两个独立信号来校验:产品和设计团队的细粒度标注,以及线上用户的反馈。

标注者的发现。 人工评估覆盖 77 个任务(其中 76 个可用于并排对比),每个模型一份幻灯片,共 4,063 页,由产品和设计团队盲审,其中 20 页做了双人标注以衡量标注者间的一致性。评估聚焦于读者最先注意到的三个维度:版式、忠于来源、美观。信息传达和叙事结构未做人工标注,涉及个人身份信息的任务在标注前已排除。

版式:与 Opus 5 相当,略差。 存在某种版式问题的页面,Gen-1 为 88%,Opus 5 为 81%;但在严重问题上差距收窄,被评为严重或更差的页面,Gen-1 为 33%,Opus 5 为 34%。审核者对同一任务并排比较时,Gen-1 24 胜、26 负、26 平。 忠于来源:略好于 Opus 5。 在从 30 份幻灯片(6 个任务 × 5 个模型)中提取的 9,141 条原子级论断中,Gen-1 的捏造率为 13.3%,Opus 5 为 17.7%,相差 4.4 个百分点。重复标注留下约 3 个百分点的判断噪声,所以我们说"略好",而不是"显著更好"。 美观:未检出差异。 在设计师的两两比较中,风格判定的胜率 Gen-1 Slides 为 49%,Opus 5 为 51%;工艺维度同样没有显著差异。

表 2. 人工评估,Gen-1 Slides 对比 Claude Opus 5。

维度/指标 Gen-1 Slides Claude Opus 5
版式:存在任何问题的页面(%) 88 81
版式:严重或更差的页面(%) 33 34
版式:不可用页面(%) 7 15
版式:同任务两两比较(胜 : 负 : 平) 24 : 26 : 26
忠于来源:论断级捏造率(%) 13.3 17.7
美观:风格维度胜率(各 60 对)(%) 49 51

版式各行基于每个模型约 42–48 页的评分,置信区间约 ±14 个百分点,因此两三个点的差距不作解读。两两比较行使用双侧二项检验,不显著。

人与评分器的判断在三个维度上都一致:在一次 229 页的审计中,标注者保留了评分器 88% 的页面级版式判定;三个裁判的多数票在抽样的 49 个捏造点中有 48 个与人工标准答案一致。出现分歧时,模式也很稳定:评分器对略显空旷的页面过于严格,并且会漏掉过小的文字。人与人之间也会有分歧,这是任何"一致性"说法都要带上的注脚。标注示例见附录 E。

用户的实际行为。 在 8 月到 9 月的分阶段发布期间,在 157 万个任务上,Gen-1 Slides 与 Claude Opus 5 在平均评分、低分占比、点赞点踩比和下载率上都无法区分。未经调整的 M3 基座则明显落后:平均评分低 0.45 星,低分占比约为五倍,点赞点踩比不到一半,只有下载率接近(30.4%)。

表 3. 线上用户反馈。

模型 平均评分(★) 低分(≤2★) 点赞/点踩比 下载率
Gen-1 Slides 4.25 3.6% 19.6 33.1%
Claude Opus 5 4.23 3.4% 18.8 31.5%
MiniMax M3(未调整) 3.80 18.0% 8.8 30.4%

2026 年 8–9 月 Genspark AI Slides 线上流量的真实用户反馈。平均评分为五星制星级评分的均值;低分占比为 2 星及以下评分的比例;点赞/点踩比为点赞数与点踩数之比;下载率为成品幻灯片被下载的比例。加粗为各列最优。

成本

Gen-1 Slides 按其基座模型的标价定价:每百万输入 token 0.30 美元,每百万输出 token 1.20 美元,缓存命中的输入 token 为 0.06 美元。Claude Opus 5 的标价为每百万输入 token 5.00 美元。就这个人人都能查到的数字而言,Gen-1 Slides 的标价约为 Opus 5 的 1/17。

不过,标价不等于一份幻灯片的成本。一个会自己渲染、检查、修改页面的模型,每份幻灯片消耗的 token 比跳过这些步骤的模型更多,而 Gen-1 Slides 在这方面做得比对比中的任何模型都多。所以我们同时报告在我们的 harness 中、同样这 200 个线上任务上,一份成品幻灯片实际花了多少钱。

表 4. 每份成品幻灯片的实测成本。

模型 美元/每份 美元/每 1,000 份 Opus 5 每 1 美元预算可做份数 综合得分
Gen-1 Slides 0.44 435 9.5 0.821
Claude Opus 5 4.16 4,155 1.0 0.810
Kimi K3 2.00 1,999 2.1 0.723
GPT-5.6 Sol 2.01 2,006 2.1 0.668
MiniMax M3(未调整) 0.34 338 12.3 0.563

200 个任务运行中实测的大模型花费;所有模型使用同一套 harness。后训练使每份成本相对未经调整的 M3 检查点增加约 29%,同时将综合得分提升 0.26。

按这种方式衡量,一份 Gen-1 成品幻灯片花费 0.44 美元,Opus 5 为 4.16 美元,大约便宜 9.5 倍。这比 17 倍的标价差距要窄,因为 Gen-1 把更多预算花在检查自己的成果上。后训练使每份成本相对未经调整的 M3 增加了约 29%,但把分数拉进了 Opus 5 的档位。我们同时报告两个数字,是因为它们回答的是不同的问题:标价告诉你调用这个模型要多少钱,实测花费告诉你拿到一份能交付的幻灯片要多少钱。

有两点值得注意。在内部评分器上唯一超过 Gen-1 Slides 的模型是 Claude Fable 5.1,差距 0.003,小到无法分出高下,而每份成本约为 14 倍。而且每一个通用模型,要么质量低于 Gen-1,要么价格高于 Gen-1。对比中没有任何模型既更便宜更好

这个差距,正是这次发布不只是一次模型发布的原因。它让 Opus 级别的幻灯片质量便宜到足以成为每一位 Genspark 用户的默认配置,而不是高级档位。它改变了大规模运行幻灯片的经济账:一个每月生成 1,000 份幻灯片的团队,成本从约 4,200 美元降到约 440 美元,质量上没有可测量的损失。也就是说,过去只够为一位用户提供前沿质量的预算,现在大约可以服务十位。随着 Gen-1 家族扩展到其他交付物,这就是我们要建立的业务形态:以前沿质量为底线。

训练方法

Gen-1 Slides 在大约 2,000 个内部构建的幻灯片任务上通过强化学习(RL)训练。采样(rollout)在 Genspark AI Slides 集群上运行,参数更新在 Fireworks 平台上完成。

经过充分的探索阶段后,最终的 RL 训练在 96 张 NVIDIA B300 GPU 上用一周完成。整个过程中,平均训练奖励从第一步的 0.271 上升到发布时 EMA 值 0.765(图 3)。全程没有出现奖励崩塌,也没有回滚过任何检查点。

图 3. 训练期间的奖励。

浅色点为每个优化器步骤的平均采样奖励;深色线为衰减系数 0.9 的 EMA;阴影带为 15 步窗口内的 ±1σ。三段背景色对应三个阶段(256k GSPO → 512k GSPO → 512k GSPO + KL 保护)。虚线为 Claude Opus 5(0.721)和 MiniMax M3 基座(0.324)在 200 个任务的留出集上的训练期奖励,仅作参考;训练奖励在训练任务上计算,不能与之直接比较。

完整的技术报告即将发布。与常规的 RL 后训练方案相比,本次训练在以下几方面做了改进。

在线评分器与策略共同演进,对抗奖励作弊。 幻灯片质量特别容易被钻空子。训练过程中,策略先后学会了:导入一份参考幻灯片当作成品交上去;在报告里写上"来源已核实"却什么都没查;把字号一路缩小,直到溢出检测不再触发。每一招都能通过检查,却让用户拿到更差的幻灯片。因此奖励作弊不可能一次性根除,而且随着 RL 规模和模型能力提升,作弊手法会更复杂、更难察觉。所以我们不试图一次就把评分器做对,而是在线更新它,让它与策略一起演进,并且每一次更新都用独立于评分器的信号来检验。具体做法有两项:

  • 一个监视智能体常态化监控训练。 它持续分析采样过程和输出;上述几种模式都是这样被发现的,并通过在线评分器更新迅速堵上。
  • 设计师持续进行人工评审。 他们的判定和建议被回灌到在线评分器中,并作为每个评分器版本的验收测试。

从评语中学习:基于评分器评语的 OPSD。 训练中我们注意到,一条幻灯片轨迹横跨几十轮、数十万 token,最后却只以一个标量奖励告诉策略这份幻灯片好还是不好。这个信号携带的信息太少:模型学到了自己做得多好,却学不到哪里错了、该怎么改。评分器的评语里恰恰有这些信息,比如"第 4 页正文超出了画布"或"第 2 页只有一张图没有内容",但模型从来看不到它们,只能在状态空间里一遍遍采样,靠试错改进。

于是 Gen-1 Slides 尝试直接从评分器评语中学习。当评分器给出具体建议时,我们把这条评语内化进策略:教师和学生是同一个模型,教师的上下文里多了一条评语,然后在学生自己的样本上,用从学生到教师的 token 加权 KL 做 on-policy self-distillation(OPSD)。实验表明,少量几次梯度更新就足以把一条评分器评语内化进策略,样本效率大幅提升。

"AI 味":一个对抗式判别器。 用户对很多 AI 生成的幻灯片有同一个评价:一看就是 AI 做的,现在大家把这种观感叫作"AI slop"。这些特征很一致,却很难用有限的规则捕捉。我们借用 GAN 式的对抗奖励学习思路,把策略视为生成器,训练一个小型判别器来区分它的幻灯片和人类设计的幻灯片,作为内部评分器的一项信号并在线更新。用最终冻结的判别器重新为每个检查点打分,Gen-1 Slides 输出中被判为 AI 制作的比例在训练过程中从 0.749 降到 0.417。

对奖励分项的课程学习,塑造优化路径。 在多目标 RL 中,指标之间的冲突决定了模型学习的效率。在较小模型上持续做单指标实验后,我们发现视觉设计和版式缺陷之间有明确的冲突。基于这一点,我们在训练早期奖励完整、精致的设计,等风格稳定后再逐步提高版式缺陷的权重;权重和切换时点根据训练过程中的指标选定,并通过在线评分器更新来落地。

训练稳定性:

  • 训练环境就是生产环境。 我们没有把 harness 复制到训练集群上,而是让采样直接在线上服务栈中运行,消除了训练与服务之间的分布偏移。

  • 用 GSPO 代替 GRPO: 用序列级而非 token 级的重要性比。奖励是轨迹级的,而 GRPO 逐 token 的比值在数万 token 长的轨迹上会给出高方差的梯度估计。GSPO 使用长度归一化的序列似然比,也就是各 token 比值的几何平均,只在模型生成的 token 上计算,工具输出被屏蔽。优化粒度与奖励粒度对齐,曲线平稳上升。

  • 有界陈旧度的异步 RL。 单个回合的中位时长为 15 分钟,最长超过一小时,因此采样和训练持续并行。采样器最多只能落后训练器一个策略版本;每一步之后同步权重,超过一个版本的旧样本被丢弃。

  • 用截断重要性采样(TIS)修正训练与推理的不一致,KL 仅作保护。 FP8 推理引擎与 BF16 训练器在每个 token 的对数概率上都有细微分歧。这是一个独立的 token 级比值,与 GSPO 的序列级比值不同;我们用阈值为 2.0 的截断重要性采样来修正,使任何单个 token 都不会主导一个批次的梯度。目标函数中没有参考 KL 项。每次更新前,用无偏、低方差的 k3 KL 估计器估算当前策略与采样策略之间的 KL;超过阈值的批次整批丢弃,KL 不进入梯度。

局限

我们愿意主动披露出当前Gen-1 Slides的局限性。

  • 它学会了设计,也用力过猛。 Gen-1 Slides 生成的页面比对比中的任何模型都更密:字更小,元素更多,头重脚轻的页面也更多。如果你的听众在手机上看幻灯片,这在今天可能是一个实际的弱点。
  • 内容和任务完成度落后于 Opus 5。 基座模型在这两项上起点都很低。Gen-1 Slides 在内容质量上补回了大部分差距,在任务完成度上补回了相当一部分,但两项都还没有追平。
  • 它只为幻灯片而生,不是通用模型。 这是我们评估过并推荐使用的唯一任务。我们看到提升延伸到了文档生成和编程上。在电子表格或研究任务上,请按接近基座模型的表现预期,而基座模型本身也落后于前沿模型。

如何使用

  • Genspark AI Slides。 Standard 模式现在默认使用 Gen-1 Slides。Ultra 模式继续在模型选择器中并列提供各前沿模型。
  • 命令行与编程智能体。 安装 Genspark CLI,登录后用 gsk task create slides 创建幻灯片。默认是 Standard 模式,也就是 Gen-1 Slides。在 Claude Code 等编程智能体中,ACP 的 gsk-slides 智能体负责多轮生成和编辑。
  • API。 以 Genspark 品牌上架 OpenRouter 的工作正在进行中。提前访问请联系 [email protected]
  • 企业工作区。 Gen-1 Slides 的训练和评估没有使用任何客户内容,你的数据也不会与基座模型的开发方共享。现有的工作区模型限制原样适用:如果你的组织将 AI Slides 限定在特定供应商,Standard 模式会像以前一样继续使用经批准的模型。如需为工作区启用或停用 Gen-1 Slides,请联系你的客户团队。

下一步

Gen-1 是一个模型家族的名字,不是一次性的发布。同样的配方,即任务专用的环境加上在交付成果上计算的奖励,会延伸到电子表格、文档和研究。面向这些任务的模型已经在训练中。

在幻灯片上,这只是一个起点。我们会继续在同一套线上 harness 和同样的三种信号上训练,目标是在每一个维度上追平并超越领先的前沿模型,而不只是平均值。随着新检查点越过这道线,它们会进入更高的档位,每一次发布都会抬高 Standard 模式的底线。

接下来要做的是原生 PowerPoint(OOXML)输出,让模型设计的幻灯片在 PowerPoint 里来回编辑后依然完好。

如果你在用 Genspark AI Slides,什么都不用设置。打开 Standard 模式,你的下一份幻灯片就已经由 Gen-1 生成。我们很期待看到你会做出什么。

在 Genspark AI Slides 中试用 Gen-1 Slides →

致谢

Gen-1 Slides 与 Fireworks AI 联合训练。它构建在 MiniMax M3 之上,这是一个为智能体工具调用设计的、原生长上下文的开源权重 MoE 基座,让我们得以跳过预训练,把全部预算投入幻灯片生成的闭环。没有这样一个开放的基座,Gen-1 Slides 不可能在几周内做出来。感谢它的开发者公开发布权重,也感谢 PPTAgent 项目和 UniPPTBench 的作者开源他们的基准和评分器。本模型运行在美国的基础设施上,没有任何数据流向基座模型的开发方。

附录

A. 评估设置

我们选取了线上幻灯片技术栈中最重要的四个模型:Claude Opus 5、Kimi K3、GPT-5.6 Sol 和 MiniMax M3,加上我们训练的 Gen-1 Slides,共五个受测模型。数据集方面,内外部来源兼有:200 个内部任务和来自两个公开基准的 254 个任务,共 454 个。评分器方面,我们将内部评分器与两个公开基准附带的评分器结合。结果是一个 5 个模型 × 3 个数据集 × 3 个评分器的评估网格。每份幻灯片都出自同一套 Genspark 幻灯片 harness,因此唯一的变量是模型。45 个格子中的每一个都包含该评分器定义的每个维度的分数,以及总分。

B. 数据集与评分器

我们使用三个数据集:Real tasksUltraPresentUniPPTBench

Real tasks(200 个,内部): 来自已开启 AI Data Retention 的个人用户、经过去标识化处理的任务;Team 和 Enterprise 数据从不使用。它是三者中唯一反映真实用户意图分布的数据集。 UltraPresent(128 个): arXiv 2602.22839。每个任务将一段自然语言的需求描述与页数、宽高比等硬性约束配对,包含英文和中文。我们使用完整的验证集。同一批作者创建了广为使用的 PPTAgent 并引入了 PPTEval;我们用这篇早期论文中的评分器 PPTEval 为 UltraPresent 打分。 UniPPTBench(126 个): arXiv 2605.17356,该论文同时定义了任务集及其评估器 UniPPTEval,覆盖四种输入场景:模糊提示、长文档、多模态文档和多来源。我们使用全部 126 个任务。

评分器方面,除内部评分器外,我们使用随两个公开基准一同发布的官方评分器。

内部评分器 v3.2 — 在四个维度(任务完成度、内容质量、视觉设计、过程质量)上以 0–1 量表打分。它与我们系统中的真实用户体验对齐,其分数同时作为 Gen-1 Slides 强化学习训练的奖励。多模态大模型裁判为 claude-fable-5。 PPTEval(PPTAgent 的评分器) — 三个维度:内容、设计、连贯性,1–5 量表。我们把论文中如今已经过时的 GPT-4o 裁判换成了 claude-fable-5,评分标准保持不变。 UniPPTEval(UniPPTBench 的评分器) — 随 UniPPTBench 发布的官方评分器;十个基础维度加一个视觉完整性维度,10 分制。为 Real tasks 和 UltraPresent 数据集打分时,由于这两个数据集没有对应的场景说明,场景维度不予评分(N/A)。裁判使用论文指定的多模态大模型 gemini-3-flash-preview。

C. 分维度完整表格

如何阅读这些表格。 三个评分器使用不同的量表(0–1、1–5、0–10),因此我们从不跨评分器平均分数,只在每一列内取排名再平均。数据集规模按完整数量标注(200 / 128 / 126)。思考强度设置与线上一致,见"我们如何评估"。

C1. 内部评分器 v3.2 分数(0–1 量表)

Real tasks(n=200)

模型 得分 任务完成度 内容质量 视觉设计 过程质量
Gen-1 Slides 0.821 0.780 0.737 0.756 0.719
Claude Opus 5 0.810 0.849 0.782 0.688 0.695
Kimi K3 0.723 0.840 0.784 0.557 0.748
GPT-5.6 Sol 0.668 0.820 0.743 0.479 0.748
MiniMax M3(未调整) 0.563 0.741 0.668 0.494 0.608

UltraPresent(n=128)

模型 得分 任务完成度 内容质量 视觉设计 过程质量
Gen-1 Slides 0.932 0.874 0.804 0.898 0.768
Claude Opus 5 0.883 0.878 0.800 0.876 0.615
Kimi K3 0.874 0.888 0.833 0.765 0.792
GPT-5.6 Sol 0.798 0.860 0.800 0.671 0.765
MiniMax M3(未调整) 0.777 0.852 0.766 0.722 0.664

UniPPTBench(n=126)

模型 得分 任务完成度 内容质量 视觉设计 过程质量
Gen-1 Slides 0.867 0.846 0.816 0.814 0.722
Claude Opus 5 0.859 0.884 0.812 0.866 0.518
Kimi K3 0.855 0.884 0.845 0.751 0.768
GPT-5.6 Sol 0.780 0.836 0.798 0.662 0.726
MiniMax M3(未调整) 0.579 0.817 0.713 0.513 0.616

得分为四个维度(任务完成度、内容质量、视觉设计、过程质量)的加权组合,再叠加版式缺陷、捏造、失实表述和忽略指令的扣分,以及无缺陷幻灯片的奖励,上限为 1。

C2. PPTEval 分数(1–5 量表)

Real tasks

模型 PPTEval 均值 内容 设计 连贯性
Gen-1 Slides 3.783 3.423 3.915 4.010
Kimi K3 3.714 3.429 4.039 3.674
Claude Opus 5 3.655 3.412 3.808 3.746
MiniMax M3(未调整) 3.655 3.274 3.681 4.010
GPT-5.6 Sol 3.416 3.283 3.547 3.420

UltraPresent

模型 PPTEval 均值 内容 设计 连贯性
Gen-1 Slides 3.812 3.483 3.952 4.000
Kimi K3 3.770 3.524 4.005 3.782
Claude Opus 5 3.701 3.460 3.843 3.800
MiniMax M3(未调整) 3.677 3.305 3.652 4.073
GPT-5.6 Sol 3.440 3.359 3.487 3.473

UniPPTBench

模型 PPTEval 均值 内容 设计 连贯性
Gen-1 Slides 3.840 3.441 3.860 4.218
Kimi K3 3.796 3.525 3.903 3.960
MiniMax M3(未调整) 3.687 3.285 3.518 4.258
Claude Opus 5 3.610 3.389 3.506 3.936
GPT-5.6 Sol 3.459 3.358 3.455 3.564

C3. UniPPTEval 分数(0–10 量表)

Real tasks — 场景维度 N/A(该数据集无场景说明)

模型 总分 基础维度均值 视觉完整性
Gen-1 Slides 8.858 8.834 9.099
Claude Opus 5 8.709 8.699 8.804
Kimi K3 8.684 8.623 9.287
MiniMax M3(未调整) 8.401 8.428 8.128
GPT-5.6 Sol 7.697 7.707 7.598

UltraPresent — 场景维度 N/A

模型 总分 基础维度均值 视觉完整性
Gen-1 Slides 8.954 8.993 8.571
Claude Opus 5 8.915 8.936 8.718
Kimi K3 8.821 8.890 8.152
MiniMax M3(未调整) 8.452 8.491 8.060
GPT-5.6 Sol 7.825 7.829 7.817

UniPPTBench

模型 总分 基础维度均值 视觉完整性 场景均值
Kimi K3 8.995 9.026 9.288 6.759
Gen-1 Slides 8.834 8.964 8.822 6.363
Claude Opus 5 8.805 8.817 8.397 6.916
MiniMax M3(未调整) 8.499 8.587 8.418 6.326
GPT-5.6 Sol 8.069 8.028 7.987 6.259

C3b. UniPPTEval 的十个基础子维度(0–10)

C3 中的基础维度均值是这十个维度的平均值;此处拆开列出以便逐维度审计。各列依次为:指令达成、内容准确性、信息密度、清晰与可读性、叙事连贯性、吸引力、视觉一致性、版式质量、层次与重点、视觉元素质量。

Real tasks

模型 指令 准确性 密度 清晰度 叙事 吸引力 一致性 版式 层次 视觉元素
Gen-1 Slides 9.741 9.135 8.870 8.710 9.565 8.378 9.503 9.078 8.990 6.373
Claude Opus 5 9.736 9.145 8.829 8.580 9.497 7.917 9.135 8.772 8.700 6.679
Kimi K3 9.596 9.072 8.731 8.845 9.342 7.617 9.300 8.964 8.793 5.974
GPT-5.6 Sol 9.119 8.912 7.668 7.197 8.896 7.135 8.026 7.249 7.492 5.378
MiniMax M3(未调整) 9.420 8.482 8.596 8.197 9.378 7.824 9.124 8.461 8.539 6.259

UltraPresent

模型 指令 准确性 密度 清晰度 叙事 吸引力 一致性 版式 层次 视觉元素
Gen-1 Slides 9.907 8.667 9.263 8.927 9.621 8.724 9.569 9.345 9.351 6.638
Claude Opus 5 10.000 9.182 9.276 8.793 9.627 8.373 9.379 8.862 9.000 6.911
Kimi K3 9.980 9.231 9.017 9.086 9.561 8.121 9.492 9.345 9.069 6.158
GPT-5.6 Sol 9.700 8.836 7.982 7.085 9.017 7.825 7.862 6.949 7.536 5.786
MiniMax M3(未调整) 9.782 8.000 8.982 8.362 9.559 8.271 9.368 8.321 9.017 5.288

UniPPTBench

模型 指令 准确性 密度 清晰度 叙事 吸引力 一致性 版式 层次 视觉元素
Gen-1 Slides 9.871 8.766 9.121 8.581 9.718 8.839 9.444 8.968 8.952 7.379
Claude Opus 5 9.702 8.903 9.024 8.210 9.710 8.637 9.097 8.452 8.573 7.863
Kimi K3 9.839 9.008 9.169 8.831 9.702 8.508 9.548 9.306 9.089 7.258
GPT-5.6 Sol 9.419 9.089 8.000 6.814 9.419 8.065 8.113 7.073 7.484 6.806
MiniMax M3(未调整) 9.710 8.516 8.726 8.008 9.734 8.565 9.145 8.065 8.653 6.740

C4. 各列排名与平均排名

排名在每一列内确定(按分数从高到低),再在九列上取平均。越低越好。

评分器 × 数据集 Gen-1 Slides Claude Opus 5 Kimi K3 GPT-5.6 Sol MiniMax M3(未调整)
内部 v3.2 · Real tasks 1 2 3 4 5
内部 v3.2 · UltraPresent 1 2 3 4 5
内部 v3.2 · UniPPTBench 1 2 3 4 5
PPTEval · Real tasks 1 3 2 5 4
PPTEval · UltraPresent 1 3 2 5 4
PPTEval · UniPPTBench 1 4 2 5 3
UniPPTEval · Real tasks 1 2 3 5 4
UniPPTEval · UltraPresent 1 2 3 5 4
UniPPTEval · UniPPTBench 2 3 1 5 4
平均排名 1.11 2.56 2.44 4.67 4.22

D. 关于图 1 的说明

纵轴为内部评分器(v3.2)综合得分,每个点是 11 个模型全部完成的真实任务上的均值。正文和表格使用的是另一次五模型运行的结果(n=200;Gen-1 Slides 0.821,Claude Opus 5 0.810),因此与图中数值属于不同批次而略有差异,差异在生成方差范围内。纵轴截取 0.45–0.9 区间。横轴为输入 token 标价(每百万 token 的美元数,对数刻度)。以 Claude Opus 5 为主要基线,是因为它是 Genspark AI Slides 目前运行规模最大的模型,我们对其幻灯片质量和成本拥有真实的、线上规模的数据。Claude Fable 5 / 5.1 在真实任务上的数据有限,仅作参考。

E. 人工评估:方法与一致性审计

我们如何标注幻灯片:版式

审核者检查渲染后的幻灯片上具体的版式缺陷,核对评分器的标记,并补充它漏掉的问题。下面的例子展示了同一页上的四个问题:三个由 AI 评分器标出,一个由人工审核补充。这些检查针对可读性和排布,与内容论断是否有来源支撑是两回事。

标注示例:Q3 2026 at a Glance。编号 1–4 标示下文讨论的区域,不是严重程度分级。AI 评分器标出了 1、3、4,人工审核者补充了 2。说明依据当时的标注记录。

1. 重叠与溢出:AI 标出。 右下角的"Sales Mix by Channel"表格高于其卡片。最后一行"Catering 3% 3%"溢出卡片,与下方的结论文字重叠,同一位置出现两层文字,两者都难以阅读。

2. 文字过小:AI 漏掉,人工补充。 根据标注记录,左侧柱状图中的数值标签、区域名称和纵轴刻度标签只有 10–11 px,而页面正文为 17–19 px。投影时难以辨认。评分器没有标出这一点,由审核者补充。

3. 空白过多:AI 标出。 右上角的折线图被压在卡片左侧,右侧约三分之一的空间未使用。该标注指出的是这张图表卡片内部的不平衡,并不是把所有留白都视为缺陷。

4. 对齐与网格不一致:AI 标出。 顶部的 KPI 卡片没有形成一致的网格:第二张卡片更高,底边低于其他卡片,卡片之间的间距也不均匀。

人工审核补充了什么。 一个页面可以配色协调,却在基本的可读性检查上不过关。在这个例子里,人工审核在评分器标出的重叠、空白和对齐问题之外,补上了它漏掉的小字缺陷。这个例子说明的是标签如何标定;版式的汇总结果另行报告。

我们如何标注幻灯片:忠于来源

审核者将每一条论断与所提供的源材料逐一核对,区分有直接依据的事实有依据的推断捏造(源材料中既未陈述也不支持的论断)。下面的例子展示了七次核对,以及两处人工审核改变了自动判定的情形。

标注示例:Strategic Options Matrix。绿色(1–2):有直接依据的事实。黄色(3):有依据的推断。红色(4–5):捏造。紫色(6–7):人与评分器的分歧,不是第四种标签。下文说明为当时标注记录的摘要。

1. 车队规模:有直接依据。 源材料写明 22 辆车,其中 18 辆日常运营,4 辆备用。人与评分器判定一致。

2. 载客率:有直接依据。 2024 年的 82% 和 2026 年上半年的 54% 均来自源材料。标注将幻灯片上的"FY 2024"视同"2024 年"。人与评分器判定一致。

3. 下降 28 个百分点:有依据的推断。 源材料没有写 28 这个数字,但 82 减 54 可以得出。人与评分器判定一致。

4. 转向货运的资本开支 NGN 8,500 万至 1.2 亿:捏造。 源材料没有给出任何投资金额,也没有要求模型估算。人与评分器判定一致。

5. 缩减至 12–14 辆:捏造。 源材料给出的是当前车队规模,既不是目标规模,也没有足够依据推导出目标。人与评分器判定一致。

6. B2B 包车利润率"强劲":人工改判为捏造。 评分器最初把它当作有依据的推断接受,理由是任务要求做一张带利润率列的对比矩阵。审核者否定了这一理由:要求有这一列,不等于任何具体评级有了依据。在没有支撑事实的情况下,该单元格应留空或标注"待评估"。这条规则明确后,评分器也将其判为捏造。

7. 客运营业利润率"下滑":有数学依据,不是捏造。 月度客运收入下降了 35.7%,而用户提供的同口径数据显示,同一业务的营业成本仅下降 11%。虽然没有直接报告利润率数字,但利润率下降在数学上是成立的。

边界很重要。 在同一列中,人工审核否定了一个没有依据的评级,又接受了另一个有证据支撑的评级。审核者逐条核对每个论断的依据,而不是整列一起接受或否定。

分享

推荐阅读