この記事で分かること
- 自社内製モデル第1号「Gen-1 Slides」の発表内容と、「Opus 5と同水準」の検証結果(数値一覧つき)
- コストが約1/17(デッキ実測で約1/10)になる仕組みと、組織全体へ展開する際の意味
- 企業のオープンウェイトモデル切り替えの潮流と、これからのモデル選びの論点
- 現時点の弱点と、AIスライドの「スキル」で運用側からカバーできる範囲
- Gensparkの立場(オーケストレーション+自社モデル+Enterpriseガバナンス)
- 学習の仕組み・評価方法論の詳細は、Genspark公式ブログ(Gen-1 Slides)をご参照ください
01発表——初の自社内製モデル「Gen-1 Slides」
Gensparkは2026年9月10日(米国時間)、自社初のAIモデル「Gen-1 Slides」を発表しました。本モデルは、Genspark AIスライドのスタンダードモードのデフォルトモデルとなり、Teamプラン・Enterpriseプランを含む全プランで、現行価格のまま自動的に利用できます。
社内でAIを選ぶとき、こんな会話になっていないでしょうか。
「結局どれがいちばん賢いの?」「じゃあそれで全部やろう」
私は、この選び方をそろそろ疑ったほうがいいと考えています。今回の発表は、その疑いを製品にしたものです。
Gen-1 Slidesは、1つの依頼文から「そのまま使える」プレゼンテーションを作ることに特化したモデルです。汎用のコーディング、表計算、長文執筆、リサーチは学習しておらず、それらの用途には推奨していません。学習にかけた予算のすべてを、スライドを作る工程だけに投入しています。
Gensparkは、70以上のフロンティアモデルを横断的に使うオーケストレーションを強みとしてきました。自社でモデルを学習し、フロンティア品質を製品のデフォルトとして出荷したのは今回が初めてです。オーケストレーションからの撤退ではありません。AIスライドのUltraモードでは、引き続きClaude Opus 5とClaude Fable 5.1をGen-1と横並びで提供します。
02なぜ自社モデルか——汎用モデルでは「成果物」が最適化されていない
理由はシンプルです。スライドデッキという「成果物」を作ることに最適化されたモデルが、どこにも存在しなかったからです。
よく切れる万能包丁が一本あれば、たいていの料理はできます。ただ、焼きたてのパンを切るときにだけは、どうしても刃がつぶれる。だから波刃の、他には何の役にも立たないパン切りナイフが、いまも売れ続けています。
モデルの話も、構造はこれと同じだと私は見ています。
フロンティアモデルの競争は、コーディング、数学、思考力を測るベンチマークの順位をめぐって繰り広げられてきました。一方、ナレッジワーカーの日常業務——デッキ、スプレッドシート、文書——には、ほとんど注目が向けられていません。測っている場所と、現場が困っている場所がずれています。
Gensparkはこの領域を大規模に運用してきました。ピーク時で1日12万デッキです。これだけの量を見ていると、汎用モデルがどこで刃こぼれするのか、その「型」が見えてきます。
当社の評価では、Claude Opus 5はタスク完了とコンテンツが最も強い一方、自分で見直す回数が最も少なく、完成したデッキに目に見える欠陥が残ります。GPT-5.6 Solはページが最も疎で、ビジュアルデザインは最下位。Kimi K3は最もバランスが良いものの、ビジュアルは3番手です。どのモデルも、このタスクの「完成物」としての品質では、ユーザーが求める水準に届いていません。
賢さと、仕上がり。この2つは別の変数だというのが、私の出した結論です。
03Gen-1 Slidesとは——スライド生成に全振りした特化設計
Gen-1 Slidesは、重みが公開されている基盤モデル(オープンウェイトモデル)を出発点に、当社が実際にスライドを作っている本番環境のなかで追加学習させたモデルです。
学習のやり方はこうです。デッキの構成を考え、作り、描き、自分で直す——これを数十回くり返させ、最後に仕上がったデッキの出来ばえを採点します。その点数が上がる方向に学習させました。途中の作業がうまそうに見えても、完成品がよくなければ点は付きません。使ったのは約2,000件の社内で用意したタスク・96基のNVIDIA B300 GPU・約1週間(約15万米ドル換算)で、ユーザーのデータは使っていません。学習の詳しい手順、点数の抜け道を突くような挙動への対処、Fireworks AIとの共同訓練については、Genspark公式ブログ(Gen-1 Slides)をご参照ください。
モデルの公開形態(オープンソース・オープンウェイト・クローズド)の違いと選び方は、本シリーズの『モデルの公開形態』の回をご参照ください。
Gen-1 Slidesは、重みが公開されている基盤モデルをベースに、当社の本番環境で追加学習し、自社サービス(Genspark AIスライド)の中でのみ提供しています。追加学習したあとのモデルの重みは公開していないため、提供のかたちとしてはクローズド(自社サービス内での提供)にあたります。一方で、品質を採点するために使った評価ツールは公開する方針です。
企業ブランドの観点で、私がもう一つ見逃せないと考えているのが「AIらしさが透けて見える出力」です。社外に出す資料でこれが出ると、内容以前のところで信用を削ります。そこで、人が作ったデッキかAIが作ったデッキかを見分ける判定の仕組みを用意し、その判定を学習に組み込みました。結果、当社の評価によると、出力のうちAIらしく見える割合は0.749から0.417へ低下しました。
04品質——「同水準」をどう証明したか
Gen-1 Slidesの品質主張は「Claude Opus 5と同水準」です。この「同水準」を支えるのは、3つの評価ツール、3つのデータセット、そして人手レビューと実利用データという2つの手がかりによる検証です。強い主張ほど、証拠の透明性が問われます。
自社製品を自社で評価して「同水準です」と言う——これは、読む側からすれば最も信用しにくい種類の主張です。だからこそ、何をどう測ったかを先に開きます。
- 評価ツール:当社が自社で作った評価ツールに加え、公開されている評価の仕組み2種(PPTAgent・UniPPTEval)の公式版。公開されている2種は学習にはいっさい使っていません
- データセット:実ユーザーの依頼を匿名化した200タスク+PPTAgent(128タスク)+UniPPTBench(126タスク)
- 人手レビュー:PMとデザイナーが77タスク・4,063ページを、どのモデルの出力か伏せたまま確認(9,141の項目を突き合わせ・160組の見た目の比較)
- 実利用データ:実際の利用157万件を、星の評価・グッド/バッド・ダウンロード率で測定
比較は、当社が同じ実行環境・同じツール・同じ指示文で5モデル(Gen-1 Slides、Claude Opus 5、Kimi K3、GPT-5.6 Sol、追加学習していないベースモデル)をテストして行いました。
主要な結果
| 評価の軸 | 結果 |
|---|---|
| 9つの評価(3評価ツール×3データセットの組み合わせ) | 8つで1位・全9つでトップ2入り |
| 平均ランク(9列中) | Gen-1 Slides 1.11/Opus 5 2.56 |
| 実タスクでの内製評価ツール | 0.821 vs 0.810(これを「同水準」と表現。勝利ではありません) |
| 実ユーザーの評価 | 平均評価4.25 vs 4.23・低評価率3.6% vs 3.4%・グッド/バッド比19.6 vs 18.8・ダウンロード率33.1% vs 31.5% |
※この9つの評価は、3つの評価ツール×3つのデータセットの組み合わせによる評価列の数であり、9つの品質項目を意味するものではありません。各列は同じ実行環境でテストした5モデルの総合スコアの順位で、Gen-1 Slidesは8列で1位、残る1列(UniPPTEval×UniPPTBench)ではKimi K3に僅差で続く2位——全9列でトップ2入りでした。列の1位は項目ごとの勝敗ではなく、タスク完了・コンテンツ品質の次元ではOpus 5が上回ります。
主要な結果の一覧
| 指標 | Gen-1 Slides | Claude Opus 5 |
|---|---|---|
| 平均ランク(9評価列中) | 1.11 | 2.56 |
| 実ユーザー評価(平均評価) | 4.25 | 4.23 |
| 低評価率 | 3.6% | 3.4% |
| グッド/バッド比 | 19.6 | 18.8 |
| ダウンロード率 | 33.1% | 31.5% |
| タスク完了(Opus 5が上回る) | 0.780 | 0.849 |
| コンテンツ品質(Opus 5が上回る) | 0.737 | 0.782 |
| 捏造率(低いほど良好・Gen-1 Slidesが優位) | 13.3% | 17.7% |
| 内製評価ツール(実タスク) | 0.821 | 0.810 |
当社の発表動画でも、同じ依頼文に対して、出発点のベースモデル・Claude Opus 5・Gen-1 Slidesが作るデッキを並べて比較し、Gen-1 SlidesがOpus 5と同等のデッキ品質を出すことを示しています。
数字の正しい読み方。「同水準」は文字通りの意味です。タスク完了とコンテンツ品質ではOpus 5が上回り、人の目による確認ではレイアウトは同等〜やや劣後、元資料への忠実さはやや優位(捏造率13.3% vs 17.7%)です。使い物にならないレベルまで崩れたページの比率は、Gen-1 Slidesが7%で、Opus 5の15%の半分以下。参考値として、当社内製評価ツールでClaude Fable 5.1はGen-1 Slidesより0.003上回りますが、語るには小さすぎる差です(デッキあたりコストは約14倍)。当社がOpus 5を主な比較対象にするのは、本番データを持つフロンティアモデルだからです。
自社評価の限界と向き合い方。自社で作った評価ツールは、学習のときに目標として使った点数そのものでもあります。つまり最も感度が高く、同時に最も身びいきになりやすい指標です(採点の56%をビジュアルデザインが占めます)。当社はそれを補うため、公開されている評価の仕組み2種・人の目による確認・実際の利用状況を併せて報告し、評価ツールそのものも公開します。この採点は人の判定とよく一致します(229ページを見比べた確認で、レイアウトは88%、事実の誤りは49件中48件が一致)。空のページに厳しめ、小さな文字を見落としやすいといった癖と、現時点の弱点(ページが密・スライド専用・タスク完了とコンテンツ品質はOpus 5に劣る)も公開しています——業務のどこまでを任せるかを、事前に決める材料になります。
弱点は、運用の側からも埋められます。ここが実務では重要だと私は考えています。モデルの改善を待たなくても、使い方の側で手を打てる部分があるからです。
- ページが密・文字が小さい → AIスライドの「スキル」で、フォント・色・余白・レイアウトの構造を指定できます。1枚あたりの情報量をそろえるよう指示することもできます
- 書式が社内の標準とそろわない → 自社で使っているPowerPointやPDFの資料を、そのままスキルとして保存できます。社内の標準書式として使い回せます
- タスク完了・コンテンツ品質はOpus 5に劣る → Ultraモードで、Claude Opus 5などのフロンティアモデルを選べます
スキルは、見た目だけを再利用する従来のテンプレートとは違い、「どう考え、どう構成し、どう論を組み立てるか」までひとまとめにしたものです。用意されているスキルから選ぶこともできます。つまり密度や書式の問題は、モデルの性能そのものというより、運用の設計で吸収できる部分が大きいということです。
05コスト——フロンティア品質が「デフォルト」になる
コストの数字は2つあり、両方報告します。モデルに読ませる文章量あたりの定価(入力トークン単価)の比率では約1/17、仕上がりデッキ1本あたりの実測コストでは約1/10です。
なぜ2つ出すのか。前者は「モデルを呼ぶコスト」、後者は「出荷できるデッキを得るコスト」で、意味が違うからです。都合のいいほうだけを出すのは、フェアではないと考えました。
| 指標 | Gen-1 Slides | Claude Opus 5 | 差・比率 |
|---|---|---|---|
| 入力トークン・リスト価格(100万あたり) | 0.30米ドル | 5.00米ドル | 約1/17(約16.7倍の差) |
| デッキあたり実測コスト(同じ200タスク) | 0.44米ドル | 4.16米ドル | 約1/10(9.5倍) |
| 出力トークン・リスト価格(100万あたり) | 1.20米ドル(キャッシュ済み入力0.06米ドル) | ― | ― |
| 月1,000デッキの制作コスト | 約440米ドル | 約4,200米ドル | 約1/10 |
| 同額(1米ドル)で作れるデッキ数(相対) | 約9.5本 | 1.0本 | ― |
※トークンは、モデルが文章を処理するときの分量の単位です。定価と実測値の違い(定価はモデルを呼ぶコスト、実測値は出荷できるデッキを得るコスト)の説明は本文を参照ください。1米ドルで作れるデッキ数の行は、同一予算での相対比較です。
実測の差がリスト価格の差より狭いのは、Gen-1がページを描き、見直し、直すという工程に多くの処理量を使うためです。
品質と価格の2軸では、フロンティアモデル(Opus 5・Fable 5.1・GPT-6 Astraなど)は高品質・高価格に集中し、価格を下げると品質も下がります。Gen-1 Slidesは、フロンティア級の品質を保ったまま、リスト価格ベースでは最安水準(約1/17)に位置します。価格を理由に品質を諦めないで済む——この2軸の関係を変えることが、今回の発表の意味のひとつだと私は考えています。
月1,000デッキのチームでは、約4,200米ドルが約440米ドルに。1米ドルで作れるデッキは、Opus 5の1本に対しGen-1 Slidesでは約9.5本で、1人分だった予算が約10人分に広がります。
ここが、私がいちばんお伝えしたい点です。この差は1チームの予算にとどまりません。フロンティア品質を標準装備にしたまま組織全体へ展開する際の判断材料になります——単位あたりのコストが小さければ、品質を落とさずに利用範囲を広げられるからです。この考え方は、成果を利用量ではなく「成功タスクあたりのコスト」で測る、本シリーズの『Genspark Index』の回で示した経済性の軸とつながっています。
06これからのモデル選び——タスク特化とオープンウェイトの潮流
企業のモデル選びの論点が変わっています。「フロンティアモデルを1つ選んで全タスクを任せる」から「タスクごとに最適なモデルを選ぶ」へ。背景には、性能差の縮小、価格下落、タスク特化モデルの登場があります。
ここで、冒頭の問いに戻ります。「いちばん賢いAIを選べば、いちばんいい資料ができるのか」。
この問いが成立していたのは、モデル間の性能差が大きく、選択が「一択」だった時期までです。その前提が、数字の上で崩れつつあります。
オープンウェイトとクローズドの性能差は縮まり、モデルを動かすときにかかる価格は下がり、タスク特化型への移行が予測されています。オープンモデル発の製品が短期間で市場の注目を集める例も続き、企業の生成AI支出そのものが急拡大しています(各データの数値と出典は表4)。Gen-1 Slidesのような「1タスクに全振りしたモデル」は、この潮流の先頭にあります。
| データ | 内容 | 出典(公表年月) |
|---|---|---|
| 性能差の縮小 | オープンウェイトとクローズドの性能差が一部ベンチマークで1年間に8%→1.7%に縮小 | スタンフォード大学「AI Index 2025」(2025年) |
| 実行価格の下落 | モデルを動かすときの価格がタスクにより年間9倍〜900倍下落 | 同上 |
| 性能・コスト | オープンモデルはクローズドの約90%の性能・動かすときのコストは87%安 | MIT Sloan(Nagle&Yue論文・2026年1月) |
| 節約の試算 | 需要の最適再配分で平均AI支出70%以上削減・世界で年間約250億米ドル | 同上 |
| タスク特化の予測 | 2027年までに小型・タスク特化型モデルの利用量が汎用LLMの3倍以上に | Gartner(2025年4月) |
| オープンモデルの勢い | DeepSeek: 米App Storeで無料アプリ1位・V3学習約560万米ドル(報道ベースの推定)/Kimi K2: リリース24時間以内にHugging Faceでトレンド1位 | WEF(2025年2月)/Hugging Face |
| 企業の生成AI支出 | 2025年は370億米ドル(2024年の約3.2倍) | Menlo Ventures(2025年12月) |
※数字は各出典の公表値です。DeepSeekの学習コストは公式発表ではなく報道ベースの推定値です。
切り替えの理由は、①従量課金のAPI依存を避けコストを削減する ②データを社外に出さない(自社ホスト・データレジデンシー) ③微調整・カスタマイズ ④ベンダーロックイン回避——の4つです。一方、自社インフラの運用・セキュリティ管理・モデル更新への追従コストという注意点もあります。「どのモデルを使うか」は、価格・データの扱い・運用で考える時代になっています。
Gensparkの立場——モデル選びと委任の設計を支援する。Gensparkは、70以上のLLMを横断するオーケストレーションと自社モデル(Gen-1ファミリー)、Enterpriseプランのガバナンス機能を組み合わせて、企業のモデル選びを支援する立場です。モデルの選定・導入は「委任の範囲と定着の設計」(本シリーズの『行動の競争』の回・『Genspark Index』の回)の一部で、成果物の品質を「成功タスクあたりのコスト」で測る視点があれば、どの業務をどのモデルに委ねるかを、価格・品質・運用の3点で決められます。
07データとプライバシー——ユーザーデータでは学習しない
Gen-1 Slidesはユーザーデータで学習していません。学習に使ったのは、約2,000件の社内構築スライドタスクだけです。
- 学習:ユーザーコンテンツは学習データに使用していません
- 評価ツールの精度調整:集計して個人が分からないようにしたユーザーの反応(グッド/バッド、評価、ダウンロード)のみ使用。個人を特定できる情報を含むタスクは、人が中身を確認する前にすべて除外しています
- 処理:すべて自社インフラのなかで完結し、お客様のコンテンツがベースモデルの提供元に送信されることはありません
エンタープライズ環境での運用
エンタープライズでの利用に関係する点を、企業のAIガバナンスの観点から整理します。
- モデル選定の統制:既存のワークスペースのモデル制限は、そのままGen-1 Slidesにも適用されます。組織がAIスライドを特定のプロバイダに制限している場合、スタンダードモードは従来どおり承認済みのモデルを使い、Gen-1 Slidesに自動で切り替わりません。新しいモデルを業務に加えるかは、組織のAIポリシーの枠内で決まる設計です
- 有効・無効の設定:アカウントチーム経由で、組織の管理単位(ワークスペース)ごとにGen-1 Slidesを有効または無効に設定できます
- 監査・検証のしやすさ:品質の採点に使った評価ツールは公開する方針です。企業は自社のデッキを同じ基準で採点・検証できるため、導入判断の透明性につながります
- 責任ある導入:弱点(ページが密、スライド専用、コンテンツ品質とタスク完了はOpus 5に劣る)も明示しています。業務の適用範囲や品質の合格ラインを事前に決める材料になります
- データの扱い:モデルは米国のインフラで稼働し、顧客コンテンツは学習・評価のいずれにも使用していません。ベースモデルの提供元への送信もありません
08まとめ
Gensparkは、自社初の内製モデル「Gen-1 Slides」を発表しました。AIスライドのスタンダードモードのデフォルトとなり、全プランで価格据え置きのまま利用できます。品質は「Opus 5と同水準」(3評価ツール×3データセット+人手レビューと実ユーザーデータ157万件で検証)、コストはリスト価格で約1/17、デッキ実測で約1/10です。ユーザーデータでの学習はなく、処理は自社インフラのなかで完結します。
当社は、フロンティア品質を「上位プランで売るもの」ではなく「標準装備の下限」にする試みの第一歩と位置づけています。Gen-1はファミリーの始まりで、次はスプレッドシート、文書、リサーチに同じやり方を適用します。評価ツールの公開や、コマンドラインツール・コーディングエージェントからの利用も進め、リリースのたびに品質の下限を引き上げていきます。
最後に、冒頭の問いへの私なりの答えを書きます。
「いちばん賢いAIを選べば、いちばんいい資料ができるのか」——できません。賢さと仕上がりは別の変数で、測っている場所が違うからです。企業のモデル選びの論点は、「フロンティアを1つ選ぶ」から「タスクごとに最適なモデルを選ぶ」へ移りつつあります。
この記事を読んだあと、スライド作成という業務を「いま、どのモデルに、いくらで委ねているのか」を一度確認していただけたら、書いた意味があります。オーケストレーションと自社モデルとEnterpriseガバナンスを持つGensparkは、そのモデル選びと「委任の範囲と定着の設計」を支援する立場にあります。
09FAQ
Q1. Gen-1 Slidesの使い方は?
特別な操作は不要です。スタンダードモードのデフォルトになったため、Team・Enterpriseを含む全プランで現行価格のまま自動的に利用できます。Ultraモードでは引き続きClaude Opus 5などのフロンティアモデルを選べます。
Q2. 料金はどうなりますか?
Gensparkユーザー向けの料金は変わりません。APIでの提供(OpenRouter掲載を含む)は準備中です。
Q3. どのモデルを選べばよいですか?
スライド生成という1つのタスクにはGen-1 Slidesがデフォルトです。タスク完了やコンテンツ品質でOpus 5が上回る領域もあるため、Ultraモードと比較して選べます。書式や1枚あたりの情報量をそろえたい場合は、AIスライドの「スキル」を併せてお使いください。Gen-1 Slidesはスライド以外の用途には推奨していません。
Q4. データはどう扱われますか?
ユーザーデータで学習していません。学習に使ったのは約2,000件の社内で用意したタスクのみで、評価ツールの精度調整には、集計して個人が分からないようにした反応データを使用しています。処理は自社インフラで完結し、コンテンツがベースモデルの提供元に送信されることはありません。
Q5. 弱点と今後の予定は?
ページが密で文字サイズが小さくなりがち、コンテンツ品質とタスク完了はOpus 5に劣る、スライドしかできない——の3点を公表しています。このうち密度と書式は、AIスライドの「スキル」で書式や1枚あたりの情報量を指定することで、運用側から調整できます(第4章)。今後はPowerPoint形式・HTML形式での直接生成、API提供、Gen-1ファミリー(スプレッドシート・文書・リサーチ)を展開予定です。
※本記事は、2026年9月10日(米国時間 9:00 PT/日本時間 9月11日 1:00)に発表されたGensparkの自社初のAIモデル「Gen-1 Slides」について、同社が公表した情報を元に編集したものです。記載の数値は、同社が公表した評価結果・価格による自社測定値または公開価格のほか、公表された調査・報道(第6章のオープンウェイト潮流)によるものです。