Gen-1 Slides: 지식 노동자를 위한 Genspark의 첫 자체 모델

지난 2년 동안 Genspark는 세계 최고 수준의 AI 모델 위에 제품을 만들어 왔습니다. 오늘, 저희가 직접 만든 모델을 소개합니다. Gen-1 Slides는 지식 노동자를 위해 설계된 포스트트레이닝 모델 패밀리의 첫 번째 모델입니다. 하나의 요청을 회의실에 바로 가져갈 수 있는 프레젠테이션으로 만들어 내며, 벤치마크에서는 프런티어 모델 수준의 성능을 훨씬 낮은 비용으로 보여 줍니다.
오늘부터 Gen-1 Slides는 Genspark AI Slides의 Standard 모드를 구동하며, 자료 품질을 크게 높이는 동시에 사용자의 토큰 비용을 낮춥니다. Fireworks AI와 함께 학습한 Gen-1 Slides는 내부와 외부 벤치마크를 통틀어 평균 순위 1위를 기록해 Claude Opus 5를 앞섰고, 입력 토큰 가격은 Opus 5의 약 1/17입니다. 전체 품질에서는 비교 대상 중 최고였던 Claude Fable 5.1과 사실상 동률이었습니다.
지금의 프런티어 모델 경쟁은 코딩 벤치마크, 수학 경시대회, 추론 테스트를 무대로 벌어져 왔습니다. 프런티어 랩은 범용 능력을 최적화하고, 오픈 모델은 같은 리더보드를 쫓으며 가격 격차를 좁힙니다. 그 결과 대다수 지식 노동자가 하루 종일 실제로 하는 일, 즉 슬라이드, 스프레드시트, 문서에는 훨씬 적은 관심이 쏠렸습니다.
피크 날에 12만 건의 자료를 만들어 내는 저희는 범용 모델이 어디에서 부족한지, 그리고 사람들이 완성된 프레젠테이션에서 실제로 무엇을 원하는지 정확히 보고 있습니다. 규모, 피드백, 그리고 더 나은 것을 만들어야 할 이유. 이 세 가지가 갖춰져 있었기에 저희 모델을 직접 학습시켰습니다.
Genspark에게 이것은 중요한 이정표입니다. 모든 작업에 가장 적합한 모델을 오케스트레이션하는 방식은 계속 유지합니다. 여기에 규모, 제품 경험, 사용자 피드백 면에서 저희가 유리한 영역에서는 직접 모델을 학습시킨다는 선택지가 더해집니다. 슬라이드가 그 첫 사례입니다. 같은 접근을 스프레드시트, 문서, 리서치에도 이미 적용하고 있습니다.
이 새로운 역량은 사용자에게 전달하는 결과물의 품질을 높이고, 저희가 가장 잘 아는 일에서 더 빠르게 나아갈 또 하나의 길을 열어 줍니다. Gen-1 Slides는 오늘부터 사용할 수 있습니다. Genspark AI Slides를 쓰고 있다면 이미 Standard 모드의 기본 모델으로 적용되어 있으니, 한번 사용해 보시기 바랍니다.
아래에서는 왜 이 모델을 만들었는지, 품질을 정확히 어떻게 측정하는지, 그리고 아직 부족한 점이 어디인지 설명합니다.
하이라이트
사용자에게: 같은 가격에 자료 품질이 크게 올라갑니다. Gen-1 Slides는 이제 Standard 모드의 기본 모델이며, 더 나은 프레젠테이션을 만들도록 특화해 학습되었습니다. AI Data Retention을 켠 개인 사용자의 비식별화된 슬라이드 작업 200건에서 내부 그레이더 기준 Claude Opus 5보다 높은 점수를 기록했고, 비주얼 디자인에서는 1위였습니다. 가격은 달라지지 않습니다. Opus급 품질이 프리미엄 등급이 아니라 기본값이 됩니다.
업계에: 애플리케이션 회사도 입력 토큰 비용 1/17로 구동되는 프런티어급 모델을 만들 수 있게 되었습니다. Gen-1 Slides는 오픈 웨이트 MiniMax M3에서 출발해 Fireworks AI와 공동으로, Genspark가 실제 프레젠테이션을 만드는 데 쓰는 바로 그 시스템 안에서 학습되었습니다. 베이스 모델은 공개적으로 밝힙니다. 출처의 투명성은 제품의 일부이며 감출 것이 아니라고 보기 때문입니다. 그 결과 자료 품질에서는 Claude Opus 5와 대등하면서, 가격은 입력 100만 토큰당 0.30달러입니다(Opus 5는 5달러). 완성된 자료 한 건 기준으로 보면 한 달에 1,000건을 만드는 팀의 비용은 약 4,200달러에서 약 440달러로 내려가고, 한 명에게 프런티어 품질을 제공하던 예산으로 대략 열 명에게 제공할 수 있습니다. Gen-1 모델 패밀리가 다른 결과물로 확장되면서 프런티어 품질은 업셀이 아니라 바닥선이 됩니다.
기술 독자에게: 직접 재현할 수 있는 벤치마크에서 강한 결과가 나왔습니다. Gen-1 Slides를 세 개의 데이터셋에서, 각각에 맞는 그레이더로 평가했습니다. 내부 실제 작업 세트는 내부 그레이더, UltraPresent는 PPTEval, UniPPTBench는 UniPPTEval입니다. 아홉 개 평가 중 여덟 개에서 1위, 아홉 개 모두에서 2위 이내에 들었고, 평균 순위는 1.11이었습니다(Kimi K3는 2.44, Claude Opus 5는 2.56).
지금 바로 사용할 수 있습니다. AI Slides Standard 모드의 기본 모델로, 그리고 gsk CLI에서도 쓸 수 있습니다. OpenRouter 등록은 진행 중입니다. API 얼리 액세스는 [email protected]로 문의해 주세요.
그림 1. 내부 그레이더 종합 점수와 입력 토큰 정가: 11개 모델, 동일 하네스.

세로축은 11개 모델이 모두 완료한 실제 작업에서의 내부 그레이더 종합 점수. 가로축은 입력 토큰 정가(로그 스케일). Gen-1 Slides는 왼쪽 위 영역에 홀로 위치하며, 이보다 더 싸면서 더 좋은 모델은 없습니다. 가격은 학습 출발점인 미조정 M3와 같고, 화살표는 그 가격에서 포스트트레이닝이 더한 상승분(0.576 → 0.827)을 나타냅니다. 이 작업에서 대규모로 운영해 온 경험이 있어 Opus 5를 주된 비교 대상으로 삼았고, Fable 5 / 5.1은 참고용으로만 표시했습니다. 축과 표본에 대한 자세한 설명은 부록 D에 있습니다.
슬라이드에 전용 모델이 필요한 이유
저희 사용자들은 프런티어 모델 가격을 내면서도 레이아웃이 깨지고, 출처가 조작되고, 원본 자료에 없는 주장이 섞인 자료를 받아 왔습니다. 세계 최고의 범용 모델은 많은 영역에서 놀라운 능력을 보이지만, 그대로 납품할 수 있는 슬라이드 자료를 완성하는 일은 그들의 우선순위가 아니었습니다. 이해할 만한 일입니다. 프런티어 랩은 범용 능력을 최적화하고, 오픈 모델도 같은 벤치마크로 평가받습니다. 이 작업에 특화된 모델이 다른 곳에서 나올 가능성은 낮았기에, 저희가 직접 만들었습니다.
슬라이드 생성은 글쓰기 작업처럼 보이지만 실제로는 엔지니어링 작업입니다. 모델은 서사를 구성하고, 원본 자료에 충실하면서, 페이지마다 프런트엔드 코드를 작성하고, 렌더링하고, 결과를 검토하고, 문제를 고치고, 이를 수십 턴에 걸쳐 반복해야 합니다. 범용 모델은 이 단계들 가운데 잘하는 것과 못하는 것이 있고, 그 약점은 일정해서 평가에서 모델마다 고유한 특징으로 드러납니다.
Claude Opus 5는 작업 완수에서 가장 강하고 콘텐츠에서도 상위권이지만, 자기 점검 루프를 가장 적게 돌리기 때문에 완성된 자료에 눈에 띄는 결함이 남습니다. 사용자 입장에서는 높은 가격을 내고도 페이지를 직접 고쳐야 한다는 뜻입니다.
GPT-5.6 Sol은 가장 빈약한 자료를 만듭니다. 각 페이지에 담긴 내용이 적습니다. 범용 모델 가운데 비주얼 디자인에서 최하위이고, UniPPTEval의 밀도, 레이아웃, 일관성, 계층 차원에서는 모든 데이터셋에서 다섯 모델 중 최하위입니다.
Kimi K3는 셋 중 가장 균형이 잡혀 있지만, 내부 그레이더의 비주얼 디자인에서는 세 데이터셋 모두 3위입니다.
슬라이드 제작은 수학 문제를 푸는 것보다 캔버스에 구성과 배치를 하는 일에 가깝습니다. 어려운 작업이지만, 사용자가 실제로 경험하는 것에서 직접 학습시키면 해결할 수 있는 문제입니다. 하루에 12만 건의 자료를 만들고 있다는 점은 범용 랩이 이 작업에서 가질 수 없는 세 가지를 저희에게 줍니다. 사람들이 슬라이드 도구에 실제로 무엇을 요청하고, 범용 모델이 어디에서 기대를 저버리는지 안다는 것. 요청한 사람에게 좋은 자료가 무엇인지, 어떤 자료가 좋아요를 받고, 다운로드되고, 수정 요청으로 되돌아오는지의 집계를 통해 안다는 것. 그리고 텍스트 기록이 아니라 완성된 결과물에 대해 보상을 계산할 수 있다는 것입니다.
평가 방법
자료의 품질은 어떻게 측정하느냐에 크게 좌우됩니다. 저희는 매일 대규모로 슬라이드 생성을 운영하기 때문에 자체 그레이더를 만들었습니다. 믿어 달라고 하기보다, 그것이 어떻게 작동하고 어떻게 검증했는지 설명하겠습니다. 세 가지 신호, 세 개의 데이터셋, 다섯 개의 모델입니다.
세 가지 신호: 자동 그레이더, 사람의 어노테이션, 프로덕션 피드백.
내부 그레이더: 저희의 채점 파이프라인입니다. 판정자는 Claude Fable 5로 구동되는 에이전트로, 렌더링된 자료를 작업 완수, 콘텐츠 품질, 비주얼 디자인, 프로세스 품질의 네 차원으로 채점합니다. 그 위에 페널티(레이아웃 결함, 조작, 왜곡, 지시 무시)와 결함 없는 자료에 대한 보너스가 더해집니다. 이 그레이더는 Gen-1 Slides의 강화학습 보상도 제공했기 때문에, 표 1의 점수는 학습과 독립적이지 않습니다. 아래의 두 공개 그레이더는 독립적입니다. 이 글에서 그레이더는 채점 파이프라인을, 판정자는 그레이더 안의 멀티모달 LLM을, 보상은 그레이더 출력으로 계산되는 스칼라 학습 신호를 뜻합니다.
공개 그레이더: 벤치마크 저자들이 공개한 두 그레이더를 사용합니다. PPTEval은 UltraPresent 저자들의 PPTAgent 프로젝트에서 나온 것으로 콘텐츠, 디자인, 일관성을 채점합니다. UniPPTEval은 UniPPTBench와 같은 논문에서 정의되었으며, 열 개의 기본 차원과 시각적 완결성을 채점합니다. 둘 모두 자기 데이터셋뿐 아니라 세 데이터셋 전부에서 실행했고, 어느 것도 학습 중 보상으로 쓰인 적이 없습니다. PPTEval은 Claude Fable 5 판정자로, UniPPTEval은 논문이 지정한 Gemini 판정자로 실행했습니다.
사람: 프로덕트 매니저와 디자이너가 77건의 슬라이드 생성 작업에 걸쳐 4,063페이지를 어노테이션했습니다. 별도로, 157만 건의 프로덕션 작업에서 별점, 좋아요/싫어요, 다운로드 신호를 얻었습니다.
세 개의 데이터셋: AI Data Retention을 켠 개인 사용자의 비식별화된 작업 200건과 두 개의 공개 벤치마크 세트를 사용했습니다. PPTAgent 저자들이 공개한 UltraPresent에서는 128건의 검증 분할을, UniPPTBench에서는 126건을 사용했습니다. 이 글에서 UltraPresent와 UniPPTBench는 데이터셋 이름이고, PPTEval과 UniPPTEval은 각각의 공식 그레이더 이름입니다.
다섯 모델이 같은 에이전트 하네스, 같은 도구, 같은 렌더링 루프, 같은 프롬프트, 프로덕션과 같은 사고량 설정으로 모든 작업을 실행했습니다. Gen-1 Slides, Claude Opus 5, Kimi K3, GPT-5.6 Sol, 그리고 포스트트레이닝을 거치지 않은 기준선으로 미조정 MiniMax M3(RL 이전) 체크포인트입니다. 그림 1에는 참고용으로 더 많은 모델을 실었지만, 프로덕션에서 의미 있는 규모로 운영해 온 것은 이 다섯 모델이므로 저희가 신뢰하는 비교는 이쪽입니다.
품질
같은 작업, 세 모델

같은 분기 사업 리뷰 작업을 세 모델이 렌더링한 결과. 각 이미지는 생성된 자료의 개요 슬라이드입니다.
200건의 실제 작업에서 Gen-1 Slides는 다섯 모델 중 종합 점수와 비주얼 디자인 점수가 가장 높았습니다. Claude Opus 5는 작업 완수와 콘텐츠 품질에서 선두입니다. 종합적으로 두 모델은 같은 수준에 있으며, 둘 사이의 격차는 다른 모델들과의 격차보다 작습니다.
표 1. 내부 그레이더, 프로덕션 실제 작업 200건(n=200).
| 모델 | 종합 | 작업 완수 | 콘텐츠 품질 | 비주얼 디자인 | 프로세스 품질 | USD/자료 1건 |
|---|---|---|---|---|---|---|
| Gen-1 Slides | 0.821 | 0.780 | 0.737 | 0.756 | 0.719 | 0.44 |
| Claude Opus 5 | 0.810 | 0.849 | 0.782 | 0.688 | 0.695 | 4.16 |
| Kimi K3 | 0.723 | 0.840 | 0.784 | 0.557 | 0.748 | 2.00 |
| GPT-5.6 Sol | 0.668 | 0.820 | 0.743 | 0.479 | 0.748 | 2.01 |
| MiniMax M3(미조정) | 0.563 | 0.741 | 0.668 | 0.494 | 0.608 | 0.34 |
비용은 동일 하네스에서 측정한 완성 자료 1건당 LLM 지출입니다. 굵은 글씨는 각 열의 최고값. 종합 점수는 네 열의 평균이 아닙니다. 부록 C를 참고하세요.
저희가 만들지 않은 그레이더에서도 유효한가
내부 그레이더는 이 작업에 대한 Genspark의 이해를 반영합니다. 그렇기에 공개 벤치마크에서도 이 개선이 유지되는지 묻는 것이 공정합니다. 그림 2는 같은 다섯 모델을 세 데이터셋에서 세 개의 독립적인 그레이더 계열로 비교한 것입니다. 막대는 0에서 시작합니다. 일부 격차가 작아 보이는 것은 상위 모델들이 각 척도의 상단 근처에 몰려 있기 때문이며, 축을 압축했기 때문이 아닙니다.
그림 2. 다섯 모델, 세 데이터셋, 세 그레이더 계열.

각 그레이더는 고유 척도로 표시(내부 0–1, PPTEval 1–5, UniPPTEval 0–10). 내부 실제 작업 200건, UltraPresent 검증 분할 128건, UniPPTBench 126건. 추론 설정은 프로덕션과 동일: 적응형 사고, 높은 사고량, 지원하지 않는 모델은 생략.
세 그레이더의 판단은 대체로 일치합니다. Gen-1 Slides는 그레이더 × 데이터셋 아홉 개 조합 중 여덟 개에서 1위였습니다. 유일하게 1위를 놓친 것은 UniPPTBench에 대한 UniPPTEval로, Kimi K3가 근소하게 앞섰습니다. 또한 2위 밖으로 한 번도 내려가지 않은 유일한 모델이며, 평균 순위는 1.11입니다. Kimi K3는 2.44, Opus 5는 2.56, M3 베이스는 4.22, GPT-5.6 Sol은 4.67입니다.
이 개선은 학습 분포 밖의 작업 세트로도 일반화됩니다. Gen-1 Slides는 아홉 개 비교 모두에서 베이스 모델을 앞섰습니다. 공개 그레이더에서는 상위 점수가 촘촘해서, 여섯 개 비교에서 1위와 2위의 차이는 만점의 1.7%를 넘지 않습니다. 그럼에도 Gen-1 Slides는 여섯 개 중 다섯 개에서 1위입니다. 차원별 전체 결과는 부록 C에 있습니다.
그레이더는 사람의 판단과 일치하는가
그레이더는 사람의 판단과 일치할 때만 신뢰할 가치가 있습니다. 저희는 두 개의 독립적인 신호, 즉 프로덕트 팀과 디자인 팀의 세밀한 어노테이션과 프로덕션 사용자의 피드백에 비추어 확인했습니다.
어노테이터가 발견한 것. 사람 평가는 77개 작업(그중 76건이 나란히 비교에 사용 가능), 모델당 자료 1건, 총 4,063페이지를 대상으로 프로덕트 팀과 디자인 팀이 블라인드로 검토했으며, 20페이지는 어노테이터 간 일치도를 측정하기 위해 이중으로 어노테이션했습니다. 독자가 가장 먼저 알아차리는 세 차원인 레이아웃, 출처 충실성, 미적 완성도에 초점을 맞췄습니다. 정보 전달과 서사 구조는 사람이 어노테이션하지 않았고, 개인 식별 정보가 포함된 작업은 어노테이션 전에 제외했습니다.
레이아웃: Opus 5와 비슷하며 약간 뒤처짐. 어떤 형태로든 레이아웃 문제가 있는 페이지는 Gen-1이 88%, Opus 5가 81%였지만, 심각한 문제로 좁히면 격차가 줄어 심각 이상으로 평가된 페이지는 Gen-1이 33%, Opus 5가 34%였습니다. 같은 작업을 나란히 비교했을 때 Gen-1은 24승 26패 26무를 기록했습니다. 출처 충실성: Opus 5보다 약간 우수. 30건의 자료(6개 작업 × 5개 모델)에서 추출한 9,141개의 원자적 주장에서 Gen-1의 조작 비율은 13.3%, Opus 5는 17.7%로 4.4포인트 차이였습니다. 재어노테이션에서 약 3포인트의 판정 편차가 남기 때문에 '크게 우수'가 아니라 '약간 우수'라고 표현합니다. 미적 완성도: 차이 없음. 디자이너의 쌍대 비교에서 스타일 판정 승률은 Gen-1 Slides 49%, Opus 5 51%였고, 완성도(craft) 판정에서도 유의한 차이는 없었습니다.
표 2. 사람 평가, Gen-1 Slides와 Claude Opus 5 비교.
| 차원/지표 | Gen-1 Slides | Claude Opus 5 |
|---|---|---|
| 레이아웃: 문제가 있는 페이지(%) | 88 | 81 |
| 레이아웃: 심각 이상 페이지(%) | 33 | 34 |
| 레이아웃: 사용 불가 페이지(%) | 7 | 15 |
| 레이아웃: 동일 작업 쌍대 비교(승 : 패 : 무) | 24 : 26 : 26 | — |
| 출처 충실성: 주장 단위 조작 비율(%) | 13.3 | 17.7 |
| 미적 완성도: 스타일 판정 승률(각 60쌍)(%) | 49 | 51 |
레이아웃 행은 모델당 약 42–48페이지 채점으로, 신뢰 구간이 약 ±14포인트이므로 2–3포인트 차이는 해석하지 않습니다. 쌍대 비교 행은 양측 이항 검정, 유의하지 않음.
사람과 그레이더의 판정은 세 차원 모두에서 일치합니다. 229페이지 감사에서 어노테이터는 그레이더의 페이지 단위 레이아웃 판정 중 88%를 유지했고, 세 판정자의 다수결은 표본으로 뽑은 49개 조작 포인트 중 48개에서 사람의 정답과 일치했습니다. 불일치가 있을 때의 패턴은 일관됩니다. 그레이더는 약간 비어 있는 페이지에 너무 엄격하고, 작은 글자는 놓칩니다. 사람들끼리도 판단이 갈리며, 이는 모든 "일치" 주장에 붙는 단서입니다. 어노테이션 예시는 부록 E에 있습니다.
사용자의 행동. 8월부터 9월까지의 단계적 출시 기간 동안 157만 건의 작업에서 Gen-1 Slides와 Claude Opus 5는 평균 평점, 낮은 평점 비율, 좋아요/싫어요 비율, 다운로드율 모두에서 구별되지 않았습니다. 미조정 M3 베이스는 분명히 뒤처집니다. 평균 평점은 0.45점 낮고, 낮은 평점 비율은 약 5배, 좋아요/싫어요 비율은 절반 이하이며, 다운로드율만 비슷했습니다(30.4%).
표 3. 프로덕션 사용자 피드백.
| 모델 | 평균 평점(★) | 낮은 평점(≤2★) | 좋아요/싫어요 비율 | 다운로드율 |
|---|---|---|---|---|
| Gen-1 Slides | 4.25 | 3.6% | 19.6 | 33.1% |
| Claude Opus 5 | 4.23 | 3.4% | 18.8 | 31.5% |
| MiniMax M3(미조정) | 3.80 | 18.0% | 8.8 | 30.4% |
2026년 8–9월 Genspark AI Slides 프로덕션 트래픽의 실사용자 피드백. 평균 평점은 5점 만점 별점의 평균, 낮은 평점 비율은 2점 이하 평점의 비율, 좋아요/싫어요 비율은 좋아요 대 싫어요의 비, 다운로드율은 완성 자료 중 다운로드된 비율. 굵은 글씨는 각 열의 최고값.
비용
Gen-1 Slides의 가격은 베이스 모델의 정가와 같습니다. 입력 100만 토큰당 0.30달러, 출력 100만 토큰당 1.20달러, 캐시된 입력 토큰(프롬프트 캐시 히트)은 0.06달러입니다. Claude Opus 5의 정가는 입력 100만 토큰당 5.00달러입니다. 누구나 확인할 수 있는 이 숫자로 보면 Gen-1 Slides의 정가는 Opus 5의 약 1/17입니다.
그러나 정가가 자료 한 건의 비용은 아닙니다. 스스로 페이지를 렌더링하고, 검토하고, 수정하는 모델은 그 단계를 건너뛰는 모델보다 한 건당 더 많은 토큰을 씁니다. 그리고 Gen-1 Slides는 비교 대상 중 그 일을 가장 많이 합니다. 그래서 같은 200건의 프로덕션 작업에서 저희 하네스로 완성 자료 한 건에 실제로 든 비용도 함께 보고합니다.
표 4. 완성 자료 1건당 측정 비용.
| 모델 | USD/자료 1건 | USD/1,000건 | Opus 5 예산 1달러로 만들 수 있는 자료 수 | 종합 점수 |
|---|---|---|---|---|
| Gen-1 Slides | 0.44 | 435 | 9.5 | 0.821 |
| Claude Opus 5 | 4.16 | 4,155 | 1.0 | 0.810 |
| Kimi K3 | 2.00 | 1,999 | 2.1 | 0.723 |
| GPT-5.6 Sol | 2.01 | 2,006 | 2.1 | 0.668 |
| MiniMax M3(미조정) | 0.34 | 338 | 12.3 | 0.563 |
200개 작업 실행에서 측정한 LLM 지출. 모든 모델이 동일 하네스를 사용. 포스트트레이닝은 미조정 M3 체크포인트 대비 건당 비용을 약 29% 높이는 대신 종합 점수를 0.26 끌어올렸습니다.
이렇게 측정하면 완성된 Gen-1 자료 한 건은 0.44달러, Opus 5는 4.16달러로 대략 9.5배 저렴합니다. 정가 격차인 17배보다 좁은 것은 Gen-1이 예산의 더 많은 부분을 자기 결과물을 점검하는 데 쓰기 때문입니다. 포스트트레이닝은 미조정 M3 대비 건당 비용을 약 29% 높였지만 점수를 Opus 5 수준으로 끌어올렸습니다. 두 숫자를 함께 보고하는 것은 서로 다른 질문에 답하기 때문입니다. 정가는 모델을 호출하는 데 드는 비용을, 측정 지출은 내놓을 수 있는 자료를 얻는 데 드는 비용을 말해 줍니다.
두 가지가 눈에 띕니다. 내부 그레이더 점수에서 Gen-1 Slides를 넘어선 유일한 모델은 Claude Fable 5.1인데, 그 차이는 0.003으로 우열을 가릴 수 없는 수준이면서 건당 비용은 약 14배입니다. 그리고 모든 범용 모델은 품질에서 Gen-1보다 낮거나 가격에서 Gen-1보다 높습니다. 비교 대상 중 더 싸면서 더 좋은 모델은 없습니다.
이 격차가 바로 이번 발표가 단순한 모델 출시 이상인 이유입니다. Opus급 슬라이드 품질을 프리미엄 등급이 아니라 모든 Genspark 사용자의 기본값으로 삼을 수 있을 만큼 저렴하게 만들었습니다. 대규모로 슬라이드를 운영하는 경제성도 달라집니다. 한 달에 1,000건을 만드는 팀의 비용은 약 4,200달러에서 약 440달러로 내려가고, 측정 가능한 품질 저하는 없습니다. 한 명에게 프런티어 품질을 제공하던 예산으로 대략 열 명에게 제공할 수 있다는 뜻입니다. Gen-1 패밀리가 다른 결과물로 확장되면서, 이것이 저희가 만들어 가는 사업의 모습이 됩니다. 프런티어 품질을 바닥선으로 삼는 것입니다.
학습 방법
Gen-1 Slides는 내부에서 구성한 약 2,000건의 슬라이드 작업으로 강화학습(RL)을 통해 학습했습니다. 롤아웃은 Genspark AI Slides 클러스터에서, 파라미터 업데이트는 Fireworks 플랫폼에서 실행했습니다.
충분한 탐색 단계를 거친 뒤, 최종 RL 실행은 NVIDIA B300 GPU 96장에서 일주일 만에 완료되었습니다. 실행 기간 동안 평균 학습 보상은 첫 스텝의 0.271에서 출시 시점 EMA 0.765까지 올랐습니다(그림 3). 보상 붕괴나 체크포인트 롤백은 실행 중 한 번도 없었습니다.
그림 3. 학습 중 보상.

연한 점은 각 옵티마이저 스텝의 평균 롤아웃 보상, 진한 선은 감쇠 계수 0.9의 EMA, 음영 띠는 15스텝 창의 ±1σ. 세 가지 배경색은 세 단계(256k GSPO → 512k GSPO → 512k GSPO + KL 가드)를 나타냅니다. 점선은 200개 작업 홀드아웃 세트에서의 Claude Opus 5(0.721)와 MiniMax M3 베이스(0.324)의 학습 시 보상으로 참고용이며, 학습 보상은 학습 작업에서 계산되므로 이들과 직접 비교할 수 없습니다.
전체 기술 보고서는 곧 공개할 예정입니다. 통상적인 RL 포스트트레이닝 방식과 비교해, 이번 실행은 다음과 같은 점을 개선했습니다.
온라인 그레이더가 정책과 함께 진화하며 보상 해킹에 대응합니다. 슬라이드 품질은 유난히 속이기 쉽습니다. 실행 과정에서 정책은 차례로, 참고 자료를 불러와 완성물인 것처럼 제출하는 법, 아무것도 확인하지 않고 보고서에 "출처 확인 완료"라고 쓰는 법, 오버플로 감지가 걸리지 않을 때까지 글자 크기를 줄이는 법을 배웠습니다. 각각은 점검을 통과하지만 사용자에게는 더 나쁜 자료를 건넵니다. 따라서 보상 해킹은 한 번에 근절할 수 있는 것이 아니며, RL 규모와 모델 능력이 커질수록 수법은 더 복잡해지고 감지하기 어려워집니다. 그래서 저희는 그레이더를 한 번에 완벽하게 만들려 하지 않고, 온라인으로 업데이트해 정책과 함께 진화시키며, 모든 업데이트를 그레이더와 독립적인 신호로 검증합니다. 구체적으로는 다음과 같습니다.
- 워처 에이전트가 학습을 상시 감시합니다. 롤아웃 과정과 결과물을 지속적으로 분석합니다. 위의 패턴들은 모두 이 방식으로 포착되어 온라인 그레이더 업데이트로 신속히 차단되었습니다.
- 디자이너가 지속적으로 검토합니다. 이들의 판정과 제안은 온라인 그레이더에 반영되며, 모든 그레이더 버전에 대한 수용 테스트 역할을 합니다.
코멘트에서 배우기: 그레이더 코멘트를 활용한 OPSD. 학습 과정에서 저희가 발견한 것은, 슬라이드 생성 궤적이 수십 턴과 수십만 토큰에 이르지만 마지막에 돌아오는 것은 자료가 좋은지 나쁜지를 알리는 스칼라 보상 하나뿐이라는 점이었습니다. 이 신호에는 정보가 너무 적습니다. 모델은 얼마나 잘했는지는 배우지만 무엇이 잘못되었고 어떻게 고쳐야 하는지는 배우지 못합니다. "4페이지 본문이 캔버스 밖으로 넘칩니다", "2페이지는 이미지만 있고 내용이 없습니다" 같은 그레이더의 코멘트에는 바로 그 정보가 담겨 있습니다. 하지만 모델은 그것을 한 번도 보지 못하고, 상태 공간에서 롤아웃을 거듭하며 시행착오로만 개선할 수 있었습니다.
그래서 Gen-1 Slides는 그레이더 코멘트에서 직접 배우려 합니다. 그레이더가 구체적인 제안을 내면 그 코멘트를 정책에 내재화합니다. 교사와 학생은 같은 모델이고, 교사의 컨텍스트에는 코멘트가 추가되어 있습니다. 학생 자신의 샘플 위에서, 학생에서 교사로의 토큰 가중 KL을 사용하는 on-policy self-distillation(OPSD)을 실행합니다. 실험에 따르면 소수의 경사 업데이트만으로 그레이더 코멘트를 정책에 내재화할 수 있어, 샘플 효율이 크게 향상되었습니다.
"AI 슬롭": 적대적 판별기. 많은 AI 생성 자료에 대해 사용자들은 같은 평가를 내립니다. AI가 만든 것처럼 보인다는 것입니다. 이제 사람들은 그런 외양을 "AI 슬롭"이라 부릅니다. 그 특징은 일관되지만 유한한 규칙으로 잡아내기는 어렵습니다. GAN 방식의 적대적 보상 학습을 빌려, 정책을 생성기로 보고 그 슬라이드와 사람이 디자인한 자료를 구별하는 작은 판별기를 학습시켰으며, 이를 내부 그레이더 신호로 삼아 온라인으로 업데이트했습니다. 최종적으로 고정한 판별기로 모든 체크포인트를 다시 채점하면, Gen-1 Slides의 결과물 중 AI 제작으로 판정되는 비율은 학습을 거치며 0.749에서 0.417로 떨어졌습니다.
보상 구성 요소에 대한 커리큘럼이 최적화 경로를 설계합니다. 다목적 RL에서는 지표 간 충돌이 학습 효율을 결정합니다. 작은 모델에서 단일 지표 실험을 지속한 결과, 비주얼 디자인과 레이아웃 결함 사이에 명확한 충돌이 있음을 확인했습니다. 이를 바탕으로 학습 초기에는 완성도 높고 세련된 디자인에 보상을 주고, 스타일이 안정된 뒤에 레이아웃 결함의 가중치를 단계적으로 높였습니다. 가중치와 전환 시점은 학습 실행 지표를 기준으로 정하고 온라인 그레이더 업데이트로 배포했습니다.
학습 안정성:
-
학습 환경이 곧 프로덕션 환경입니다. 하네스를 학습 클러스터에 복제하는 대신 롤아웃을 실제 서빙 스택 안에서 직접 실행해, 학습과 서빙 사이의 분포 차이를 없앴습니다.
-
GRPO 대신 GSPO: 토큰 단위가 아니라 시퀀스 단위의 중요도 비율을 사용합니다. 보상은 궤적 단위인데, GRPO의 토큰별 비율은 수만 토큰 길이의 궤적에서 분산이 큰 경사 추정을 만듭니다. GSPO는 길이로 정규화한 시퀀스 우도 비율, 즉 토큰 비율의 기하 평균을 사용하며, 모델이 생성한 토큰만 대상으로 하고 도구 출력은 마스킹합니다. 최적화 단위가 보상 단위와 일치하고, 곡선은 매끄럽게 올라갑니다.
-
제한된 지연을 허용하는 비동기 RL. 에피소드 중앙값은 15분, 가장 긴 것은 한 시간을 넘기 때문에 롤아웃과 학습은 계속 병렬로 돌아갑니다. 샘플러는 트레이너보다 최대 한 정책 버전까지만 뒤처질 수 있고, 가중치는 매 스텝 후 동기화되며, 한 버전보다 오래된 샘플은 폐기됩니다.
-
절단 중요도 샘플링(TIS)으로 학습–추론 불일치를 보정하고, KL은 가드로만 사용합니다. FP8 추론 엔진과 BF16 트레이너는 모든 토큰의 로그 확률에서 조금씩 어긋납니다. 이는 GSPO의 시퀀스 단위 비율과는 별개인 토큰 단위 비율이며, 임계값 2.0의 절단 중요도 샘플링으로 보정해 단일 토큰이 배치의 경사를 지배하지 못하게 합니다. 참조 KL 항은 없습니다. 각 업데이트 전에 현재 정책과 롤아웃 정책 사이의 KL을 불편(unbiased)이고 분산이 낮은 k3 KL 추정기로 추정하고, 임계값을 넘는 배치는 폐기합니다. KL은 경사에 들어가지 않습니다.
한계
다른 누군가가 지적하기 전에 저희가 먼저 말하겠습니다.
- 디자인을 배웠고, 너무 밀어붙였습니다. Gen-1 Slides는 비교 대상 어느 모델보다 밀도 높은 페이지를 만듭니다. 글자는 작고, 요소는 많고, 위쪽으로 무게가 쏠려 보이는 페이지도 더 많습니다. 슬라이드를 휴대폰으로 보는 청중이 많다면, 지금은 실제 약점이 될 수 있습니다.
- 콘텐츠와 작업 완수는 Opus 5에 미치지 못합니다. 베이스 모델은 둘 다 크게 뒤처진 상태에서 출발했습니다. Gen-1 Slides는 콘텐츠 품질에서 그 격차의 대부분을, 작업 완수에서도 상당 부분을 좁혔지만, 어느 쪽도 아직 따라잡지는 못했습니다.
- 슬라이드 전용이며 범용 모델이 아닙니다. 저희가 평가하고 사용을 권하는 작업은 이것뿐입니다. 문서 생성과 코딩에서는 개선이 이어지는 것을 확인했습니다. 스프레드시트나 리서치에서는 베이스 모델에 가까운 성능을 예상하시기 바랍니다. 그 베이스 모델 자체도 프런티어 모델에는 뒤처집니다.
사용 방법
- Genspark AI Slides. Standard 모드는 이제 기본으로 Gen-1 Slides를 사용합니다. Ultra 모드에서는 모델 선택기에서 프런티어 모델들을 나란히 놓고 계속 선택할 수 있습니다.
- 커맨드라인과 코딩 에이전트. Genspark CLI를 설치하고 로그인한 뒤
gsk task create slides로 자료를 만듭니다. 기본값은 Standard 모드, 즉 Gen-1 Slides입니다. Claude Code 같은 코딩 에이전트에서는 ACP gsk-slides 에이전트가 여러 턴에 걸친 생성과 편집을 담당합니다. - API. Genspark 브랜드로 OpenRouter 등록을 진행하고 있습니다. 얼리 액세스는 [email protected]로 문의해 주세요.
- 엔터프라이즈 워크스페이스. Gen-1 Slides의 학습과 평가에는 고객 콘텐츠가 전혀 사용되지 않았으며, 고객 데이터가 베이스 모델 개발사에 공유되는 일도 없습니다. 기존 워크스페이스의 모델 제한은 그대로 적용됩니다. 조직에서 AI Slides를 특정 제공자로 제한해 두었다면 Standard 모드는 이전처럼 승인된 모델을 계속 사용합니다. 워크스페이스에서 Gen-1 Slides를 켜거나 끄려면 담당 어카운트 팀에 문의해 주세요.
앞으로의 계획
Gen-1은 모델 패밀리의 이름이며, 일회성 출시가 아닙니다. 작업 전용 환경과 납품된 결과물에 대해 계산하는 보상이라는 같은 레시피는 스프레드시트, 문서, 리서치로 확장됩니다. 이들 작업을 위한 모델은 이미 학습 중입니다.
슬라이드에서 이 체크포인트는 출발점입니다. 같은 프로덕션 하네스와 같은 세 가지 신호로 학습을 계속하며, 평균뿐 아니라 모든 차원에서 주요 프런티어 모델과 같아지고 이어서 앞서는 것을 목표로 합니다. 새 체크포인트가 그 기준을 넘을 때마다 상위 등급으로 올라가고, 출시마다 Standard 모드의 바닥선이 함께 올라갑니다.
다음으로 준비하고 있는 것은 네이티브 PowerPoint(OOXML) 출력입니다. 모델이 디자인한 자료를 PowerPoint에서 열고 편집해 다시 가져와도 그대로 유지되도록 하는 것입니다.
Genspark AI Slides를 쓰고 있다면 따로 설정할 것이 없습니다. Standard 모드를 열면 다음 자료는 이미 Gen-1으로 만들어집니다. 여러분이 무엇을 만들어 낼지 기대하고 있습니다.
Genspark AI Slides에서 Gen-1 Slides 사용해 보기 →
감사의 말
Gen-1 Slides는 Fireworks AI와 공동으로 학습했습니다. 베이스는 MiniMax M3로, 에이전트 방식의 도구 호출을 위해 설계된 오픈 웨이트의 네이티브 롱 컨텍스트 MoE 모델입니다. 덕분에 사전 학습을 건너뛰고 예산 전부를 슬라이드 생성 루프에 쓸 수 있었습니다. 이런 오픈 베이스가 없었다면 Gen-1 Slides를 몇 주 만에 만들 수는 없었을 것입니다. 가중치를 공개해 준 개발사에, 그리고 벤치마크와 그레이더를 오픈소스로 공개해 준 PPTAgent 프로젝트와 UniPPTBench의 저자들에게 감사드립니다. 이 모델은 미국 인프라에서 구동되며, 베이스 모델 개발사로 데이터가 흘러가지 않습니다.
부록
A. 평가 설정
저희 프로덕션 슬라이드 스택에서 가장 중요한 네 모델인 Claude Opus 5, Kimi K3, GPT-5.6 Sol, MiniMax M3에 저희가 학습시킨 Gen-1 Slides를 더해 총 다섯 모델을 평가 대상으로 삼았습니다. 데이터셋은 내부와 외부 양쪽에서 모았으며, 내부 작업 200건과 두 공개 벤치마크의 254건을 합쳐 총 454건입니다. 그레이더는 내부 그레이더에 공개 벤치마크와 함께 배포된 두 그레이더를 결합했습니다. 그 결과는 5개 모델 × 3개 데이터셋 × 3개 그레이더의 평가 그리드입니다. 모든 자료는 같은 Genspark 슬라이드 하네스에서 나오므로, 달라지는 것은 모델뿐입니다. 45개 셀 각각에는 그레이더가 정의한 모든 차원의 점수와 종합 점수가 담깁니다.
B. 데이터셋과 그레이더
데이터셋은 Real tasks, UltraPresent, UniPPTBench 세 가지입니다.
Real tasks(200건, 내부): AI Data Retention을 켠 개인 사용자의 비식별화된 작업. Team과 Enterprise 데이터는 전혀 사용하지 않습니다. 셋 중 유일하게 실제 사용자 의도 분포를 반영합니다. UltraPresent(128건): arXiv 2602.22839. 각 작업은 자연어 브리프에 슬라이드 수, 화면 비율 같은 엄격한 제약이 붙은 형태이며, 영어와 중국어를 포함합니다. 검증 분할 전체를 사용합니다. 같은 저자들이 널리 쓰이는 PPTAgent를 만들고 PPTEval을 도입했습니다. UltraPresent는 그 이전 논문의 그레이더인 PPTEval로 채점합니다. UniPPTBench(126건): arXiv 2605.17356. 이 논문은 작업 세트와 평가기 UniPPTEval을 함께 정의하며, 모호한 프롬프트, 긴 문서, 멀티모달 문서, 다중 소스라는 네 가지 입력 설정을 다룹니다. 126건 전부를 사용합니다.
그레이더는 내부 그레이더에 더해, 두 공개 벤치마크와 함께 공개된 공식 그레이더를 사용합니다.
내부 그레이더 v3.2 — 네 차원(작업 완수, 콘텐츠 품질, 비주얼 디자인, 프로세스 품질)을 0–1 척도로 채점합니다. 저희 시스템의 실제 사용자 경험에 맞춰 조정되어 있으며, 그 점수는 Gen-1 Slides의 RL 학습 보상으로도 쓰입니다. 멀티모달 LLM 판정자는 claude-fable-5입니다. PPTEval(PPTAgent의 그레이더) — 콘텐츠, 디자인, 일관성 세 차원을 1–5 척도로 채점합니다. 논문에서 사용한, 이제는 오래된 GPT-4o 판정자를 claude-fable-5로 교체했고, 평가 기준은 바꾸지 않았습니다. UniPPTEval(UniPPTBench의 그레이더) — UniPPTBench와 함께 공개된 공식 그레이더로, 열 개의 기본 차원과 시각적 완결성 차원을 10점 척도로 채점합니다. Real tasks와 UltraPresent 데이터셋에는 해당하는 시나리오 사양이 없어 시나리오 차원은 채점하지 않았습니다(N/A). 판정자로는 논문이 지정한 멀티모달 LLM인 gemini-3-flash-preview를 사용합니다.
C. 차원별 전체 점수표
표 읽는 법. 세 그레이더는 척도가 다르기 때문에(0–1, 1–5, 0–10) 그레이더 간 점수를 평균하지 않고, 열 안의 순위만 평균합니다. 데이터셋 크기는 전체 건수(200 / 128 / 126)로 표기합니다. 사고량 설정은 프로덕션과 같으며 "평가 방법"에 적혀 있습니다.
C1. 내부 그레이더 v3.2 점수(0–1 척도)
Real tasks(n=200)
| 모델 | 점수 | 작업 완수 | 콘텐츠 품질 | 비주얼 디자인 | 프로세스 품질 |
|---|---|---|---|---|---|
| Gen-1 Slides | 0.821 | 0.780 | 0.737 | 0.756 | 0.719 |
| Claude Opus 5 | 0.810 | 0.849 | 0.782 | 0.688 | 0.695 |
| Kimi K3 | 0.723 | 0.840 | 0.784 | 0.557 | 0.748 |
| GPT-5.6 Sol | 0.668 | 0.820 | 0.743 | 0.479 | 0.748 |
| MiniMax M3(미조정) | 0.563 | 0.741 | 0.668 | 0.494 | 0.608 |
UltraPresent(n=128)
| 모델 | 점수 | 작업 완수 | 콘텐츠 품질 | 비주얼 디자인 | 프로세스 품질 |
|---|---|---|---|---|---|
| Gen-1 Slides | 0.932 | 0.874 | 0.804 | 0.898 | 0.768 |
| Claude Opus 5 | 0.883 | 0.878 | 0.800 | 0.876 | 0.615 |
| Kimi K3 | 0.874 | 0.888 | 0.833 | 0.765 | 0.792 |
| GPT-5.6 Sol | 0.798 | 0.860 | 0.800 | 0.671 | 0.765 |
| MiniMax M3(미조정) | 0.777 | 0.852 | 0.766 | 0.722 | 0.664 |
UniPPTBench(n=126)
| 모델 | 점수 | 작업 완수 | 콘텐츠 품질 | 비주얼 디자인 | 프로세스 품질 |
|---|---|---|---|---|---|
| Gen-1 Slides | 0.867 | 0.846 | 0.816 | 0.814 | 0.722 |
| Claude Opus 5 | 0.859 | 0.884 | 0.812 | 0.866 | 0.518 |
| Kimi K3 | 0.855 | 0.884 | 0.845 | 0.751 | 0.768 |
| GPT-5.6 Sol | 0.780 | 0.836 | 0.798 | 0.662 | 0.726 |
| MiniMax M3(미조정) | 0.579 | 0.817 | 0.713 | 0.513 | 0.616 |
점수는 네 차원(작업 완수, 콘텐츠 품질, 비주얼 디자인, 프로세스 품질)의 가중 평균에 레이아웃 결함, 조작, 왜곡, 지시 무시에 대한 페널티와 결함 없는 자료에 대한 보너스를 반영한 것으로, 상한은 1입니다.
C2. PPTEval 점수(1–5 척도)
Real tasks
| 모델 | PPTEval 평균 | 콘텐츠 | 디자인 | 일관성 |
|---|---|---|---|---|
| Gen-1 Slides | 3.783 | 3.423 | 3.915 | 4.010 |
| Kimi K3 | 3.714 | 3.429 | 4.039 | 3.674 |
| Claude Opus 5 | 3.655 | 3.412 | 3.808 | 3.746 |
| MiniMax M3(미조정) | 3.655 | 3.274 | 3.681 | 4.010 |
| GPT-5.6 Sol | 3.416 | 3.283 | 3.547 | 3.420 |
UltraPresent
| 모델 | PPTEval 평균 | 콘텐츠 | 디자인 | 일관성 |
|---|---|---|---|---|
| Gen-1 Slides | 3.812 | 3.483 | 3.952 | 4.000 |
| Kimi K3 | 3.770 | 3.524 | 4.005 | 3.782 |
| Claude Opus 5 | 3.701 | 3.460 | 3.843 | 3.800 |
| MiniMax M3(미조정) | 3.677 | 3.305 | 3.652 | 4.073 |
| GPT-5.6 Sol | 3.440 | 3.359 | 3.487 | 3.473 |
UniPPTBench
| 모델 | PPTEval 평균 | 콘텐츠 | 디자인 | 일관성 |
|---|---|---|---|---|
| Gen-1 Slides | 3.840 | 3.441 | 3.860 | 4.218 |
| Kimi K3 | 3.796 | 3.525 | 3.903 | 3.960 |
| MiniMax M3(미조정) | 3.687 | 3.285 | 3.518 | 4.258 |
| Claude Opus 5 | 3.610 | 3.389 | 3.506 | 3.936 |
| GPT-5.6 Sol | 3.459 | 3.358 | 3.455 | 3.564 |
C3. UniPPTEval 점수(0–10 척도)
Real tasks — 시나리오 차원 N/A(이 데이터셋에 시나리오 사양 없음)
| 모델 | 종합 점수 | 기본 차원 평균 | 시각적 완결성 |
|---|---|---|---|
| Gen-1 Slides | 8.858 | 8.834 | 9.099 |
| Claude Opus 5 | 8.709 | 8.699 | 8.804 |
| Kimi K3 | 8.684 | 8.623 | 9.287 |
| MiniMax M3(미조정) | 8.401 | 8.428 | 8.128 |
| GPT-5.6 Sol | 7.697 | 7.707 | 7.598 |
UltraPresent — 시나리오 차원 N/A
| 모델 | 종합 점수 | 기본 차원 평균 | 시각적 완결성 |
|---|---|---|---|
| Gen-1 Slides | 8.954 | 8.993 | 8.571 |
| Claude Opus 5 | 8.915 | 8.936 | 8.718 |
| Kimi K3 | 8.821 | 8.890 | 8.152 |
| MiniMax M3(미조정) | 8.452 | 8.491 | 8.060 |
| GPT-5.6 Sol | 7.825 | 7.829 | 7.817 |
UniPPTBench
| 모델 | 종합 점수 | 기본 차원 평균 | 시각적 완결성 | 시나리오 평균 |
|---|---|---|---|---|
| Kimi K3 | 8.995 | 9.026 | 9.288 | 6.759 |
| Gen-1 Slides | 8.834 | 8.964 | 8.822 | 6.363 |
| Claude Opus 5 | 8.805 | 8.817 | 8.397 | 6.916 |
| MiniMax M3(미조정) | 8.499 | 8.587 | 8.418 | 6.326 |
| GPT-5.6 Sol | 8.069 | 8.028 | 7.987 | 6.259 |
C3b. UniPPTEval의 열 가지 기본 차원(0–10)
C3의 기본 차원 평균은 이 열 가지 차원의 평균입니다. 차원별 감사를 위해 내역을 제시합니다. 열은 순서대로 지시 충족, 내용 정확성, 정보 밀도, 명료성과 가독성, 서사 일관성, 몰입도, 시각적 일관성, 레이아웃 품질, 계층과 강조, 시각 요소 품질입니다.
Real tasks
| 모델 | 지시 | 정확성 | 밀도 | 명료성 | 서사 | 몰입도 | 일관성 | 레이아웃 | 계층 | 시각 요소 |
|---|---|---|---|---|---|---|---|---|---|---|
| Gen-1 Slides | 9.741 | 9.135 | 8.870 | 8.710 | 9.565 | 8.378 | 9.503 | 9.078 | 8.990 | 6.373 |
| Claude Opus 5 | 9.736 | 9.145 | 8.829 | 8.580 | 9.497 | 7.917 | 9.135 | 8.772 | 8.700 | 6.679 |
| Kimi K3 | 9.596 | 9.072 | 8.731 | 8.845 | 9.342 | 7.617 | 9.300 | 8.964 | 8.793 | 5.974 |
| GPT-5.6 Sol | 9.119 | 8.912 | 7.668 | 7.197 | 8.896 | 7.135 | 8.026 | 7.249 | 7.492 | 5.378 |
| MiniMax M3(미조정) | 9.420 | 8.482 | 8.596 | 8.197 | 9.378 | 7.824 | 9.124 | 8.461 | 8.539 | 6.259 |
UltraPresent
| 모델 | 지시 | 정확성 | 밀도 | 명료성 | 서사 | 몰입도 | 일관성 | 레이아웃 | 계층 | 시각 요소 |
|---|---|---|---|---|---|---|---|---|---|---|
| Gen-1 Slides | 9.907 | 8.667 | 9.263 | 8.927 | 9.621 | 8.724 | 9.569 | 9.345 | 9.351 | 6.638 |
| Claude Opus 5 | 10.000 | 9.182 | 9.276 | 8.793 | 9.627 | 8.373 | 9.379 | 8.862 | 9.000 | 6.911 |
| Kimi K3 | 9.980 | 9.231 | 9.017 | 9.086 | 9.561 | 8.121 | 9.492 | 9.345 | 9.069 | 6.158 |
| GPT-5.6 Sol | 9.700 | 8.836 | 7.982 | 7.085 | 9.017 | 7.825 | 7.862 | 6.949 | 7.536 | 5.786 |
| MiniMax M3(미조정) | 9.782 | 8.000 | 8.982 | 8.362 | 9.559 | 8.271 | 9.368 | 8.321 | 9.017 | 5.288 |
UniPPTBench
| 모델 | 지시 | 정확성 | 밀도 | 명료성 | 서사 | 몰입도 | 일관성 | 레이아웃 | 계층 | 시각 요소 |
|---|---|---|---|---|---|---|---|---|---|---|
| Gen-1 Slides | 9.871 | 8.766 | 9.121 | 8.581 | 9.718 | 8.839 | 9.444 | 8.968 | 8.952 | 7.379 |
| Claude Opus 5 | 9.702 | 8.903 | 9.024 | 8.210 | 9.710 | 8.637 | 9.097 | 8.452 | 8.573 | 7.863 |
| Kimi K3 | 9.839 | 9.008 | 9.169 | 8.831 | 9.702 | 8.508 | 9.548 | 9.306 | 9.089 | 7.258 |
| GPT-5.6 Sol | 9.419 | 9.089 | 8.000 | 6.814 | 9.419 | 8.065 | 8.113 | 7.073 | 7.484 | 6.806 |
| MiniMax M3(미조정) | 9.710 | 8.516 | 8.726 | 8.008 | 9.734 | 8.565 | 9.145 | 8.065 | 8.653 | 6.740 |
C4. 열별 순위와 평균 순위
순위는 각 열 안에서 정하고(점수 높은 순), 아홉 개 열에 걸쳐 평균합니다. 낮을수록 좋습니다.
| 그레이더 × 데이터셋 | Gen-1 Slides | Claude Opus 5 | Kimi K3 | GPT-5.6 Sol | MiniMax M3(미조정) |
|---|---|---|---|---|---|
| 내부 v3.2 · Real tasks | 1 | 2 | 3 | 4 | 5 |
| 내부 v3.2 · UltraPresent | 1 | 2 | 3 | 4 | 5 |
| 내부 v3.2 · UniPPTBench | 1 | 2 | 3 | 4 | 5 |
| PPTEval · Real tasks | 1 | 3 | 2 | 5 | 4 |
| PPTEval · UltraPresent | 1 | 3 | 2 | 5 | 4 |
| PPTEval · UniPPTBench | 1 | 4 | 2 | 5 | 3 |
| UniPPTEval · Real tasks | 1 | 2 | 3 | 5 | 4 |
| UniPPTEval · UltraPresent | 1 | 2 | 3 | 5 | 4 |
| UniPPTEval · UniPPTBench | 2 | 3 | 1 | 5 | 4 |
| 평균 순위 | 1.11 | 2.56 | 2.44 | 4.67 | 4.22 |
D. 그림 1에 대한 설명
세로축은 내부 그레이더(v3.2)의 종합 점수로, 각 점은 11개 모델이 모두 완료한 실제 작업에서의 평균입니다. 본문과 표는 별도의 다섯 모델 실행(n=200, Gen-1 Slides 0.821, Claude Opus 5 0.810)을 기준으로 하기 때문에 그림의 값과는 배치가 달라 차이가 있지만, 그 차이는 생성 편차 범위 안에 있습니다. 세로축은 0.45–0.9 구간으로 잘라 표시했습니다. 가로축은 입력 토큰 정가(100만 토큰당 미국 달러, 로그 스케일)입니다. Claude Opus 5를 주된 기준으로 삼은 것은 현재 Genspark AI Slides가 가장 큰 규모로 운영하는 모델이어서 슬라이드 품질과 비용에 대한 실제 프로덕션 규모 데이터를 갖고 있기 때문입니다. Claude Fable 5 / 5.1은 실제 작업 데이터가 제한적이어서 참고용으로만 표시했습니다.
E. 사람 평가: 방법과 일치도 감사
슬라이드 어노테이션 방법: 레이아웃
검토자는 렌더링된 슬라이드에서 구체적인 레이아웃 결함을 점검하고, 그레이더가 표시한 항목을 확인한 뒤 놓친 문제를 추가합니다. 아래 예시는 같은 페이지에 있는 네 가지 문제를 보여 줍니다. 셋은 AI 그레이더가 표시했고, 하나는 사람의 검토로 추가되었습니다. 이는 가독성과 배치에 대한 점검이며, 기재된 주장이 출처로 뒷받침되는지와는 별개입니다.

어노테이션 예시: Q3 2026 at a Glance. 번호 1–4는 아래에서 설명하는 영역을 가리키며, 심각도 점수가 아닙니다. AI 그레이더는 1, 3, 4를 표시했고, 사람 검토자가 2를 추가했습니다. 설명은 제공된 어노테이션 메모를 따릅니다.
1. 겹침과 넘침: AI가 표시. 오른쪽 아래 "Sales Mix by Channel" 표가 카드보다 높습니다. 마지막 행 "Catering 3% 3%"가 카드 밖으로 넘쳐 아래의 요약 문구와 겹치면서, 같은 자리에 두 겹의 텍스트가 생겨 읽기 어렵습니다.
2. 너무 작은 글자: AI가 놓치고 사람이 추가. 왼쪽 막대그래프의 값 레이블, 지역명, 세로축 눈금 레이블은 어노테이션 메모에 따르면 10–11px에 불과해, 본문의 17–19px과 비교하면 작습니다. 투사하면 읽기 어렵습니다. 그레이더는 이를 표시하지 않았고, 검토자가 추가했습니다.
3. 과도한 빈 공간: AI가 표시. 오른쪽 위 선그래프가 카드의 왼쪽으로 몰려 있어 오른쪽 약 3분의 1이 비어 있습니다. 이 어노테이션은 이 그래프 카드 안의 불균형을 가리키는 것으로, 모든 여백을 결함으로 보는 규칙은 아닙니다.
4. 정렬과 그리드 불일치: AI가 표시. 상단 KPI 카드들이 일정한 그리드를 이루지 않습니다. 두 번째 카드만 높아서 아래 가장자리가 다른 카드보다 아래로 내려와 있고, 카드 사이 간격도 고르지 않습니다.
사람의 검토가 더하는 것. 색 배합이 잘 정돈된 페이지도 기본적인 가독성 점검에서 떨어질 수 있습니다. 이 예시에서 사람의 검토는 그레이더가 표시한 겹침, 빈 공간, 정렬 항목에 더해, 놓쳤던 작은 글자 결함을 추가했습니다. 이 예시는 레이블을 붙이는 방식을 보여 주기 위한 것이며, 레이아웃 집계 결과는 별도로 보고합니다.
슬라이드 어노테이션 방법: 출처 충실성
검토자는 개별 주장을 제공된 원본 자료와 대조하여 직접 뒷받침되는 사실, 뒷받침되는 추론, 조작(원본에 기재도 뒷받침도 없는 주장)을 구분합니다. 아래 예시는 일곱 건의 대조와, 사람의 검토가 자동 판정을 바꾼 두 건을 보여 줍니다.

어노테이션 예시: Strategic Options Matrix. 녹색(1–2): 직접 뒷받침되는 사실. 노란색(3): 뒷받침되는 추론. 빨간색(4–5): 조작. 보라색(6–7): 사람과 그레이더의 판정이 갈린 항목으로, 네 번째 레이블은 아닙니다. 아래 설명은 제공된 어노테이션 메모를 요약한 것입니다.
1. 차량 수: 직접 뒷받침. 원본에는 22대로 기재되어 있으며, 18대는 일상 운행, 4대는 예비입니다. 사람과 그레이더 판정 일치.
2. 탑승률: 직접 뒷받침. 2024년 82%와 2026년 상반기 54%는 모두 원본의 수치입니다. 슬라이드의 "FY 2024" 표기는 "2024년"과 같은 뜻으로 간주합니다. 사람과 그레이더 판정 일치.
3. 28퍼센트포인트 하락: 뒷받침되는 추론. 원본에 28이라는 숫자는 없지만, 82에서 54를 빼면 도출됩니다. 사람과 그레이더 판정 일치.
4. 화물 전환 투자액 NGN 8,500만–1억 2,000만: 조작. 원본에는 투자액이 없고, 추정을 요구하지도 않았습니다. 사람과 그레이더 판정 일치.
5. 12–14대로 축소: 조작. 원본이 제시하는 것은 현재 차량 수이며, 목표 차량 수도, 그것을 도출할 근거도 아닙니다. 사람과 그레이더 판정 일치.
6. B2B 차터의 "높은" 마진: 사람이 조작으로 수정. 그레이더는 처음에 작업이 마진 열이 있는 비교표를 요구했다는 이유로 이를 뒷받침되는 추론으로 받아들였습니다. 검토자는 그 근거를 기각했습니다. 열을 요구했다는 사실은 특정 평가의 근거가 되지 않습니다. 뒷받침하는 사실이 없다면 그 셀은 비워 두거나 "평가 필요"로 표시해야 합니다. 이 규칙을 명확히 한 뒤, 그레이더도 이를 조작으로 판정했습니다.
7. 여객 영업 마진 "하락": 수학적으로 뒷받침, 조작 아님. 월간 여객 매출은 35.7% 줄었고, 사용자가 제공한 동일 기준 데이터에 따르면 같은 사업의 영업비용 감소는 11%에 그쳤습니다. 마진 수치가 직접 보고되지는 않았지만, 마진 하락은 수학적으로 성립합니다.
경계가 중요합니다. 같은 열 안에서 사람의 검토는 뒷받침 없는 평가 하나를 기각하고, 다른 하나는 근거 있는 것으로 받아들였습니다. 검토자는 열 전체를 한꺼번에 받아들이거나 기각하는 대신, 주장 하나하나의 근거를 확인합니다.


