予定表への会議追加
「Aさんの予定表に、2024/5/17 10:30〜11:00の会議を追加する」— 日時を読み取り、重ならない枠に入れます。
AIベンチマーク
オフィスベンチ(OfficeBench)
表計算・文書・メール・予定表を使う事務作業を、AIが最後まで正しく終えられるか。300件の公開課題を実際に走らせ、所要時間・正確さを同じ条件で評価しています。
事務作業を効率化するために、自社に専用のAIを導入検討する際には、性能の高さはもちろんですが、それ以外にも作業遂行のスピード、安定した回答率も判断要素に入れる必要があります。
使ったのは「オフィスベンチ(OfficeBench)」という公開の学術ベンチマークです。これは事務作業を任せられる総合力を図るためのもので、文書・表計算・メール・予定表・PDFなどを扱う300件の課題を通して、複数のAIを比べられます。
事務作業では、1つのアプリではなく複数のアプリを使うことがよくあります。そのため、このベンチマークは1〜3個のアプリを組み合わせた作業を評価できる課題になっています。公式の課題から、アプリを1つ使うもの・2つ使うもの・3つ使うものを挙げます。課題の指示を、人名を伏せた日本語で示しています。
「Aさんの予定表に、2024/5/17 10:30〜11:00の会議を追加する」— 日時を読み取り、重ならない枠に入れます。
「中間試験1の最低点と最高点を求め、その差を答える」— 表の値から計算し、指定されたファイルに書きます。
「5/1にAさんとBさんが1時間の会議をできる共通の時間を探す」— 2人の予定を突き合わせます。
「停電通知の画像から文字を取り出し、power_failure.pdf として保存する」— 読み取りと、保存先・ファイル名の指定を守ります。
「スキャンしたPDFの最初の5人分の得点を score.xlsx に入れる」— 値を別のアプリへ移します。
「CS161を受講している学生の氏名と学籍番号を students.docx に、1行に1人ずつ『学籍番号, 氏名』の形で書く」— 書式の指定まで守ります。
「プロジェクト表を task.pdf に変換し、そのPDFを添付したメールを作る」— 変換とメール作成を続けて行います。
「売上の数値を取り出して revenues.xlsx に表として保存し、上長へメールする」— 3つのアプリを跨ぎます。
「奨学金の申請PDFが学校の方針を満たすか確認し、result.docx に yes か no を書き、5/31 13:00に担当者との面談を meeting.ics に登録する」— 判断・文書・予定の3つを続けて行います。
「すべてのメールを読み、宛先ごとのフォルダを作り、元の名前のPDFとしてそれぞれのフォルダに保存する」— 件数分の作業を最後まで続けます。
「コンサート告知のPDFを読み、名前と日付を取り出して contact.docx に連絡先として保存する」— 読み取り元を間違えません。
課題で使う9種類のアプリです。課題は、この中から1〜3個を組み合わせて作られています。
文書の作成・読み取り・書き込み・PDF変換
表の作成・セル操作・PDF変換
受信一覧の確認・本文の読み取り・送信
予定の追加・削除・一覧の確認
PDFの読み取り、PDFと画像の相互変換、Wordへの変換
画像やスキャン資料からの文字の取り出し
文章の要約や判定をモデル自身に問い合わせる
コマンド実行によるファイル操作
コピー・貼り付けによる値の受け渡しとアプリの切り替え
利用するアプリの個数ごとに、モデルと推論能力の組み合わせごとの正解の割合を示します。同じ条件で評価した値だけを並べています。
棒は、モデルと推論能力の組み合わせごとの正解の割合です。推論を切った条件も含めて掲載しています。
推論能力を変えると、何がどう動くかを見ます。所要時間はモデルごとに大きく開き、Lunaは120秒以上かかるのに対し、GLMとDeepSeekは10〜100秒の範囲です。能力を最大まで上げると、DeepSeekとLunaはその中でも最も長くなります。出力速度もモデルごとの差が大きく、Lunaは8〜24、DeepSeekは最も速い設定で181.8に達します。能力との連動ははっきりせず、答えの長さに左右されます。回答率は、導入できるモデルでは低から高まで9割以上を保ちます。ただし最大まで上げると下がるモデルもあり、DeepSeekは85.0%になります。
自社環境に置く場合に、モデルそのものを保持しておくためのメモリ量です。同じモデルでも、精度を落とした軽い構成ほど小さく収まります。公開されている構成ごとに示しています。
公開されている重みの実サイズです。推論能力を変えても重みは変わらないため、モデルごとの値です。実際にはこれに加えて、文書の長さに応じた作業領域が必要になります。
回答率は「AIが答えを返せた割合」で、正答率は正解の割合です。 スマートフォンでは表を左右に動かせます。
| モデル | 提供元 | 推論能力 | 費用 | 正答率 | 回答率 | 試行数(完走分) | ||
|---|---|---|---|---|---|---|---|---|
| アプリ1つ | アプリ2つ | アプリ3つ | ||||||
| GLM 5.3 Flash | Ollama Cloud | None | $0.0253 | 74.2% | 52.6% | 18.8% | 80.0% | 300 |
| Low | $0.0014 | 73.1% | 58.9% | 23.2% | 90.6% | 300 | ||
| Medium | $0.0021 | 77.4% | 75.8% | 35.7% | 91.5% | 300 | ||
| High | $0.0014 | 76.3% | 69.5% | 29.5% | 96.8% | 300 | ||
| Max | $0.0021 | 79.6% | 73.7% | 33.0% | 92.9% | 300 | ||
| DeepSeek V4.1 Flash | Ollama Cloud | None | $0.0018 | 55.9% | 54.7% | 17.9% | 100.0% | 300 |
| Low | $0.0033 | 77.4% | 63.2% | 38.4% | 96.2% | 300 | ||
| Medium | $0.004 | 78.5% | 63.2% | 30.4% | 99.3% | 300 | ||
| High | $0.0033 | 73.1% | 66.3% | 32.1% | 96.5% | 300 | ||
| Max | $0.0135 | 76.3% | 51.6% | 24.1% | 85.0% | 300 | ||
| GPT-5.6 Luna参考 | OpenAI | None | $0.0505 | 69.0% | 35.2% | 10.3% | 51.5% | 154 |
| Low | $0.015 | 62.9% | 51.4% | 24.3% | 71.4% | 210 | ||
| Medium | $0.0153 | 58.2% | 51.3% | 17.9% | 74.7% | 221 | ||
| High | $0.0137 | 73.7% | 64.1% | 31.8% | 80.7% | 242 | ||
| XHigh | $0.0133 | 73.0% | 64.4% | 36.2% | 94.7% | 284 | ||
| Max | $0.0148 | 76.3% | 69.5% | 35.7% | 99.3% | 300 | ||
費用は、課題1件を実行したときに発生するモデル利用料です。開発費、保守費、人による確認時間は含みません。1課題あたりの金額は1セント未満のため、小数第4位まで表示しています。自社環境に置く場合は、この料金はかからず、サーバー費用のみになります。
同じ課題でも、優先するものが違えば選ぶモデルは変わります。よくある事務業務を、推奨する構成と、その構成でも残る限界に分けて示します。
推奨: GLM 5.3 Flash(推論: 高)
スキャンした書類から数値を抜いて一覧にする、といった1つのツールで終わる作業が中心なら、正解の割合は76.3%です。
4件に1件は不正解です。金額や日付など、誤りがそのまま業務に流れる項目は、人が確認する前提で設計してください。
推奨: GLM 5.3 Flash(推論: 中)
表で集計した数値を報告文書にまとめる作業なら、正解の割合は75.8%です。2種類のツールを使う条件では、導入できるモデルの中で最も高い割合でした。
推論を低に落とすと58.9%まで下がります。中との差が最も大きく開く条件なので、ここは下げない前提で組んでください。
推奨: DeepSeek V4.1 Flash(推論: 低)
PDFを読んで表計算に取り込み、上長へメールするような作業なら、正解の割合は38.4%です。3種類のツールを使う条件では、導入できるモデルの中で最も高い割合でした。
どのモデルも4割前後にとどまり、10件任せれば6件は手直しが必要という水準です。人が最後に確認する工程を前提にしてください。
推奨: DeepSeek V4.1 Flash(推論: 中)
回答率99.3%は、推論を切った場合を除いて導入できるモデルで最も高い値です。答えが返ってこない回をできるだけ減らしたい用途に向きます。
回答率は「答えを返せた割合」で、正解の割合ではありません。推論を切れば100%になりますが、正解の割合は41.3%まで下がります。
推奨: GLM 5.3 Flash(推論: 低)
課題あたりの所要時間の中央値が13.9秒と、推論を切った場合(10.7秒)を除いて評価した中で最も短い値です。書類を短時間でまとめて処理したいときに効きます。
速さを優先すると、複数のツールをまたぐ複合業務では正解の割合が23.2%まで下がります。所要時間と正確さは同時には改善しません。
推奨: GPT-5.6 Luna(推論: 最大)
回答率99.3%は評価した中でも最も高い水準です。複数のツールをまたぐ作業でも正解の割合35.7%で、導入できるモデルの最高値(38.4%)とほぼ同じでした。
自社環境に置けるモデルではありません。導入できるモデルが、この水準からどれだけ離れているかを示すために掲載しています。
上の内容は、課題の種類ごとの一般的な傾向です。実際の業務では、扱う書類の作りや確認手順で結果が変わります。手元の業務での試算と、無理なく回る運用のかたちを一緒に設計します。
ベンチマーク:オフィスベンチ(OfficeBench)。2024年に論文と評価コードが公開された学術ベンチマークで、公式の300課題と公式の判定プログラムをそのまま使っています。課題の割り当ては、アプリ1つが93件、2つが95件、3つが112件です。
比較したモデル:GLM 5.3 Flash と DeepSeek V4.1 Flash(いずれも Ollama Cloud)が、自社環境に導入できる候補です。GPT-5.6 Luna(OpenAI)は、この2つに性能のものさしを与えるための参考で、同じようには自社環境に置けません。推論能力は、導入できる候補が5段階(None / Low / Medium / High / Max)、参考のLunaは1段階多い6段階です。導入できる候補では、各段階とも300件が最後まで完走しています。
実行環境:候補の2つは Ollama Cloud 上で実行しました。同じモデルを自社の環境に置いた場合と、モデルの挙動は同じです。速度は自社環境の計算資源に左右されるため、このページの速度は構成を選ぶときの目安としてお読みください。
費用の計算:各モデルが公開しているトークン単価に、実際に使ったトークン数を掛けて算出しています。各社の単価はドル建てのため、そのままドルで表示します。表示は1課題あたりの金額で、1セント未満になるため小数第4位まで示しています。DeepSeekは時間帯によって単価が変わるため、通常時間帯(Base)の単価を使いました。自社環境に置く場合、この料金はかからず、かかるのはサーバー費用のみです。開発費・保守費・人が確認する時間は、いずれの場合も含みません。
正しさの判定:採点は最後のファイルの状態を機械的に検査しています。「指示された値が入っているか」「指定のファイル名で保存されているか」「余計な値が入っていないか」を見る方式です。正解の割合は、最後まで実行できた課題のうち何割が合格だったかを表します。
速度の算出:出力速度(トークン/秒)は、1回の応答にかかった時間で出力トークン数を割った値です。応答の最初の1文字が出るまでの待ち時間を含むため、モデル単体の生成速度ではありません。所要時間は1課題の実行時間の中央値で、採点の処理(約4秒)を含みます。
失敗の区分:結果が出なかった場合を、提供元の障害・評価プログラム側の問題・モデルが答えを返せなかった場合に分けています。前の2つはモデルの性能ではないため、回答率から除いています。
データの出所:このページの数値は、実行記録(run-result.json)から自動で集計しています。集計プログラムと、集計値が正しいことを確認するテストは別途管理しています。