AIベンチマーク

事務作業の性能評価

オフィスベンチ(OfficeBench)

表計算・文書・メール・予定表を使う事務作業を、AIが最後まで正しく終えられるか。300件の公開課題を実際に走らせ、所要時間・正確さを同じ条件で評価しています。

判断基準

事務作業を効率化するために、自社に専用のAIを導入検討する際には、性能の高さはもちろんですが、それ以外にも作業遂行のスピード、安定した回答率も判断要素に入れる必要があります。

使ったのは「オフィスベンチ(OfficeBench)」という公開の学術ベンチマークです。これは事務作業を任せられる総合力を図るためのもので、文書・表計算・メール・予定表・PDFなどを扱う300件の課題を通して、複数のAIを比べられます。

課題の中身

事務作業では、1つのアプリではなく複数のアプリを使うことがよくあります。そのため、このベンチマークは1〜3個のアプリを組み合わせた作業を評価できる課題になっています。公式の課題から、アプリを1つ使うもの・2つ使うもの・3つ使うものを挙げます。課題の指示を、人名を伏せた日本語で示しています。

01

予定表への会議追加

「Aさんの予定表に、2024/5/17 10:30〜11:00の会議を追加する」— 日時を読み取り、重ならない枠に入れます。

02

表の集計と回答

「中間試験1の最低点と最高点を求め、その差を答える」— 表の値から計算し、指定されたファイルに書きます。

03

共通の空き時間の探索

「5/1にAさんとBさんが1時間の会議をできる共通の時間を探す」— 2人の予定を突き合わせます。

04

画像からの文字取り出し

「停電通知の画像から文字を取り出し、power_failure.pdf として保存する」— 読み取りと、保存先・ファイル名の指定を守ります。

05

スキャンPDFの表計算への転記

「スキャンしたPDFの最初の5人分の得点を score.xlsx に入れる」— 値を別のアプリへ移します。

06

条件に合う受講生の抜き出し

「CS161を受講している学生の氏名と学籍番号を students.docx に、1行に1人ずつ『学籍番号, 氏名』の形で書く」— 書式の指定まで守ります。

07

資料のPDF化とメール送付

「プロジェクト表を task.pdf に変換し、そのPDFを添付したメールを作る」— 変換とメール作成を続けて行います。

08

数値の表化と上長への報告

「売上の数値を取り出して revenues.xlsx に表として保存し、上長へメールする」— 3つのアプリを跨ぎます。

09

申請PDFの判定と面談の登録

「奨学金の申請PDFが学校の方針を満たすか確認し、result.docx に yes か no を書き、5/31 13:00に担当者との面談を meeting.ics に登録する」— 判断・文書・予定の3つを続けて行います。

10

メールの仕分けと保存

「すべてのメールを読み、宛先ごとのフォルダを作り、元の名前のPDFとしてそれぞれのフォルダに保存する」— 件数分の作業を最後まで続けます。

11

告知PDFからの連絡先作成

「コンサート告知のPDFを読み、名前と日付を取り出して contact.docx に連絡先として保存する」— 読み取り元を間違えません。

扱うアプリ

課題で使う9種類のアプリです。課題は、この中から1〜3個を組み合わせて作られています。

文書(Word)

文書の作成・読み取り・書き込み・PDF変換

表計算(Excel)

表の作成・セル操作・PDF変換

メール

受信一覧の確認・本文の読み取り・送信

予定表

予定の追加・削除・一覧の確認

PDF

PDFの読み取り、PDFと画像の相互変換、Wordへの変換

画像読み取り(OCR)

画像やスキャン資料からの文字の取り出し

LLMへの問い合わせ

文章の要約や判定をモデル自身に問い合わせる

シェル

コマンド実行によるファイル操作

システム

コピー・貼り付けによる値の受け渡しとアプリの切り替え

専用AIの導入は、まず業務の切り分けから

自社の業務では、どの作業をAIに任せ、どこから人が担当するかの切り分けが必要です。専用AI導入前の業務切り分けから御相談下さい。

正答率と所要時間

利用するアプリの個数ごとに、モデルと推論能力の組み合わせごとの正解の割合を示します。同じ条件で評価した値だけを並べています。

アプリ1つ

表示モデル

GLM 5.3 FlashDeepSeek V4.1 FlashGPT-5.6 Luna

アプリ2つ

表示モデル

GLM 5.3 FlashDeepSeek V4.1 FlashGPT-5.6 Luna

アプリ3つ

表示モデル

GLM 5.3 FlashDeepSeek V4.1 FlashGPT-5.6 Luna

棒は、モデルと推論能力の組み合わせごとの正解の割合です。推論を切った条件も含めて掲載しています。

推論能力ごとの速度・所要時間・回答率

推論能力を変えると、何がどう動くかを見ます。所要時間はモデルごとに大きく開き、Lunaは120秒以上かかるのに対し、GLMとDeepSeekは10〜100秒の範囲です。能力を最大まで上げると、DeepSeekとLunaはその中でも最も長くなります。出力速度もモデルごとの差が大きく、Lunaは8〜24、DeepSeekは最も速い設定で181.8に達します。能力との連動ははっきりせず、答えの長さに左右されます。回答率は、導入できるモデルでは低から高まで9割以上を保ちます。ただし最大まで上げると下がるモデルもあり、DeepSeekは85.0%になります。

出力速度(トークン/秒)

課題あたりの所要時間(秒)

回答率

GLM 5.3 FlashDeepSeek V4.1 FlashGPT-5.6 Luna

モデルごとの必要メモリ量

自社環境に置く場合に、モデルそのものを保持しておくためのメモリ量です。同じモデルでも、精度を落とした軽い構成ほど小さく収まります。公開されている構成ごとに示しています。

モデルごとの必要メモリ量

公開されている重みの実サイズです。推論能力を変えても重みは変わらないため、モデルごとの値です。実際にはこれに加えて、文書の長さに応じた作業領域が必要になります。

数値一覧

回答率は「AIが答えを返せた割合」で、正答率は正解の割合です。 スマートフォンでは表を左右に動かせます。

モデル提供元推論能力費用正答率回答率試行数(完走分)
アプリ1つアプリ2つアプリ3つ
GLM 5.3 FlashOllama CloudNone$0.025374.2%52.6%18.8%80.0%300
Low$0.001473.1%58.9%23.2%90.6%300
Medium$0.002177.4%75.8%35.7%91.5%300
High$0.001476.3%69.5%29.5%96.8%300
Max$0.002179.6%73.7%33.0%92.9%300
DeepSeek V4.1 FlashOllama CloudNone$0.001855.9%54.7%17.9%100.0%300
Low$0.003377.4%63.2%38.4%96.2%300
Medium$0.00478.5%63.2%30.4%99.3%300
High$0.003373.1%66.3%32.1%96.5%300
Max$0.013576.3%51.6%24.1%85.0%300
GPT-5.6 Luna参考OpenAINone$0.050569.0%35.2%10.3%51.5%154
Low$0.01562.9%51.4%24.3%71.4%210
Medium$0.015358.2%51.3%17.9%74.7%221
High$0.013773.7%64.1%31.8%80.7%242
XHigh$0.013373.0%64.4%36.2%94.7%284
Max$0.014876.3%69.5%35.7%99.3%300

費用は、課題1件を実行したときに発生するモデル利用料です。開発費、保守費、人による確認時間は含みません。1課題あたりの金額は1セント未満のため、小数第4位まで表示しています。自社環境に置く場合は、この料金はかからず、サーバー費用のみになります。

用途別の選び方

同じ課題でも、優先するものが違えば選ぶモデルは変わります。よくある事務業務を、推奨する構成と、その構成でも残る限界に分けて示します。

定型処理を大量にこなしたい

推奨: GLM 5.3 Flash(推論: 高)

スキャンした書類から数値を抜いて一覧にする、といった1つのツールで終わる作業が中心なら、正解の割合は76.3%です。

4件に1件は不正解です。金額や日付など、誤りがそのまま業務に流れる項目は、人が確認する前提で設計してください。

表計算と文書をまたいで仕上げたい

推奨: GLM 5.3 Flash(推論: 中)

表で集計した数値を報告文書にまとめる作業なら、正解の割合は75.8%です。2種類のツールを使う条件では、導入できるモデルの中で最も高い割合でした。

推論を低に落とすと58.9%まで下がります。中との差が最も大きく開く条件なので、ここは下げない前提で組んでください。

複数のツールをまたぐ複合業務を任せたい

推奨: DeepSeek V4.1 Flash(推論: 低)

PDFを読んで表計算に取り込み、上長へメールするような作業なら、正解の割合は38.4%です。3種類のツールを使う条件では、導入できるモデルの中で最も高い割合でした。

どのモデルも4割前後にとどまり、10件任せれば6件は手直しが必要という水準です。人が最後に確認する工程を前提にしてください。

人が見ていない間も動かし続けたい

推奨: DeepSeek V4.1 Flash(推論: 中)

回答率99.3%は、推論を切った場合を除いて導入できるモデルで最も高い値です。答えが返ってこない回をできるだけ減らしたい用途に向きます。

回答率は「答えを返せた割合」で、正解の割合ではありません。推論を切れば100%になりますが、正解の割合は41.3%まで下がります。

1件あたりの時間を短くしたい

推奨: GLM 5.3 Flash(推論: 低)

課題あたりの所要時間の中央値が13.9秒と、推論を切った場合(10.7秒)を除いて評価した中で最も短い値です。書類を短時間でまとめて処理したいときに効きます。

速さを優先すると、複数のツールをまたぐ複合業務では正解の割合が23.2%まで下がります。所要時間と正確さは同時には改善しません。

参考:到達点の目安を知りたい

推奨: GPT-5.6 Luna(推論: 最大)

回答率99.3%は評価した中でも最も高い水準です。複数のツールをまたぐ作業でも正解の割合35.7%で、導入できるモデルの最高値(38.4%)とほぼ同じでした。

自社環境に置けるモデルではありません。導入できるモデルが、この水準からどれだけ離れているかを示すために掲載しています。

社内業務に最適な運用を専用AIで

上の内容は、課題の種類ごとの一般的な傾向です。実際の業務では、扱う書類の作りや確認手順で結果が変わります。手元の業務での試算と、無理なく回る運用のかたちを一緒に設計します。

評価条件

ベンチマーク:オフィスベンチ(OfficeBench)。2024年に論文と評価コードが公開された学術ベンチマークで、公式の300課題と公式の判定プログラムをそのまま使っています。課題の割り当ては、アプリ1つが93件、2つが95件、3つが112件です。

比較したモデル:GLM 5.3 Flash と DeepSeek V4.1 Flash(いずれも Ollama Cloud)が、自社環境に導入できる候補です。GPT-5.6 Luna(OpenAI)は、この2つに性能のものさしを与えるための参考で、同じようには自社環境に置けません。推論能力は、導入できる候補が5段階(None / Low / Medium / High / Max)、参考のLunaは1段階多い6段階です。導入できる候補では、各段階とも300件が最後まで完走しています。

実行環境:候補の2つは Ollama Cloud 上で実行しました。同じモデルを自社の環境に置いた場合と、モデルの挙動は同じです。速度は自社環境の計算資源に左右されるため、このページの速度は構成を選ぶときの目安としてお読みください。

費用の計算:各モデルが公開しているトークン単価に、実際に使ったトークン数を掛けて算出しています。各社の単価はドル建てのため、そのままドルで表示します。表示は1課題あたりの金額で、1セント未満になるため小数第4位まで示しています。DeepSeekは時間帯によって単価が変わるため、通常時間帯(Base)の単価を使いました。自社環境に置く場合、この料金はかからず、かかるのはサーバー費用のみです。開発費・保守費・人が確認する時間は、いずれの場合も含みません。

正しさの判定:採点は最後のファイルの状態を機械的に検査しています。「指示された値が入っているか」「指定のファイル名で保存されているか」「余計な値が入っていないか」を見る方式です。正解の割合は、最後まで実行できた課題のうち何割が合格だったかを表します。

速度の算出:出力速度(トークン/秒)は、1回の応答にかかった時間で出力トークン数を割った値です。応答の最初の1文字が出るまでの待ち時間を含むため、モデル単体の生成速度ではありません。所要時間は1課題の実行時間の中央値で、採点の処理(約4秒)を含みます。

失敗の区分:結果が出なかった場合を、提供元の障害・評価プログラム側の問題・モデルが答えを返せなかった場合に分けています。前の2つはモデルの性能ではないため、回答率から除いています。

データの出所:このページの数値は、実行記録(run-result.json)から自動で集計しています。集計プログラムと、集計値が正しいことを確認するテストは別途管理しています。

社内業務は専用AIで効率化しませんか?

扱う書類や確認手順が変われば、任せられる範囲も変わります。どの作業から始めるかの切り分けと、無理なく回る運用のかたちまで、まとめてご相談ください。