LLM MODELS

LLMモデルの比較

2026-10-02 に7モデル(MiMo-V2.6-Pro/MiniMax M3/Laguna S 2.1/Qwen3.7 Plus/GLM 5.2/DeepSeek V4 Pro 0423/Kimi K2.7 Code)を追加しました(現在: クラウド22・手元9)。同日、表のどの列でも並べ替えられるようにしました。

クラウドで提供される22モデルと、Mac で動かした手元9モデル(日本語特化7・汎用2)を、同じ35問で測りました。 総合点は出しません。 項目ごとに順位が入れ替わるため、用途に必要な項目だけを見てください。測定日・条件・生の回答はすべて開示しています。

測定環境の違い

条件の異なるクラウドとローカルの実測値を同じものとして扱わないため、出所を各モデルに明示しています。

クラウド22モデルとローカル9モデルの測定条件
項目クラウド22モデルローカル9モデル
経路OpenRouter APIMacBook Pro M5 Max / Ollama
量子化追加5件は fp8 / bf16、既存10件は記録なしQ4_K_M(全件同一)
必要メモリ・速度測定対象外(提供元の設備のため)実測値あり
要約・敬語・個人情報別AIが採点済みクラウドと同じ採点役で採点済み

COMPARISON DATABASE

業務日本語の実測(全31モデル)

初期表示は「答えられない質問への対応」の割合が高い順です。どの列も、見出しを選ぶと並べ替えられます(1回目は大きい順・新しい順、2回目は小さい順・古い順、3回目で元の並びに戻ります)。未測定・未確認の行は、どちらの向きでも末尾に置きます。総合順位ではありません。項目ごとに得意・不得意が入れ替わります。

表示を絞り込む(補助機能・初期状態は全件表示)

モデル公開日は、掲載したモデル・更新版について提供元が公表した提供開始日です。量子化版の作成日や当サイトの測定日とは異なります。日付の出典と確認日を各行に示しています。未確認の日付は、並べ替え時に末尾へ置きます。

表の見方:モデル名をクリック → このサイトが実際に測った結果(35問の回答全文)↗ Hugging Face → 重み・ライセンス(別タブ)↗ OpenRouter → 価格・提供元(別タブ)ローカル / クラウド → どこで動かして測ったか

業務日本語の実測(全31件)
モデル名
モデル名を選ぶと、このサイトが実際に測った結果(35問の回答全文・採点の理由)を開きます。右の小さなボタンは外部サイトへのリンクです。
モデル公開日答えられない質問への対応
(9回×5問)
答えが存在しない5種類の質問を各9回試行し、正しく「確認が必要」と保留できた回数/取得できた試行回数です。
指示の遵守
(100点満点)
設問に指定された条件や形式に沿って回答できた度合いです。各項目は100点満点で、総合点にはしません。
専門用語
(100点満点)
業務文書に含まれる専門用語を扱う設問の結果です。各項目は100点満点で、総合点にはしません。
数値の扱い
(100点満点)
数値を含む業務文書の設問に対する結果です。各項目は100点満点で、総合点にはしません。
要約
(100点満点)
業務文書を要約する設問の結果です。クラウド・ローカルの全測定モデルを同じ採点役で採点しています。
敬語
(100点満点)
業務上の敬語表現に関する設問の結果です。クラウド・ローカルの全測定モデルを同じ採点役で採点しています。
個人情報の配慮
(100点満点)
個人情報を含む業務文書に関する設問の結果です。クラウド・ローカルの全測定モデルを同じ採点役で採点しています。
測定日
業務日本語ベンチマークを実施した日です。測定条件は、この表の下にある「この数字の測り方」で開示しています。
元モデルの公開日公開日の出典 ↗確認: 45/4510080100795557
未確認36/45706080656172
IBM公式発表・元モデルの公開日公開日の出典 ↗確認: 27/451000100857360
未確認26/4510080100877281
公開日の出典 ↗確認: 25/45808090886167
未確認23/458060100774874
公開日の出典 ↗確認: 22/451000100825961
公開日の出典 ↗確認: 18/3910080100837984
未確認18/45100100100885662
公式提供開始日(重みの公開日とは別)公開日の出典 ↗確認: 16/456080100807781
公開日の出典 ↗確認: 16/4510040100856562
公式APIの提供開始日公開日の出典 ↗確認: 13/41100100100887176
未確認14/4510020100776759
未確認12/4510060100896476
LLM-jp-4.1 8B (thinking)ローカル↗ Hugging Face
未確認9/3610080100876863
元モデルの公開日公開日の出典 ↗確認: 9/45100100100876465
未確認8/4510060100886261
公開日の出典 ↗確認: 7/4510060100887569
preview版公開日の出典 ↗確認: 5/3710060100947267
未確認5/4410080100877274
未確認5/4510080100936776
公開日の出典 ↗確認: 5/4510060100858365
公開日の出典 ↗確認: 4/4010080100878873
公開日の出典 ↗確認: 4/45902090806455
0731更新版公開日の出典 ↗確認: 3/4410080100847564
0813更新版公開日の出典 ↗確認: 3/4510060100896961
公開日の出典 ↗確認: 3/4510060100808052
公開日の出典 ↗確認: 2/4510040100825961
Llama-3-ELYZA-JP 8Bローカル↗ Hugging Face
ELYZA公式発表・元モデルの公開日公開日の出典 ↗確認: 0/45606070836151
LLM-jp-4 33B (thinking)ローカル↗ Hugging Face
元モデルの公開日公開日の出典 ↗確認: 0/4510080100878364
LLM-jp-4 8B (thinking)ローカル↗ Hugging Face
元モデルの公開日公開日の出典 ↗確認: 0/4510040100836967

COMPARISON DATABASE

ローカルで動かすには(実測9モデル)

実測値です。並び順は指定した項目の降順であり、総合順位ではありません。項目ごとに得意・不得意が入れ替わります。

表示を絞り込む(補助機能・初期状態は全件表示)

表の見方:モデル名をクリック → このサイトが実際に測った結果(35問の回答全文)↗ Hugging Face → 重み・ライセンス(別タブ)↗ OpenRouter → 価格・提供元(別タブ)ローカル / クラウド → どこで動かして測ったか

ローカルで動かすには(実測9件)
モデル名
モデル名を選ぶと、このサイトが実際に測った結果(35問の回答全文・採点の理由)を開きます。右の小さなボタンは外部サイトへのリンクです。
提供元
モデルを提供している組織・プロジェクトの表記です。
必要メモリ
メモリは扱う文章の長さ(文脈)でほぼ決まる。業務文書の要約なら 8K〜32K が目安。MacBook Pro(M5 Max・メモリ128GB)での実測値です。別の機械では変わります。
生成速度
MacBook Pro(M5 Max・メモリ128GB)でOllamaを使い、毎秒生成できたトークン数です。別の機械では変わります。
規模
公開情報にあるパラメータ数です。必要メモリや生成速度を直接示す値ではありません。
量子化
モデルの重みを、ローカルで実行しやすい形式に圧縮する設定です。この表の手元モデルはすべてQ4_K_Mです。
答えられない質問への対応
答えが存在しない5種類の質問を各9回試行し、正しく「確認が必要」と保留できた回数/取得できた試行回数です。
出典
仕様の確認に使ったHugging Faceのモデルカードへのリンクです。
rinna文脈 8K: 22.4GB / 32K: 28.9GB
最大文脈(32,768トークン)で読み込んだ時: 28.9GB
機材判定・メモリ順の基準: 文脈32K: 28.9GB
4 トークン/秒32.8BQ4_K_M45/45Hugging Face
Google文脈 8K: 9.6GB / 32K: 9.9GB
最大文脈(131,072トークン)で読み込んだ時: 10.2GB
機材判定・メモリ順の基準: 文脈32K: 9.9GB
50.6 トークン/秒8.0BQ4_K_M36/45Hugging Face
IBM文脈 8K: 6.9GB / 32K: 11.0GB
最大文脈(131,072トークン)で読み込んだ時: 27.7GB
機材判定・メモリ順の基準: 文脈32K: 11.0GB
37.1 トークン/秒8.8BQ4_K_M27/45Hugging Face
LLM-jp(国立情報学研究所)文脈 8K: 22.2GB / 32K: 29.4GB
最大文脈(65,536トークン)で読み込んだ時: 37.4GB
機材判定・メモリ順の基準: 文脈32K: 29.4GB
4.8 トークン/秒33.2BQ4_K_M18/45Hugging Face
LLM-jp-4.1 8B (thinking)ローカル↗ Hugging Face
LLM-jp(国立情報学研究所)文脈 8K: 6.8GB / 32K: 10.1GB
最大文脈(65,536トークン)で読み込んだ時: 14.8GB
機材判定・メモリ順の基準: 文脈32K: 10.1GB
39.7 トークン/秒8.6BQ4_K_M9/36Hugging Face
LLM-jp(国立情報学研究所)文脈 8K: 22.2GB / 32K: 23.8GB
最大文脈(65,536トークン)で読み込んだ時: 26.4GB
機材判定・メモリ順の基準: 文脈32K: 23.8GB
58.7 トークン/秒32.1BQ4_K_M9/45Hugging Face
Llama-3-ELYZA-JP 8Bローカル↗ Hugging Face
ELYZA文脈 8K: 6.2GB / 32K: 非対応(最大 8K)
最大文脈(8,192トークン)で読み込んだ時: 6.2GB
機材判定・メモリ順の基準: 文脈8K: 6.2GB
38.5 トークン/秒8.0BQ4_K_M0/45Hugging Face
LLM-jp-4 33B (thinking)ローカル↗ Hugging Face
LLM-jp(国立情報学研究所)文脈 8K: 22.7GB / 32K: 29.2GB
最大文脈(65,536トークン)で読み込んだ時: 38.4GB
機材判定・メモリ順の基準: 文脈32K: 29.2GB
5.9 トークン/秒33.2BQ4_K_M0/45Hugging Face
LLM-jp-4 8B (thinking)ローカル↗ Hugging Face
LLM-jp(国立情報学研究所)文脈 8K: 6.6GB / 32K: 9.9GB
最大文脈(65,536トークン)で読み込んだ時: 14.6GB
機材判定・メモリ順の基準: 文脈32K: 9.9GB
25.5 トークン/秒8.6BQ4_K_M0/45Hugging Face

COMPARISON DATABASE

モデルの仕様

実測値です。並び順は指定した項目の降順であり、総合順位ではありません。項目ごとに得意・不得意が入れ替わります。

表示を絞り込む(補助機能・初期状態は全件表示)

表の見方:モデル名をクリック → このサイトが実際に測った結果(35問の回答全文)↗ Hugging Face → 重み・ライセンス(別タブ)↗ OpenRouter → 価格・提供元(別タブ)ローカル / クラウド → どこで動かして測ったか

モデルの仕様(全31件)
モデル名
モデル名を選ぶと、このサイトが実際に測った結果(35問の回答全文・採点の理由)を開きます。右の小さなボタンは外部サイトへのリンクです。
提供元
モデルを提供している組織・プロジェクトの表記です。
出所
クラウドはOpenRouter API経由、ローカルはMacBook Pro M5 MaxでOllamaを使って測定したことを示します。2つの測定環境の数値は同列に扱いません。
ライセンス
モデルの重みや利用条件に関するライセンスです。
規模
公開情報にあるパラメータ数です。必要メモリや生成速度を直接示す値ではありません。
文脈長
一度の処理で参照できる入力と出力のテキスト量の上限です。トークン数で表記しています。
入力価格
APIへ入力する100万トークン当たりの掲載価格です。
出力価格
APIから出力される100万トークン当たりの掲載価格です。
入力データの学習利用
APIへ送信した入力データが学習に使われるかを示す項目です。今回のモデルは未確認です。
出典
仕様の確認に使ったHugging Faceのモデルカードへのリンクです。
取得日
仕様・価格などの一次情報を確認した日です。業務日本語ベンチマークの測定日とは異なります。
rinnaローカル(Ollama)Apache-2.032.8B未確認該当なし該当なし未確認一次情報
Googleローカル(Ollama)Apache-2.08.0B未確認該当なし該当なし未確認一次情報
IBMローカル(Ollama)Apache-2.08.8B未確認該当なし該当なし未確認一次情報
Xiaomiクラウド(OpenRouter API)MIT1024.2B1,050,000トークン$0.435 / 100万トークン$0.87 / 100万トークン未確認一次情報
Googleクラウド(OpenRouter API)Apache-2.031.3B262,144トークン$0.09 / 100万トークン$0.34 / 100万トークン未確認一次情報
MiniMaxクラウド(OpenRouter API)minimax-community427.0B1,048,576トークン$0.3 / 100万トークン$1.2 / 100万トークン未確認一次情報
IBMクラウド(OpenRouter API)Apache-2.08.8B131,072トークン$0.06 / 100万トークン$0.25 / 100万トークン未確認一次情報
Z.aiクラウド(OpenRouter API)MIT321.3B1,048,576トークン$0.15 / 100万トークン$0.5 / 100万トークン未確認一次情報
LLM-jp(国立情報学研究所)ローカル(Ollama)Apache-2.033.2B未確認該当なし該当なし未確認一次情報
Z.aiクラウド(OpenRouter API)glm-5.3753.3B1,048,576トークン$1.4 / 100万トークン$4.4 / 100万トークン未確認一次情報
OpenAIクラウド(OpenRouter API)Apache-2.020.9B131,072トークン$0.018 / 100万トークン$0.09 / 100万トークン未確認一次情報
Qwenクラウド(OpenRouter API)qwen-community-1.0180.0B1,000,000トークン$0.15 / 100万トークン$0.47 / 100万トークン未確認一次情報
Poolsideクラウド(OpenRouter API)openmdw-1.1117.6B1,048,576トークン$0.09 / 100万トークン$0.18 / 100万トークン未確認一次情報
Qwenクラウド(OpenRouter API)未確認未確認1,000,000トークン$0.32 / 100万トークン$1.28 / 100万トークン未確認一次情報
LLM-jp-4.1 8B (thinking)ローカル↗ Hugging Face
LLM-jp(国立情報学研究所)ローカル(Ollama)Apache-2.08.6B未確認該当なし該当なし未確認一次情報
LLM-jp(国立情報学研究所)ローカル(Ollama)Apache-2.032.1B未確認該当なし該当なし未確認一次情報
Z.aiクラウド(OpenRouter API)MIT753.3B1,048,576トークン$0.41 / 100万トークン$3.99 / 100万トークン未確認一次情報
OpenAIクラウド(OpenRouter API)Apache-2.0116.8B131,072トークン$0.037 / 100万トークン$0.17 / 100万トークン未確認一次情報
Tencentクラウド(OpenRouter API)Apache-2.0780.0B1,048,576トークン$0.834 / 100万トークン$2.501 / 100万トークン未確認一次情報
MoonshotAIクラウド(OpenRouter API)modified-mit1026.9B262,144トークン$0.6712 / 100万トークン$3.35 / 100万トークン未確認一次情報
DeepSeekクラウド(OpenRouter API)MIT1598.8B1,048,576トークン$0.2088 / 100万トークン$0.4176 / 100万トークン未確認一次情報
Qwenクラウド(OpenRouter API)Apache-2.027.8B1,000,000トークン$0.42 / 100万トークン$3.0 / 100万トークン未確認一次情報
DeepSeekクラウド(OpenRouter API)MIT763.2B1,048,576トークン$0.015 / 100万トークン$0.75 / 100万トークン未確認一次情報
Metaクラウド(OpenRouter API)Llama 3.3 Community License70.6B131,072トークン$0.1 / 100万トークン$0.32 / 100万トークン未確認一次情報
DeepSeekクラウド(OpenRouter API)MIT304.2B1,048,576トークン$0.0115 / 100万トークン$1.28 / 100万トークン未確認一次情報
DeepSeekクラウド(OpenRouter API)MIT1650.5B1,048,576トークン$1.32 / 100万トークン$3.96 / 100万トークン未確認一次情報
Mistralクラウド(OpenRouter API)Apache-2.024.0B256,000トークン$0.0938 / 100万トークン$0.25 / 100万トークン未確認一次情報
Mistralクラウド(OpenRouter API)Apache-2.08.9B262,144トークン$0.15 / 100万トークン$0.15 / 100万トークン未確認一次情報
Llama-3-ELYZA-JP 8Bローカル↗ Hugging Face
ELYZAローカル(Ollama)Llama 3 Community License8.0B未確認該当なし該当なし未確認一次情報
LLM-jp-4 33B (thinking)ローカル↗ Hugging Face
LLM-jp(国立情報学研究所)ローカル(Ollama)Apache-2.033.2B未確認該当なし該当なし未確認一次情報
LLM-jp-4 8B (thinking)ローカル↗ Hugging Face
LLM-jp(国立情報学研究所)ローカル(Ollama)Apache-2.08.6B未確認該当なし該当なし未確認一次情報

この数字の測り方

何を測ったか

日本の職場で実際に起きる書き仕事を7分類・35問にしたものを、31モデルに解かせました。給与明細・社内通達・議事録・相談記録などの素材は、すべてこちらで作った架空のものです。実在の人名・会社名・電話番号・メールアドレスは1件も含まれていません。

「答えられない質問への対応」とは

答えが存在しない質問を5種類、それぞれ9回ずつ投げました。 架空の法律の条文/情報が足りない計算/まだ決まっていない法改正/個別の法的判断/出典のない統計の5つです。「わかりません」「確認が必要です」と答えられたら正解、条文や数字を答えたら不正解としています。表の 36/45 は「45回のうち36回、正しく保留できた」という意味です。

なぜ9回も投げるのか。 同じ設定(temperature=0 / seed=42)で同じ質問をしても、同じ答えが返るとは限らないためです。クラウド提供のモデルでは15組中8組で答えが入れ替わりました。提供元を1社に固定しても消えませんでした。3回と9回では結果が20ポイントずれたため、この項目だけ9回にしています。

2つの測定環境が混ざっています

  • クラウド22モデル — OpenRouter API 経由。追加5件は提供元を固定し、量子化を記録しました。既存10件は提供元を指定せず、提供元・量子化の記録はありません。必要メモリと速度は測定対象外です(提供元の設備で動くため原理的に測れません)。
  • ローカル9モデル — MacBook Pro(M5 Max・メモリ128GB)で Ollama を使って実行。量子化は全件 Q4_K_M に揃えています。必要メモリと速度はこの機械での実測値です。要約・敬語・個人情報の3項目は、クラウド22モデルと同じ採点役(moonshotai/kimi-k2.5)で採点しました(既存5件は2026年9月4日)。

手元の Mac では、同じ条件なら毎回同じ答えが返ります。そのため「答えられない質問」の9回は実質1回分で、Granite 手元版の27/45は「5問中3問で正しく保留」と同じ意味です。クラウドは同じ条件でも回ごとに答えが割れます。

Granite 4.2 8B は同じモデルをクラウド(圧縮なし・bf16)と手元(Q4_K_M)の両方で測りました。設問ごとに結果が入れ替わっており、圧縮すると成績が上がる、とは読めません。手元版は Ollama 0.33.3(既存5件は0.33.2)で測定しました。

採点した人(機械)

35問のうち20問は文字列の照合で機械的に採点しました。残る15問(要約・敬語・個人情報の配慮)は別のAI(moonshotai/kimi-k2.5)に採点させています。採点役は、評価対象と系列が重ならないものを選びました。

数字を並べて見えたこと

項目ごとに順位は入れ替わります。答えられない質問への対応が最も良かった Qwen2.5 Bakeneko 32B(36/45)は、敬語が31モデル中で最も低い54点でした。敬語83点の LLM-jp-4 33B は、答えられない質問で一度も保留できませんでした(0/45)。一方で Granite 4.2 8B(手元)は両方とも高く(27/45・86点)、単純な逆の関係でもありません。だから総合点ではなく、用途に必要な項目を見てください。

実務上の意味はひとつです。読みやすさで選ぶと、確認を促す力までは選べません。用途に必要な項目を、個別に見てください。そのために総合点を出していません。

利益相反について

この設問と採点基準は、AI COUNCIL の運営者(株式会社EFFECT)が作りました。採点役のAIも運営者が選んでいます。中立な第三者による測定ではありません。 検証していただけるよう、設問・採点基準・生の回答をすべて公開しています。

まだ測っていないこと

  • 入力データが学習に使われるか — 提供元ごとに異なり、未確認です
  • クラウド22モデルの必要メモリ・速度 — 原理的に測れません

測定条件

  • 測定日: 2026年9月1日(既存のクラウド測定10件) / 2026年9月16日(追加クラウド5件) / 2026年9月2〜3日(既存のローカル5件) / 2026年9月17日(Granite 手元版)
  • パラメータ: temperature = 0 / seed = 42(Hy4 preview の提供元は seed 非対応) / システムプロンプトなし
  • 点数は各項目100点満点。合計も平均も出していません

この表を、自社の条件に当てはめる

どのモデルが合うかは、扱うデータの機密度と使えるメモリで変わります。5問に答えると、上の実測値の中から条件に合う候補を絞り込みます。

5問で診断する

🔒 入力内容は送信されません。判定はブラウザの中だけで行われます。

この実測を、自社の条件で確かめる

この実測を御社の機材で再現します —AI LOCAL 実機診断(運営会社の商品・お伺いしません)。

AI に自社が紹介されているかはAI CRAWLで確認できます。

いずれも AI COUNCIL の運営会社、株式会社EFFECTが提供しています。

Copyright 2026 AI COUNCIL. 運営:株式会社EFFECT