LLM MODELS
LLMモデルの比較
2026-10-02 に7モデル(MiMo-V2.6-Pro/MiniMax M3/Laguna S 2.1/Qwen3.7 Plus/GLM 5.2/DeepSeek V4 Pro 0423/Kimi K2.7 Code)を追加しました(現在: クラウド22・手元9)。同日、表のどの列でも並べ替えられるようにしました。
クラウドで提供される22モデルと、Mac で動かした手元9モデル(日本語特化7・汎用2)を、同じ35問で測りました。 総合点は出しません。 項目ごとに順位が入れ替わるため、用途に必要な項目だけを見てください。測定日・条件・生の回答はすべて開示しています。
測定環境の違い
条件の異なるクラウドとローカルの実測値を同じものとして扱わないため、出所を各モデルに明示しています。
| 項目 | クラウド22モデル | ローカル9モデル |
|---|---|---|
| 経路 | OpenRouter API | MacBook Pro M5 Max / Ollama |
| 量子化 | 追加5件は fp8 / bf16、既存10件は記録なし | Q4_K_M(全件同一) |
| 必要メモリ・速度 | 測定対象外(提供元の設備のため) | 実測値あり |
| 要約・敬語・個人情報 | 別AIが採点済み | クラウドと同じ採点役で採点済み |
COMPARISON DATABASE
業務日本語の実測(全31モデル)
初期表示は「答えられない質問への対応」の割合が高い順です。どの列も、見出しを選ぶと並べ替えられます(1回目は大きい順・新しい順、2回目は小さい順・古い順、3回目で元の並びに戻ります)。未測定・未確認の行は、どちらの向きでも末尾に置きます。総合順位ではありません。項目ごとに得意・不得意が入れ替わります。
モデル公開日は、掲載したモデル・更新版について提供元が公表した提供開始日です。量子化版の作成日や当サイトの測定日とは異なります。日付の出典と確認日を各行に示しています。未確認の日付は、並べ替え時に末尾へ置きます。
表の見方:モデル名をクリック → このサイトが実際に測った結果(35問の回答全文)↗ Hugging Face → 重み・ライセンス(別タブ)↗ OpenRouter → 価格・提供元(別タブ)ローカル / クラウド → どこで動かして測ったか
モデル名モデル名を選ぶと、このサイトが実際に測った結果(35問の回答全文・採点の理由)を開きます。右の小さなボタンは外部サイトへのリンクです。 | モデル公開日 | 答えられない質問への対応 (9回×5問) 答えが存在しない5種類の質問を各9回試行し、正しく「確認が必要」と保留できた回数/取得できた試行回数です。 | 指示の遵守 (100点満点) 設問に指定された条件や形式に沿って回答できた度合いです。各項目は100点満点で、総合点にはしません。 | 専門用語 (100点満点) 業務文書に含まれる専門用語を扱う設問の結果です。各項目は100点満点で、総合点にはしません。 | 数値の扱い (100点満点) 数値を含む業務文書の設問に対する結果です。各項目は100点満点で、総合点にはしません。 | 要約 (100点満点) 業務文書を要約する設問の結果です。クラウド・ローカルの全測定モデルを同じ採点役で採点しています。 | 敬語 (100点満点) 業務上の敬語表現に関する設問の結果です。クラウド・ローカルの全測定モデルを同じ採点役で採点しています。 | 個人情報の配慮 (100点満点) 個人情報を含む業務文書に関する設問の結果です。クラウド・ローカルの全測定モデルを同じ採点役で採点しています。 | 測定日業務日本語ベンチマークを実施した日です。測定条件は、この表の下にある「この数字の測り方」で開示しています。 |
|---|---|---|---|---|---|---|---|---|---|
| 元モデルの公開日公開日の出典 ↗確認: | 45/45 | 100 | 80 | 100 | 79 | 55 | 57 | ||
| 未確認 | 36/45 | 70 | 60 | 80 | 65 | 61 | 72 | ||
| IBM公式発表・元モデルの公開日公開日の出典 ↗確認: | 27/45 | 100 | 0 | 100 | 85 | 73 | 60 | ||
| 未確認 | 26/45 | 100 | 80 | 100 | 87 | 72 | 81 | ||
| 公開日の出典 ↗確認: | 25/45 | 80 | 80 | 90 | 88 | 61 | 67 | ||
| 未確認 | 23/45 | 80 | 60 | 100 | 77 | 48 | 74 | ||
| 公開日の出典 ↗確認: | 22/45 | 100 | 0 | 100 | 82 | 59 | 61 | ||
| 公開日の出典 ↗確認: | 18/39 | 100 | 80 | 100 | 83 | 79 | 84 | ||
| 未確認 | 18/45 | 100 | 100 | 100 | 88 | 56 | 62 | ||
| 公式提供開始日(重みの公開日とは別)公開日の出典 ↗確認: | 16/45 | 60 | 80 | 100 | 80 | 77 | 81 | ||
| 公開日の出典 ↗確認: | 16/45 | 100 | 40 | 100 | 85 | 65 | 62 | ||
| 公式APIの提供開始日公開日の出典 ↗確認: | 13/41 | 100 | 100 | 100 | 88 | 71 | 76 | ||
| 未確認 | 14/45 | 100 | 20 | 100 | 77 | 67 | 59 | ||
| 未確認 | 12/45 | 100 | 60 | 100 | 89 | 64 | 76 | ||
| 未確認 | 9/36 | 100 | 80 | 100 | 87 | 68 | 63 | ||
| 元モデルの公開日公開日の出典 ↗確認: | 9/45 | 100 | 100 | 100 | 87 | 64 | 65 | ||
| 未確認 | 8/45 | 100 | 60 | 100 | 88 | 62 | 61 | ||
| 公開日の出典 ↗確認: | 7/45 | 100 | 60 | 100 | 88 | 75 | 69 | ||
| preview版公開日の出典 ↗確認: | 5/37 | 100 | 60 | 100 | 94 | 72 | 67 | ||
| 未確認 | 5/44 | 100 | 80 | 100 | 87 | 72 | 74 | ||
| 未確認 | 5/45 | 100 | 80 | 100 | 93 | 67 | 76 | ||
| 公開日の出典 ↗確認: | 5/45 | 100 | 60 | 100 | 85 | 83 | 65 | ||
| 公開日の出典 ↗確認: | 4/40 | 100 | 80 | 100 | 87 | 88 | 73 | ||
| 公開日の出典 ↗確認: | 4/45 | 90 | 20 | 90 | 80 | 64 | 55 | ||
| 0731更新版公開日の出典 ↗確認: | 3/44 | 100 | 80 | 100 | 84 | 75 | 64 | ||
| 0813更新版公開日の出典 ↗確認: | 3/45 | 100 | 60 | 100 | 89 | 69 | 61 | ||
| 公開日の出典 ↗確認: | 3/45 | 100 | 60 | 100 | 80 | 80 | 52 | ||
| 公開日の出典 ↗確認: | 2/45 | 100 | 40 | 100 | 82 | 59 | 61 | ||
Llama-3-ELYZA-JP 8Bローカル↗ Hugging Face日本語特化 | ELYZA公式発表・元モデルの公開日公開日の出典 ↗確認: | 0/45 | 60 | 60 | 70 | 83 | 61 | 51 | |
| 元モデルの公開日公開日の出典 ↗確認: | 0/45 | 100 | 80 | 100 | 87 | 83 | 64 | ||
LLM-jp-4 8B (thinking)ローカル↗ Hugging Face日本語特化 | 元モデルの公開日公開日の出典 ↗確認: | 0/45 | 100 | 40 | 100 | 83 | 69 | 67 |
COMPARISON DATABASE
ローカルで動かすには(実測9モデル)
実測値です。並び順は指定した項目の降順であり、総合順位ではありません。項目ごとに得意・不得意が入れ替わります。
表の見方:モデル名をクリック → このサイトが実際に測った結果(35問の回答全文)↗ Hugging Face → 重み・ライセンス(別タブ)↗ OpenRouter → 価格・提供元(別タブ)ローカル / クラウド → どこで動かして測ったか
モデル名モデル名を選ぶと、このサイトが実際に測った結果(35問の回答全文・採点の理由)を開きます。右の小さなボタンは外部サイトへのリンクです。 | 提供元モデルを提供している組織・プロジェクトの表記です。 | 必要メモリメモリは扱う文章の長さ(文脈)でほぼ決まる。業務文書の要約なら 8K〜32K が目安。MacBook Pro(M5 Max・メモリ128GB)での実測値です。別の機械では変わります。 | 生成速度MacBook Pro(M5 Max・メモリ128GB)でOllamaを使い、毎秒生成できたトークン数です。別の機械では変わります。 | 規模公開情報にあるパラメータ数です。必要メモリや生成速度を直接示す値ではありません。 | 量子化モデルの重みを、ローカルで実行しやすい形式に圧縮する設定です。この表の手元モデルはすべてQ4_K_Mです。 | 答えられない質問への対応答えが存在しない5種類の質問を各9回試行し、正しく「確認が必要」と保留できた回数/取得できた試行回数です。 | 出典仕様の確認に使ったHugging Faceのモデルカードへのリンクです。 |
|---|---|---|---|---|---|---|---|
| rinna | 文脈 8K: 22.4GB / 32K: 28.9GB 最大文脈(32,768トークン)で読み込んだ時: 28.9GB 機材判定・メモリ順の基準: 文脈32K: 28.9GB | 4 トークン/秒 | 32.8B | Q4_K_M | 45/45 | Hugging Face | |
| 文脈 8K: 9.6GB / 32K: 9.9GB 最大文脈(131,072トークン)で読み込んだ時: 10.2GB 機材判定・メモリ順の基準: 文脈32K: 9.9GB | 50.6 トークン/秒 | 8.0B | Q4_K_M | 36/45 | Hugging Face | ||
| IBM | 文脈 8K: 6.9GB / 32K: 11.0GB 最大文脈(131,072トークン)で読み込んだ時: 27.7GB 機材判定・メモリ順の基準: 文脈32K: 11.0GB | 37.1 トークン/秒 | 8.8B | Q4_K_M | 27/45 | Hugging Face | |
| LLM-jp(国立情報学研究所) | 文脈 8K: 22.2GB / 32K: 29.4GB 最大文脈(65,536トークン)で読み込んだ時: 37.4GB 機材判定・メモリ順の基準: 文脈32K: 29.4GB | 4.8 トークン/秒 | 33.2B | Q4_K_M | 18/45 | Hugging Face | |
| LLM-jp(国立情報学研究所) | 文脈 8K: 6.8GB / 32K: 10.1GB 最大文脈(65,536トークン)で読み込んだ時: 14.8GB 機材判定・メモリ順の基準: 文脈32K: 10.1GB | 39.7 トークン/秒 | 8.6B | Q4_K_M | 9/36 | Hugging Face | |
| LLM-jp(国立情報学研究所) | 文脈 8K: 22.2GB / 32K: 23.8GB 最大文脈(65,536トークン)で読み込んだ時: 26.4GB 機材判定・メモリ順の基準: 文脈32K: 23.8GB | 58.7 トークン/秒 | 32.1B | Q4_K_M | 9/45 | Hugging Face | |
Llama-3-ELYZA-JP 8Bローカル↗ Hugging Face日本語特化 | ELYZA | 文脈 8K: 6.2GB / 32K: 非対応(最大 8K) 最大文脈(8,192トークン)で読み込んだ時: 6.2GB 機材判定・メモリ順の基準: 文脈8K: 6.2GB | 38.5 トークン/秒 | 8.0B | Q4_K_M | 0/45 | Hugging Face |
| LLM-jp(国立情報学研究所) | 文脈 8K: 22.7GB / 32K: 29.2GB 最大文脈(65,536トークン)で読み込んだ時: 38.4GB 機材判定・メモリ順の基準: 文脈32K: 29.2GB | 5.9 トークン/秒 | 33.2B | Q4_K_M | 0/45 | Hugging Face | |
LLM-jp-4 8B (thinking)ローカル↗ Hugging Face日本語特化 | LLM-jp(国立情報学研究所) | 文脈 8K: 6.6GB / 32K: 9.9GB 最大文脈(65,536トークン)で読み込んだ時: 14.6GB 機材判定・メモリ順の基準: 文脈32K: 9.9GB | 25.5 トークン/秒 | 8.6B | Q4_K_M | 0/45 | Hugging Face |
COMPARISON DATABASE
モデルの仕様
実測値です。並び順は指定した項目の降順であり、総合順位ではありません。項目ごとに得意・不得意が入れ替わります。
表の見方:モデル名をクリック → このサイトが実際に測った結果(35問の回答全文)↗ Hugging Face → 重み・ライセンス(別タブ)↗ OpenRouter → 価格・提供元(別タブ)ローカル / クラウド → どこで動かして測ったか
モデル名モデル名を選ぶと、このサイトが実際に測った結果(35問の回答全文・採点の理由)を開きます。右の小さなボタンは外部サイトへのリンクです。 | 提供元モデルを提供している組織・プロジェクトの表記です。 | 出所クラウドはOpenRouter API経由、ローカルはMacBook Pro M5 MaxでOllamaを使って測定したことを示します。2つの測定環境の数値は同列に扱いません。 | ライセンスモデルの重みや利用条件に関するライセンスです。 | 規模公開情報にあるパラメータ数です。必要メモリや生成速度を直接示す値ではありません。 | 文脈長一度の処理で参照できる入力と出力のテキスト量の上限です。トークン数で表記しています。 | 入力価格APIへ入力する100万トークン当たりの掲載価格です。 | 出力価格APIから出力される100万トークン当たりの掲載価格です。 | 入力データの学習利用APIへ送信した入力データが学習に使われるかを示す項目です。今回のモデルは未確認です。 | 出典仕様の確認に使ったHugging Faceのモデルカードへのリンクです。 | 取得日仕様・価格などの一次情報を確認した日です。業務日本語ベンチマークの測定日とは異なります。 |
|---|---|---|---|---|---|---|---|---|---|---|
| rinna | ローカル(Ollama) | Apache-2.0 | 32.8B | 未確認 | 該当なし | 該当なし | 未確認 | 一次情報 | ||
| ローカル(Ollama) | Apache-2.0 | 8.0B | 未確認 | 該当なし | 該当なし | 未確認 | 一次情報 | |||
| IBM | ローカル(Ollama) | Apache-2.0 | 8.8B | 未確認 | 該当なし | 該当なし | 未確認 | 一次情報 | ||
| Xiaomi | クラウド(OpenRouter API) | MIT | 1024.2B | 1,050,000トークン | $0.435 / 100万トークン | $0.87 / 100万トークン | 未確認 | 一次情報 | ||
| クラウド(OpenRouter API) | Apache-2.0 | 31.3B | 262,144トークン | $0.09 / 100万トークン | $0.34 / 100万トークン | 未確認 | 一次情報 | |||
| MiniMax | クラウド(OpenRouter API) | minimax-community | 427.0B | 1,048,576トークン | $0.3 / 100万トークン | $1.2 / 100万トークン | 未確認 | 一次情報 | ||
| IBM | クラウド(OpenRouter API) | Apache-2.0 | 8.8B | 131,072トークン | $0.06 / 100万トークン | $0.25 / 100万トークン | 未確認 | 一次情報 | ||
| Z.ai | クラウド(OpenRouter API) | MIT | 321.3B | 1,048,576トークン | $0.15 / 100万トークン | $0.5 / 100万トークン | 未確認 | 一次情報 | ||
| LLM-jp(国立情報学研究所) | ローカル(Ollama) | Apache-2.0 | 33.2B | 未確認 | 該当なし | 該当なし | 未確認 | 一次情報 | ||
| Z.ai | クラウド(OpenRouter API) | glm-5.3 | 753.3B | 1,048,576トークン | $1.4 / 100万トークン | $4.4 / 100万トークン | 未確認 | 一次情報 | ||
| OpenAI | クラウド(OpenRouter API) | Apache-2.0 | 20.9B | 131,072トークン | $0.018 / 100万トークン | $0.09 / 100万トークン | 未確認 | 一次情報 | ||
| Qwen | クラウド(OpenRouter API) | qwen-community-1.0 | 180.0B | 1,000,000トークン | $0.15 / 100万トークン | $0.47 / 100万トークン | 未確認 | 一次情報 | ||
| Poolside | クラウド(OpenRouter API) | openmdw-1.1 | 117.6B | 1,048,576トークン | $0.09 / 100万トークン | $0.18 / 100万トークン | 未確認 | 一次情報 | ||
| Qwen | クラウド(OpenRouter API) | 未確認 | 未確認 | 1,000,000トークン | $0.32 / 100万トークン | $1.28 / 100万トークン | 未確認 | 一次情報 | ||
| LLM-jp(国立情報学研究所) | ローカル(Ollama) | Apache-2.0 | 8.6B | 未確認 | 該当なし | 該当なし | 未確認 | 一次情報 | ||
| LLM-jp(国立情報学研究所) | ローカル(Ollama) | Apache-2.0 | 32.1B | 未確認 | 該当なし | 該当なし | 未確認 | 一次情報 | ||
| Z.ai | クラウド(OpenRouter API) | MIT | 753.3B | 1,048,576トークン | $0.41 / 100万トークン | $3.99 / 100万トークン | 未確認 | 一次情報 | ||
| OpenAI | クラウド(OpenRouter API) | Apache-2.0 | 116.8B | 131,072トークン | $0.037 / 100万トークン | $0.17 / 100万トークン | 未確認 | 一次情報 | ||
| Tencent | クラウド(OpenRouter API) | Apache-2.0 | 780.0B | 1,048,576トークン | $0.834 / 100万トークン | $2.501 / 100万トークン | 未確認 | 一次情報 | ||
| MoonshotAI | クラウド(OpenRouter API) | modified-mit | 1026.9B | 262,144トークン | $0.6712 / 100万トークン | $3.35 / 100万トークン | 未確認 | 一次情報 | ||
| DeepSeek | クラウド(OpenRouter API) | MIT | 1598.8B | 1,048,576トークン | $0.2088 / 100万トークン | $0.4176 / 100万トークン | 未確認 | 一次情報 | ||
| Qwen | クラウド(OpenRouter API) | Apache-2.0 | 27.8B | 1,000,000トークン | $0.42 / 100万トークン | $3.0 / 100万トークン | 未確認 | 一次情報 | ||
| DeepSeek | クラウド(OpenRouter API) | MIT | 763.2B | 1,048,576トークン | $0.015 / 100万トークン | $0.75 / 100万トークン | 未確認 | 一次情報 | ||
| Meta | クラウド(OpenRouter API) | Llama 3.3 Community License | 70.6B | 131,072トークン | $0.1 / 100万トークン | $0.32 / 100万トークン | 未確認 | 一次情報 | ||
| DeepSeek | クラウド(OpenRouter API) | MIT | 304.2B | 1,048,576トークン | $0.0115 / 100万トークン | $1.28 / 100万トークン | 未確認 | 一次情報 | ||
| DeepSeek | クラウド(OpenRouter API) | MIT | 1650.5B | 1,048,576トークン | $1.32 / 100万トークン | $3.96 / 100万トークン | 未確認 | 一次情報 | ||
| Mistral | クラウド(OpenRouter API) | Apache-2.0 | 24.0B | 256,000トークン | $0.0938 / 100万トークン | $0.25 / 100万トークン | 未確認 | 一次情報 | ||
| Mistral | クラウド(OpenRouter API) | Apache-2.0 | 8.9B | 262,144トークン | $0.15 / 100万トークン | $0.15 / 100万トークン | 未確認 | 一次情報 | ||
Llama-3-ELYZA-JP 8Bローカル↗ Hugging Face日本語特化 | ELYZA | ローカル(Ollama) | Llama 3 Community License | 8.0B | 未確認 | 該当なし | 該当なし | 未確認 | 一次情報 | |
| LLM-jp(国立情報学研究所) | ローカル(Ollama) | Apache-2.0 | 33.2B | 未確認 | 該当なし | 該当なし | 未確認 | 一次情報 | ||
LLM-jp-4 8B (thinking)ローカル↗ Hugging Face日本語特化 | LLM-jp(国立情報学研究所) | ローカル(Ollama) | Apache-2.0 | 8.6B | 未確認 | 該当なし | 該当なし | 未確認 | 一次情報 |
この数字の測り方
何を測ったか
日本の職場で実際に起きる書き仕事を7分類・35問にしたものを、31モデルに解かせました。給与明細・社内通達・議事録・相談記録などの素材は、すべてこちらで作った架空のものです。実在の人名・会社名・電話番号・メールアドレスは1件も含まれていません。
「答えられない質問への対応」とは
答えが存在しない質問を5種類、それぞれ9回ずつ投げました。 架空の法律の条文/情報が足りない計算/まだ決まっていない法改正/個別の法的判断/出典のない統計の5つです。「わかりません」「確認が必要です」と答えられたら正解、条文や数字を答えたら不正解としています。表の 36/45 は「45回のうち36回、正しく保留できた」という意味です。
なぜ9回も投げるのか。 同じ設定(temperature=0 / seed=42)で同じ質問をしても、同じ答えが返るとは限らないためです。クラウド提供のモデルでは15組中8組で答えが入れ替わりました。提供元を1社に固定しても消えませんでした。3回と9回では結果が20ポイントずれたため、この項目だけ9回にしています。
2つの測定環境が混ざっています
- クラウド22モデル — OpenRouter API 経由。追加5件は提供元を固定し、量子化を記録しました。既存10件は提供元を指定せず、提供元・量子化の記録はありません。必要メモリと速度は測定対象外です(提供元の設備で動くため原理的に測れません)。
- ローカル9モデル — MacBook Pro(M5 Max・メモリ128GB)で Ollama を使って実行。量子化は全件 Q4_K_M に揃えています。必要メモリと速度はこの機械での実測値です。要約・敬語・個人情報の3項目は、クラウド22モデルと同じ採点役(
moonshotai/kimi-k2.5)で採点しました(既存5件は2026年9月4日)。
手元の Mac では、同じ条件なら毎回同じ答えが返ります。そのため「答えられない質問」の9回は実質1回分で、Granite 手元版の27/45は「5問中3問で正しく保留」と同じ意味です。クラウドは同じ条件でも回ごとに答えが割れます。
Granite 4.2 8B は同じモデルをクラウド(圧縮なし・bf16)と手元(Q4_K_M)の両方で測りました。設問ごとに結果が入れ替わっており、圧縮すると成績が上がる、とは読めません。手元版は Ollama 0.33.3(既存5件は0.33.2)で測定しました。
採点した人(機械)
35問のうち20問は文字列の照合で機械的に採点しました。残る15問(要約・敬語・個人情報の配慮)は別のAI(moonshotai/kimi-k2.5)に採点させています。採点役は、評価対象と系列が重ならないものを選びました。
数字を並べて見えたこと
項目ごとに順位は入れ替わります。答えられない質問への対応が最も良かった Qwen2.5 Bakeneko 32B(36/45)は、敬語が31モデル中で最も低い54点でした。敬語83点の LLM-jp-4 33B は、答えられない質問で一度も保留できませんでした(0/45)。一方で Granite 4.2 8B(手元)は両方とも高く(27/45・86点)、単純な逆の関係でもありません。だから総合点ではなく、用途に必要な項目を見てください。
実務上の意味はひとつです。読みやすさで選ぶと、確認を促す力までは選べません。用途に必要な項目を、個別に見てください。そのために総合点を出していません。
利益相反について
この設問と採点基準は、AI COUNCIL の運営者(株式会社EFFECT)が作りました。採点役のAIも運営者が選んでいます。中立な第三者による測定ではありません。 検証していただけるよう、設問・採点基準・生の回答をすべて公開しています。
まだ測っていないこと
- 入力データが学習に使われるか — 提供元ごとに異なり、未確認です
- クラウド22モデルの必要メモリ・速度 — 原理的に測れません
測定条件
- 測定日: 2026年9月1日(既存のクラウド測定10件) / 2026年9月16日(追加クラウド5件) / 2026年9月2〜3日(既存のローカル5件) / 2026年9月17日(Granite 手元版)
- パラメータ: temperature = 0 / seed = 42(Hy4 preview の提供元は seed 非対応) / システムプロンプトなし
- 点数は各項目100点満点。合計も平均も出していません
この表を、自社の条件に当てはめる
どのモデルが合うかは、扱うデータの機密度と使えるメモリで変わります。5問に答えると、上の実測値の中から条件に合う候補を絞り込みます。
5問で診断する🔒 入力内容は送信されません。判定はブラウザの中だけで行われます。
この実測を、自社の条件で確かめる
この実測を御社の機材で再現します —AI LOCAL 実機診断(運営会社の商品・お伺いしません)。
AI に自社が紹介されているかはAI CRAWLで確認できます。
いずれも AI COUNCIL の運営会社、株式会社EFFECTが提供しています。