パラメータ数
パラメータスウ
公式定義は確認できず(業界の慣用)
AIモデルが学習で獲得した内部の数値の個数。規模を示す目安で、「7B」なら70億個を指す。
「B」は billion(10億)を意味します。多いほど高性能とは限らない点は、資料によって書きぶりが分かれます。Google の Gemma 公式ドキュメントは「パラメータ数とビット数が大きいモデルは一般により高性能」と説明する一方、査読前論文には逆の実測が複数あります(Chinchilla 70B が Gopher 280B や GPT-3 175B を上回る、LLaMA-13B が GPT-3 175B を多くのベンチマークで上回る、など)。学習データ量や学習手法が同等でない限り、パラメータ数だけでの性能比較は成立しません。
確認上の注記: 「パラメータ数」という語自体を定義した提供元の公式ページは確認できませんでした。B=billion の表記と、上記の性能に関する実測は一次情報で裏が取れています。
出典: arXiv(Chinchilla 論文)/Google AI for Developers
モデル内部の数値をより少ないビット数で表し直し、動かすのに必要なメモリを減らす技術。
Hugging Face の公式ドキュメントは「精度をできるだけ保ちながら、重みをより低い精度で保存することで、モデルの読み込みと利用に必要なメモリを下げるもの」と定義しています。重みは通常32ビットで保持されますが、16ビット、さらに8ビット・4ビットまで落とす手法があります。どの程度精度が落ちるかは手法とモデルによって異なり、一律には言えません。llama.cpp の公式ドキュメントも、精度低下は Perplexity などの指標で測るもので、適切な設定で軽減できると述べており、劣化幅が固定値でないことを示しています。
出典: Hugging Face Transformers ドキュメント
ローカルでAIモデルを動かすための、設定情報もまとめて1つに収めたファイル形式。
ggml 公式リポジトリの仕様書は GGUF を「GGML および GGML ベースの実行系で推論するためにモデルを保存するファイル形式」とし、GGML・GGMF・GGJT の後継であると明記しています。特徴として「単一ファイルでの配布:追加情報のための外部ファイルを必要とせず、容易に配布・読み込みができる」ことを挙げ、重みとメタデータの両方を含みます。量子化形式は F32・F16・Q4_K・Q6_K などが仕様に定義されています。
確認上の注記: GGUF が何の略かは公式仕様書に記載がなく、よく見る展開形は一次情報で確認できませんでした。Q4_K_M 等の末尾 S/M/L が何を意味するかも公式ドキュメントには説明がありません。
出典: ggml 公式リポジトリ GGUF 仕様書
モデルが一度のやり取りでまとめて参照できる文章量の上限。トークンという単位で数える。
Anthropic の公式ドキュメントは「言語モデルが応答を生成する際に参照できるすべてのテキスト。応答そのものを含む」と定義し、応答も枠に含まれると明記しています。Google の Gemini 公式も「入力トークンと出力トークンの合計の上限を定めるもの」としており、入力と出力は別枠ではありません。長ければその全部を正しく使えるわけではない点は複数の一次情報が指摘しており、Anthropic は「文脈が多ければ自動的に良いわけではない。トークン数が増えるにつれ正確さと想起が劣化する(context rot として知られる現象)」と述べています。arXiv の「Lost in the Middle」も、関連情報が文脈の中間にあると性能が大きく落ちることを報告しています。
出典: Anthropic 公式ドキュメント/Google Gemini API/arXiv:2307.03172
AIが文章を処理する際の最小単位。単語より細かく区切られることがあり、料金の計算にも使われる。
Google の公式ドキュメントは「トークンは z のような単一の文字のこともあれば cat のような単語全体のこともある。長い単語は複数のトークンに分割される」とし、Gemini では1トークンが約4文字、100トークンが英語60〜80語に相当するとしています。API 料金は入力・出力のトークン数で決まるため、課金単位でもあります。日本語・中国語は単語が空白で区切られないため専用の分割手法が必要になると Hugging Face の解説は明記しています。同じ内容の文章でも言語によってトークン数が大きく異なり、最大15倍の差が出ることが arXiv 論文で実測されており、これが利用料金・処理時間・投入できる文脈量の差につながります。
確認上の注記: 「日本語は英語の何倍」という具体的な倍率は、OpenAI の一次情報にアクセスできなかった(HTTP 403)ため記載していません。言語間で差が出ること自体は arXiv 論文で確認済みです。
出典: Google Gemini API 公式ドキュメント/Hugging Face/arXiv:2305.15425
temperature
テンパラチャー
定義が割れている
出力のばらつき具合を調整する設定値。低いほど安定し、高いほど多様な文章になる。
取りうる値の範囲は提供元によって異なります。OpenAI は0〜2を採り、高い値でランダムに、低い値でより焦点が絞られ決定的になると説明します。Anthropic は0〜1(既定値1.0)で「応答に注入されるランダム性の量」と定義しており、範囲が倍違うため設定値をそのまま移植すると挙動が変わります。「0にすれば完全に決定的」とは公式には言えず、Anthropic は「temperature が 0.0 であっても、結果は完全に決定的にはならない」と明記しています。
出典: Anthropic 公式 API リファレンス/OpenAI 公式 API リファレンス
生成時のランダム性を決める数値。同じ値で出力を再現しやすくなるが、完全一致は保証されない。
OpenAI は「システムは最善の努力で決定的にサンプリングし、同じ seed とパラメータを使った繰り返しのリクエストは同じ結果を返すはず」と説明する一方、「決定性は保証されない」と明記しています。さらに「リクエストパラメータが一致していても、モデルに内在する非決定性により応答が異なる可能性がわずかにある」とも記されています。ローカル実行系にも seed はありますが、llama.cpp・Ollama の公式ドキュメントはいずれも決定性の保証には言及していません。実務では「seed を固定したのに出力が変わった」は不具合ではなく仕様の範囲内と理解する必要があります。
出典: OpenAI Cookbook(公式)/llama.cpp/Ollama 公式ドキュメント
蒸留(Distillation)
ジョウリュウ(ディスティレーション)
定義が割れている
大きなモデルが持つ知識を、より小さく動かしやすいモデルに学習させて移し替える手法。
原論文は Hinton・Vinyals・Dean による2015年の「Distilling the Knowledge in a Neural Network」で、複数モデルの集団が持つ知識を、展開がずっと容易な単一のモデルに圧縮できることを示したものです。一方、現在の LLM 業界では「大きなモデルの出力を訓練データにして小さなモデルをファインチューニングする」という広い意味で使われることが多く、原義と現在の一般的用法にはずれがあります。ライセンス上の論点として、Anthropic の商用利用規約は競合するAIモデルの訓練を含む目的でのサービス利用を禁じており、他社モデルの出力を使った蒸留が規約に抵触しうる実例が確認できます。
確認上の注記: OpenAI の利用規約は HTTP 403 で開けなかったため、OpenAI 側の規約内容については記載していません。
出典: arXiv:1503.02531(Hinton ほか)/Anthropic 商用利用規約
MoE(Mixture of Experts)
エムオーイー
公式定義あり
入力ごとに一部の「専門家」だけを働かせる構造。総パラメータ数より実際に使う量が少ない。
Mistral は Mixtral 8x7B について「総パラメータは46.7Bだが、1トークンあたり12.9Bしか使わない」と説明し、8つの専門家グループからルーターが2つを選んでトークンを処理する構造だとしています。実務でもっとも誤解されるのは「アクティブパラメータが小さい=必要メモリも小さい」という読み違いで、Hugging Face 公式ドキュメントは「各エキスパートはすべてRAMに読み込まれる必要がある」と明記しています。つまり MoE が減らすのは計算量であって、モデルを載せるメモリではありません。
出典: Mistral AI 公式ブログ/Hugging Face/arXiv:2101.03961
推論モデル(reasoning model)
スイロンモデル
定義が割れている
回答を出す前に、内部で考える過程を生成してから答えるモデル。呼び方は提供元ごとに異なる。
OpenAI は「reasoning models」と呼び、モデルが reasoning token を使って考え、プロンプトを分解して複数のアプローチを検討すると説明します。この reasoning token は表示されなくてもコンテキストを占有し、出力トークンとして課金されます。Anthropic は同種の機能を「extended thinking」と呼んでいましたが「adaptive thinking」へ移行中で、返される思考ブロックは生の思考の連鎖ではなく推論の要約だと明記しています。Google は「thinking」と呼びます。この語には業界共通の統一定義がなく、名称も制御方法も提供元ごとに異なるため、比較の際はどの提供元の用語かを必ず添える必要があります。
出典: OpenAI/Anthropic/Google Gemini API 各公式ドキュメント
ファインチューニング
ファインチューニング
公式定義あり
学習済みモデルに追加のデータを学習させ、特定の用途や振る舞いに合わせて調整すること。
OpenAI の公式ガイドはファインチューニングを「学習された記憶」、RAG を「文脈内の記憶」として対比し、授業に出て身につけるか教科書を手元に置くかの違いだと説明しています。使い分けの指針としては、誤答の原因が文脈ではなく一貫性や振る舞いにある場合にファインチューニングを使うとされ、新しい情報や専門的な文脈を注入する用途には RAG が挙げられています。つまり知識を足したいのか振る舞いを揃えたいのかで選ぶ道具が変わる点が実務上の分かれ目です。省コストな手法として LoRA などがあり、事前学習済みの重みを凍結することで学習対象パラメータを大幅に減らせます。
出典: OpenAI 公式ガイド/Hugging Face PEFT/arXiv:2106.09685(LoRA)