MEASUREMENT EVIDENCE
測定の根拠
この測定で使った設問・採点基準・生の回答を、加工せずに置いています。設問と採点基準は株式会社EFFECTが作りました。中立な第三者による測定ではありません。検証していただくために、材料をすべて出しています。
答えられない質問への回答
5問に対する31モデルの回答全文を、1回目の出力そのままで確認できます。
全35問
業務日本語ベンチマークで使った設問を、本文そのままで掲載しています。
採点基準と採点結果
機械採点と別AIによる採点基準と採点理由を確認できます。
コードを直す力の試験(参考値)
6問を2回ずつ5モデルで測りました。日本語軸とは別の試験で、順位は付けていません。
JSONデータをダウンロードする
- index.json — 測定条件と各ファイルの説明
- questions.json — 全35問の本文
- unanswerable-answers.json — 答えられない5問への、31モデルの実際の回答(各1回目)
- unanswerable-runs.json — 同じ5問を9回ずつ投げた当たり外れ
- judge-scores.json — 要約・敬語・個人情報の採点結果と、採点AIが書いた理由
- scoring-rules.json — 採点基準(judge の観点/機械採点の判定方法)
- coding-test.json — コードを直す力の試験(参考値・6問×2回・5モデル)の出題と結果
この測定を、自社の機材で再現する
この実測を御社の機材で再現します —AI LOCAL 実機診断(運営会社の商品・お伺いしません)。
AI に自社が紹介されているかはAI CRAWLで確認できます。
いずれも AI COUNCIL の運営会社、株式会社EFFECTが提供しています。