{
 "measured_at": {
  "cloud_第1回10件": "2026-09-01",
  "cloud_追加5件": "2026-09-16",
  "local_5件": "2026-09-03",
  "local_Granite": "2026-09-17",
  "local_追加3件（LLM-jp-4.1 8B・33B / Gemma 4 8B）": "2026-09-29",
  "judge": "2026-09-04 / 2026-09-16 / 2026-09-29"
 },
 "models": 31,
 "last_rescored": "2026-09-29",
 "rescore_note": "2026-09-29 に採点の不具合4件を是正し、全モデルを採点し直しました。①丁寧な聞き返しを「保留」として認める ②採点役（AI）が書いた合計点をそのまま使わず観点の点数から計算する ③9回測定の採点を都度計算する ④割増率などの「例示」を断定と誤判定しない。この是正で既存21件のうち19件の数値が変わりました。回帰テストは46件すべて合格しています。",
 "parameters": {
  "temperature": 0,
  "seed": 42,
  "system_prompt": null,
  "local_quantization": "Q4_K_M",
  "local_machine": "MacBook Pro M5 Max / メモリ128GB / Ollama"
 },
 "files": {
  "questions.json": "業務日本語ベンチマークの全35問（本文そのまま）",
  "unanswerable-answers.json": "答えが存在しない5問に、31モデルが実際に返した回答（各1回目・153件）",
  "unanswerable-runs.json": "同じ5問を9回ずつ投げた当たり外れ（1361回分）",
  "judge-scores.json": "要約・敬語・個人情報の採点460件と、採点AIが書いた理由",
  "scoring-rules.json": "採点基準（judge の観点／機械採点の判定方法／採点基準を直した記録）"
 },
 "disclosure": "設問・採点基準・生の回答は、すべてこのページから取得できます。設問と採点基準は株式会社EFFECTが作成しており、中立な第三者による測定ではありません。"
}