AIVEST

無料PDF資料

LLM評価 合否基準の較正ワークシート

AIに任せた仕事の出来を、担当者の感覚ではなく測れる合否で判定するための記入式シート。誤りの向きの決定、ブラインドで作る正解セット、基準の3層への仕分け、人のラベルとの突き合わせ(一致率・κ・見逃し・判定のブレ)、不一致の直し方、合格ラインの凍結、最初の2週間の進め方までを5ページに収めました。

LLM評価 合否基準の較正ワークシート

この資料に含まれるもの

  • ✓使い方|「LLM 評価」の解説が扱っていない「誰がどう合否を決め、判定が人とズレたらどう直すか」だけを埋める/業務で測るのはモデルの性能ではなく1件ごとの合否(既存の指標は参考値)/較正されていない判定をゲートにしない/このシートの流れ。出どころとしてAIVESTのX運用の判定器の較正記録(2026年9月2日・正解セット91組のうち66組が過去の没から作った落ちるべき例・64組で調整し27組は見せていない問題・一致率0.99・κ0.98・見逃し0件・コードで先に決着7組/AIへ57組・既定ラインでは判定のブレ1件で較正不足)を明記
  • ✓STEP1 対象とどちらの誤りが痛いかを決める|見逃し(不良を通す)と過剰不合格(良品を落とす)の起きることと、迷ったときの倒し方(社外に出る工程は見逃しゼロ・社内の途中工程は人のレビューへ)を選ぶ表
  • ✓STEP2 AIの判定を見ずに、人が合否と一言の理由を付ける|正解セットの記入表(記入例1行・記入行6行・差し戻し実物の印)。ブラインドで付ける・過去の事故を入れる・理由文を基準の原文にする。立ち上げ期は良品と欠陥を1種類埋めた不良品のペアを最低6組
  • ✓STEP3 理由文を3層に仕分ける|L1形式・L2機械プロキシ(コード)とL3判断(書き手と別のAIか人)の表に自社の基準を書き込む。判断層は二値・証拠の逐語引用必須・集計はコード
  • ✓STEP4 人のラベルと突き合わせる|判定回数(目安3回・提示順を入れ替える)と見せていない問題の件数、一致率・κ・見逃し・判定のブレの4つの数字をAIVESTの既定ライン(2026年9月時点の自社基準)と並べて自社のラインと実測を書く表
  • ✓STEP5 不一致を5つに分類して直す|基準が曖昧/基準が足りない/実はコードで判定できる/AI側の癖/人のラベルが間違いの件数と直したことの表。最良の修理はコード判定への降格・基準の削除とラインの引き下げは修理ではない
  • ✓STEP6 合格ラインを凍結し改定できる人を1人に決める|ラインの置き場所と改定者・差し戻しを正解セットに追記する場所・変えたら全件を走らせ直す担当・見直しの記録先の記入欄
  • ✓運用|1業務1成果物で回す最初の2週間(7段階の進行表と終えた日の欄)、差し戻しと再測定の記録表4行と読み方、AIVESTのサービスと相談窓口

本資料は、株式会社AIVESTが自社で実践している手順をまとめたものです。内容についてのご質問や、自社に合わせた進め方のご相談はお問い合わせからどうぞ。