証拠の状態
このページは測定精度を報告していません
将来の評価に必要なプロトコルおよび開示を定義しています。現在、テストデータセット、サンプルサイズ、評価日、信頼区間、または測定されたパフォーマンス値は公開されていません。
測定原理
精度は1つのハイライト数字以上のものである
有用な評価は、結果が入手可能かどうかと、その結果が正しいかどうかを分けて行う。変動を単一の集計スコアの中に隠すのではなく、不確実性を記録し、意味のあるセグメントを検討する。
独立した評価
評価対象人口を訓練データセットとは独立して記述する。
記録されたサンプリング
選択、除外、重複除去、重み付け、およびサンプリングバイアスの可能性を記述する。
漏洩制御
漏洩制御を記録し、評価データが訓練に使用されたことを証明する。
提案された報告契約
このフレームワークが要請するメトリクス
各メトリクスは異なる問いに答える。まだ測定されておらず、公開にはなっていない。値は日付付きデータセットのスナップショット、記録されたサンプル、およびレビュー承認が必要である。
知られているカバレッジ
サービスがサポートする推論を返すeligible入力の割合
知られている精度
サポートされる推論を持つ入力のみに焦点を当てて正しい結果を測定
カバレッジ調整済みの精度
既知の結果に対する結果の可用性と正確性の統合的な視点。
未知率
サービスがサポートする推論を返さない入力。
曖昧率
競合するか、十分に明確でない信号を含む入力。
校正誤差
予測確率帯と観測結果の間の差異。
設計上再現可能
評価プロセス
- 1
対象人口を定義する
評価前に対象者、除外条件、国別文脈、文字体系、重複除去ルールを設定する。
- 2
データセットのスナップショットを固定する
評価されたデータセットを記録し、評価記録をトレーニング入力と分離する。
- 3
セグメントごとに測定する
サンプルサイズおよび6つのメトリクスを全体および対象国・文字体系セグメントごとに報告する。
- 4
レビューし、公開する
ドキュメントの制限、カーブフィッティング、評価日、バージョン、および結果に対するレビューの署名。
適切な使用
推論は同一性ではない
名前に基づく推論は確率的であり、個人の性別を特定することはできず、個人に関する影響のある決定に使用してはならない。
- 個人に関する決定において推論された性別を使用しない。
- 未知または曖昧な結果は強制的に結果に変換せず、保持する。
未知の結果
サービスがサポートしない推論を返した場合を定義し、その結果を別途報告する。
曖昧な結果
競合するまたは低信頼性の結果を定義し、二値化された成功結果に強制しない。
セグメントの変動
集計性能は国ごと、言語ごと、曖昧な入力における差異を隠す可能性がある。
Calibration
各対象セグメントごとに予測確率帯と観測結果を比較する。