提案された測定プロトコル

GenderAPI精度評価フレームワーク

将来のカバレッジ、精度、不確実性、および校正の測定に向けた提案されたプロトコル—確率的推論を同一性の主張に変換しないこと。

証拠の状態

このページは測定精度を報告していません

将来の評価に必要なプロトコルおよび開示を定義しています。現在、テストデータセット、サンプルサイズ、評価日、信頼区間、または測定されたパフォーマンス値は公開されていません。

測定原理

精度は1つのハイライト数字以上のものである

有用な評価は、結果が入手可能かどうかと、その結果が正しいかどうかを分けて行う。変動を単一の集計スコアの中に隠すのではなく、不確実性を記録し、意味のあるセグメントを検討する。

01

独立した評価

評価対象人口を訓練データセットとは独立して記述する。

02

記録されたサンプリング

選択、除外、重複除去、重み付け、およびサンプリングバイアスの可能性を記述する。

03

漏洩制御

漏洩制御を記録し、評価データが訓練に使用されたことを証明する。

提案された報告契約

このフレームワークが要請するメトリクス

各メトリクスは異なる問いに答える。まだ測定されておらず、公開にはなっていない。値は日付付きデータセットのスナップショット、記録されたサンプル、およびレビュー承認が必要である。

まだ測定されていない

知られているカバレッジ

サービスがサポートする推論を返すeligible入力の割合

まだ測定されていない

知られている精度

サポートされる推論を持つ入力のみに焦点を当てて正しい結果を測定

まだ測定されていない

カバレッジ調整済みの精度

既知の結果に対する結果の可用性と正確性の統合的な視点。

まだ測定されていない

未知率

サービスがサポートする推論を返さない入力。

まだ測定されていない

曖昧率

競合するか、十分に明確でない信号を含む入力。

まだ測定されていない

校正誤差

予測確率帯と観測結果の間の差異。

設計上再現可能

評価プロセス

  1. 1

    対象人口を定義する

    評価前に対象者、除外条件、国別文脈、文字体系、重複除去ルールを設定する。

  2. 2

    データセットのスナップショットを固定する

    評価されたデータセットを記録し、評価記録をトレーニング入力と分離する。

  3. 3

    セグメントごとに測定する

    サンプルサイズおよび6つのメトリクスを全体および対象国・文字体系セグメントごとに報告する。

  4. 4

    レビューし、公開する

    ドキュメントの制限、カーブフィッティング、評価日、バージョン、および結果に対するレビューの署名。

!

適切な使用

推論は同一性ではない

名前に基づく推論は確率的であり、個人の性別を特定することはできず、個人に関する影響のある決定に使用してはならない。

  • 個人に関する決定において推論された性別を使用しない。
  • 未知または曖昧な結果は強制的に結果に変換せず、保持する。

未知の結果

サービスがサポートしない推論を返した場合を定義し、その結果を別途報告する。

曖昧な結果

競合するまたは低信頼性の結果を定義し、二値化された成功結果に強制しない。

セグメントの変動

集計性能は国ごと、言語ごと、曖昧な入力における差異を隠す可能性がある。

Calibration

各対象セグメントごとに予測確率帯と観測結果を比較する。

さらに調査を進める

推論の背後にあるデータを理解する

プロヴァンス、選定基準、責任ある使用の境界がどのように記述されているかを読む

データのプロヴァンス →