Vorgeschlagenes Messprotokoll

Framework zur Genauigkeitsbewertung von GenderAPI

Ein vorgeschlagenes Protokoll zur zukünftigen Messung von Abdeckung, Genauigkeit, Unsicherheit und Kalibrierung – ohne die wahrscheinliche Inferenz in eine Identitätsbehauptung umzuwandeln.

Nachweisstatus

Diese Seite gibt keine gemessene Genauigkeit wieder

Es legt das Protokoll und die zu erfüllenden Offenlegungspflichten für eine zukünftige Bewertung fest. Derzeit ist kein Testdatensatz, Stichprobenumfang, Bewertungsdatum, Konfidenzintervall oder gemessene Leistungsangabe veröffentlicht.

Messprinzipien

Genauigkeit ist mehr als eine Übersichtszahl

Eine nützliche Bewertung trennt die Verfügbarkeit eines Ergebnisses von der Richtigkeit desselben. Sie dokumentiert Unsicherheiten und untersucht sinnvolle Segmente anstelle der Versteckung von Variationen in einem einzigen aggregierten Score.

01

Unabhängige Bewertung

Dokumentieren Sie die für die Bewertung zugelassenen Population unabhängig von der Trainingspopulation.

02

Dokumentierte Stichprobe

Dokumentieren Sie die Auswahl, Ausschlusskriterien, Doppelungsaufklärung, Gewichtung und potenzielle Stichprobenverzerrungen.

03

Leakage-Controllen

Protokollieren Sie Leakage-Prüfungen und beweisen Sie, dass Bewertungsdatensätze nicht für das Training verwendet wurden.

Vorgeschlagener Berichtsvertrag

Maßstäbe, die von diesem Rahmen erfordert werden

Jedes Maß beantwortet eine andere Frage. Keines davon wurde bisher gemessen und veröffentlicht; die Werte erfordern einen datenbasierten Zeitpunkt, eine dokumentierte Stichprobe und die Genehmigung eines Prüfers.

Noch nicht gemessen

Bekannte Abdeckung

Der Anteil der berechtigten Eingaben, für die der Dienst eine unterstützte Inferenz zurückgibt.

Noch nicht gemessen

Genauigkeit bei bekannten Eingaben

Richtige Ergebnisse, die nur auf Eingaben mit einer unterstützten Inferenz gemessen werden.

Noch nicht gemessen

Abdeckungsangepasste Genauigkeit

Eine kombinierte Ansicht zur Verfügbarkeit und Genauigkeit der Ergebnisse bei bekannten Ausgängen.

Noch nicht gemessen

Unbekannte Rate

Eingaben, für die der Dienst keine unterstützten Inferenzen zurückgibt.

Noch nicht gemessen

Ambiguitätsrate

Eingaben mit konkurrierenden oder nicht ausreichend abgegrenzten Signalen.

Noch nicht gemessen

Kalibrierungsfehler

Der Unterschied zwischen den vorhergesagten Wahrscheinlichkeitsbereichen und den beobachteten Ergebnissen.

Fehlerfrei durch Design gewährleistet

Bewertungsprozess

  1. 1

    Die Bevölkerung definieren

    Eligibilität, Ausschlüsse, Landkontext, Schriftsysteme und Doppelungsvorschriften vor der Bewertung festlegen.

  2. 2

    Den Datensatz-Snapshot einfrieren

    Den bewerteten Datensatz aufzeichnen und die Bewertungsdaten von den Trainingsdaten getrennt halten.

  3. 3

    Nach Segmenten messen

    Stichprobengröße und alle sechs Metriken insgesamt sowie für die berechtigten Länder- und Schriftsegmente berichten.

  4. 4

    Prüfen und veröffentlichen

    Beschränkungen des Dokuments, Kalibrierung, Bewertungsdatum, Version und Genehmigung durch den Prüfer mit den Ergebnissen.

!

Verantwortungsvolles Verwenden

Inferenz ist keine Identität

Namebasierte Inferenz ist probabilistisch. Sie kann die Geschlechtsidentität einer Person nicht feststellen und darf nicht für konsequente Entscheidungen bezüglich eines Einzelpersons verwendet werden.

  • Verwenden Sie inferierte Geschlechter nicht für konsequente Entscheidungen bezüglich eines Einzelpersonen.
  • Behalten Sie unbekannte und unklare Ergebnisse bei und drücken sie nicht ein.

Unbekannte Ergebnisse

Definieren Sie den Fall, in dem der Dienst keine unterstützten Inferenz zurückgibt, und berichten Sie diesen Ergebniswert separat.

Ambigene Ergebnisse

Definieren Sie konkurrierende oder niedrige Sicherheitsgrade ohne diese zwangsläufig in ein binäres Erfolgsergebnis zu drücken.

Variation innerhalb der Segmentierung

Die aggregierte Leistung kann Unterschiede zwischen Ländern, Schreibweisen und unklaren Eingaben verbergen.

Calibration

Vergleichen Sie die vorhergesagten Wahrscheinlichkeitsintervalle mit den beobachteten Ergebnissen für jeden zulässigen Segment.

Weitere Erforschung fortsetzen

Verstehe die Daten hinter einer Inferenz

Lesen Sie, wie Provenienz, Auswahlkriterien und Grenzen für verantwortungsvolles Verwenden dokumentiert sind.

Datenaufzeichnung anzeigen →