Nachweisstatus
Diese Seite gibt keine gemessene Genauigkeit wieder
Es legt das Protokoll und die zu erfüllenden Offenlegungspflichten für eine zukünftige Bewertung fest. Derzeit ist kein Testdatensatz, Stichprobenumfang, Bewertungsdatum, Konfidenzintervall oder gemessene Leistungsangabe veröffentlicht.
Messprinzipien
Genauigkeit ist mehr als eine Übersichtszahl
Eine nützliche Bewertung trennt die Verfügbarkeit eines Ergebnisses von der Richtigkeit desselben. Sie dokumentiert Unsicherheiten und untersucht sinnvolle Segmente anstelle der Versteckung von Variationen in einem einzigen aggregierten Score.
Unabhängige Bewertung
Dokumentieren Sie die für die Bewertung zugelassenen Population unabhängig von der Trainingspopulation.
Dokumentierte Stichprobe
Dokumentieren Sie die Auswahl, Ausschlusskriterien, Doppelungsaufklärung, Gewichtung und potenzielle Stichprobenverzerrungen.
Leakage-Controllen
Protokollieren Sie Leakage-Prüfungen und beweisen Sie, dass Bewertungsdatensätze nicht für das Training verwendet wurden.
Vorgeschlagener Berichtsvertrag
Maßstäbe, die von diesem Rahmen erfordert werden
Jedes Maß beantwortet eine andere Frage. Keines davon wurde bisher gemessen und veröffentlicht; die Werte erfordern einen datenbasierten Zeitpunkt, eine dokumentierte Stichprobe und die Genehmigung eines Prüfers.
Bekannte Abdeckung
Der Anteil der berechtigten Eingaben, für die der Dienst eine unterstützte Inferenz zurückgibt.
Genauigkeit bei bekannten Eingaben
Richtige Ergebnisse, die nur auf Eingaben mit einer unterstützten Inferenz gemessen werden.
Abdeckungsangepasste Genauigkeit
Eine kombinierte Ansicht zur Verfügbarkeit und Genauigkeit der Ergebnisse bei bekannten Ausgängen.
Unbekannte Rate
Eingaben, für die der Dienst keine unterstützten Inferenzen zurückgibt.
Ambiguitätsrate
Eingaben mit konkurrierenden oder nicht ausreichend abgegrenzten Signalen.
Kalibrierungsfehler
Der Unterschied zwischen den vorhergesagten Wahrscheinlichkeitsbereichen und den beobachteten Ergebnissen.
Fehlerfrei durch Design gewährleistet
Bewertungsprozess
- 1
Die Bevölkerung definieren
Eligibilität, Ausschlüsse, Landkontext, Schriftsysteme und Doppelungsvorschriften vor der Bewertung festlegen.
- 2
Den Datensatz-Snapshot einfrieren
Den bewerteten Datensatz aufzeichnen und die Bewertungsdaten von den Trainingsdaten getrennt halten.
- 3
Nach Segmenten messen
Stichprobengröße und alle sechs Metriken insgesamt sowie für die berechtigten Länder- und Schriftsegmente berichten.
- 4
Prüfen und veröffentlichen
Beschränkungen des Dokuments, Kalibrierung, Bewertungsdatum, Version und Genehmigung durch den Prüfer mit den Ergebnissen.
Verantwortungsvolles Verwenden
Inferenz ist keine Identität
Namebasierte Inferenz ist probabilistisch. Sie kann die Geschlechtsidentität einer Person nicht feststellen und darf nicht für konsequente Entscheidungen bezüglich eines Einzelpersons verwendet werden.
- Verwenden Sie inferierte Geschlechter nicht für konsequente Entscheidungen bezüglich eines Einzelpersonen.
- Behalten Sie unbekannte und unklare Ergebnisse bei und drücken sie nicht ein.
Unbekannte Ergebnisse
Definieren Sie den Fall, in dem der Dienst keine unterstützten Inferenz zurückgibt, und berichten Sie diesen Ergebniswert separat.
Ambigene Ergebnisse
Definieren Sie konkurrierende oder niedrige Sicherheitsgrade ohne diese zwangsläufig in ein binäres Erfolgsergebnis zu drücken.
Variation innerhalb der Segmentierung
Die aggregierte Leistung kann Unterschiede zwischen Ländern, Schreibweisen und unklaren Eingaben verbergen.
Calibration
Vergleichen Sie die vorhergesagten Wahrscheinlichkeitsintervalle mit den beobachteten Ergebnissen für jeden zulässigen Segment.