Aanbevolen meetprotocol

Framework voor evaluatie van nauwkeurigheid van GenderAPI

Een voorgesteld protocol voor toekomstige meting van de omvang, nauwkeurigheid, onzekerheid en kalibratie—zonder een waarschijnlijkheidsinferentie om te veranderen in een identiteitsclaim.

Bewijsstatus

Deze pagina rapporteert geen gemeten nauwkeurigheid

Het definieert het protocol en de verklaringen die vereist zijn voor een toekomstige beoordeling. Geen testdataset, steekproefgrootte, beoordelingsdatum, betrouwbaarheidsinterval of gemeten prestatiewaarde is momenteel gepubliceerd.

Meetingsprincipes

Nauwkeurigheid is meer dan één hoofdgetal

Een nuttige evaluatie onderscheidt of een resultaat beschikbaar is van of dat resultaat correct is. Het registreert onzekerheid en onderzoekt betekenisvolle segmenten in plaats van de variatie te verbergen in een enkele agregate score.

01

Onafhankelijke evaluatie

Documenteer de eligible evaluatiepopulatie onafhankelijk van de trainingspopulatie.

02

Documenteerde steekproef

Documenteer de selectie, uitsluitingen, deduplicatie, gewichting en eventuele samplingbias.

03

Leakagecontroles

Bewaar lekcontroles en bewijs dat evaluatiegegevens niet werden gebruikt voor training.

Aanbevolen rapportagecontract

Meetwaarden die vereist zijn door dit kader

Elke meetwaarde beantwoordt een ander vraagstuk. Geen waarde is nog gemeten voor publicatie; waarden vereisen een geïnformeerd dataset-snapshot, een gedocumenteerde steekproef en goedgekeurde reviewer.

Nog niet gemeten

Bekende dekking

De deelverhouding van geldige invoer waarvoor de service een ondersteunde inferentie retourneert.

Nog niet gemeten

Accuratie op bekende invoer

Correcte uitkomsten gemeten alleen op invoer met een ondersteunde inferentie.

Nog niet gemeten

Aangepaste nauwkeurigheid op basis van de dekking

Een gecombineerde weergave van de beschikbaarheid en nauwkeurigheid van resultaten op bekende uitkomsten.

Nog niet gemeten

Onbekende rate

Invoer waarvoor de service geen ondersteunde inferentie teruggeeft.

Nog niet gemeten

Vage rate

Invoer met concurrerende of onvoldoende duidelijke signalen.

Nog niet gemeten

Calibratiefout

De afwijking tussen de voorspelde waarschijnlijkheidsbanden en de waargenomen uitkomsten.

Herhaalbaar door ontwerp

Beoordelingsproces

  1. 1

    Definieer de populatie

    Stel de geldigheid, uitsluitingen, landcontext, schrijfsystemen en regels voor dubbele registratie vast voordat de evaluatie plaatsvindt.

  2. 2

    Vrieze de dataset-snapshot

    Bewaar de geëvalueerde dataset en houd evaluatiegegevens gescheiden van opleidingsinvoer.

  3. 3

    Meet per segment

    Verslagleg de steekproefgrootte en alle zes de metrieken in totaal en per geldige land- en scriptsegment.

  4. 4

    Beoordeel en publiceer

    Beperkingen van documenten, kalibratie, evaluatie datum, versie en goedkeuring door de reviewer met de resultaten.

!

Verantwoordelijk gebruik

Inference is niet identiteit

Naamgebaseerde inferentie is waarschijnlijk. Het kan de genderidentiteit van een persoon niet bepalen en mag niet gebruikt worden voor consequentiebeoordelingen ten aanzien van een individu.

  • Gebruik geïnfererde geslacht niet voor consequentiële besluiten over een individu.
  • Behoud onbekende en ambigue resultaten in plaats van een resultaat te dwingen.

Onbekende resultaten

Definieer wanneer de service geen ondersteunde inferentie retourneert en rapporteer dit resultaat afzonderlijk.

Vage resultaten

Definieer concurrente of laag-confidente uitkomsten zonder ze te dwingen in een binair succesresultaat te veranderen.

Variatie binnen segmenten

Aggregatie van prestaties kan verschillen verbergen tussen landen, scripts en ambigue invoer.

Calibration

Vergelijk de voorspelde waarschijnlijkheidsbanden met de waargenomen uitkomsten per geldige segment.

Verder onderzoek blijven uitvoeren

Verstaan de data achter een inferentie

Lees hoe de provenantie, selectiecriteria en grenzen voor verantwoorde gebruik worden documenteerd.

Bekijk de dataprovenantie →