Protocollo proposto di misurazione

Framework per la valutazione dell'accuratezza di GenderAPI

Un protocollo proposto per la futura misurazione della copertura, accuratezza, incertezza e calibrazione—senza trasformare un'inferrimento probabilistico in una affermazione di identità.

Stato di evidenza

Questa pagina non riporta una precisione misurata

Definisce il protocollo e le dichiarazioni richieste per una valutazione futura. Attualmente non è pubblicato alcun insieme di dati di test, dimensione del campione, data di valutazione, intervallo di confidenza o valore di prestazione misurato.

Principi di misurazione

La precisione è più di un singolo valore

Una valutazione utile distingue se un risultato è disponibile da se tale risultato è corretto. Rileva l'incertezza e esamina segmenti significativi piuttosto che nascondere la variazione all'interno di un singolo punteggio aggregato.

01

Valutazione indipendente

Documentare la popolazione di valutazione idonea in modo indipendente dalla popolazione di formazione.

02

Campionamento documentato

Documentare la selezione, le esclusioni, la deduplicazione, il peso e eventuali bias di campionamento.

03

Controlli di fuga

Registrare i controlli relativi al leak e dimostrare che i dati di valutazione non sono stati utilizzati per il training.

Contratto proposto di comunicazione

Metriche richieste da questo framework

Ogni metrica risponde a una domanda diversa. Nessuna è stata misurata per la pubblicazione; i valori richiedono un momento specificato del dataset, un campione documentato e l'approvazione del revisore.

Ancora non misurata

Copertura nota

La percentuale di input ammissibili per i quali il servizio restituisce un'inferrimento supportato.

Ancora non misurata

Precisione su dati noti

Risultati corretti misurati solo sugli input con un'inferrenza supportata.

Ancora non misurata

Precisione aggiustata per la copertura

Una visione combinata della disponibilità dei risultati e della loro precisione sui risultati noti.

Ancora non misurata

Tasso sconosciuto

I dati di ingresso per i quali il servizio non restituisce inferenze supportate.

Ancora non misurata

Tasso ambiguo

I dati di ingresso con segnali concorrenti o insufficientemente distinti.

Ancora non misurata

Errore di calibrazione

La differenza tra i intervalli di probabilità previsti e i risultati osservati.

Riproducibile per progettazione

Processo di valutazione

  1. 1

    Definire la popolazione

    Stabilire le condizioni di ammissibilità, le esclusioni, il contesto nazionale, i sistemi di scrittura e le regole di deduplicazione prima della valutazione.

  2. 2

    Congelare lo snapshot del dataset

    Registrare il dataset valutato e mantenere i record della valutazione separati dagli input di formazione.

  3. 3

    Misurare per segmento

    Rapportare la dimensione del campione e tutti i sei indicatori in generale e per i segmenti nazionali e di scrittura ammissibili.

  4. 4

    Esaminare e pubblicare

    Limitazioni del documento, calibrazione, data di valutazione, versione e firma del revisore con i risultati.

!

Uso responsabile

L'inferenza non è l'identità

L'inferenza basata su nomi è probabilistica. Non può stabilire l'identità di genere di una persona e non deve essere utilizzata per decisioni conseguenti riguardo a un individuo.

  • Non utilizzare il genere inferito per decisioni conseguenti riguardanti un individuo.
  • Conservare i risultati sconosciuti e ambigui piuttosto che costringerli a un risultato.

Risultati sconosciuti

Definire quando il servizio restituisce un'inflessione non supportata e riportare tale risultato separatamente.

Risultati ambigui

Definire risultati in conflitto o a bassa fiducia senza costringerli a un risultato binario di successo.

Variazione di segmento

La performance aggregata può nascondere differenze tra paesi, script e input ambigui.

Calibration

Confrontare i intervalli di probabilità previsti con gli esiti osservati per ogni segmento idoneo.

Continuare a esplorare

Comprendere i dati alla base di un'inferenza

Leggere come vengono documentati il provenienza, i criteri di selezione e i limiti di utilizzo responsabile.

Visualizza il provenienza dei dati →