Stato di evidenza
Questa pagina non riporta una precisione misurata
Definisce il protocollo e le dichiarazioni richieste per una valutazione futura. Attualmente non è pubblicato alcun insieme di dati di test, dimensione del campione, data di valutazione, intervallo di confidenza o valore di prestazione misurato.
Principi di misurazione
La precisione è più di un singolo valore
Una valutazione utile distingue se un risultato è disponibile da se tale risultato è corretto. Rileva l'incertezza e esamina segmenti significativi piuttosto che nascondere la variazione all'interno di un singolo punteggio aggregato.
Valutazione indipendente
Documentare la popolazione di valutazione idonea in modo indipendente dalla popolazione di formazione.
Campionamento documentato
Documentare la selezione, le esclusioni, la deduplicazione, il peso e eventuali bias di campionamento.
Controlli di fuga
Registrare i controlli relativi al leak e dimostrare che i dati di valutazione non sono stati utilizzati per il training.
Contratto proposto di comunicazione
Metriche richieste da questo framework
Ogni metrica risponde a una domanda diversa. Nessuna è stata misurata per la pubblicazione; i valori richiedono un momento specificato del dataset, un campione documentato e l'approvazione del revisore.
Copertura nota
La percentuale di input ammissibili per i quali il servizio restituisce un'inferrimento supportato.
Precisione su dati noti
Risultati corretti misurati solo sugli input con un'inferrenza supportata.
Precisione aggiustata per la copertura
Una visione combinata della disponibilità dei risultati e della loro precisione sui risultati noti.
Tasso sconosciuto
I dati di ingresso per i quali il servizio non restituisce inferenze supportate.
Tasso ambiguo
I dati di ingresso con segnali concorrenti o insufficientemente distinti.
Errore di calibrazione
La differenza tra i intervalli di probabilità previsti e i risultati osservati.
Riproducibile per progettazione
Processo di valutazione
- 1
Definire la popolazione
Stabilire le condizioni di ammissibilità, le esclusioni, il contesto nazionale, i sistemi di scrittura e le regole di deduplicazione prima della valutazione.
- 2
Congelare lo snapshot del dataset
Registrare il dataset valutato e mantenere i record della valutazione separati dagli input di formazione.
- 3
Misurare per segmento
Rapportare la dimensione del campione e tutti i sei indicatori in generale e per i segmenti nazionali e di scrittura ammissibili.
- 4
Esaminare e pubblicare
Limitazioni del documento, calibrazione, data di valutazione, versione e firma del revisore con i risultati.
Uso responsabile
L'inferenza non è l'identità
L'inferenza basata su nomi è probabilistica. Non può stabilire l'identità di genere di una persona e non deve essere utilizzata per decisioni conseguenti riguardo a un individuo.
- Non utilizzare il genere inferito per decisioni conseguenti riguardanti un individuo.
- Conservare i risultati sconosciuti e ambigui piuttosto che costringerli a un risultato.
Risultati sconosciuti
Definire quando il servizio restituisce un'inflessione non supportata e riportare tale risultato separatamente.
Risultati ambigui
Definire risultati in conflitto o a bassa fiducia senza costringerli a un risultato binario di successo.
Variazione di segmento
La performance aggregata può nascondere differenze tra paesi, script e input ambigui.
Calibration
Confrontare i intervalli di probabilità previsti con gli esiti osservati per ogni segmento idoneo.