Navržený protokol měření

Rámec hodnocení přesnosti GenderAPI

Vyhledat navržené metriky pro budoucí měření pokrytí, přesnosti, neurčitosti a kalibrace – bez převodu pravděpodobnostního odhadu na tvrzení o identitě.

Stav důkazu

Tato stránka nezpracovává měřenou přesnost

Definuje protokol a vykazování požadované pro budoucí hodnocení. Momentálně není veřejně publikováno žádné testovací dataset, velikost vzorku, datum hodnocení, interval spolehlivosti nebo měřená výkonnostní hodnota.

Zásady měření

Přesnost je více než jedna hlavní číslo

Užitečná hodnocení rozděluje, zda je výsledek dostupný, a zda je tento výsledek správný. Zaznamenává nejistotu a zkoumá významné segmenty namísto skrytí rozptylu v jednom agregovaném výsledku.

01

Nezávislé hodnocení

Zaznamenávejte zvláštní hodnotu hodnoty pro vyhodnocovací populaci nezávisle na trénovací populaci.

02

Zaznamenané výběry

Zaznamenejte výběr, výjimky, odstranění duplikátů, vážení a možné základní chyby při výběru.

03

Ochrany proti ztrátě dat

Zaznamenejte kontrolu při přechodu a dokažte, že záznamy pro hodnocení nebyly použity k trénování.

Navržený smluvní dokument o zprávě

Metriky vyžadované touto rámci

Každá metrika odpovídá na jiný dotaz. Žádná z nich je ještě měřena pro publikaci; hodnoty vyžadují datový snímek s datem, dokumentovaný výběr a schválení recenzenta.

Ještě nebyla měřena

Známá pokrytí

Procento povolených vstupů, pro které služba vrátí podporovanou inferenci.

Ještě nebyla měřena

Presnost na známém

Správné výsledky změřené pouze pro vstupy s podporovanou inferencí.

Ještě nebyla měřena

Presnost přizpůsobená pokrytí

Shrnutí výsledků k dispozici a přesnosti na známých výsledcích.

Ještě nebyla měřena

Neznámá míra

Vstupy, pro které služba nevrátí podporované odhadování.

Ještě nebyla měřena

Nejasná míra

Vstupy s konkurenčními nebo nevýraznými signály.

Ještě nebyla měřena

Chyba kalibrace

Rozdíl mezi předpověděnými intervaly pravděpodobnosti a pozorovanými výsledky.

Reproducibilní designem

Proces hodnocení

  1. 1

    Zdefinujte populaci

    Nastavte způsob vyhovění, výjimky, kontext země, písmena a pravidla pro odstranění duplikátů před hodnocením.

  2. 2

    Zfrozejte snímek datové sady

    Zaznamenávejte vyhodnocenou datovou sadu a udržujte záznamy hodnocení oddělené od vstupních dat pro výuku.

  3. 3

    Hodnotit podle segmentu

    Zveřejněte velikost vzorku a všechny šest metrik v celku a pro základní segmenty země a písmen.

  4. 4

    Proveďte kontrolu a zveřejněte

    Omezení dokumentu, kalibrace, datum hodnocení, verze a podepsání revizního účastníka s výsledky.

!

Zodpovědné použití

Odvození není identita

Odvození z názvu je pravděpodobné. Není schopné určit pohlaví osoby a nemá být použito pro důsledné rozhodnutí ohledně jednotlivce.

  • Nepoužívejte odhadnout pohlaví k důsledným rozhodnutím ohledně jednotlivce.
  • Udržujte neznámé a nejasné výsledky namísto tlaku na konkrétní výsledek.

Neznámé výsledky

Definujte, kdy služba nevrátí podporované odhadové hodnoty a zaznamenejte tento výsledek odděleně.

Nejasné výsledky

Definujte konkurenční nebo nízkopodstatné výsledky bez jejich tlakem do binárního výsledku úspěchu.

Variace segmentu

Agregované výkony mohou skrytě ukazovat rozdíly mezi zememi, jazyky a nejasnými vstupy.

Calibration

Porovnejte rozsahy předpokládaných pravděpodobností s pozorovanými výsledky pro každou vhodnou skupinu.

Pokračujte v vyhledávání

Porozumět datům za inferencí

Zjistit, jak je dokumentována provenance, kritéria výběru a hranice odpovědného použití.

Zobrazit provenanci dat →