Zaproponowany protokół pomiarowy

Ramowy system oceny dokładności GenderAPI

Zaproponowany protokół do przyszłych pomiarów zakresu, dokładności, niepewności i kalibracji – bez przekształcania inferencji probabilistycznych w stwierdzenie o identyfikacji.

Status dowodowy

Ta strona nie przedstawia pomiarowej dokładności

Definiuje protokół i oświadczenia wymagane dla przyszłej oceny. Aktualnie nie opublikowano zestawu danych testowych, liczby próbek, daty oceny, przedziału ufności ani wartości wykonywanej wydajności.

Zasady pomiarowe

Dokładność to więcej niż jedna liczba podsumowująca

Skuteczna ocena oddziela pytanie, czy wynik jest dostępny, od pytania, czy wynik jest poprawny. Zapisuje niepewność i analizuje istotne segmenty, zamiast ukrywać zmienności w jednym agregowanym wyniku.

01

Ocena niezależna

Zapisz populację ocenianą w sposób niezależny od populacji treningowej.

02

Zapisana próba

Zapisz metody wyboru, wykluczenia, usunięcia duplikatów, wagowanie oraz potencjalne biasy próbkowe.

03

Kontrole przepływu

Zapisz kontrole dotyczące przepływu danych i udowodnij, że dane oceniane nie zostały wykorzystywane do treningu.

Zaproponowany kontrakt raportowania

Metryki wymagane przez ten ramowy

Każda metryka odpowiada na inny pytanie. Żadna nie została jeszcze zmierzona i opublikowana; wartości wymagają zapisanego zestawu danych z daty, dokumentowanej próbki i zatwierdzenia przeglądarki.

Nie została jeszcze zmierzona

Znane zakresy

Stosunek dopuszczalnych wejść, dla których usługa zwraca wspierany wniosek.

Nie została jeszcze zmierzona

Dokładność na znanych danych

Poprawne wyniki mierzone tylko w przypadku wejść z wspieranym wnioskiem.

Nie została jeszcze zmierzona

Dokładność uwzględniająca zakres

Całkowity przegląd dostępności wyników i ich dokładności na znanych wynikach.

Nie została jeszcze zmierzona

Stosunek nieznanych wyników

Dane wejściowe, dla których usługa nie zwraca wspieranych wniosków.

Nie została jeszcze zmierzona

Stosunek niejasnych wyników

Dane wejściowe z konkurencyjnych lub nie wystarczająco wyraźnych sygnałów.

Nie została jeszcze zmierzona

Błąd kalibracji

Różnica między przedziałami prawdopodobieństwa przewidywanych a obserwowanymi wynikami.

Wynikowy w sposób zaprojektowany

Proces oceny

  1. 1

    Zdefiniuj populację

    Ustal dostępność, wykluczenia, kontekst krajowy, systemy pisanie oraz zasady unikalności przed oceną.

  2. 2

    Zamrożenie snapshota zbioru danych

    Zapisz oceniony zbiór danych i zachowuj rekordy oceny oddzielnie od danych treningowych.

  3. 3

    Ocenić według segmentów

    Wyświetl rozmiar próby oraz wszystkie sześć metryk w całości oraz dla segmentów krajowych i systemów pisania, które są dopuszczalne.

  4. 4

    Przeprowadź przegląd i opublikuj

    Ograniczenia dokumentu, kalibracja, data oceny, wersja oraz podpis recenzenta z wynikami.

!

Zastosowanie odpowiedzialne

Wnioskowanie nie jest tożsamością

Wnioskowanie na podstawie nazwy jest prawdopodobne. Nie może ustalać tożsamości płeć osoby i nie powinno być stosowane w decyzjach konsekwentnych dotyczących osoby.

  • Nie używaj przewidywanego płciowego wyniku do podejmowania konsekwentnych decyzji dotyczących osoby.
  • Zachowuj wyniki nieznane i niejasne zamiast ich wymuszać do określonego rezultatu.

Nieznane wyniki

Zdefiniuj sytuację, w której usługa nie zwraca wspieranych przewidywań, oraz zapisz ten wynik osobno.

Niejasne wyniki

Zdefiniuj konkurencyjne lub niskopewne wyniki bez wymuszania ich do binarnego rezultatu sukcesu.

Zmienność segmentu

Wyniki agregowane mogą ukrywać różnice między krajami, językami i niejasnymi wejściami.

Calibration

Porównaj przedział przewidywanych prawdopodobieństw z obserwowanymi wynikami dla każdego dopuszczalnego segmentu.

Kontynuuj badania

Zrozumienie danych, które są podstawą dla wniosku

Odczytaj, jak dokumentowane są pochodzenie danych, kryteria wyboru oraz granice odpowiedzialnego użytkowania.

Wyświetl pochodzenie danych →