Protocolo proposto de medição

Framework de avaliação de precisão do GenderAPI

Um protocolo proposto para futuras medições de cobertura, precisão, incerteza e calibração — sem transformar uma inferência probabilística em uma afirmação de identidade.

Status de evidência

Esta página não reporta precisão medida

Define o protocolo e as divulgações necessárias para uma avaliação futura. Nenhum conjunto de dados de teste, tamanho de amostra, data de avaliação, intervalo de confiança ou valor de desempenho medido está atualmente publicado.

Princípios de medição

A precisão é mais do que um único número resumo

Uma avaliação útil separa se um resultado está disponível de se esse resultado é correto. Ela registra a incerteza e analisa segmentos significativos, em vez de ocultar a variação dentro de uma única pontuação agregada.

01

Avaliação independente

Documente a população de avaliação elegível de forma independente da população de treinamento.

02

Amostragem documentada

Documente a seleção, exclusões, deduplication, ponderação e possíveis viéses de amostragem.

03

Controles de vazamento

Registre os controles de vazamento e comprove que os registros de avaliação não foram utilizados para o treinamento.

Contrato proposto de relato

Métricas exigidas por este quadro

Cada métrica responde a uma pergunta diferente. Nenhuma delas foi medida para publicação ainda; os valores exigem um instantâneo de conjunto de dados com data, amostra documentada e aprovação do revisor.

Ainda não medida

Cobertura conhecida

A porcentagem de entradas elegíveis para as quais o serviço retorna uma inferência suportada.

Ainda não medida

Precisão em cobertura conhecida

Resultados corretos medidos apenas em entradas com inferência suportada.

Ainda não medida

Precisão ajustada pela cobertura

Uma visão combinada da disponibilidade e precisão dos resultados em relação a resultados conhecidos.

Ainda não medida

Taxa desconhecida

Entradas para as quais o serviço não retorna inferência suportada.

Ainda não medida

Taxa ambígua

Entradas com sinais concorrentes ou insuficientemente distintos.

Ainda não medida

Erro de calibração

A diferença entre os intervalos de probabilidade previstos e os resultados observados.

Reprodutível por design

Processo de avaliação

  1. 1

    Defina a população

    Defina a elegibilidade, exclusões, contexto nacional, sistemas de escrita e regras de deduplação antes da avaliação.

  2. 2

    Congele o instantâneo do conjunto de dados

    Registre o conjunto de dados avaliado e mantenha os registros de avaliação separados dos inputs de treinamento.

  3. 3

    Medir por segmento

    Relate o tamanho da amostra e todas as seis métricas globalmente e para os segmentos de país e script elegíveis.

  4. 4

    Revise e publique

    Limitações do documento, calibração, data de avaliação, versão e assinatura do revisor com os resultados.

!

Uso responsável

Inferência não é identidade

A inferência baseada em nome é probabilística. Não pode estabelecer a identidade de gênero de uma pessoa e não deve ser utilizada para decisões conseqüentes sobre um indivíduo.

  • Não utilize o gênero inferido para decisões conseqüentes sobre um indivíduo.
  • Preserve os resultados desconhecidos e ambíguos em vez de forçar um resultado.

Resultados desconhecidos

Defina quando o serviço retorna inferência sem suporte e reporte esse resultado separadamente.

Resultados ambíguos

Defina resultados concorrentes ou de baixa confiança sem forçá-los a um resultado binário de sucesso.

Variação de segmento

O desempenho agregado pode ocultar diferenças entre países, scripts e entradas ambíguas.

Calibration

Compare os intervalos de probabilidade previstos com os resultados observados para cada segmento elegível.

Continuar explorando

Entender os dados por trás de uma inferência

Leia como a proveniência, os critérios de seleção e as fronteiras de uso responsável são documentados.

Visualizar a proveniência dos dados →