Protocolo propuesto de medición

Marco para la evaluación de precisión de GenderAPI

Propuesta de protocolo para futuras mediciones de cobertura, precisión, incertidumbre y calibración—sin convertir una inferencia probabilística en una afirmación de identidad.

Estado de evidencia

Esta página no reporta precisión medible

Establece el protocolo y las declaraciones requeridas para una evaluación futura. Actualmente no se publica ningún conjunto de datos de prueba, tamaño de muestra, fecha de evaluación, intervalo de confianza ni valor de desempeño medido.

Principios de medición

La precisión es más que un número resumido

Una evaluación útil separa si un resultado está disponible de si ese resultado es correcto. Registra la incertidumbre y examina segmentos significativos en lugar de ocultar la variación dentro de una sola puntuación agregada.

01

Evaluación independiente

Documente la población evaluada apta de forma independiente de la población de entrenamiento.

02

Muestreo documentado

Documente la selección, las exclusiones, la deduplicación, el peso y los posibles sesgos de muestreo.

03

Controles de filtrado

Registre los controles de filtrado y demuestre que los registros de evaluación no fueron utilizados para el entrenamiento.

Contrato propuesto de informe

Métricas requeridas por este marco

Cada métrica responde a una pregunta diferente. Ninguna ha sido medida para su publicación aún; los valores requieren un snapshot de conjunto de datos con fecha, una muestra documentada y aprobación del revisor.

Aún no medida

Cobertura conocida

La proporción de entradas elegibles para las que el servicio devuelve una inferencia soportada.

Aún no medida

Precisión en cobertura conocida

Resultados correctos medidos únicamente en entradas con una inferencia soportada.

Aún no medida

Precisión ajustada por cobertura

Una vista combinada de la disponibilidad y precisión de los resultados en resultados conocidos.

Aún no medida

Tasa desconocida

Entradas para las cuales el servicio no devuelve inferencias compatibles.

Aún no medida

Tasa ambigua

Entradas con señales competidoras o insuficientemente distintas.

Aún no medida

Error de calibración

La diferencia entre los intervalos de probabilidad predichos y los resultados observados.

Reproducible by design

Proceso de evaluación

  1. 1

    Definir la población

    Establecer la elegibilidad, exclusiones, contexto nacional, sistemas de escritura y reglas de deduplicación antes de la evaluación.

  2. 2

    Congelar el instantáneo del conjunto de datos

    Registrar el conjunto de datos evaluado y mantener los registros de evaluación separados de los datos de entrenamiento.

  3. 3

    Medir por segmento

    Reportar el tamaño de la muestra y las seis métricas en general y para los segmentos de país y script elegibles.

  4. 4

    Revisar y publicar

    Limitaciones del documento, calibración, fecha de evaluación, versión y firma del revisor con los resultados.

!

Uso responsable

La inferencia no es identidad

La inferencia basada en el nombre es probabilística. No puede establecer la identidad de género de una persona y no debe utilizarse para decisiones consecuentes sobre un individuo.

  • No utilice el género inferido para decisiones consecuentes sobre un individuo.
  • Conservar los resultados desconocidos y ambiguos en lugar de forzar un resultado.

Resultados desconocidos

Defina cuándo el servicio devuelve una inferencia no soportada y reporte ese resultado por separado.

Resultados ambiguos

Defina resultados competentes o de baja confianza sin forzarlos a un resultado binario de éxito.

Variación de segmento

El rendimiento agregado puede ocultar diferencias entre países, idiomas y entradas ambiguas.

Calibration

Compare los intervalos de probabilidad predichos con los resultados observados para cada segmento apto.

Continuar explorando

Entender los datos que subyacen a una inferencia

Leer cómo se documentan la proveniencia, los criterios de selección y los límites de uso responsable.

Ver la proveniencia de los datos →