Statut de preuve
Cette page ne rapporte pas une précision mesurée
Elle définit le protocole et les déclarations nécessaires à une évaluation future. Aucun ensemble de données de test, taille d'échantillon, date d'évaluation, intervalle de confiance ou valeur de performance mesurée n'est actuellement publié.
Principes de mesure
La précision dépasse un seul chiffre global
Une évaluation utile permet de distinguer la disponibilité d'un résultat de sa correction. Elle enregistre l'incertitude et examine des segments significatifs au lieu de cacher la variation dans un seul score global.
Évaluation indépendante
Documenter la population d'évaluation qualifiée de manière indépendante par rapport à la population d'entraînement.
Échantillonnage documenté
Documenter la sélection, les exclusions, la déduplication, le poidsage et les biais potentiels de sélection.
Contrôles de fuite
Enregistrer les contrôles de fuite et prouver que les enregistrements d'évaluation n'ont pas été utilisés pour l'entraînement.
Contrat de reporting proposé
Indicateurs requis par ce cadre
Chaque indicateur répond à une question différente. Aucun n'a encore été mesuré pour publication ; les valeurs nécessitent une prise de snapshot de données datée, un échantillon documenté et l'approbation d'un reviseur.
Couverture connue
La part des entrées éligibles pour lesquelles le service retourne une inférence prise en charge.
Précision sur les cas connus
Résultats corrects mesurés uniquement sur les entrées ayant une inférence prise en charge.
Précision ajustée selon la couverture
Une vue combinée de la disponibilité des résultats et de leur précision sur des résultats connus.
Taux inconnu
Les entrées pour lesquelles le service ne retourne aucune inférence prise en charge.
Taux ambigü
Les entrées présentant des signaux concurrents ou insuffisamment distincts.
Erreur de calibration
La différence entre les bandes de probabilités prédites et les résultats observés.
Reproduit par conception
Processus d'évaluation
- 1
Définir la population
Établir les critères d'éligibilité, les exclusions, le contexte national, les systèmes d'écriture et les règles de déduplication avant l'évaluation.
- 2
Freezer l'instantané du jeu de données
Enregistrer le jeu de données évalué et maintenir les enregistrements d'évaluation séparés des entrées d'entraînement.
- 3
Mesurer par segment
Rapporter la taille de l'échantillon et les six indicateurs globalement ainsi que pour les segments nationaux et scriptuels éligibles.
- 4
Vérifier et publier
Limites du document, calibration, date d'évaluation, version et signature du reviseur avec les résultats.
Utilisation responsable
L'inférence n'est pas l'identité
L'inférence basée sur le nom est probabiliste. Elle ne peut pas établir l'identité de genre d'une personne et ne doit pas être utilisée pour des décisions conséquentes concernant un individu.
- Ne pas utiliser le sexe inféré pour des décisions conséquentes concernant une personne.
- Conserver les résultats inconnus et ambigus au lieu de les forcer à produire un résultat.
Résultats inconnus
Définir la situation où le service ne retourne pas de prédiction prise en charge et rapporter ce résultat séparément.
Résultats ambigus
Définir des résultats concurrents ou à faible confiance sans les forcer à se transformer en un résultat binaire de succès.
Variation de segment
La performance globale peut cacher des différences entre pays, scripts et entrées ambiguës.
Calibration
Comparer les bandes de probabilités prédites aux résultats observés pour chaque segment éligible.