提出的测量协议

GenderAPI 准确性评估框架

提出一种未来测量覆盖率、准确性、不确定性和校准的协议——无需将概率推断转化为身份声明。

证据状态

本页面不报告测量准确性

它定义了未来评估所需的协议和披露要求。目前尚未发布测试数据集、样本量、评估日期、置信区间或测量性能值。

测量原理

准确性远不止一个 headline 数字

一个有用的评估将结果是否可获得与结果是否正确区分开来。它记录不确定性,并考察有意义的细分部分,而不是将变化隐藏在单一的综合评分中。

01

独立评估

独立于训练数据集,明确记录符合评估条件的评价人群。

02

有记录的抽样

记录选择标准、排除项、去重处理、加权方法以及潜在的抽样偏差。

03

泄漏控制

记录泄漏控制措施,并证明评估记录未用于训练过程。

提议的报告合同

本框架要求的指标

每个指标回答一个不同的问题。目前尚未测量并发布;数值需要一个带时间戳的数据集快照、有记录的样本以及审核人员的批准。

尚未测量

已知覆蓋範圍

服務對 eligible 輸入中能夠返回支持推斷的部分所佔比例。

尚未测量

已知範圍內的準確性

僅在輸入具有支持推斷的情況下測量的正確結果。

尚未测量

調整覆蓋範圍的準確性

已知结果上预测可用性与准确性的综合视图。

尚未测量

未知率

服务返回无支持推断的输入。

尚未测量

模糊率

存在竞争信号或信号不充分且不明确的输入。

尚未测量

校准误差

预测概率区间与实际结果之间的差异。

设计即可复现

评估流程

  1. 1

    定义目标人群

    在评估之前设定资格标准、排除条件、国家背景、书写系统以及去重规则。

  2. 2

    冻结数据集快照

    记录评估数据集,并将评估记录与训练输入分开保存。

  3. 3

    按段落进行测量

    报告样本量以及所有六个指标的总体情况,以及针对合格国家和书写系统段落的详细情况。

  4. 4

    审核并发布

    文档限制、校准、评估日期、版本及结果审核签字。

!

负责任地使用

推断并非身份

基于名称的推断是概率性的,无法确定个人的性别身份,不得用于涉及个人的具有重大影响的决策。

  • 不得将推断出的性别用于对个人做出具有重大影响的决策。
  • 应保留未知和模糊的结果,而非强行给出一个确定结果。

未知结果

定义服务在无法提供支持推断时的返回情况,并单独报告该结果。

模糊结果

定义存在竞争性或低置信度的结果,而不将其强制归为二元的成功结果。

群体差异

聚合性能可能掩盖各国、不同语言和模糊输入之间的差异。

Calibration

针对每个符合条件的群体,将预测概率区间与实际观测结果进行对比。

继续探索

理解推断背后的數據

了解數據來源、選擇標準以及責任使用邊界是如何記錄的。

查看數據來源 →