证据状态
本页面不报告测量准确性
它定义了未来评估所需的协议和披露要求。目前尚未发布测试数据集、样本量、评估日期、置信区间或测量性能值。
测量原理
准确性远不止一个 headline 数字
一个有用的评估将结果是否可获得与结果是否正确区分开来。它记录不确定性,并考察有意义的细分部分,而不是将变化隐藏在单一的综合评分中。
独立评估
独立于训练数据集,明确记录符合评估条件的评价人群。
有记录的抽样
记录选择标准、排除项、去重处理、加权方法以及潜在的抽样偏差。
泄漏控制
记录泄漏控制措施,并证明评估记录未用于训练过程。
提议的报告合同
本框架要求的指标
每个指标回答一个不同的问题。目前尚未测量并发布;数值需要一个带时间戳的数据集快照、有记录的样本以及审核人员的批准。
尚未测量
已知覆蓋範圍
服務對 eligible 輸入中能夠返回支持推斷的部分所佔比例。
尚未测量
已知範圍內的準確性
僅在輸入具有支持推斷的情況下測量的正確結果。
尚未测量
調整覆蓋範圍的準確性
已知结果上预测可用性与准确性的综合视图。
尚未测量
未知率
服务返回无支持推断的输入。
尚未测量
模糊率
存在竞争信号或信号不充分且不明确的输入。
尚未测量
校准误差
预测概率区间与实际结果之间的差异。
设计即可复现
评估流程
- 1
定义目标人群
在评估之前设定资格标准、排除条件、国家背景、书写系统以及去重规则。
- 2
冻结数据集快照
记录评估数据集,并将评估记录与训练输入分开保存。
- 3
按段落进行测量
报告样本量以及所有六个指标的总体情况,以及针对合格国家和书写系统段落的详细情况。
- 4
审核并发布
文档限制、校准、评估日期、版本及结果审核签字。
负责任地使用
推断并非身份
基于名称的推断是概率性的,无法确定个人的性别身份,不得用于涉及个人的具有重大影响的决策。
- 不得将推断出的性别用于对个人做出具有重大影响的决策。
- 应保留未知和模糊的结果,而非强行给出一个确定结果。
未知结果
定义服务在无法提供支持推断时的返回情况,并单独报告该结果。
模糊结果
定义存在竞争性或低置信度的结果,而不将其强制归为二元的成功结果。
群体差异
聚合性能可能掩盖各国、不同语言和模糊输入之间的差异。
Calibration
针对每个符合条件的群体,将预测概率区间与实际观测结果进行对比。