제안된 측정 프로토콜

GenderAPI 정확도 평가 프레임워크

미래의 커버리지, 정확도, 불확실성, 그리고 캘리브레이션 측정을 위한 제안된 프로토콜—확률적 추론을 정체성 주장으로 바꾸지 않고.

증거 상태

이 페이지는 측정 정확도를 보고하지 않습니다

미래 평가를 위한 프로토콜 및 공개 요구 사항을 정의합니다. 현재는 테스트 데이터셋, 샘플 크기, 평가 일자, 신뢰 구간, 또는 측정된 성능 값이 공개되지 않았습니다.

측정 원리

정확도는 하나의 헤드라인 숫자를 넘는다

유용한 평가에서는 결과가 존재하는지 여부와 그 결과가 올바른지 여부를 분리하여 평가한다. 불확실성을 기록하고 의미 있는 세그먼트를 분석하는 것이며, 단일 집계 점수 안에 변동성을 숨기는 것은 피한다.

01

독립 평가

평가 대상 집합을 훈련 데이터 집합과 독립적으로 기록한다.

02

기록된 샘플링

선택, 제외, 중복 제거, 가중치 적용 및 샘플링 편향 가능성에 대해 기록한다.

03

leakage 제어

leakage 제어를 기록하고 평가 기록이 훈련에 사용되지 않았음을 입증한다.

제안된 보고 계약

이 프레임워크가 요구하는 지표

각 지표는 다른 질문에 답한다. 아직 공개를 위해 측정되지 않았으며, 값은 날짜 기반 데이터 세트 스토리지, 기록된 샘플, 그리고 리뷰어의 승인을 필요로 한다.

아직 측정되지 않음

지식 범위

서비스가 지원하는 추론을 반환하는 적격 입력의 비율

아직 측정되지 않음

지식 범위에서의 정확도

지원되는 추론을 가진 입력에 대해서만 정확한 결과를 측정합니다.

아직 측정되지 않음

범위 조정된 정확도

지식 결과의 가용성과 정확도를 종합적으로 보여주는 시각화.

아직 측정되지 않음

알 수 없는 비율

서비스가 지원하지 않는 추론을 반환하는 입력 값들.

아직 측정되지 않음

불확실한 비율

경쟁하거나 충분히 구분되지 않은 신호를 가진 입력 값들.

아직 측정되지 않음

정밀도 오류

예측 확률 범위와 관찰된 결과 사이의 차이.

디자인을 통해 재현 가능하게

평가 과정

  1. 1

    인구를 정의한다

    평가 전에 타당성, 제외 조건, 국가 맥락, 글자 시스템, 중복 제거 규칙을 설정한다.

  2. 2

    데이터셋 샷을 고정한다

    평가된 데이터셋을 기록하고, 평가 기록을 훈련 입력과 분리한다.

  3. 3

    세그먼트별로 측정한다

    표본 크기와 모든 여섯 가지 지표를 전체 및 타당한 국가와 글자 세그먼트별로 보고한다.

  4. 4

    검토하고 공개한다

    문서 제한, 캘리브레이션, 평가 일자, 버전 및 결과에 대한 리뷰어 승인

!

책임 있는 사용

추론은 정체성과 다름

이름 기반 추론은 확률적임. 개인의 성별 정체성을 확립할 수 없으며, 개인에 대한 결과에 영향을 미치는 결정에 사용되어서는 안 됨.

  • 개인에 대한 결정에서 추론된 성별을 사용하지 말 것
  • 모호하거나 알려지지 않은 결과를 보존하고 결과를 강제하지 말 것.

알 수 없는 결과

서비스가 지원하지 않는 추론을 반환할 경우 그 상황을 정의하고 별도로 보고한다.

모호한 결과

경쟁적 또는 낮은 신뢰도 결과를 정의하며 이들을 이진 성공 결과로 강제하지 않는다.

세그먼트 변동

집계된 성능은 국가, 언어, 모호한 입력 간의 차이를 숨길 수 있다.

Calibration

각 타당한 세그먼트별로 예측 확률 범위와 관찰된 결과를 비교한다.

더 깊이 탐색을 계속

추론의 뒤에 있는 데이터를 이해하세요

추천 기준, 선택 기준, 책임 있는 사용 범위가 어떻게 기록되었는지 확인하세요.

데이터 출처 확인 →