# 데이터 출처와 입력 처리

## 평가 입력의 출처

외부 공개 벤치마크나 실제 회사·고객 데이터를 가져온 평가가 아닙니다. 이 실험을 위해 작성하고 실행 전에 고정한 합성 48문항을 사용했습니다. 파일은 evaluation-v2.json이며 문항 ID, 과제, 상태, 질문, 후보, 기대 라벨과 작성 이유를 포함합니다. 근거관계 24건은 8유형에 지지/반박/부족을 하나씩, 라우팅 24건은 결제/배송/계정 각 8건입니다.

고정 파일 SHA-256: ff2a2f979ad3aa849af10488dd506e6036cc5de43272dc1d7792c9b87a2bc03b

expected와 rationale은 채점·검토용입니다. expected는 추론 입력으로 전달하지 않았습니다. 이는 외부 세계의 참거짓을 조사하는 사실검증이 아니라 주어진 근거와 주장의 관계를 평가합니다.

## 모델별 입력 형식

- Julia: state와 question, 후보 ID→description mapping을 named choice 질문으로 전달했습니다.
- Kev: 같은 state/question/criteria를 제작자의 SystemOneRequest와 to_record로 직렬화했습니다. 후보 ID와 description의 표현이 Julia와 다릅니다.
- mDeBERTa: state에서 가상의 근거와 주장을 분리해 premise/hypothesis 쌍으로 입력하고 entailment/contradiction/neutral을 지지/반박/부족으로 매핑했습니다. 라우팅은 평가하지 않았습니다.
- Qwen: state, question, 후보 mapping과 JSON 출력 요청을 프롬프트로 조합하고, choice enum을 제한한 JSON schema로 생성했습니다. temperature 0, seed 7, num_ctx 2048, think false입니다.

## 측정과 범위

2026-10-07 KST 재평가의 새 168응답입니다. 이전 실행과 선택은 모두 같지만 두 실행은 합산하지 않습니다. summary-v3.json에는 성공 실행과 추론 전 실패를 별도로 기록했습니다. 이 근거 묶음의 results에는 성공 실행의 168개 응답 JSON만 원본 bytes 그대로 들어 있습니다. supervisor와 실패 로그, 메모리 sample은 로컬 재평가 폴더에 보관했습니다. summary의 supervisor/failed_attempts 경로는 전체 로컬 기록의 식별 정보이며 이 공개 후보 묶음에는 해당 파일이 없습니다.

첫 요청은 이후 분포와 구분합니다. 근거관계 이후 요청 중앙값은 23건, 라우팅은 뒤이어 실행한 24건입니다. p95는 nearest-rank입니다. 실행기·정밀도·입력 형식·메모리 계측이 달라 일반 성능 순위로 해석하지 않습니다. 새 독립 리뷰어의 QA는 하지 않았고 기존 검수 코드와 이전 결과 비교를 사용했습니다.

이 데이터는 모호함·범주 밖 요청·복수 의도·보류를 평가하지 않습니다. Jev와 Decisions API는 직접 호출하지 않았습니다. 데이터 선택·기대 라벨 작성의 판단과 제한도 함께 읽어야 합니다.
