평가 방법
무엇을 어떻게 채점하는지, 점수를 어떻게 읽어야 하는지, 이 평가가 아직 보장하지 못하는 것은 무엇인지 적었습니다.
평가 범위
실무 문항은 모두 302개입니다. 이 중 253개는 비공개 평가 문항으로, 모델 학습 데이터로 새어 들어가지 않도록 본문과 정답을 공개하지 않으며 순위는 이 문항들로만 매깁니다. 나머지 49개는 공개 샘플이고, 그중 저자가 법령·기준서 원문과 대조해 검수를 마친 34개를 실제로 배포합니다.
분야별
- 부가가치세 68
- 법인세 66
- 소득세 54
- 회계 48
- 국세기본법 36
- 복합 30
유형별
- 근거 제시 81
- 사례 판단 75
- 리스크 분석 54
- 계산 54
- 업무 수행 36
- 객관식 1
- 단답 1
난이도 표시
- 어려움 175
- 보통 124
- 쉬움 2
- 전문가 1
난이도는 문항을 만들 때 붙인 표시이며, 실제 모델 점수로 다시 검증한 값은 아닙니다.
데이터 파일 v0.1 (sha256 앞 12자 0cb2998b4ac6). 문항별 버전은 0.1 40개 · 0.2 260개 · 0.3 2개입니다.
두 가지 평가 방식
- 기본 평가
- 참고 자료 없이 모델이 아는 것만으로 답합니다. 공식 순위는 이 평가로 매깁니다.
- 근거 자료 제공 평가
- 문항마다 미리 고정해 둔 법령·기준서 발췌 묶음을 함께 주고 답하게 합니다. 자료를 읽고 쓰는 능력을 따로 보는 측정이라 순위를 매기지 않습니다.
두 방식의 점수는 서로 섞어 평균 내지 않습니다.
채점 방식
답을 만드는 모델과 채점하는 모델(judge)을 분리합니다. 현재 공식 결과는 모두 같은 채점 모델 codex-clean-judge:gpt-5.4로 채점했고, 채점은 답 생성과 다른 세션에서 따로 실행합니다. 채점 모델이 다른 결과는 같은 순위표에 놓지 않습니다.
채점 항목과 배점(100점 만점)은 문항 유형마다 다릅니다. 예를 들어 계산 문항은 계산·절차에, 근거 제시 문항은 법적 근거에 배점이 큽니다.
| 채점 항목 | 근거 제시 | 사례 판단 | 리스크 분석 | 계산 | 업무 수행 | 객관식 | 단답 |
|---|---|---|---|---|---|---|---|
| 결론 정확성 | 20 | 25 | 25 | 20 | 20 | 50 | 25 |
| 법적 근거 | 35 | 20 | 20 | 15 | 20 | 20 | 20 |
| 계산·절차 | — | — | 15 | 40 | 15 | — | 15 |
| 사실관계 반영 | 10 | 15 | 10 | 10 | — | 10 | 10 |
| 실무성 | 15 | 20 | 15 | 10 | — | — | 15 |
| 리스크 처리 | 15 | 15 | 10 | — | 10 | 10 | 10 |
| 명확성 | 5 | 5 | 5 | 5 | — | 10 | 5 |
| 도구 사용 | — | — | — | — | 20 | — | — |
| 산출물 품질 | — | — | — | — | 15 | — | — |
감점 규칙
- 존재하지 않는 근거 생성 -20점
- 기준시점 무시 -10점
- 요청 형식 미준수 -5점
- 과도한 면책으로 실질 회피 -5점
- 출처 없이 단정 -10점
- 필수 도구 미사용 -15점
- 조회하지 않은 조문 인용 -10점
근거 제시 문항에서는 답에 인용된 조문을 정답 근거 목록과 기계적으로 대조합니다. 목록에 없는 조문은 자동으로 깎지 않고 「확인 대상」으로 표시해 채점 모델이 판단합니다.
점수 읽는 법
결과 화면에는 성격이 다른 불확실성 두 가지를 함께 그립니다.
- 95% 표본 신뢰구간 (실선)
- 비공개 253문항을 다시 뽑았을 때(부트스트랩) 평균이 움직일 수 있는 범위입니다. 문항 수가 한정돼 생기는 불확실성입니다.
- judge 교체 실험 이동량 (점선 띠)
- 같은 답안을 채점 모델만 바꿔 다시 채점한 실험에서 평균 점수가 움직인 폭입니다. gpt-5.4-cli 의 답안 302문항을 gpt-5.4 judge 와 gpt-5.5 judge 로 각각 채점했을 때 기본 평가에서 평균 6.32점, 근거 자료 제공 평가에서 2.37점 차이가 났습니다. 한 번의 실험에서 관측한 값이며, 모든 모델에 보장되는 오차범위가 아닙니다.
같은 계열 judge 끼리(gpt-5.4 ↔ gpt-5.5)는 문항별 점수 상관이 0.930·0.941(후보 두 모델)로 높았지만, 다른 회사 judge (Claude Opus ↔ gpt-5.4, gpt-5.5 답안 302문항)로 바꾸면 0.778 로 떨어졌습니다. 이 실험들에서 모델 간 순위는 바뀌지 않았지만 절대 점수는 채점 모델에 따라 달라졌습니다. 그래서 점수는 채점 모델과 함께 읽어야 하고, 다른 채점 모델로 잰 점수와 비교하면 안 됩니다. 계산 문항은 채점 모델을 바꿔도 점수가 거의 같았고, 판단 재량이 큰 유형일수록 차이가 컸습니다.
항목별 달성률
비공개 253문항에서 각 채점 항목의 만점 대비 얻은 점수 비율입니다. 항목마다 배점이 달라 원점수로는 비교할 수 없어서 비율로 바꿨고, 같은 비율은 같은 색으로 칠했습니다. 괄호 안은 그 항목이 배점에 있는 문항 수입니다.
| 채점 항목 (해당 문항 수) | gpt-5.5 | gpt-5.4-cli | gpt-5.4-mini |
|---|---|---|---|
| 계산·절차 (124) | 93.3% | 87.5% | 82.9% |
| 명확성 (218) | 95.7% | 89.5% | 89.2% |
| 결론 정확성 (253) | 92.2% | 83.0% | 78.8% |
| 산출물 품질 (35) | 92.2% | 79.2% | 72.2% |
| 사실관계 반영 (218) | 96.2% | 89.4% | 87.0% |
| 법적 근거 (253) | 83.3% | 73.5% | 66.1% |
| 실무성 (218) | 89.6% | 79.5% | 76.5% |
| 리스크 처리 (210) | 86.9% | 75.6% | 69.5% |
| 도구 사용 (35) | 40.3% | 25.9% | 20.6% |
| 채점 항목 (해당 문항 수) | gpt-5.5 | gpt-5.4-cli | gpt-5.4-mini |
|---|---|---|---|
| 계산·절차 (124) | 94.4% | 94.0% | 90.4% |
| 명확성 (218) | 98.0% | 97.2% | 96.6% |
| 결론 정확성 (253) | 94.3% | 93.6% | 90.5% |
| 산출물 품질 (35) | 93.0% | 91.0% | 87.6% |
| 사실관계 반영 (218) | 97.7% | 96.5% | 95.9% |
| 법적 근거 (253) | 95.6% | 95.5% | 91.9% |
| 실무성 (218) | 94.2% | 91.7% | 90.0% |
| 리스크 처리 (210) | 95.8% | 93.8% | 90.6% |
| 도구 사용 (35) | 66.9% | 81.6% | 79.3% |
자주 나온 문제
채점 중 표시된 문제를 유형별로 센 값입니다. 채점 모델이 문항 내용을 직접 적은 지적은 비공개 문항의 단서가 되므로 원문 대신 「그 밖의 judge 지적」으로 묶어 건수만 보여 줍니다. 실제 지적 사례는 공개 문항에서 볼 수 있습니다.
| 표시 유형 | gpt-5.5 | gpt-5.4-cli | gpt-5.4-mini |
|---|---|---|---|
| 정답 근거 목록에 없는 조문 인용(자동 감점 아님, 확인 대상) | 28 | 29 | 26 |
| 그 밖의 judge 지적(오답·누락 등) | 27 | 46 | 69 |
| 표시 유형 | gpt-5.5 | gpt-5.4-cli | gpt-5.4-mini |
|---|---|---|---|
| 정답 근거 목록에 없는 조문 인용(자동 감점 아님, 확인 대상) | 16 | 21 | 20 |
| 그 밖의 judge 지적(오답·누락 등) | 15 | 7 | 12 |
| 출처 없이 단정 | 4 | 0 | 0 |
| 존재하지 않는 근거 생성 | 2 | 0 | 0 |
| 기준시점 무시 | 2 | 0 | 0 |
검증의 한계
- 외부 세무·회계 전문가가 검수한 문항은 아직 없습니다(0/302). 정답의 신뢰성은 저자 검수와 AI 채점 모델 간 교차검증에 기대고 있으며, 사람 전문가 합의로 확인한 것은 아닙니다.
- 공개 34문항만 저자가 법령·기준서 원문과 대조해 검수했고, 비공개 문항은 내부 검수 단계입니다.
- 채점 모델 사이의 큰 이견이 어느 쪽이 옳은지는 이 실험만으로 판정할 수 없습니다. 사람 판정이 가장 필요한 지점입니다.
- 평가 코드와 비공개 데이터는 공개하지 않습니다. 이 사이트에서는 공개 샘플, 채점 기준, 채점 모델과 실행 조건을 확인할 수 있습니다.
- 현재 공식 비교 대상은 3개 모델입니다. 이 결과를 다른 모델이나 다른 과제로 일반화하지 않습니다.
변경 이력
- 2026-09 — 공식 순위 자격을 「채점 모델·평가 방식·비공개 문항 수가 모두 같은 결과」로 정했습니다. 2026-06-11 에 이전 조건으로 잰 Claude 3개 모델 결과는 지우지 않고 홈 하단 「과거 측정」으로 옮겼습니다. 사이트를 보고서 형식으로 새로 만들었습니다.
- 2026-07 — gpt-5.5 기본 평가를 다른 모델들과 같은 채점 모델(gpt-5.4 judge)로 다시 채점해 교체했습니다.
- 2026-06-26 — 정답·채점 기준을 고친 4개 문항을 다시 채점해 gpt-5.5 집계를 갱신했습니다.
공개 샘플
공개 34문항의 질문·정답·근거·채점 기준을 JSONL 파일로 받을 수 있습니다. 파일에는 학습 데이터 오염을 탐지하는 표식 문자열이 들어 있습니다.