한국 회계·세무 AI는 실무 문제를 얼마나 잘 풀까?
K-TaxBench는 부가가치세·법인세·소득세·회계·국세기본법과 여러 세목이 얽힌 복합 사례까지, 실무 문항 302개로 AI 모델을 평가합니다. 결론만이 아니라 법적 근거·계산 과정·리스크 판단까지 채점하고, 같은 조건에서 잰 결과끼리만 비교합니다.
- 평가 문항
- 302개 — 순위는 비공개 253문항, 공개 샘플 49문항 중 34문항 공개
- 모델 측정일
- 2026-06-26 ~ 07-04
- 채점 모델(judge)
- codex-clean-judge:gpt-5.4
- 답을 만든 모델과 따로 실행
- 데이터 파일
- v0.1 · 0cb2998b4ac6
채점은 AI judge가 하고, 다른 judge로 다시 채점해 교차검증했습니다. 외부 전문가가 정답을 검수한 문항은 아직 없습니다(0/302). 공개 34문항만 저자가 법령 원문과 대조해 검수했습니다. 점수는 절대 등급이 아니라 같은 조건 안에서의 비교로 읽어 주세요. 평가 방법과 한계
결과
참고 자료 없이 모델이 아는 것만으로 답하게 합니다. 공식 순위는 이 평가로 매기며, 비공개 253문항의 평균 점수(100점 만점) 순입니다.
| 순위 | 95% 신뢰구간 | 문항 수 | 측정일 | 상세 | ||
|---|---|---|---|---|---|---|
| 1 | gpt-5.5 | 88.46 | 86.66–90.19 | 253 | 2026-06-26 | |
| 2 | gpt-5.4-cli | 79.31 | 76.86–81.64 | 253 | 2026-07-04 | |
| 3 | gpt-5.4-mini | 74.52 | 71.62–77.43 | 253 | 2026-07-03 |
점수 구간
- 비공개 평가 평균
- 95% 표본 신뢰구간
- judge 교체 실험 이동량 ±6.32
gpt-5.5
88.46 · 86.66–90.19
gpt-5.4-cli
79.31 · 76.86–81.64
gpt-5.4-mini
74.52 · 71.62–77.43
과거 측정 (조건이 달라 순위에서 제외)
2026년 6월에 이전 조건으로 잰 결과입니다. 채점 모델이 다르고, 기본 평가와 이전 방식의 자료 제공 평가 기록이 섞여 있으며, 지금의 302문항 이전 문항 집합으로 잰 것이라 평가 기록 수(59~115)도 다릅니다. 지우지 않고 남겨 두지만 위 결과와 같은 순위표에 놓지 않습니다.
| 모델 | 평균 | 평가 기록 수 | 채점 모델 | 측정일 |
|---|---|---|---|---|
| claude-opus-4-8 | 92.22 | 115 | claude-sonnet-4-6 | 2026-06-11 |
| claude-sonnet-4-6 | 85.25 | 59 | claude-sonnet-4-6 | 2026-06-11 |
| claude-haiku-4-5 | 46.26 | 85 | claude-sonnet-4-6 | 2026-06-11 |