K-TaxBench

한국 회계·세무 AI는 실무 문제를 얼마나 잘 풀까?

K-TaxBench는 부가가치세·법인세·소득세·회계·국세기본법과 여러 세목이 얽힌 복합 사례까지, 실무 문항 302개로 AI 모델을 평가합니다. 결론만이 아니라 법적 근거·계산 과정·리스크 판단까지 채점하고, 같은 조건에서 잰 결과끼리만 비교합니다.

평가 문항
302개 — 순위는 비공개 253문항, 공개 샘플 49문항 중 34문항 공개
모델 측정일
2026-06-26 ~ 07-04
채점 모델(judge)
codex-clean-judge:gpt-5.4
답을 만든 모델과 따로 실행
데이터 파일
v0.1 · 0cb2998b4ac6

채점은 AI judge가 하고, 다른 judge로 다시 채점해 교차검증했습니다. 외부 전문가가 정답을 검수한 문항은 아직 없습니다(0/302). 공개 34문항만 저자가 법령 원문과 대조해 검수했습니다. 점수는 절대 등급이 아니라 같은 조건 안에서의 비교로 읽어 주세요. 평가 방법과 한계

결과

참고 자료 없이 모델이 아는 것만으로 답하게 합니다. 공식 순위는 이 평가로 매기며, 비공개 253문항의 평균 점수(100점 만점) 순입니다.

기본 평가 모델별 결과
순위문항 수상세
1gpt-5.588.46253
2gpt-5.4-cli79.31253
3gpt-5.4-mini74.52253

점수 구간

  • 비공개 평가 평균
  • 95% 표본 신뢰구간
  • judge 교체 실험 이동량 ±6.32
gpt-5.5
88.46 · 86.66–90.19
gpt-5.4-cli
79.31 · 76.86–81.64
gpt-5.4-mini
74.52 · 71.62–77.43
실선은 평가 문항을 다시 뽑았을 때 평균이 움직일 수 있는 범위(부트스트랩 95% 신뢰구간)입니다. 점선 띠는 채점 judge를 다른 모델로 바꾼 실험에서 평균이 움직인 폭이며, 모든 모델에 보장되는 오차범위가 아닙니다. 띠가 겹치는 모델 사이의 차이는 채점 모델을 바꾸면 달라질 수 있습니다.

과거 측정 (조건이 달라 순위에서 제외)

2026년 6월에 이전 조건으로 잰 결과입니다. 채점 모델이 다르고, 기본 평가와 이전 방식의 자료 제공 평가 기록이 섞여 있으며, 지금의 302문항 이전 문항 집합으로 잰 것이라 평가 기록 수(59~115)도 다릅니다. 지우지 않고 남겨 두지만 위 결과와 같은 순위표에 놓지 않습니다.

과거 측정 결과 — 순위 없음
모델평균평가 기록 수채점 모델
claude-opus-4-892.22115claude-sonnet-4-6
claude-sonnet-4-685.2559claude-sonnet-4-6
claude-haiku-4-546.2685claude-sonnet-4-6