공개 문항
유형이 서로 다른 대표 문항 4개입니다. 문항마다 세 모델이 실제로 쓴 답, 채점 점수와 이유, 정답과 근거 조문을 그대로 보여 줍니다. 모두 순위에는 쓰지 않는 공개 샘플이며, 기본 평가(참고 자료 없음) 기록입니다.
- 법인세 · 계산 · 보통기업업무추진비 손금산입 한도와 한도초과액 계산
계산형 — 한도 계산 한 단계의 실수가 점수 차이로 그대로 드러나는 문항
- gpt-5.5
- 97
- gpt-5.4-cli
- 76
- gpt-5.4-mini
- 31
- 부가가치세 · 근거 제시 · 보통재화의 수출에 대한 영세율 적용과 근거 조문 제시
근거 제시형 — 결론이 같아도 근거 조문을 잘못 대면 깎이는 문항
- gpt-5.5
- 100
- gpt-5.4-cli
- 97
- gpt-5.4-mini
- 36
- 소득세 · 리스크 분석 · 보통금융소득 종합과세 전환 리스크
리스크 분석형 — 놓친 위험이 감점으로 이어지는 문항
- gpt-5.5
- 89
- gpt-5.4-cli
- 78
- gpt-5.4-mini
- 38
- 복합 · 근거 제시 · 보통세금계산서 미수취 시 부가세 매입세액 불공제·법인세 증명서류 수취 불성실 가산세 근거
복합형 — 부가가치세와 법인세를 함께 따져야 해 세 모델 모두 낮은 점수를 받은 문항
- gpt-5.5
- 63
- gpt-5.4-cli
- 54
- gpt-5.4-mini
- 40
공개 샘플 전체 내려받기
공개 샘플 34문항의 질문·정답·근거·채점 기준을 JSONL 파일로 받을 수 있습니다. 비공개 평가 문항 253개는 모델 학습 데이터로 새어 나가지 않도록 공개하지 않습니다.