PRODUCT · 리더보드 공개
📊

K-TaxBench

한국 세무·회계 AI를 실무 기준으로 줄 세웁니다

정답률이 아니라 실무 신뢰도를 재는 한국 세무·회계 AI 평가 인프라.

웹사이트 열기 ↗문의 남기기
01

무엇을 하나

6개 도메인(부가·법인·소득·국세기본·회계·복합) × 7개 역량(계산·근거·사례·리스크·에이전트 등) 101문항을 closed-book·RAG·agent 3모드로 돌립니다. 코드 채점(계산 역산·근거 조문/기준서 문단 매치)과 비self LLM judge를 결합해, 정답뿐 아니라 환각·계산오류·근거오류를 차원별로 분해합니다.

02

왜 만드나

세무·회계 AI는 빠르게 늘지만 '실제로 한국 세법·회계기준을 이해하는가'를 같은 조건에서 재현 가능하게 재는 표준이 없습니다. 일반 LLM 벤치나 객관식 정답률로는 답이 안 됩니다. 정답률이 아니라 실무 신뢰도 — 근거가 맞는지, 위험한 단정을 피하는지 — 를 측정합니다.

03

지금 단계

101문항으로 3모델 변별 spread 40.2, RAG 환각감소 +8.6을 확인했습니다. 공개 리더보드는 비공개 holdout 기준 순위와 공개셋 점수를 분리 표기하고(Leaderboard Illusion 방지), 버전핀·재현 검증을 강제합니다. 외부 전문가 검수 도입과 기술 리포트 공개를 준비 중입니다.

CONTACT

같이 이야기합시다.

도입 검토, 파일럿 협의, 또는 그냥 궁금한 것.
어떤 이야기든 환영합니다.