법률 AI 모델 벤치마크 (참고)

Legal Benchmarks 커뮤니티가 실무 변호사 과제 63건으로 평가한 API 모델 순위입니다(July 2026 기준). 신뢰도(정답 비율)와 유용성(실무 사용 가능성)을 분리해 공표합니다.

⚠️ 라이츠백은 특정 모델을 추천하지 않습니다. 라이츠백 BYOL·탐색 메뉴 사용자용 참고 자료입니다. 특정 모델 추천·법률자문이 아닙니다. 원문·최신 순위는 출처 링크를 확인하세요.

모델 순위

계약서 작성 34과제

상업 변호사가 자주 수행하는 작성 업무를 평가합니다. 신규 조항 작성, 상대방 초안 수정(redline), 개정안·템플릿 기반 계약 작성, 문장 다듬기 등.

순위모델제공사신뢰도유용성과제당 비용
1Claude Opus 4.8Anthropic67.6% (23/34)2.67~$0.29
2Claude Fable 5Anthropic61.8% (21/34)2.66~$0.64
3Claude Opus 5신규Anthropic61.8% (21/34)2.47~$0.74
4Kimi K3신규Moonshot58.8% (20/34)2.64~$0.14
5Grok 4.5신규xAI58.8% (20/34)2.61~$0.19
6Gemini 3.5 FlashGoogle55.9% (19/34)2.60~$0.08
7Claude Sonnet 4.6Anthropic50% (17/34)2.63$0.13
8Gemini 3.1 ProGoogle50% (17/34)2.69$0.07
9Qwen3.7 MaxAlibaba44.1% (15/34)2.67~$0.03
10GPT 5.6 Sol신규OpenAI44.1% (15/34)2.75~$0.19
11GPT-5.5OpenAI41.2% (14/34)2.77$0.15
12GPT-5.4-miniOpenAI26.5% (9/34)2.55~$0.01
13DeepSeek V4 ProDeepSeek26.5% (9/34)2.68~$0.03
  • Anthropic이 작성 분야 선두이나, 신규 플래그십이 1위는 아님

    Claude Opus 4.8이 67.6%로 1위. Opus 5는 61.8%로 3위 데뷔(Fable 5와 동률).

  • 토큰 단가만 보면 안 됨 — 과제 완료 비용이 중요

    Opus 5 토큰 단가는 Fable의 절반이지만 입력·출력이 더 길어 과제당 비용은 $0.74 vs $0.64로 약 16% 더 비쌈.

  • Anthropic 외 최강 작성 모델은 Kimi K3

    58.8%(Grok 4.5와 동률), 과제당 약 $0.14. Google·OpenAI 전 모델보다 앞섬.

  • GPT 5.6 Sol은 겉보기 품질은 좋으나 정확도는 낮음

    문장은 깔끔하지만 절반 이상이 지시사항을 하나 이상 놓침. 깔끔해서 오류를 놓치기 쉬움.

  • 지시·문서 간 모순 감지는 전반적 약점

    대부분 모순을 지적하지 않고 그대로 작성. Opus 4.8이 가장 잘 처리, GPT 5.6 Sol이 가장 자주 무시.

정보 추출 29과제

계약·규정·정책 문서에 대해 변호사가 묻는 질문(해지 시점, 계약 금액, 준거법, 특정 의무 존재 여부 등)에 얼마나 정확히 답하는지 평가합니다.

순위모델제공사신뢰도유용성과제당 비용
1GPT 5.6 Sol신규OpenAI89.7% (26/29)2.78~$0.19
2Claude Opus 4.8Anthropic86.2% (25/29)2.54~$0.29
3Claude Fable 5Anthropic86.2% (25/29)2.51~$0.64
4Claude Opus 5신규Anthropic86.2% (25/29)2.31~$0.74
5GPT-5.5OpenAI82.8% (24/29)2.62$0.15
6Kimi K3신규Moonshot82.8% (24/29)2.28~$0.14
7Grok 4.5신규xAI79.3% (23/29)2.70~$0.19
8Claude Sonnet 4.6Anthropic72.4% (21/29)2.47$0.13
9Gemini 3.5 FlashGoogle65.5% (19/29)2.76~$0.08
10Gemini 3.1 ProGoogle65.5% (19/29)2.51$0.07
11DeepSeek V4 ProDeepSeek62.1% (18/29)2.37~$0.03
12GPT-5.4-miniOpenAI58.6% (17/29)2.75~$0.01
13Qwen3.7 MaxAlibaba55.2% (16/29)2.55~$0.03
  • GPT 5.6 Sol이 추출 1위 — 가장 명확한 답변

    관련 조항 전부 찾기·다문서 비교 등 가장 어려운 추출 과제에서 우위.

  • Opus 5는 신뢰도는 동률이나 가독성은 낮음

    정확하고 구조화되어 있으나 답변이 가장 길어 붙여넣기 전에 다듬어야 함.

  • Kimi K3 — 텍스트 접근 가능 시 프론티어급

    읽을 수 있는 텍스트 과제에서 100% 통과. 스캔 PDF는 PDF 처리 경로 한계로 낮은 점수.

  • GPT 5.6 Sol 약점: 스캔 문서·조건부 답변

    실패 대부분이 스캔 파일 오독 또는 조건부를 단정적으로 답한 경우.

  • Grok 4.5 — 스캔 문서 강점, 완전성 약점

    모든 인스턴스를 찾아야 하는 질문에서 '거의 다' 수준에 그침.

준비 중인 카테고리

  • 법률 리서치 분석
  • 계약서 검토
  • 법률 번역

과제 범위

평가 방법

질문측정
신뢰도답이 맞는가?체크리스트 이진 통과율
유용성그대로 쓸 수 있는가?명확성·길이·구조 (1~3) 평균

한계

  1. 63과제·영어·상업법 중심 — 한국 학폭·가사 영역 미포함
  2. 단일 턴만 — 멀티턴·도구 사용 미평가
  3. 시점 스냅샷 — 월별 변동
  4. LLM 심사 의존 — 길이(length) 항목에서 심사관 간 일치율 낮음
  5. 앱(Claude·ChatGPT UI) 미재평가 — API 모델만
  6. 비전 없는 모델은 스캔 PDF 과제에서 불리
  7. 과제당 비용 = 공시 API 요금 기준(엔터프라이즈 할인·재시도 미포함)

향후 계획

Legal Benchmarks는 월 1회 리더보드를 재실행합니다. 라이츠백은 이 페이지의 데이터를 분기별로 갱신할 예정이며, 원문 측의 지역·언어 확대 계획에 따라 향후 항목이 추가될 수 있습니다.

용어

신뢰도 (Reliability)
과제를 완전히 맞힌 비율. 정확성·완전성·관련성·모르는 것을 지어내지 않는지를 체크리스트로 이진 판정.
유용성 (Usefulness)
실무자가 그대로 쓸 수 있는지. 명확성·길이·구조 각 1~3점 평균 (1=재작업 필요, 2=수정 후 사용, 3=그대로 사용).
과제당 비용
63개 전체 과제 기준 모델별 평균 API 비용(실행 시점 공시 요금). ~ 표시는 근사치.

변경 이력

본 페이지는 Legal Benchmarks 리더보드(July 2026)를 요약·번역한 참고 자료입니다. 순위·수치의 정확한 정의와 최신 결과는 원문을 확인하세요. 라이츠백은 법률자문·AI 모델 판매·추천을 하지 않습니다.