여러 단계의 도구 사용, 코딩과 지식 작업이 필요하다면 Claude Sonnet 5를 통제된 방식으로 시험할 가치가 있습니다. 먼저 조건을 고정할 수 있는 에이전트 작업에서 사용하세요. Opus에 가까운 능력이 필요하지만 비용이나 접근성이 제약일 때 특히 의미가 있습니다. 버그 탐지 범위, 빠른 수렴 또는 특정 도구가 더 중요하면 Sonnet 4.6이나 상위 모델도 비교 대상으로 남겨야 합니다.
Anthropic은 2026년 6월 30일 Claude Sonnet 5를 발표했습니다. 현재 모델 ID는 claude-sonnet-5입니다. 이 글은 2026년 9월 20일 확인한 Anthropic 발표와 Claude Platform 카탈로그를 기준으로 합니다. 핵심은 새 모델이라는 사실만이 아닙니다. effort, 도구와 실제 제공 경로가 비용과 결과를 결정합니다.(Anthropic, Claude Platform)
핵심 요약
Sonnet 5는 계획, 도구, 코딩과 여러 단계의 전문 작업을 중시하는 Sonnet입니다.
카탈로그에는
claude-sonnet-5, 적응형 사고, 100만 token 컨텍스트와 128K 최대 출력이 표시됩니다. 모든 클라이언트가 같은 제어 항목을 제공하는 것은 아닙니다.API 확인 시점의 가격은 입력 2달러, 출력 10달러/100만 token입니다. effort, 사고 token과 재시도가 작업 비용을 높일 수 있습니다.
공개 평가는 조건부입니다. Terminal-Bench와 지식 작업은 Opus 4.8에 가까운 반면 CodeRabbit은 코드 리뷰에서 정밀도와 재현율의 절충을 보고했습니다.
이 초안에서는 Tabbit Sonnet 5 작업과 스크린샷을 수행하지 않았습니다. Claude Sonnet 5 모델 자료 (English)와 실제 선택기를 확인하세요.
Claude Sonnet 5 사양과 접근
| 항목 | 확인한 스냅샷 | 판단 기준 |
|---|---|---|
| 모델 ID | claude-sonnet-5 | API와 평가 로그에 정확한 ID를 남깁니다. |
| 출시 | 2026년 6월 30일 | 같은 작업과 평가 환경으로 비교합니다. |
| 입력 / 출력 | 텍스트·이미지 / 텍스트 | 도구는 경로에 따라 달라집니다. |
| 컨텍스트 / 최대 출력 | 100만 / 128K token | 카탈로그 한도이며 클라이언트 한도는 별도입니다. |
| 사고 | 적응형, 기본 effort는 high | 모델명만 아니라 effort를 비교합니다. |
| API 가격 | 입력 2달러 / 출력 10달러 / MTok | 구독, 클라우드와 Tabbit은 별도입니다. |
| 접근 | Anthropic이 Claude 요금제와 API를 제시 | 계정, 지역, 할당량과 선택기를 확인합니다. |
카탈로그의 신뢰 가능한 지식 기준일은 2026년 1월입니다. 연결된 검색이나 도구가 최신이라는 보장은 아닙니다. 에이전트 브라우저는 실시간 페이지를 보고 조작할 수 있지만 모델 능력만으로 권한이 생기지는 않습니다.
Sonnet 4.6에서 무엇이 달라졌나
Anthropic은 더 긴 계획, 브라우저와 터미널 도구, 코딩, 추론과 지식 작업을 중심으로 설명합니다. Sonnet 4.6보다 바람직하지 않은 행동이 적고 사이버 안전장치가 기본 활성화됐다고도 말합니다. 이는 제공업체의 설명이지 우리 작업의 결과는 아닙니다.
| 기준 | Sonnet 4.6 | Sonnet 5 | 실제 확인 |
|---|---|---|---|
| 에이전트 지속성 | 이전 세대 기준 | 더 많은 다단계 작업을 끝내고 결과를 확인한다고 설명 | 중단 조건과 검증 명령을 고정합니다. |
| 도구 사용 | 경로 의존 | 출시의 중심 주제 | 권한과 호출을 기록합니다. |
| 터미널 작업 | 공개 비교에서 67.0% | Terminal-Bench 2.1에서 80.4% | 내 저장소에서 재실행한 결과가 아닙니다. |
| 지식 작업 | 이전 세대 기준 | GDPval-AA v2 1,618, Opus 4.8은 1,615 | 3점 차이로 보편적 승자를 정하지 않습니다. |
| 코드 리뷰 | 약 63% 엄격 재현율, 정밀도 29% | 약 50–51%, 정밀도 38–40% | 깨끗한 의견과 넓은 탐지를 선택합니다. |
| 안전 | Sonnet 4.6 기준 | 바람직하지 않은 행동이 적다는 보고 | 사람 검토와 전문 테스트를 남깁니다. |
Vellum은 일부 Sonnet 4.6 기준이 수정됐다고 경고합니다. 서로 다른 날짜, 판정기와 도구 조건의 수치를 하나의 순위표에 섞지 마세요. Claude Sonnet 5 리뷰 자료 (English)와 에이전트 추론 안내도 확인할 수 있습니다.
아직 모르는 위험
공개 평가는 우리의 harness가 아닙니다. Endor Labs의 Agent Security League에서 Sonnet 5와 Claude Code는 기능 측면에서는 강했지만 취약점 해결은 더 약했습니다. 요약은 FuncPass 83.2%, 본문은 82.6%로 서로 달라 어느 숫자도 확정된 제목 수치로 쓰지 않습니다. 기능 테스트를 통과한 패치가 안전한 패치라는 뜻은 아닙니다.
effort는 비용도 바꿉니다. CodeRabbit은 높은 effort가 엄격한 버그 재현율을 뚜렷하게 높이지 못했고 리뷰 비용은 거의 두 배가 됐다고 보고했습니다. token 단가 외에 사고 token, 재시도, 도구와 사람의 수정도 기록하세요.
접근도 경로에 따라 다릅니다. Anthropic이 요금제와 API를 열거해도 실제 선택기, 지역, 할당량과 도구가 사용 가능성을 결정합니다. API에 접근된다고 브라우저나 제3자 제공업체에서 같은 모델을 쓸 수 있다는 뜻은 아닙니다.
커뮤니티의 의견
Reddit의 의견은 갈립니다. Exodus_Green은 공개 차트를 읽고 Sonnet 4.6의 low effort가 에이전트 검색에서 Sonnet 5 medium을 앞설 수 있다고 적었습니다(원문). Rent_South는 논리 흐름 평가를 모델별로 다섯 번 실행하고 선택은 워크플로에 달렸다고 했습니다(같은 글). qubedView는 단일 문서 추출에는 Sonnet이 훨씬 저렴할 수 있고 어려운 코딩에는 Opus가 맞다고 말했습니다(원 토론). TheRealJesus2는 작은 모델을 낮은·중간 추론에 쓰고 큰 모델을 계획과 검증에 쓰도록 작업을 나누라고 제안했습니다(같은 토론).
이는 개인 경험이지 benchmark가 아닙니다. 9월 20일 X와 YouTube 검색도 시도했지만 안정적으로 확인할 게시물이나 댓글 본문을 얻지 못했습니다. 스크린샷은 만들지 않고 초안으로 둡니다.
누가 써 볼 만한가
| 작업 | 첫 단계 | 이유 |
|---|---|---|
| 반복적인 추출·분류·라우팅 | low/medium effort로 시작 | 경계가 분명한 반복 작업에 적합합니다. |
| 테스트가 있는 여러 파일 개발 | 도구를 켜고 파일럿 | 긴 작업 추적이 주요 개선점입니다. |
| 고위험 보안 검토 | 전문 또는 상위 모델을 유지 | 기능 정확성이 취약점 해결을 보장하지 않습니다. |
| 한 줄 수정·저지연 채팅 | Sonnet 4.6이나 빠른 모델과 비교 | 작은 작업에는 과도하게 생각할 수 있습니다. |
| 선택기에 ID가 없음 | 접근을 약속하지 말고 계정과 지역 확인 | 카탈로그 이름은 권한이 아닙니다. |
브라우저 자동화도 인증, 모델 제한과 검토 의무를 없애지 않습니다. 제품을 비교한다면 AI 브라우저 비교와 AI 브라우저 안내를 별도로 보세요.
실제 다음 단계: 완료한 작업 하나를 측정하기
되돌릴 수 있는 대표 작업을 하나 골라 정확한 모델 ID, 클라이언트, effort, 컨텍스트, 권한, token, 시간, 재시도, 도구 호출, 독립 검증 결과와 사람의 개입을 기록합니다. Sonnet 4.6이나 현재 모델로 같은 fixture를 실행하세요. token이 아니라 완료된 결과당 비용으로 판단합니다.
Tabbit Browser 안내는 브라우저 워크플로를, Tabbit 사용법은 사람을 루프에 남기는 방법을 다룹니다. 이 초안에서는 Tabbit에서 Sonnet 5를 확인하지 않았으므로 접근 가능하다고 말하지 않습니다.
결론
Claude Sonnet 5는 에이전트 코딩, 도구 워크플로와 반복 지식 작업에서 통제된 파일럿을 해 볼 가치가 있습니다. 자동으로 Opus를 대체하거나 안전성과 저비용을 보장하는 모델은 아닙니다. effort, 재시도, 경로 제한과 작업 분해가 결과를 결정합니다. 필요한 최소 effort에서 시작해 실제 작업 비용을 기록하고, Tabbit 계정 테스트와 필요한 커뮤니티 이미지를 확인할 때까지 이 글은 초안으로 유지합니다.
출처
Anthropic: Introducing Claude Sonnet 5 — 출시, 접근, 안전과 가격.
Claude Platform 모델 개요 — ID, 컨텍스트, 출력, 사고와 메타데이터.
Claude Platform 가격 — API 가격 참고.
Endor Labs — 안전 평가와 한계.
CodeRabbit — 코드 리뷰 평가.
Vellum — 날짜가 있는 비교와 token 분할 주의.
자주 묻는 질문
Claude Sonnet 5란 무엇인가요?
Claude Sonnet 5는 Anthropic이 코딩, 도구 사용, 지식 작업과 에이전트 워크플로를 위해 제공하는 중간급 모델입니다. 2026년 9월 20일 확인한 Claude Platform 카탈로그에는 API ID claude-sonnet-5, 적응형 사고, 100만 token 컨텍스트와 최대 128K 출력이 표시됩니다.
Sonnet 4.6에서 무엇이 달라졌나요?
Anthropic은 Sonnet 5를 추론, 도구 사용, 코딩과 지식 작업이 강화된 에이전트 중심 모델로 설명합니다. 독립 보고서는 환경에 따라 코드 리뷰의 정밀도가 좋아지는 대신 엄격한 버그 재현율이 낮아질 수 있다는 절충도 보여 줍니다.
컨텍스트와 출력 한도는 얼마인가요?
2026년 9월 20일 확인한 카탈로그는 100만 token 컨텍스트와 128K 최대 출력을 표시합니다. 카탈로그 한도이며 실제 클라이언트, 요금제와 제공업체의 유효 한도는 다를 수 있습니다.
Claude Sonnet 5의 가격은 얼마인가요?
현재 Claude Platform 스냅샷은 입력 100만 token당 2달러, 출력 10달러를 표시합니다. API, 구독, 클라우드와 제3자 추가 요금은 별도이고 적응형 사고가 작업당 비용을 바꿀 수 있습니다.
Claude Sonnet 5는 어디서 사용할 수 있나요?
Anthropic 출시 글은 Claude 요금제와 Claude API를 제시합니다. 실제 모델 선택기, 지역, 할당량과 도구는 경로마다 다르므로 팀에 약속하기 전에 실제 계정을 확인해야 합니다.
전환 전에 어떻게 테스트해야 하나요?
대표 작업 하나를 고르고 모델 ID, effort, 도구 호출, 시간, token과 사람의 개입을 기록한 뒤 Sonnet 4.6 또는 현재 모델과 비교하세요. 한 번의 성공은 운영 안정성을 증명하지 않습니다.