Anthropic이 7월 24일 Claude Opus 5를 출시했습니다. Claude Max의 기본 모델이 됐고, Pro에서도 선택할 수 있습니다. Claude API와 Amazon Bedrock, Google Cloud, Microsoft Foundry에서도 같은 날 제공을 시작했습니다.
Opus 5의 API 가격은 Fable 5보다 낮게 책정됐습니다. 토큰 단가는 절반이지만, 실제 작업 비용까지 절반으로 줄어드는 것은 아닙니다. 첫 외부 평가에서는 Opus 5가 근소하게 앞섰고, 먼저 써 본 사람들의 평가는 어느 한쪽으로 모이지 않았습니다.
Max·Pro와 API에서 바로 쓸 수 있습니다
Opus 5는 출시 당일부터 Claude API 전 고객에게 열렸습니다. 기존 Opus 4.8도 그대로 남아 있어 두 모델을 계속 선택할 수 있습니다.
7월 25일 국내에서 확인했을 때 claude.ai와 Claude Code의 모델 목록에도 Opus 5가 나타났고, OpenRouter를 거친 API 호출도 가능했습니다. 이 내용은 Anthropic 문서가 아니라 출시 다음 날 직접 확인한 결과입니다.
한 번에 넣을 수 있는 분량은 100만 토큰입니다. 별도 설정을 켤 필요 없이 기본으로 적용되며, 이보다 늘릴 수는 없습니다. 답변은 최대 12만 8천 토큰까지 생성할 수 있고, 답하기 전에 생각하는 과정인 thinking도 기본으로 켜져 있습니다.
가격은 낮지만 실제 비용은 작업마다 달랐습니다
Anthropic이 공개한 API 가격은 입력 100만 토큰당 5달러, 출력 25달러입니다. 앞 모델인 Opus 4.8과 같고, Fable 5의 입력 10달러·출력 50달러와 비교하면 절반입니다.
하지만 토큰 단가가 절반이라고 실제 청구액까지 절반이 되는 것은 아닙니다. Artificial Analysis가 max effort로 돌린 평가에서는 차이가 줄었습니다.
| 2026-07-25 Artificial Analysis 측정 | Opus 5 | Fable 5 |
|---|---|---|
| 태스크당 평균 비용 | $2.03 | $2.75 |
| 평가 전체 출력 토큰 | 1억 개 | 8,700만 개 |
Opus 5는 단가가 절반이었지만 이 평가에서 쓴 비용은 Fable 5보다 26% 낮았습니다. 같은 문제를 풀면서 더 많은 출력 토큰을 사용했기 때문입니다.
이 결과를 모든 작업에 그대로 적용할 수는 없습니다. max effort는 모델이 가장 오래 생각하도록 둔 설정이고, 실제 청구액은 작업의 종류와 모델이 사용한 토큰 수에 따라 달라집니다.
첫 외부 평가에서는 차이가 크지 않았습니다
출시 다음 날 공개된 두 평가에서는 Opus 5가 Fable 5를 앞섰습니다. 다만 두 모델의 점수 차이는 크지 않았습니다.
| 2026-07-25 관측 | Opus 5 | Fable 5 | Opus 4.8 |
|---|---|---|---|
| AA 지능 지수 (max effort) | 61 | 60 | — |
| SWE-bench Verified (vals.ai) | 97.00% | 95.00% | 88.60% |
Artificial Analysis의 지능 지수는 여러 평가 결과를 하나의 점수로 묶습니다. Opus 5는 190개 모델 가운데 1위, Fable 5는 3위였습니다. 순위는 두 계단 갈렸지만 점수 차이는 1점뿐입니다.
vals.ai의 SWE-bench Verified는 실제 오픈소스 저장소의 문제를 모델이 직접 고치게 하는 코딩 평가입니다. 여기서도 Opus 5가 앞섰지만, 이 평가 하나가 모든 코딩 작업을 대표하지는 않습니다.
먼저 써 본 사람들의 반응은 엇갈렸습니다
Hacker News의 한 사용자는 두 모델을 자신의 실무 태스크 14개에 나란히 적용한 결과를 공개했습니다. 10개는 결과가 같았고, Opus 5가 3개, Fable 5가 1개 앞섰습니다. 비용은 Opus 5가 Fable 5의 약 3분의 1이었다고 적었습니다.
공개 벤치마크가 아니라 한 사람이 자기 작업으로 만든 비공개 비교입니다. Artificial Analysis의 평가보다 비용 차이가 크게 나온 것도 태스크와 effort 설정, 표본 크기가 모두 달랐기 때문일 수 있습니다.
다른 Hacker News 게시물에는 성능이 아닌 이유로 Opus 5를 택했다는 경험도 올라왔습니다. Fable 5가 어셈블리 코드 디버깅이나 로그인 화면 작업을 거절했다는 사례가 있었고, 데이터 보존 기간과 구독 사용 한도를 이유로 든 사람도 있었습니다. 아직 몇 사람의 경험이라 이런 문제가 얼마나 자주 생기는지는 알 수 없습니다.
반대 평가도 나왔습니다. r/ClaudeAI의 비교 글에는 Fable 5가 원래 의도를 더 잘 지켜 결과물도 더 쓸 만했다는 의견이 달렸습니다. 설계는 Fable 5에, 구현은 Opus 5에 맡긴다는 의견도 있었습니다.
첫날만으로 판단하기는 이릅니다
7월 25일 기준 LMArena 텍스트 순위에는 Opus 5가 아직 없습니다. Fable 5가 1위에 올라 있고, Epoch AI도 Opus 5 페이지는 만들었지만 점수는 비워 둔 상태입니다. 두 순위표에 Opus 5 결과가 나오기 전이라 초기 평가만으로 우열을 굳히기는 어렵습니다.
실제 비용도 외부 평가와 개인 작업에서 서로 다른 폭으로 줄었습니다. 안전 필터 때문에 모델을 바꿨다는 사례 역시 아직 몇 건에 그칩니다. 실제 작업에서 어느 모델이 나은지 말하려면 사례가 더 필요합니다.
참고한 문서
- Anthropic: Introducing Claude Opus 5
- Anthropic 개발자 문서: What's new in Claude Opus 5
- Artificial Analysis: Claude Opus 5 model page
- Artificial Analysis: Opus 5 분석
- vals.ai: SWE-bench Verified
- Hacker News: Claude Opus 5 출시 스레드
- Hacker News: 전환 보고 스레드
- r/ClaudeAI: Opus 5와 Fable 5 비교 글
- LMArena: 리더보드
- Epoch AI: claude-opus-5