2026년 5월 28일, Anthropic이 플래그십 모델 Claude Opus 4.8을 공개했습니다. 코딩 벤치마크 신기록과 함께, 경쟁의 축을 성능에서 정직성으로 옮긴 이번 업데이트의 핵심을 정리했습니다.
저도 처음 Opus 4.8 발표를 봤을 때 솔직히 "또 버전업이네" 하고 스쳐갈 뻔했거든요. 그런데 릴리스 노트를 꼼꼼히 읽다 보니, 이번엔 숫자보다 철학이 바뀐 업데이트라는 게 느껴졌습니다. Anthropic이 처음으로 벤치마크 점수보다 정직성(Honesty)을 첫 번째 키워드로 내세운 거거든요.
Opus 4.7이 나온 지 6주 만에 4.8이 등장했습니다. 가격은 그대로인데 뭔가 달라졌다는 건데, 과연 실제로 체감할 수 있는 변화인지 하나씩 뜯어보겠습니다.
Claude Opus 4.8은 2026년 5월 28일, Anthropic이 공개한 Opus 계열의 최신 플래그십 AI 모델입니다. 모델 ID는 claude-opus-4-8이고, claude.ai, Claude API, Claude Code에서 동시에 사용할 수 있습니다.
Opus 4.7이 2026년 4월 16일에 출시됐으니, 약 6주 만의 업데이트입니다. Anthropic은 이번 릴리스를 "전작 대비 완만하지만 분명히 체감되는(modest but tangible) 향상"이라고 표현했는데, 저는 이 표현 자체가 꽤 솔직하다고 느꼈습니다. 과장 없이 기대치를 조정해준 거잖아요.
| 버전 | 출시일 | 핵심 변화 |
|---|---|---|
| Opus 4.6 | 2026년 2월 6일 | 도구 활용 개선, 1M 컨텍스트 지원(베타) |
| Opus 4.7 | 2026년 4월 16일 | 코딩·멀티스텝 성능 집중 개선 |
| Opus 4.8 | 2026년 5월 28일 | 정직성 강화, 동적 워크플로우, 코딩 벤치마크 신기록 |
Anthropic이 Opus 4.8을 소개하면서 가장 먼저 꺼낸 단어가 정직성(Honesty)이었습니다. AI 모델의 고질적인 문제 중 하나가 "근거 없이 자신 있게 완료 보고를 하는 것"인데, Opus 4.8은 이 부분을 직접적으로 개선했습니다.
Anthropic의 내부 평가에 따르면, Opus 4.8은 자신이 작성한 코드의 결함을 그냥 통과시킬 확률이 Opus 4.7 대비 약 4배 낮아졌습니다. 저도 코딩 작업에 Claude를 많이 쓰는데, 예전엔 분명히 버그가 있는 코드를 "완성됐습니다"라고 건네줘서 당황한 적이 몇 번 있었거든요. 그게 4배 줄었다면 실제로 체감이 될 것 같습니다.
불확실할 때 먼저 알려주고, 스스로의 실수를 표시하며, 더 정직하게 협업하는 모델. Anthropic이 Opus 4.8을 소개하는 방식
이번 업데이트에서 완전히 새로 추가된 기능이 바로 동적 워크플로우(Dynamic Workflows)입니다. 현재 Claude Code에서만 연구 미리보기(Research Preview) 상태로 제공됩니다.
작동 방식이 꽤 흥미롭더라고요. 사용자가 "이 코드베이스를 새 프레임워크로 마이그레이션해줘"처럼 규모가 큰 작업을 던지면, Opus 4.8이 먼저 작업 계획을 세웁니다. 그 다음 계획을 수백 개의 하위 작업으로 쪼개서 서브에이전트들에게 병렬로 분배하고, 결과를 보고하기 전에 산출물을 직접 검증합니다.
다만 현재 연구 미리보기 단계라는 점은 감안해야 합니다. Anthropic은 앞으로 4~6주 동안 오케스트레이션 방식이 바뀔 수 있다고 밝혔기 때문에, 프로덕션 팀이라면 안정화 이후에 도입을 고려하는 게 현명할 것 같습니다.
claude.ai와 Cowork에서 모델 선택기 옆에 노력(Effort) 컨트롤이 생겼습니다. 작업 난이도에 따라 모델이 토큰을 얼마나 쓸지 직접 고를 수 있는 기능입니다. 평소 일반 작업엔 High, 까다로운 리팩터링이나 장시간 에이전트 작업엔 Extra·Max로 올리는 식으로 활용하면 됩니다. 토큰을 더 쓰는 만큼 비용도 올라가니 조절이 핵심입니다.
수치 얘기를 안 할 수가 없죠. Opus 4.8은 주요 코딩 벤치마크에서 이전 버전과 경쟁 모델을 전부 앞섰습니다.
| 벤치마크 | Opus 4.8 | Opus 4.7 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|
| SWE-bench Pro | 69.2% | 64.3% | 58.6% | 54.2% |
| SWE-bench Verified | 88.6% | 87.6% | — | — |
| Terminal-Bench 2.1 | 74.6% | 66.1% | — | — |
| MCP-Atlas | 82.2% | 77.3% | — | — |
특히 Terminal-Bench 2.1에서 8.5%p 향상은 꽤 인상적입니다. 실제 터미널 작업과 명령줄 실행 능력이 그만큼 올라간 거니까요. 개인적으로 저는 Claude Code를 터미널 작업에 많이 쓰는데, 이 수치 향상이 실사용에서 어떻게 느껴지는지 테스트해보고 싶어지더라고요.
일반 사용 가격은 Opus 4.7과 동일하게 유지됐습니다. 입력 토큰 100만 개당 5달러, 출력 100만 개당 25달러입니다. 그런데 이번에 Fast Mode가 새롭게 정비됐는데, 가격이 꽤 눈에 띄게 바뀌었습니다.
| 모드 | 입력 (1M 토큰) | 출력 (1M 토큰) | 특징 |
|---|---|---|---|
| Standard | $5 | $25 | Opus 4.7과 동일 가격 유지 |
| Fast Mode | $10 | $50 | 2.5배 빠름, 이전 Fast 대비 3배 저렴 |
Fast Mode가 이전 버전 대비 속도는 2.5배 빠르면서 가격은 3분의 1 수준으로 내려온 겁니다. 실시간 응답이 필요한 서비스라면 Standard 대신 Fast Mode를 선택할 이유가 생긴 셈입니다.
2026년 6월 기준, AI 모델 시장의 주요 플래그십 모델들을 한눈에 비교해봤습니다.
저는 이번 Opus 4.8의 포지셔닝이 흥미롭다고 느꼈습니다. 모델 성능이 상향 평준화된 시장에서 Anthropic은 "값을 더 받을 명분"을 똑똑함이 아닌 정직함에서 찾겠다는 방향을 택한 거거든요. 이게 장기적으로 맞는 방향인지, 아니면 마케팅에 가까운 건지는 실사용으로 검증해봐야 알 것 같습니다.
Claude Opus 4.8, 스펙보다 신뢰가 더 중요한 시대의 AI 업데이트. 유용하셨다면 주변에 공유해주세요 🙌