앤트로픽은 새 모델에 함정이 숨겨진 퍼즐을 던졌습니다.
과제는 이렇습니다. 기계 부품 도면이 하나 있으니, 디자이너들이 실제 사물을 모델링할 때 쓰는 무료 엔지니어링 소프트웨어 ‘FreeCAD’로 이를 3D 모델로 재현하는 코드를 짜라는 거예요. 그런데 함정이 있었죠. 모델에게 도면을 실제로 볼 수 있는 수단이 주어지지 않았습니다. 비전 기능이 아예 없어요. 그냥 평소엔 열 수 없는 형식의 파일만 건네진 겁니다.
대부분의 AI라면 여기서 멈추거나, 억지로 답을 만들어냈겠죠. 하지만 Claude Opus 5는 둘 다 하지 않았습니다. 아예 자체 소형 컴퓨터 비전 프로그램을 처음부터 짜기 시작한 거예요. 이미지 파일의 픽셀을 읽고, 가장자리와 형태를 찾아내며, 기술적으로는 ‘볼 수 없는’ 이미지에서 기하학적 구조를 추출하는 코드를 스스로 작성한 것이죠. 그리고 그걸 바탕으로 부품을 3D로 다시 재현했습니다. 여러 번 반복해서요. 앤트로픽에 따르면, 같은 조건에서 다른 경쟁 모델은 다섯 번의 시도 끝에 이 문제를 풀지 못했다고 합니다.
이번 출시에서 진짜 주목해야 할 점은 가격도, 벤치마크 우월감도 아닙니다. 모델이 벽에 부딪혔을 때, 스스로 해결 도구를 만들어내는 그 능력이에요. Opus 5가 정확히 무엇인지, 실제로 얼마나 뛰어난지, 그리고 솔직히 ChatGPT와 어떻게 비교되는지 살펴볼 텐데요. 헤드라인이 시사하는 것보다 답은 훨씬 복잡합니다.
Claude Opus 5는 정확히 무엇인가요
Claude Opus 5는 Claude를 만든 회사, 앤트로픽의 최신 모델입니다. 2026년 7월 24일에 정식 오픈했으며, 지금 바로 Claude.ai, Claude API, Claude Code, Claude Cowork에서 사용해 보실 수 있습니다.
쉽게 말해 이렇습니다. 앤트로픽은 AI 모델을 몇 가지 계층으로 나누어 운영합니다. 가장 똑똑하지만 비싼 ‘프론티어(Frontier)’ 모델은 바로 Fable 5죠. Opus는 그 바로 아래 등급으로, 여전히 성능이 뛰어나 하루 종일 돌려도 부담 없는 ‘일꾼’ 역할입니다. Opus 5의 핵심은 Fable 5에 버금가는 지능을 제공하면서도 실행 비용은 훨씬 낮추겠다는 거예요. Cursor의 한 공동 창업자는 “Opus의 속도와 가격대 근처에서 Fable 5 수준의 지능을 제공한다”고 표현했습니다.
숫자가 궁금하신 분들을 위해 정리해 볼게요. 모델 ID는 claude-opus-5입니다. 가격은 입력 토큰 100만 개당 $5, 출력 토큰 100만 개당 $25로, 후속 모델인 Opus 4.8과 정확히 동일합니다. (토큰은 단어의 약 0.75개 분량이며, 100만 토큰은 약 75만 단어를 의미합니다.) 그래서 ‘가격이 절반’이라는 말은 Opus 4.8보다 싸다는 뜻이 아니라, 프론티어 모델 대비라는 의미예요. 토큰당 단가는 동일합니다. Opus 5는 이제 Claude Max의 기본 모델이 되었으며, Claude Pro에서 선택할 수 있는 최상위 모델입니다.
함께 출시된 두 가지 작은 기능도, 실제로 무언가를 개발하거나 활용하신다면 꽤 중요합니다. 이제 Claude 플랫폼에서 대화 중간에 모델이 접근할 수 있는 도구를 재시작 없이 바로 바꿀 수 있습니다. 또한 API를 통해 Opus 5 요청에 문제가 생길 경우, 자동으로 이전 버전인 Opus 4.8으로 롤백되도록 설정할 수 있어요. 라이브 앱에서 Claude를 운영하는 분들에게는 확실한 안전장치입니다.

2026년 7월 24일 앤트로픽 발표 페이지 — Opus 5는 Claude Max의 기본 모델이자 Claude Pro의 최상위 모델입니다. 출처: Anthropic.
낯선 문제를 푸는 것이 중요한 이유
대부분의 벤치마크는 모델이 ‘무엇을 알고 있는지’를 측정합니다. 하지만 FreeCAD 사례는 그와 다른 지표를 보여줬죠. 바로 ‘즉흥적으로 해결할 수 있는지’입니다. 비전 도구를 제공받지 않았으니, 스스로 코드를 써서 도구를 만든 거예요. 막다른 길도 포기할 이유가 아니라, 우회할 문제를 공학적으로 풀어낸 것이죠.
앤트로픽은 이를 ‘ARC-AGI-3’라는 벤치마크로 뒷받침했습니다. 모델이 본 적 없는 새로운 문제를 추론하는 능력을 평가하기 위한 테스트죠. 단순히 암기로 통과할 수 없는 영역입니다. 이 테스트에서 Opus 5는 두 번째 모델보다 약 3배 높은 점수를 받았습니다. 코딩을 안 하는데 왜 신경 써야 하냐고요? ‘낯선 문제’는 실제 업무의 대부분을 차지하기 때문입니다. 어느 스크립트에도 맞지 않는 이상한 고객 민원, 그 어느 튜토리얼로도 설명할 수 없는 방식으로 망가진 스프레드시트 말이에요. 교과서적인 케이스만 처리하는 모델은 잔재미에 불과하지만, 기록되지 않은 상황까지 논리적으로 풀어내는 모델이야말로 진짜 신뢰할 수 있는 도구입니다.
벤치마크 결과, 있는 그대로
출시 발표문은 대개 자신의 장점만 골라 내세우기 마련입니다. 그래서 앤트로픽이 공개한 공식 수치와 함께 주의사항도 함께 정리해 드립니다. 발표 페이지에는 Opus 5가 오픈AI의 GPT-5.6(일명 ‘Sol’ 버전)과 직접 비교된 표가 실렸습니다.

앤트로픽 공식 비교 표, 오른쪽 열은 GPT-5.6 Sol — Opus 5는 대부분 테스트에서 앞섰지만 전부는 아닙니다. 출처: Anthropic.
일목요연하게 읽어보면, 이건 완벽한 승리가 아닌 확실한 결과입니다. 앤트로픽이 선정한 테스트에서 Opus 5가 GPT-5.6 Sol을 대부분 앞섰습니다:
- Agentic terminal coding (Frontier-Bench): 43.3% vs 34.4%
- Knowledge work (GDPval-AA): 1,861 vs 1,736
- Novel problem-solving (ARC-AGI-3): 30.2% vs 7.8%
- Computer use (OSWorld 2.0): 70.6% vs 62.6%
- Business workflows (AutomationBench): 26.0% vs 18.1%
- Agentic web search (BrowseComp): 거의 접전, 90.8% vs 90.4%
하지만 보도자료라면 절대 강조하지 않을 부분도 있습니다. 바로 실제 개발자들이 많이 쓰는 영역에서 GPT-5.6 Sol이 승리했다는 점이에요. 실제 코딩 수준을 가리는 벤치마크 ‘DeepSWE’에서는 GPT-5.6 Sol이 72.7%로 Opus 5의 68.8%를 앞서며, Opus 5뿐 아니라 Fable 5까지 꺾었습니다. 전문 의료 지식을 테스트하는 ‘HealthBench’에서도 60.5%로 Opus 5(59.8%)를 간신히 앞섰죠. 따라서 “Opus 5가 ChatGPT를 압도한다”는 이 표의 결론은 아닙니다. 이 표가 전하는 진짜 메시지는 이렇습니다. Opus 5는 앤트로픽이 선정한 테스트에서는 앞섰지만, ChatGPT의 모델은 특정 코딩 분야에서 실제로 더 뛰어나며, 격차는 생각보다 크지 않다는 거예요.
이 수치들을 너무 맹신하기 전에 주의할 점이 두 가지 있습니다. 첫째, 테스트와 비교 상대를 모두 앤트로픽이 선정했다는 점이에요. 모든 연구실이 자신에게 유리한 방식으로 벤치마크를 진행하는 건 당연한 일이고, 그래서 외부의 객관적 평가를 기다리는 거죠. 둘째, 아직 독립 평가 기관에서 Opus 5를 공식 평가하지 않았다는 점입니다. 어느 회사에도 속하지 않는 ‘Artificial Analysis’의 지능 지수에는 Fable 5가 60점, GPT-5.6 Sol이 59점, Opus 4.8이 56점으로 집계되어 있습니다. Opus 5는 아직 반영되지 않았죠. 나중에 이 지수에 Opus 5가 반영되면, 그 수치가 출시 당일의 차트보다 훨씬 믿을 만합니다.
요즘 떠도는 “Opus 5가 SWE-Bench Pro에서 GPT-5.6을 이겼다”는 주장도 사실과 다릅니다. 앤트로픽의 표에는 SWE-Bench Pro가 아예 포함되어 있지 않거든요. 더군다나 표에 나온 코딩 테스트에서는 GPT-5.6 Sol이 앞섰습니다. 이 주장은 아직 검증되지 않은 루머로 받아들이셔야 합니다.
국내 IT 매체들은 한 마디로 ‘가성비’를 강조하며, 프론티어급 품질을 정가 없이 즐길 수 있는 모델로 Opus 5를 평가했습니다. 다만 흥미로운 점은, 그런 호의적인 현지 보도조차도 솔직한 주의사항을 가장 앞에 내세웠다는 거예요. “GPT-5.6 Sol은 여전히 DeepSWE 코딩 테스트에서 승리합니다”라고 분명히 적고 있으니까요.
아직 할 수 없는 것들과 우리가 모르는 것들
솔직하게 말씀드릴게요. 신뢰가 판매보다 훨씬 중요하니까요.
Opus 5가 앤트로픽의 최강 모델은 아닙니다. 그 자리는 여전히 Fable 5가 차지하고 있어요. Opus 5는 ‘가성비’를 노린 모델입니다. 산 정상은 아니지만, 비용은 절반으로 프론티어 성능의 대부분을 경험할 수 있게 해주는 거죠. 수 시간 동안 자율 실행이 필요한 프로젝트라면, 앤트로픽은 여전히 Fable 5를 권장합니다.
단 하나, 매우 의도적으로 균형이 맞춰진 부분도 있습니다. 바로 보안 영역이에요. Opus 5는 ‘Mythos 5’라는 전문 모델과 비교해 소프트웨어 취약점을 찾는 능력은 비슷하지만, 실제로 악용 가능한 익스플로이트를 만드는 능력에서는 한참 뒤처집니다. 이 격차는 의도적인 거예요. 잠긴 문을 찾아내는 모델은 원하지만, 그 문을 강제로 뚫는 전문가가 되길 원하는 건 아니니까요.
컨텍스트 윈도우(한 번에 처리할 수 있는 글자 수)는 아직 공식 확인되지 않았습니다. 기존 Opus 라인업은 수개월간 100만 토큰(약 75만 단어) 창을 사용해 왔고, 초기 보도도 Opus 5가 이를 계승할 것이라고 가정하지만, 앤트로픽 공식 문서에는 아직 Opus 5가 명시되지 않았습니다. 따라서 100만 토큰은 ‘유력하지만 미확정’으로 봐야 합니다. 위에 나온 모든 수치는 앤트로픽이 자체적으로 선정한 테스트에서 발표한 수치라는 점도 잊지 마세요. 방향성을 알려줄 뿐 절대적인 진리는 아니며, 보통 독립 평가 기관의 수치는 몇 주 안에 공개됩니다.
이게 당신에게 어떤 의미일까요
이미 Claude Pro나 Max를 구독 중이시라면, 자동으로 업그레이드된 거예요. 별도 설정이 필요 없습니다. Max에서는 기본 모델로, Pro에서는 최상위 옵션으로 Opus 5가 적용됩니다. 이제 너무 조그마한 단계로 쪼개지 말고, 지저분한 보고서나 꼬인 스프레드시트 같은 어려운 업무도 맡겨 보시는 걸 추천합니다.
글쓰기나 기획, 분석 업무를 하신다면, 회계팀이 눈치채지 못할 만한 합리적인 가격에 하루 종일 쓸 수 있는 확실한 도구입니다. 더군다나 템플릿도 없고 명확한 경로도 없는 ‘진짜 이상한’ 작업이 발생했을 때, 멈추기보다 논리적으로 풀어내는 데 특화된 모델이 바로 Opus 5입니다.
코딩을 하시거나 자동화 파이프라인을 운영하신다면, 코딩 및 에이전트 성능 수치와 대화 중 도구 변경 기능이 특히 눈에 띕니다. 장난감 데모가 아니라 실제 코드베이스에서 제대로 테스트해 볼 가치가 있습니다. 다만 토큰 사용량에는 신경 쓰셔야 해요. 토큰당 단가는 싸지만, 매 작업마다 더 오래 생각한다면 오히려 비용이 더 들 수 있으니까요.
Claude와 ChatGPT 중 고민 중이시라면, 이번 주 벤치마크 결과로 선택하지 마세요. 어떤 모델이 당신의 업무 스타일에 더 맞는지, 인터페이스나 문체, 이미 사용하고 있는 도구들과의 호환성 등을 기준으로 고르세요. 두 모델의 기본 능력 차이는 미미한 편이라, 점수 2점 차이보다 ‘내 스타일’이 훨씬 중요합니다. 만약 여전히 두 모델 사이에서 막막하시다면, 저희 ChatGPT 업무 활용 강좌가 어떤 모델을 선택하더라도 그 효과를 극대화하는 데 도움을 드릴 것입니다.
결론
Opus 5가 흥미로운 이유는 세상의 가장 똑똑한 AI라서도, 그리고 절대 가장 똑똑한 AI라서도 아닙니다. 오히려 프론티어급 능력을 ‘일꾼 가격’으로 내려왔다는 점, 그리고 주어진 조건이 부족해도 스스로 우회로를 개척해 낸 능력에 의미가 있습니다. 실제 업무 대부분에겐 “프리미엄을 치고 최고를 쓰는 것”보다 “비용은 절반으로, 성능은 프론티어의 대부분을 얻는 것”이 훨씬 합리적인 선택입니다.
ChatGPT와의 비교 문제도 어느 한쪽으로 단정 지을 수 없는 상황입니다. 앤트로픽의 자체 수치로는 Opus 5가 대부분에서 앞섰지만, GPT-5.6은 특정 코딩 분야에서 이겼고, 중립 평가 기관의 최종 판단은 아직 나오지 않았습니다. 따라서 화려한 출시 소문에 휩쓸려 당장 도구를 바꾸기보다, 이미 익숙한 도구를 잘 다루는 실력을 쌓아 새로운 모델을 내 업무에 바로 적용해 보는 눈이 생기는 게 중요해요. 어떤 연구실이 이번 달에 더 잘나든, 결국 돈을 벌어다 주는 건 ‘모델을 실제로 업무에 끼워 맞추는 능력’입니다. 바로 그런 실력을 기르는 데 저희 AI 기초 강좌가 맞춰져 있습니다. 당신의 일상에 어떤 AI 모델도 자연스럽게 녹여내는 법을 배울 수 있죠.