Claude Opus 5 드디어 출시

유진·2026년 7월 26일

목록 보기
15/18
post-thumbnail

지난 Gemini 글 마지막에 "소문대로면 곧 Opus 5도 나온다"고 썼는데,
7월 24일, 진짜 나오게 됐다.

한 줄로 요약하면 Fable 5에 근접한 지능을 절반 가격에 라는 것이다.
(사실 원래 Opus의 두 배 가격이니 Opus가 업그레이드됐다는 말이랑 똑같아서 뭐가 강조된 건지 잘 모르겠다.)

Claude Max의 새 기본 모델이고, Claude Pro에서 쓸 수 있는 가장 강력한 모델이 됐다.

Max 쓰는 입장에선 기본 모델이 업그레이드되는 셈이라 기분이 좋다.

가격부터

모델입력 (1M)출력 (1M)
Opus 4.8$5$25
Opus 5$5$25

가격이 똑같고, 성능만 올렸다.

Fast 모드는 기본 대비 약 2.5배 속도에 가격 2배고, Claude Code에선 사용 크레딧으로 제공된다.
그리고 이전 Opus들처럼 데이터 보존 요구사항이 없다. 이게 은근 중요하다는데, 뒤에서 다시 말해보겠다.

벤치마크

지난 글에서도 썼지만, 요즘 벤치마크 숫자를 그대로 받아들이는 게 의미가 있나 싶다.

어쨌든 결론만 적으면 이렇다.

  • 코딩·지식 노동 계열에서 전반적으로 최상위
  • effort 설정을 낮춰도 다른 모델보다 잘하는 구간이 있다
  • 사이버보안 측면은 여전히 Mythos 5에 뒤진다

이 정도만 알면 될 것 같다.

흥미로운 사례

블로그에 사례가 세 개 나온다.

1. FreeCAD 작업
기계 부품 도면을 보고 3D 모델을 코드로 재구성하는 과제인데,
이 태스크는 의도적으로 모델이 도면을 직접 볼 수 없게 만들어져 있었다.
Opus 5는 여기서 자기가 컴퓨터 비전 파이프라인을 짜서 원시 픽셀에서 형상을 뽑아낸 다음 부품을 복원했다고 한다.
같은 조건에서 다른 모델들은 5회 시도해도 못 풀었다고 한다.

2. 오픈소스 패키지 매니저 버그
실제 버그인데, 근본 원인을 찾아서 커뮤니티 패치가 놓친 경계 케이스까지 고쳤다.
비교 모델은 표면 증상만 고치고 "해결됐다"고 보고했다.

3. 트레이딩 회사 시장 데이터 피드
새 거래소용 피드를 한 세션에서 구축했는데,
검증할 실시간 피드가 없으니까 자체 테스트 하네스를 만들어서 파싱이 맞는지 확인했다고 한다.

세 개가 공통으로 말하는 건 하나다.
검증할 방법이 없으면 검증할 방법부터 만든다.

(클릭하면 Antropic이 제공한
"Claude Opus 5 builds a working wind tunnel" 영상으로 넘어간다)

실사용할 때 이 성질이 꽤 크게 다가올 것 같다.
물론 이건 직접 굴려봐야 아는 부분이고.

안전장치

지난 글에서 Gemini 3.5 Flash Cyber를 두고 "일반 개발자한텐 못 쓰는 모델"이라고 썼었다.
모델 자체를 정부·신뢰 파트너에게만 제한 배포하는 방식이었어서 그렇다.

Anthropic은 이번엔 접근이 좀 다르다.

  • 소스 코드의 취약점 탐지는 허용
  • 바이너리 기반 취약점 스캔, 침투 테스트, 익스플로잇 생성은 차단
  • 분류기 개입 자체가 Fable 5 대비 약 85% 적을 것으로 예상
  • 걸린 요청은 차단이 아니라 Opus 4.8로 폴백
  • Fable 5에서 막히던 생물학 요청은 이제 Opus 5로 라우팅

모델을 통째로 잠그는 대신 작업 단위로 자르고, 막힌 요청은 다른 모델로 흘려보낸다.
CVP(Cyber Verification Program) 참여 기업·연구자는 제한이 적은 버전을 바로 쓸 수 있다.

같은 이중용도 문제를 두고 한쪽은 배포 대상을 자르고, 한쪽은 작업 종류를 자른다.
어느 쪽이 맞다기보다, 후자가 일반 사용자한테는 확실히 덜 답답하다.

역량 자체는 취약점 "발견"은 Mythos 5에 근접했는데 "익스플로잇 개발"은 크게 뒤진다고 한다.
보안 쪽을 잘 몰라서 이쪽은 알아두면 될 것 같다.

베타 기능 두 개

대화 중 툴 변경
프롬프트 캐시를 무효화하지 않고 대화 도중에 사용 가능한 도구를 바꿀 수 있다.
MCP 붙였다 뗐다 할 때마다 캐시 날아가는 게 은근 비용이었는데 이건 반갑다.

자동 폴백
안전 분류기에 걸린 요청을 차단하는 대신 다른 모델로 자동 라우팅한다. API에서 켤 수 있다.

커뮤니티 반응 (Hacker News)

AI와 함께 정리하자면 대충 아래와 같다.

  • 진짜 핵심은 절대 성능이 아니라, 30일 데이터 보관 의무 없이 Fable급 모델을 쓸 수 있게 됐다는 것. Fable에 ARC-AGI 점수가 없는 것도 보관 정책 때문이라는 얘기가 나왔다.
  • 이미지 → HTML 변환 테스트에서 Opus 5가 Fable보다 원본 디자인을 더 정확히 따라갔다는 후기. 반대로 링크만 보면 Fable 쪽이 더 예쁘다는 의견도 같이 있었다.
  • 모델 라우팅이 요즘 제일 빠르게 크는 분야라는 얘기. 반대편에선 코딩에서 라우터를 못 믿겠다, 아낀 비용 대비 나중에 고칠 버그 비용을 측정할 방법이 없다는 반론.
  • 문체 얘기가 의외로 많았다. Claude 특유의 표현이 반복돼서 '짜증 나는 영어' 벤치마크가 필요하다는 농담까지 나왔다. Fable이 벗어났던 버릇을 Opus 5는 4.8처럼 그대로 쓴다고.
  • "Opus 5가 전반적으로 Fable 5보다 뛰어나진 않다"고 해놓고 블로그에선 대부분 벤치에서 이겼다고 나열해서 커뮤니케이션이 혼란스럽다는 지적. 정부 감시를 피하려는 절충 아니냐는 추측도 있었다.
  • 그래프에서 중간 사고 모드의 작업당 효율이 제일 높고, 추론량을 늘리면 오히려 결과가 나빠지는 구간이 있다는 관찰. 과잉 설계로 토큰을 태우는 것 아니냐, Ballmer Peak 아니냐는 농담.

마무리

지난 글에 "다음 프론티어가 하나 떨어지면 위 벤치 표들은 또 통째로 갈아엎어질 거다"라고 썼는데,
며칠 만에 그렇게 됐다.

claude만 결제하는 입장이라 성능은 업그레이드되고 비용은 그대로인 업데이트가 달갑기도 한데,
일단 뭐 체감은 이것저것 쓰면서 판단해나갈 것 같다.

아무튼 그럼 이제 남은 건.. GPT 6?


출처:

0개의 댓글