Claude Opus 5: 추론 노력·비용 곡선으로 에이전트 모델을 고르다
Anthropic이 장기 에이전트와 코딩·전문 업무를 겨냥한 Claude Opus 5를 기존 Opus 가격으로 출시했다.
한 문장 요약: Anthropic이 장기 에이전트와 코딩·전문 업무를 겨냥한 Claude Opus 5를 기존 Opus 가격으로 출시했다.
무엇이 발표됐나
Anthropic은 7월 24일 Claude Opus 5를 모든 Claude 제품과 API에 출시했다. API 모델 ID는 claude-opus-5이며 가격은 100만 입력 토큰당 5달러, 출력 토큰당 25달러로 Opus 4.8과 같다. 기본 모드보다 약 2.5배 빠르다고 밝힌 Fast mode는 기본 가격의 두 배다. 따라서 “새 모델이 더 싸다”기보다 같은 단가에서 더 적은 단계와 토큰으로 작업을 끝낸다는 것이 발표의 중심 주장이다.
Anthropic은 Opus 5가 장기 코딩과 전문 업무에서 결과를 스스로 점검하고 실패 원인을 고쳐 가는 능력을 개선했다고 설명했다. 사용자는 effort 설정으로 정확도와 토큰 사용량 사이를 조절할 수 있다. 이 글은 발표사가 제시한 벤치마크 우위를 직접 재현하지 않았다.
기술 구조와 API에서 볼 지점
모델 내부 구조보다 개발자가 직접 다룰 수 있는 실행 제어가 중요하다. 베타인 mid-conversation tool changes는 최초 요청에 전체 도구를 선언한 뒤 tool_addition과 tool_removal 블록으로 실제 노출 도구를 바꾼다. 도구 배열 자체는 유지되므로 긴 대화의 프롬프트 캐시가 무효화되지 않는다. 작업 단계별 최소 권한을 적용하면서 캐시 비용도 지킬 수 있는 방식이다.
자동 폴백도 함께 공개됐다. 안전 분류기가 Opus 5 요청을 차단하면 다른 모델로 넘길 수 있으며, Claude 제품에서는 기본적으로 Opus 4.8이 사용된다. 가용성은 높아지지만 같은 세션의 실행 모델과 안전 정책이 조용히 달라질 수 있다. 응답 메타데이터에 실제 모델, effort, 폴백 원인과 도구 집합 버전을 남겨야 재현과 감사가 가능하다.
개발자에게 왜 중요한가
에이전트의 경제성은 토큰 단가만으로 비교하기 어렵다. 잘못된 계획, 반복 도구 호출, 테스트 재실행과 인간 개입까지 합친 작업 완료 비용이 실제 지표다. 동일한 저장소·도구·시간 상한에서 effort별 성공률, 총 입출력 토큰, 도구 호출 수, 벽시계 시간과 변경 정확도를 측정해야 한다. Fast mode도 속도 배수만 보지 말고 꼬리 지연과 작업당 비용을 함께 비교해야 한다.
한계와 검증 포인트
발표의 성능·안전 수치는 Anthropic과 초기 파트너 평가다. Frontier-Bench 결과는 작업당 5회 시도의 평균이고, Opus 5나 Fable 5가 안전 분류기에 거절됐을 때 Opus 4.8을 폴백으로 사용했다. 순수 모델 능력과 라우팅된 제품 성능이 섞일 수 있다는 뜻이다. Opus 5가 공격적 사이버 작업에서 더 강한 Mythos 5보다 뒤진다는 시스템 카드의 평가도 독립 재현된 보편적 경계로 보기는 어렵다. 도입 전에는 기존 Opus의 고정 평가 세트와 실제 에이전트 궤적으로 품질·비용·거절 회귀를 다시 확인해야 한다.
공식 1차 출처
- Introducing Claude Opus 5 — Anthropic, 2026-07-24
- Claude Opus 5 System Card — 능력·정렬·위험 평가와 방법
- Mid-conversation system messages and tool changes — 캐시와 도구 변경 API