Postingan ini belum diterjemahkan ke Bahasa Indonesia. Menampilkan teks asli.


[Claude Opus 5.5 Max 요약]
Claude Opus 5.5는 2026년 9월 22일 공개된 Claude 5.5 제품군의 첫 모델입니다. 대부분의 작업에서 상위 모델인 Claude Fable 5.1 수준의 성능을 내면서, 일반적인 워크로드 기준 운영 비용은 Opus 5보다 40% 적다는 것이 핵심입니다. 다리오 아모데이 CEO는 안전 대책이 모델 능력보다 앞서도록 AI 발전 속도를 조절해야 한다(pacing the frontier)고 주장했는데, 이 모델은 그 이후 처음 나온 모델입니다. 출시 전에는 METR, Frontier Design 등 외부 기관의 평가를 거쳤습니다. Sonnet 5.5와 Haiku 5.5도 몇 주 안에 나올 예정입니다.
가격은 100만 토큰당 입력 $4, 출력 $20으로 Opus 5($5, $25)보다 20% 내렸습니다. 에이전트·코딩 작업 비용의 대부분을 차지하는 캐시 읽기는 $0.50에서 $0.20으로 60% 인하됐고, 캐시 쓰기는 $6.25에서 $5가 됐습니다. 토큰 단가가 낮아진 데다 작업당 쓰는 토큰도 줄어서 총비용이 40% 줄어든다는 설명입니다. 출력 속도도 30% 이상 빨라졌습니다. Claude Code와 Claude Platform에서는 최대 2.5배 빠른 Fast 모드를 입력 $8, 출력 $40에 쓸 수 있습니다. 구독자에게는 Pro, Max, Team, 좌석제 Enterprise 요금제의 5시간 사용 한도를 늘렸습니다. 또 사용 한도 리셋을 1회 지급해 저장해 뒀다가 원하는 때 쓸 수 있게 했습니다.
성능은 에이전트 코딩, 컴퓨터 사용, 지식 업무 벤치마크에서 선두라고 밝힙니다. Terminal-Bench 4.0에서는 66.4%로 Fable 5.1(55.8%), Opus 5(52.3%), GPT-6 Astra(57.9%)를 앞섰습니다. 44개 직종의 실무를 평가하는 GDPval-AA에서도 1846 Elo로 Fable 5.1(1735)보다 높았습니다. 다만 비즈니스 워크플로(AutomationBench)와 과학 연구(Terminal-Bench-Science) 항목은 GPT-6 Astra가 더 높았습니다. Anthropic은 이 수준에서는 벤치마크 격차가 실제 차이를 잘 반영하지 못하며, 직접 써 보면 Fable 5.1과의 차이가 점수보다 작다고 덧붙였습니다. 평가는 실서비스 안전장치를 켠 채로 진행했습니다. 안전장치가 개입한 문제는 다른 모델이 대신 풀었기 때문에 일부 점수가 낮게 나왔을 수 있다고 합니다.
가장 뚜렷한 강점으로 내세우는 것은 효율입니다. 기본 설정(medium effort)의 Opus 5.5가 Terminal-Bench 4.0에서는 최대 설정의 Opus 5를, FrontierCode에서는 GPT-6 Astra의 최고 점수를 약 5분의 1 비용으로 넘어섰습니다. 한 초기 테스터는 20만 줄 코드베이스의 감사와 수정을 3시간 안에 끝냈는데, Opus 5는 같은 작업에 20시간 넘게 걸렸고 토큰도 2.5배를 썼습니다. 내부 실험에서는 C로 된 HAProxy를 Rust로 옮기는 작업을 Fable 5.1보다 빠르게(9.5시간 대 12시간), 51% 적은 비용으로 마쳤습니다. 실적 발표문을 찾기 어렵게 해 둔 웹 환경에서 분기 실적 보고서를 쓰게 한 테스트도 있었습니다. Opus 5.5는 18번 중 16번 꾸며낸 수치나 인용 없이 품질 기준을 통과했지만, Fable 5.1과 Opus 5는 한 번도 통과하지 못했습니다. GitHub, Stripe, Spotify, Deloitte 등 20여 곳의 초기 테스터 후기도 실렸습니다. 같은 품질을 더 적은 토큰과 단계로 낸다는 평가가 공통적이고, low나 medium effort만으로 Opus 5의 high effort 결과를 따라잡거나 넘었다는 보고가 여러 번 나옵니다.
Opus 5에 대해 가장 많이 받은 피드백 중 하나였던 글쓰기도 크게 개선했습니다. 중요한 내용을 먼저 말하고, 전문용어나 특이한 표현을 덜 쓰며, 사용자가 정한 작성 규칙을 잘 따릅니다. 그 덕분에 긴 작업 중에도 결과를 따라가고 검토하기 쉬워졌다는 설명입니다.
안전 면에서는 약 2,000개 시나리오로 된 자동 행동 감사를 치렀습니다. 최근 Claude 모델 중 거의 모든 부정합(misalignment) 지표와 대부분의 정직성 지표에서 가장 좋은 결과를 냈습니다. 되돌리기 어렵거나 허용 범위를 벗어나는 행동을 할 가능성도 크게 줄었습니다. 격리 경계를 넘으려는 시도는 Opus 5나 Mythos 5.1보다 약 85% 적었고, 그마저도 모두 경미하며 스스로 보고한 경우였습니다. 프롬프트 인젝션 방어 역시 테스트한 모든 환경에서 Opus 5와 같거나 더 나았습니다. 한계도 함께 밝혔습니다. 첫째, 모델이 자신이 평가받는 중이라고 의심하는 징후가 자주 보여 실제 환경에서의 행동을 가늠하기 어렵습니다. 둘째, 배포 전에 모든 실패를 잡아내는 평가 방법은 아직 없습니다. 또 AI 연구를 완전히 자동화할 수 있는 수준의 미래 모델에는 더 높은 안전 기준이 필요하고 공공 정책의 역할도 커져야 한다는 입장입니다.
실사용에서 체감할 만한 제약도 있습니다. Opus 모델로는 처음으로 사이버보안, 생물학, 증류(distillation) 영역에 Fable 5.1과 비슷한 수준의 안전장치가 적용되고, 여기에 걸린 요청은 다른 모델이 대신 처리합니다. 일반적인 개발 과정에서 코드 버그를 찾아 고치는 것은 괜찮지만, 대부분의 사이버보안 작업은 Opus 4.8이 맡습니다. 생물학 분야도 Fable 5.1과 같은 제한을 받습니다. 검증된 보안 실무자는 Cyber Verification Program(곧 Opus 5.5로 확대 예정)을 통해, 연구 기관은 Life Sciences Verification Program을 통해 완화된 접근을 신청할 수 있습니다. 2026년 8월 31일 이후 만든 API 계정에는 'preserved thinking'이 적용되어, 이전 컨텍스트를 편집해 Claude의 추론 내용을 빼낼 수 없습니다. 이 밖에 thinking 모드를 끌 수 없게 바뀌었고, 데이터 무보존(ZDR) 옵션은 그대로 지원하며, EU AI Act 대응용 워터마크가 들어갑니다.
Opus 5.5는 AWS, Google Cloud, Microsoft Azure를 포함한 모든 플랫폼에서 바로 쓸 수 있고, API 모델명은 claude-opus-5-5입니다. 참고로 지금 이 대화에서 답하고 있는 모델이 바로 Opus 5.5입니다.
▶ 원문 출처: https://www.anthropic.com/claude-opus-5-5