Claude Opus 4.1 출시 — 에이전트 코딩과 추론 성능 업그레이드
Claude Opus 4.1
TL;DR Highlight
Claude Opus 4.1은 SWE-bench 74.5%로 코딩 벤치마크 최고점을 갱신했으나 커뮤니티가 가격 대비 효용을 의문시했다.
Who Should Read
Claude Code나 API로 대규모 코드베이스를 다루는 개발자, 또는 AI 코딩 도구 간 비용 대비 성능을 비교하고 있는 팀 리드.
Core Mechanics
- SWE-bench Verified에서 74.5%를 기록했는데, 이건 별도 scaffold 없이 bash 도구와 파일 편집 도구 두 개만으로 달성한 점수다. 이전 Opus 4 대비 소폭 상승.
- GitHub에 따르면 멀티파일 리팩토링에서 특히 눈에 띄는 성능 향상이 있고, Rakuten은 대규모 코드베이스에서 불필요한 수정 없이 정확한 버그 수정을 해준다고 평가했다.
- Windsurf 벤치마크 기준으로 Opus 4 대비 1 표준편차 개선인데, 이건 Sonnet 3.7에서 Sonnet 4로 넘어갈 때와 비슷한 폭이라고 한다.
- 가격은 Opus 4와 동일하게 유지된다. API에서 모델 ID는 claude-opus-4-1-20250805로, 기존 Opus 4 사용자는 그냥 모델명만 바꾸면 된다.
- extended thinking(최대 64K 토큰)을 쓸 때와 안 쓸 때 벤치마크 점수가 다르다. SWE-bench는 extended thinking 없이, TAU-bench/GPQA 등은 켜고 측정했다.
- Anthropic이 '앞으로 몇 주 내에 훨씬 큰 개선을 출시할 계획'이라고 예고했는데, 커뮤니티에서는 이 부분이 Opus 4.1 자체보다 더 주목받고 있다.
- 같은 날 OpenAI(o3 오픈소스 모델)와 Google도 동시에 발표를 해서, 3대 AI 랩이 같은 날 릴리스를 쏟아낸 이례적인 상황이 됐다.
Evidence
- Opus의 비용 문제가 가장 큰 논쟁 포인트였다. 한 사용자는 OpenRouter 기준으로 Sonnet만 써도 시간당 $5가 드는데, Opus는 그보다 훨씬 비싸서 비용 대비 효용이 안 맞다고 지적했다. 가성비 최고는 GPT-4.1 mini라는 의견.
- 벤치마크상 Opus가 거의 모든 면에서 우위인데, 실제 사용 경험은 Sonnet이 훨씬 낫다는 모순적 반응이 많았다. 'Opus 4.1도 Opus 4만큼 쓸모없다'는 극단적 의견도 있었고, 출시 당일 Claude 전반의 품질이 떨어졌다는 보고도 여러 건.
- OpenRouter 랭킹 데이터에 따르면 Sonnet 3.7과 Sonnet 4의 합산 토큰 생성량이 Opus 4의 17배에 달한다. 가격이 같은 한 Opus 채택률이 오르기 어렵다는 분석.
- Claude Code 외에 다양한 LLM을 쓸 수 있는 에이전트 코딩 도구에 대한 수요가 있었다. Aider, Codename Goose 등이 거론됐고, 로컬 모델로 돌려서 비용을 줄이고 싶다는 의견도.
- o3/o3-pro가 추론 면에서 Claude보다 강하다는 의견이 있었고, 반면 Claude의 코딩 정밀도를 높이 사는 쪽도 있어서 용도별 모델 선택이 갈리는 양상이었다.
How to Apply
- 현재 Opus 4를 API로 쓰고 있다면 모델 ID를 claude-opus-4-1-20250805로 바꾸기만 하면 된다. 가격 동일하고 하위 호환되므로 리스크 없이 테스트 가능.
- 멀티파일 리팩토링이나 대규모 코드베이스 디버깅처럼 정밀도가 중요한 작업에는 Opus 4.1을, 일반적인 코드 생성이나 대화형 작업에는 Sonnet 4를 쓰는 식으로 모델을 분리하면 비용을 절감할 수 있다.
- 비용이 부담되면 Claude Code 대신 Aider나 Goose 같은 오픈소스 에이전트 도구에 GPT-4.1 mini를 연결해서 간단한 작업을 처리하고, 복잡한 작업에만 Claude를 쓰는 하이브리드 전략을 고려할 것.
- Anthropic이 '몇 주 내 대폭 개선' 예고를 했으므로, 지금 대규모 모델 마이그레이션을 하기보다는 소규모 테스트만 해두고 다음 릴리스를 지켜보는 것이 합리적.
Terminology
관련 논문
프로덕션 AI 에이전트를 GPT-5.6으로 마이그레이션: 2.2배 빠르고 27% 저렴
마케팅 웹사이트를 자동 생성하는 프로덕션 AI 에이전트를 Claude Opus 4.8에서 GPT-5.6 Sol로 전환한 실전 경험담으로, 단순 모델 교체가 아니라 eval 하네스, 툴 스키마, 캐싱, 추론 리플레이까지 손봐야 했던 과정을 구체적인 수치와 함께 정리했다.
xAI Grok Build CLI가 xAI 서버로 전송하는 데이터: 네트워크 레벨 분석
xAI의 공식 코딩 CLI 도구 Grok Build가 사용자 동의 없이 전체 Git 저장소와 .env 시크릿 파일을 xAI 서버로 업로드한다는 사실이 네트워크 트래픽 분석으로 밝혀졌다.
중요할 때 기억하라: Long-Horizon 에이전트를 위한 Proactive Memory Agent
LLM 에이전트가 긴 작업 중 중요한 정보를 잊어버리는 문제를 별도의 메모리 에이전트가 '적절한 타이밍에' 끼어들어 해결하는 방법
WebSwarm: 깊고 넓은 웹 검색을 위한 재귀적 Multi-Agent Orchestration
복잡한 웹 검색을 재귀적으로 분해하고 각 노드에 적합한 검색 모드를 동적으로 할당하는 멀티에이전트 프레임워크
웹 앱을 리버스 엔지니어링해서 AI Agent 도구로 자동 변환하기
로그인된 웹 앱의 API 호출을 브라우저에서 감시해 자동으로 MCP 도구로 변환하는 에이전트를 만들었다. 소스 코드나 공식 API 문서 없이도 Jira, Spotify 같은 서비스에 AI 어시스턴트를 붙일 수 있다.
FableCut – AI 에이전트가 조작할 수 있는 브라우저 기반 비디오 에디터 (zero deps)
타임라인 전체를 JSON 파일 하나로 표현하고 MCP/REST로 AI 에이전트가 직접 편집할 수 있는 브라우저 비디오 에디터로, Claude 같은 AI가 프롬프트 하나로 영상을 자동 컷편집하고 결과를 실시간으로 UI에 반영해준다.