Claude Sonnet 4, 1M token context window 지원 시작
Claude Sonnet 4 now supports 1M tokens of context
TL;DR Highlight
Claude Sonnet 4는 컨텍스트 윈도우를 200K에서 1M 토큰으로 5배 확장하면서 200K 초과 입력 토큰 가격을 처음으로 2배 인상했다.
Who Should Read
Claude API로 대규모 코드베이스 분석이나 멀티스텝 에이전트를 만드는 개발자, 또는 Claude Code를 쓰면서 컨텍스트 관리에 고민이 많은 개발자.
Core Mechanics
- Claude Sonnet 4의 컨텍스트 윈도우가 200K에서 1M 토큰으로 5배 늘어났다. 코드 기준으로 약 75,000줄 이상을 한 번에 넣을 수 있는 수준이다.
- 200K 토큰까지는 기존 가격($3/MTok 입력, $15/MTok 출력)이 유지되지만, 200K를 넘으면 입력 $6/MTok, 출력 $22.50/MTok으로 올라간다. LLM 업계에서 토큰 수에 따라 비선형 가격을 매긴 첫 사례다.
- Anthropic API에서 public beta로 제공되며, Amazon Bedrock과 Google Cloud Vertex AI에서도 사용 가능하다. Tier 4 이상 고객부터 이용할 수 있다.
- 주요 활용 시나리오로 대규모 코드 분석(전체 코드베이스 + 테스트 + 문서를 한번에 로딩), 문서 합성(수백 건의 법률/연구 문서 교차 분석), 컨텍스트 인지 에이전트(수백 번의 tool call에도 맥락을 잃지 않는 에이전트) 세 가지를 제시했다.
- Prompt caching을 함께 쓰면 비용과 지연 시간을 줄일 수 있고, batch processing을 쓰면 추가로 50% 비용을 절감할 수 있다.
- Bolt.new CEO는 실제 프로덕션에서 Sonnet 4가 다른 모델보다 코드 생성 성능이 좋았고, 1M 컨텍스트 덕분에 훨씬 큰 프로젝트를 다룰 수 있게 됐다고 밝혔다.
- iGent AI는 자사 에이전트 Maestro에 1M 컨텍스트를 적용해 며칠 단위의 실제 코드베이스 작업 세션을 가능하게 했다고 말했다.
Evidence
- 컨텍스트가 늘어나면 LLM이 '산만해져서' 오히려 출력 품질이 떨어진다는 우려가 많았다. 코드베이스를 통째로 넣으면 좋겠지만, 실제로 긴 컨텍스트에서 모델이 얼마나 정확하게 따라가는지에 대한 eval이 없으면 비용 대비 가치를 판단하기 어렵다는 의견이 지배적이었다.
- Anthropic의 컨텍스트 윈도우 크기 주장에 회의적인 경험담이 나왔다. 이전에 200K라고 했지만 실제로는 32K도 안 돼서 앞부분을 잊어버렸다는 제보가 있었고, Gemini의 1M 컨텍스트가 recall 면에서 더 낫다는 비교 의견도 있었다.
- Claude Code 사용 팁이 공유됐다. 컨텍스트를 충분히 채운 뒤 작업하고, 논리적 중단점마다 double escape로 체크포인트에 되감으면 토큰을 절약할 수 있다. /resume으로 같은 스레드를 여러 채팅에서 이어갈 수도 있다.
- 200K 초과 시 가격이 2배가 되는 구조에 대해, LLM 추론 비용이 토큰 수에 따라 이차함수적으로 증가한다는 것을 가격에 처음으로 반영한 것이라는 분석이 있었다. one-shot으로 답을 못 얻으면 비용이 급격히 늘어난다는 걱정도 나왔다.
- 실용적 활용법으로 'Are there any bugs in the current diff?'라고 물어보는 것만으로도 매우 세밀한 버그를 잡아내서 디버깅 시간을 크게 줄였다는 경험담이 인기를 끌었다.
How to Apply
- 대규모 코드베이스를 다루는 에이전트를 만들 때, 전체 소스를 컨텍스트에 넣되 prompt caching을 반드시 함께 적용해서 반복 호출 비용을 줄여라. 200K 이하로 유지할 수 있다면 가격이 절반이므로 컨텍스트 프루닝 전략을 먼저 검토하는 게 낫다.
- Claude Code에서 작업할 때 컨텍스트를 충분히 채운 후 double escape로 체크포인트를 만들어두고, 각 작업 단위마다 되감기하면 토큰 소비를 대폭 줄일 수 있다.
- 코드 리뷰 자동화에 1M 컨텍스트를 활용할 수 있다. diff뿐 아니라 관련 파일 전체를 함께 넣어서 cross-file dependency 버그를 잡아내는 파이프라인을 구성하면 효과적이다.
- 비용이 민감한 경우 batch processing(추가 50% 할인)과 200K 이하 컨텍스트 유지를 조합하면 1M 풀로딩 대비 약 75% 비용을 절감할 수 있다.
Terminology
관련 논문
Claude Code는 프롬프트 읽기 전에 33k 토큰을 전송한다; OpenCode는 7k
동일한 모델과 작업 환경에서 Claude Code와 OpenCode의 실제 토큰 사용량을 API 레벨에서 측정한 결과, Claude Code가 시스템 프롬프트 오버헤드만으로 OpenCode 대비 4.7배 더 많은 토큰을 소비한다는 것을 확인했다.
Mesh LLM: iroh 기반 분산 AI 컴퓨팅
사무실, 집, 클라우드에 흩어진 GPU들을 하나의 OpenAI 호환 API로 묶어주는 분산 LLM 실행 시스템으로, 비싼 API 비용 없이 큰 모델을 직접 운영할 수 있다.
Frugon – LLM API 호출 로그를 분석해서 더 싼 모델로 대체 가능한 구간을 찾아주는 로컬 도구
내 LLM API 비용이 어디서 새는지 로컬에서 분석해주는 오픈소스 CLI 도구로, 비싼 모델 대신 저렴한 모델로 전환 가능한 호출을 골라낸다.
로컬에서 SOTA LLM 실행하기 완전 가이드 (하드웨어부터 설정까지)
2천 달러짜리 RTX 3090 한 장부터 4만 달러짜리 RTX PRO 6000 4장 셋업까지, 로컬에서 최신 LLM을 직접 돌리는 방법을 하드웨어 선택·구성·실행 설정까지 통째로 정리한 실전 가이드다.
Manticore Search에서 ONNX 경로를 재설계해 임베딩 속도를 14배 높인 방법
Manticore Search가 기존 SentenceTransformers/Candle 백엔드를 ONNX Runtime으로 교체해 텍스트 임베딩 생성 속도를 평균 14배 향상시켰다. 별도 모델 서비스 없이 DB 내부에서 직접 임베딩을 처리하는 구조에서 INSERT 속도가 곧 임베딩 속도이기 때문에 이 개선은 실질적인 ingest 처리량 향상으로 직결된다.
Asymmetric Quantization: 97% 스토리지 절감으로 Late Interaction 검색 품질 유지하기
멀티벡터 검색 모델의 문서 벡터를 1비트 이진값으로 압축하고 쿼리 벡터만 int8로 유지하는 비대칭 양자화 기법으로, 스토리지를 97% 줄이면서 검색 품질 손실을 0.61점(NDCG@10 기준)에 그치게 만든 실제 프로덕션 적용 사례다.