Claude Code 사용량 한도가 줄어든 게 아니라, 1M Context Window가 토큰을 잡아먹고 있는 거다
Your Claude Code Limits Didn't Shrink — I Think the 1M Context Window Is Eating Them Alive
TL;DR Highlight
Opus 4.6의 1M 컨텍스트 창은 context compression 문제로 Claude Code의 rate limit을 빠르게 차게 하며, 1M 모델을 비활성화하면 안정성이 개선된다.
Who Should Read
Claude Code를 일상적으로 사용하는 개발자 중 최근 rate limit 초과나 응답 불안정을 겪고 있는 사람. 특히 긴 작업 세션을 자주 돌리는 경우.
Core Mechanics
- Anthropic이 Opus 4.6에 1M 토큰 컨텍스트 창을 전체 사용자에게 롤아웃한 이후, rate limit 소진이 빨라지고 서버 불안정이 심해졌다는 보고가 급증했다.
- Claude Code에는 오래된 대화 히스토리를 요약해서 토큰을 아끼는 context compression 시스템이 있는데, 이게 1M 컨텍스트 창에 맞게 충분히 공격적으로 작동하지 않는 것으로 보인다.
- 결과적으로 각 Claude Code 세션이 실제로 필요한 것보다 훨씬 많은 토큰을 요청에 포함시키게 되고, 전체 사용자가 모여서 Anthropic 서버를 의도치 않게 과부하시키는 형태가 됐다.
- 작성자의 가설에 따르면, Anthropic은 이 과부하에 대한 임시방편으로 사용자별 사용량 한도를 낮춘 것으로 보인다 — 실제로 한도가 줄어든 게 아니라, 작업당 소모되는 토큰이 늘어난 것.
- Anthropic이 조용히 기존 non-1M 컨텍스트 모델을 다시 옵션으로 복구했고, 해당 모델로 전환하자 안정성이 눈에 띄게 개선되고 한도 소진 속도도 줄었다.
Evidence
- 작성자 직접 검증: non-1M 모델로 전환하자 rate limit 소진 속도가 줄어들었고 세션이 더 안정적이었다고 보고
- 댓글 다수 공감: 1M 윈도우 출시 이후 긴 세션에서 컨텍스트 소모가 체감상 훨씬 빨라졌다는 경험 공유 — /compact 명령이 그나마 도움된다는 팁도
- claude-lens(github.com/Astro-Han/claude-lens) 도구로 컨텍스트 % 추적한 유저: 1M 모델에서 동일 작업 대비 burn rate가 더 높음을 실측으로 확인
- 반론: Pro 플랜은 1M 한도 없는데도 동일한 rate limit 현상이 발생 — 이론이 완전히 맞지 않을 수 있다는 지적 / off-peak 시간대에 사용량 카운팅이 안 된다는 프로모션 관련 변수도 언급됨
How to Apply
- Claude Code 설정에서 모델을 1M 컨텍스트 버전이 아닌 기존 모델로 전환해보고, rate limit 소진 속도와 응답 안정성이 개선되는지 확인한다.
- 긴 세션을 사용하는 경우, 주기적으로 `/clear` 또는 `/compact`로 컨텍스트를 직접 정리해서 누적 토큰을 줄인다.
- rate limit이 자주 걸린다면 실제 한도가 줄었는지보다, 작업당 소모 토큰이 늘었는지 먼저 의심해보고 컨텍스트 크기를 모니터링한다.
Terminology
관련 논문
Claude Code는 프롬프트 읽기 전에 33k 토큰을 전송한다; OpenCode는 7k
동일한 모델과 작업 환경에서 Claude Code와 OpenCode의 실제 토큰 사용량을 API 레벨에서 측정한 결과, Claude Code가 시스템 프롬프트 오버헤드만으로 OpenCode 대비 4.7배 더 많은 토큰을 소비한다는 것을 확인했다.
Mesh LLM: iroh 기반 분산 AI 컴퓨팅
사무실, 집, 클라우드에 흩어진 GPU들을 하나의 OpenAI 호환 API로 묶어주는 분산 LLM 실행 시스템으로, 비싼 API 비용 없이 큰 모델을 직접 운영할 수 있다.
Frugon – LLM API 호출 로그를 분석해서 더 싼 모델로 대체 가능한 구간을 찾아주는 로컬 도구
내 LLM API 비용이 어디서 새는지 로컬에서 분석해주는 오픈소스 CLI 도구로, 비싼 모델 대신 저렴한 모델로 전환 가능한 호출을 골라낸다.
로컬에서 SOTA LLM 실행하기 완전 가이드 (하드웨어부터 설정까지)
2천 달러짜리 RTX 3090 한 장부터 4만 달러짜리 RTX PRO 6000 4장 셋업까지, 로컬에서 최신 LLM을 직접 돌리는 방법을 하드웨어 선택·구성·실행 설정까지 통째로 정리한 실전 가이드다.
Manticore Search에서 ONNX 경로를 재설계해 임베딩 속도를 14배 높인 방법
Manticore Search가 기존 SentenceTransformers/Candle 백엔드를 ONNX Runtime으로 교체해 텍스트 임베딩 생성 속도를 평균 14배 향상시켰다. 별도 모델 서비스 없이 DB 내부에서 직접 임베딩을 처리하는 구조에서 INSERT 속도가 곧 임베딩 속도이기 때문에 이 개선은 실질적인 ingest 처리량 향상으로 직결된다.
Asymmetric Quantization: 97% 스토리지 절감으로 Late Interaction 검색 품질 유지하기
멀티벡터 검색 모델의 문서 벡터를 1비트 이진값으로 압축하고 쿼리 벡터만 int8로 유지하는 비대칭 양자화 기법으로, 스토리지를 97% 줄이면서 검색 품질 손실을 0.61점(NDCG@10 기준)에 그치게 만든 실제 프로덕션 적용 사례다.