
Claude Haiku 5.5 갈아타야 하나요? 10만 토큰 넘으면 5배, 4.5 은퇴 하한 2026-10-15
무료 자료
PDF · 무료
같은 AI, 월 $300이 $15로 줄어드는 이유: 비개발자를 위한 쉬운 가이드
긴 글을 다 읽기 전에, 실무 가이드부터 먼저 챙겨가세요.
Claude Haiku 5.5 갈아타야 하나요? 10만 토큰 넘으면 5배, 4.5 은퇴 하한 2026-10-15
Haiku 5.5로 갈아타야 하나요, 지금 모델 조합을 그대로 둬도 되나요?
Claude Haiku 5.5가 2026-10-07에 출시됐어요. 같은 날 Sonnet 5.5의 캐시 읽기 단가도 직전 단가 대비 50% 내려갔고요. 먼저 결론부터 말할게요. 두 소식 모두 월 비용을 줄여 주는 건 맞아요. 줄어드는 폭은 프롬프트 길이와 캐시 재사용 횟수에 따라 크게 달라져요.
"우리 모델 조합과 월 비용을 바꿔야 하나요?" 이 질문이 제일 먼저 떠오르는 게 자연스러워요. "싸졌다는데 그냥 다 Haiku로 바꾸면 안 되나요?"도 마찬가지고요. 가격표에서 90% 인하 같은 숫자만 보고 바꾸면 청구서가 기대와 다르게 나올 수 있거든요. 그 숫자가 어느 조건에서만 맞는지 먼저 봐야 해요.
이 글은 Anthropic 공식 문서의 가격표를 직접 다시 계산한 결과를 순서대로 풀어요. 가격표, 캐시 인하가 청구서에 주는 효과, 바꿔도 되는 작업, 10만 토큰 경계, 2026-10-15 전에 할 일 순이에요.
Haiku 5.5 가격은 Haiku 4.5와 얼마나 다른가요?
Anthropic 공식 모델 문서에 따르면 Claude Haiku 5.5의 API 모델 ID는 claude-haiku-5-5예요. 컨텍스트는 1M 토큰, 최대 출력은 128K 토큰으로 Haiku 4.5의 200K와 64K보다 커졌어요. Haiku 계열에서 처음으로 effort 설정도 생겼고 기본값은 medium이에요.
Haiku 5.5 가격은 Haiku 4.5와 얼마나 다른가요?
차트의 90%는 10만 토큰 이하 구간에만 해당해요. 10만 토큰을 넘으면 같은 항목이 50% 인하로 바뀌어요. 자료: 본문 데이터 · QJC 재구성
Claude API 가격은 100만 토큰(MTok) 단위로 표기해요. 아래 표는 직전 세대인 Haiku 4.5를 기준선으로 잡은 비교예요. 인하율은 제가 직접 나눗셈으로 확인했어요.
| 항목 ($/MTok) | Haiku 4.5 | Haiku 5.5 (10만 토큰 이하) | 인하율 | Haiku 5.5 (10만 토큰 초과) | 인하율 |
|---|---|---|---|---|---|
| 입력 | 1.00 | 0.10 | 90% | 0.50 | 50% |
| 출력 | 5.00 | 0.50 | 90% | 2.50 | 50% |
| 캐시 읽기 | 0.10 | 0.01 | 90% | 0.05 | 50% |
| 캐시 쓰기 (5분) | 1.25 | 0.125 | 90% | 0.625 | 50% |
Haiku 4.5 대비 10만 토큰 이하는 전 항목 90%, 초과는 전 항목 50% 인하예요. 출시 공지는 "평균 약 75% 저렴"이라고 적었어요. 요청의 90%가 10만 토큰 이하라는 전제에 새 토크나이저의 토큰 증가를 반영한 Anthropic의 추정치예요. 공개된 숫자로 다시 계산하면 토큰당 86% 인하이고 토큰 30% 증가를 얹으면 약 82%라서 75%가 그대로 재현되지는 않아요. 틀렸다기보다 더 보수적으로 잡은 값으로 읽혀요. 그래서 이 글은 계산으로 확인된 "10만 토큰 이하 90% 인하"를 기준으로 삼아요.
체감 비용에는 토크나이저도 영향을 줘요. Haiku 5.5 스펙 페이지에 따르면 같은 글이 Haiku 4.5보다 약 30% 더 많은 토큰으로 계산돼요. 단가가 90% 내려가도 같은 업무의 실효 비용은 그만큼 덜 내려가요.
모델별 월 비용은 얼마나 차이 나나요?
계산 가정은 이래요. 월 입력 100만 토큰, 월 출력 10만 토큰(추론 토큰 포함), 프롬프트 캐싱과 Batch API 미사용이에요. Haiku 5.5는 모든 프롬프트가 10만 토큰 이하라고 봤어요.
| 모델 | 월 비용 | Haiku 5.5(10만 토큰 이하) 대비 |
|---|---|---|
| Haiku 5.5 (10만 토큰 이하) | $0.150 | 1.0배 |
| Haiku 5.5 (10만 토큰 초과) | $0.750 | 5.0배 |
| Haiku 4.5 | $1.500 | 10.0배 |
| Sonnet 5.5 | $3.000 | 20.0배 |
| Opus 5.5 | $6.000 | 40.0배 |
Haiku 4.5와 비교할 때는 토큰 보정이 필요해요. 같은 업무량이면 Haiku 5.5는 $0.150에 1.30을 곱한 $0.195가 돼서 Haiku 4.5의 $1.500보다 약 87% 낮아요. Sonnet 5.5와 Opus 5.5는 Haiku 5.5와 같은 토크나이저라 20배, 40배 차이를 그대로 읽어도 돼요. 금액이 작아 보여도 배수는 사용량이 커져도 그대로예요.
이 표는 토큰당 비용이고 작업당 비용이 아니에요. 그 차이는 뒤에서 따로 다뤄요.
Sonnet 5.5 캐시 읽기 50% 인하는 내 청구서를 얼마나 줄여 주나요?
Anthropic이 2026-10-07 공개한 출시 공지에는 이렇게 적혀 있어요. "Cache reads now cost 50% less: $0.10 per million tokens rather than $0.20." Sonnet 5.5의 직전 단가 $0.20이 $0.10이 됐으니 정확히 50%예요. 경쟁사나 다른 세대와 비교한 숫자가 아니라 Sonnet 5.5 자기 자신의 직전 단가가 기준선이에요.
Sonnet 5.5 캐시 읽기 50% 인하는 내 청구서를 얼마나 줄여 주나요?
자료: 본문 데이터 · QJC 재구성
구조는 배수 변경이에요. Anthropic 프롬프트 캐싱 문서의 각주는 이렇게 설명해요. "Cache hits and refreshes on Claude Opus 5.5 and Claude Sonnet 5.5 are priced at 0.05x the base input price. All other models use the standard 0.1x multiplier" Sonnet 5.5 기본 입력가가 $2라서 0.1배였던 $0.20이 0.05배인 $0.10이 됐어요. 캐시 쓰기는 안 바뀌었어요. 5분 TTL은 $2.50, 1시간 TTL은 $4.00 그대로예요.
Sonnet 5.5 캐시 읽기 인하란?: Sonnet 5.5가 캐시에 저장된 프롬프트를 다시 읽을 때 내는 단가가 100만 토큰당 $0.20에서 $0.10으로 내려간 변경이에요. 기본 입력가 $2의 0.1배가 0.05배가 된 것이고 캐시에 처음 쓰는 단가는 그대로예요.
캐싱을 쓰는 에이전트는 월 얼마가 줄어드나요?
시스템 프롬프트 5만 토큰짜리 Sonnet 5.5 에이전트를 하루 100번, 30일 동안 호출한다고 가정해 볼게요. 전부 캐시 히트로 보고 캐시 쓰기 비용은 뺐어요.
| 경우 | 월 비용 (30일) |
|---|---|
| 캐싱 없이 매번 입력 처리 | $300 |
| 캐시 읽기 인하 전 ($0.20) | $30 |
| 캐시 읽기 인하 후 ($0.10) | $15 |
캐싱을 켜는 것만으로 월 $300이 $30으로 내려가고, 이번 인하가 그 $30을 다시 $15로 줄여요. 절감의 큰 쪽은 인하가 아니라 캐싱이에요. 아직 프롬프트 캐싱을 안 쓴다면 가격 인하보다 캐싱 도입이 먼저예요.
같은 컨텍스트를 한 번 쓰고 N번 읽을 때는 어떨까요? 기본 입력가를 1로 둔 상대 비용으로 계산했어요.
| 읽기 횟수 N | 인하 전 | 인하 후 | 인하가 준 추가 절감 |
|---|---|---|---|
| 1 | 1.35 | 1.30 | 3.7% |
| 10 | 2.25 | 1.75 | 22.2% |
| 100 | 11.25 | 6.25 | 44.4% |
| 1,000 | 101.25 | 51.25 | 49.4% |
읽기가 늘수록 추가 절감이 50%에 가까워져요. 혜택은 같은 컨텍스트를 아주 많이 재사용하는 쪽에 몰려요. 장시간 단일 에이전트 세션, 코드베이스를 통째로 컨텍스트에 물린 반복 질의, 같은 시스템 프롬프트로 도는 대량 분류 루프가 그런 경우예요. 호출마다 컨텍스트가 바뀌는 작업은 거의 혜택이 없어요.
공식 "에이전틱 20% 저렴"은 내 워크로드에도 맞을까요?
공지에는 이런 문장도 있어요. "this reduces the cost of Sonnet 5.5 on most agentic tasks by around 20%" 어떤 항목을 절반으로 깎아 총액이 20% 줄려면 그 항목이 총액의 40%여야 해요(0.5 × 0.4 = 0.2). Anthropic이 일반적인 에이전트 워크로드에서는 캐시 읽기가 Sonnet 5.5 청구액의 약 40%라고 본다는 뜻이죠. 내 청구서에서 캐시 읽기 비중이 40%보다 낮으면 체감은 20%보다 작아요.
Haiku 5.5의 캐시는 사정이 달라요. 읽기 배수가 0.1배라서 절대 금액은 $0.01로 가장 싸요. 캐싱으로 얻는 상대 절감률은 0.05배인 Sonnet 5.5보다 낮아요.
Haiku 5.5로 바꿔도 되는 작업과 안 되는 작업은 뭔가요?
Anthropic 출시 공지는 Haiku 5.5의 자리를 컴팩션, 요약, 서브에이전트처럼 범위가 좁게 정의된 과제로 잡아요. 공식 예시는 분류, 추출, 라우팅, DB 질의, 고객 지원, 브라우저 사용이에요. 복잡한 에이전틱 코딩은 Sonnet 5.5와 Opus 5.5가 여전히 더 낫다고 공지가 직접 밝혔어요. 공식 표에서 Terminal-Bench 4.0 점수는 Haiku 5.5가 39.2%, Sonnet 5.5가 70.6%예요.
직전 세대 Haiku 4.5와 비교하면 얼마나 좋아졌나요?
세대 비교는 얘기가 달라요. 같은 공지의 OSWorld 2.1 점수는 Haiku 4.5가 15.7%, Haiku 5.5가 72.4%예요. Haiku 4.5로 컴퓨터 사용 작업을 시도하다 접었던 팀이라면 다시 볼 만한 폭이에요.
경쟁 모델 GPT-6 Luna와 비교하면 과제당 비용은 어떤가요?
여기서부터는 경쟁 모델 기준이라 위의 세대 비교와 따로 읽어야 해요. 제3자 평가기관 Artificial Analysis의 비교 페이지에 따르면 max effort 기준으로 지능 지수는 Haiku 5.5가 43, GPT-6 Luna가 38이고 출력 속도는 240 대 126 토큰/초예요. 과제당 비용은 Luna가 더 싸요. xhigh effort 기준으로 Haiku 5.5가 $0.12, Luna가 $0.04이고 과제당 출력 토큰은 89K 대 27K예요. 10만 토큰 이하에서 두 모델의 입출력 요율은 같으니 원인은 단가가 아니라 토큰 소모량이에요. 과제당 출력·추론 토큰 수치는 검색 요약을 거쳐 확인한 값이라 신뢰도를 한 단계 낮춰 보세요.
Hacker News 스레드(1030 points, 2026-10-07)의 사용자 simonw도 비슷한 걸 확인했어요. 자체 테스트에서 max effort는 3.3826센트에 5분 9초, low effort는 0.0936센트에 7초가 걸려 비용 차이가 약 36배였다고 해요. "토큰당 싸진 것"이 "작업당 싸진 것"과 같지 않다는 증거예요.
같은 스레드에는 부정적인 보고도 1건 있었어요. 지연에 민감한 운영 작업에서 Haiku 4.5를 쓰던 사용자가 Haiku 5.5의 결과가 나쁘고 오히려 느려졌다고 썼어요. 조건이 공개되지 않은 단일 보고라 일반화할 수는 없어요. 교체 전에 내 워크로드로 A/B를 돌려야 하는 이유로는 충분해요. Reddit과 X 반응은 본문을 확보하지 못해 이 글에 반영하지 않았어요.
API를 옮길 때 하나 더 있어요. temperature, top_p, top_k에 기본값이 아닌 값을 넣으면 400 에러가 나요. Haiku 4.5용 코드를 그대로 옮기면 여기서 깨질 수 있어요.
프롬프트가 10만 토큰을 넘으면 Haiku 5.5 요금이 얼마나 뛰나요?
Haiku 5.5의 가장 큰 함정은 10만 토큰 경계예요. Anthropic 가격 문서에 따르면 프롬프트가 10만 토큰을 넘는 순간 입력은 $0.10에서 $0.50으로, 출력은 $0.50에서 $2.50으로, 캐시 읽기는 $0.01에서 $0.05로 전 항목이 5배가 돼요. 이 2단 구조는 Haiku 5.5에만 있고 Sonnet 5.5와 Opus 5.5에는 없어요.
앞의 월 비용 가정(입력 100만, 출력 10만 토큰)으로 보면 $0.150이 $0.750이 돼요. 그래도 Sonnet 5.5의 $3.000보다는 4분의 1 수준이라 여전히 싸요. 문제는 Haiku 4.5 대비 인하율이 90%에서 50%로 줄고 토큰 30% 증가까지 겹치면 체감이 더 작아진다는 점이에요.
Hacker News 스레드(480 comments)에서 가장 많이 반복된 불만도 이 지점이었어요. 사용자 minimaxir는 이렇게 썼어요. "100k tokens is an absurdly low cutoff and it is only applicable to Haiku and not Sonnet or Opus." 자기 에이전트 작업이 전부 10만 토큰을 넘어서 청구서가 표보다 5배 나올 거라는 댓글도 있었어요.
컨텍스트 윈도우가 1M이라고 1M을 다 쓰는 게 경제적인 건 아니에요. 코드베이스나 긴 대화 이력을 물리는 에이전트는 이 선을 쉽게 넘어요. 호출 로그에서 프롬프트 길이 분포부터 확인하세요. 초과 비율이 높다면 같은 작업을 Sonnet 5.5로 돌렸을 때의 과제당 비용과 나란히 재 보세요.
Haiku 4.5 은퇴 하한 2026-10-15 전에 무엇부터 해야 하나요?
Anthropic 모델 문서에 따르면 Haiku 4.5의 은퇴 하한은 2026-10-15예요. 2026-10-09 기준으로 6일 남았어요. 하한은 은퇴일이 아니라 그날 이후 언제든 은퇴가 공지될 수 있다는 뜻이에요. 날짜가 확정된 건 아니어도 교체 계획은 지금 세워 두는 게 안전해요. Haiku 5.5의 은퇴 하한은 2027-10-07이에요.
- 캐싱부터 확인해요. 긴 시스템 프롬프트를 반복 호출하는데 캐시를 안 쓰고 있다면 앞의 계산대로 월 $300이 $30 수준으로 내려와요. 모델 교체보다 이게 먼저예요.
- effort별 과제당 비용을 재요. 기본값은 medium이에요. 같은 과제 묶음을 effort만 바꿔 돌려서 토큰 소모와 시간을 비교하세요.
- 10만 토큰 초과 비율을 세요. 호출 로그에서 프롬프트가 10만 토큰을 넘는 비율이 곧 5배 요금이 적용될 비율이에요.
- 같은 샘플로 Haiku 4.5와 5.5를 A/B로 돌려요. 모델 ID는
claude-haiku-5-5이고temperature,top_p,top_k는 빼야 해요.
클라우드 경유라면 비용 조건도 하나 봐야 해요. Anthropic 가격 문서에 따르면 Bedrock과 Google Cloud의 리전 엔드포인트는 global 엔드포인트보다 10% 비싸고, inference_geo: "us"를 지정하면 1.1배가 적용돼요. 데이터가 특정 지역을 거쳐야 하는 요건이 없다면 global이 저렴해요.
우리 팀 상황별로는 어떻게 판단하나요?
| 지금 상황 | 먼저 할 일 | 근거 수치 |
|---|---|---|
| 긴 시스템 프롬프트를 반복 호출하는데 캐싱 미사용 | 프롬프트 캐싱 도입 | 월 $300이 $30으로 (Sonnet 5.5, 5만 토큰 × 하루 100회 가정) |
| Sonnet 5.5로 같은 컨텍스트를 자주 재사용 | 청구서에서 캐시 읽기 비중 확인 | 읽기 100회 기준, 인하 전 캐시 비용 총액 대비 추가 절감 44.4% |
| 요약·분류·추출·서브에이전트, 프롬프트 10만 이하 | Haiku 5.5 A/B | 월 $0.150 대 Sonnet 5.5 $3.000 (같은 가정) |
| 복잡한 에이전틱 코딩 | Sonnet 5.5 또는 Opus 5.5 유지 | Terminal-Bench 4.0 39.2% 대 70.6% |
| 프롬프트 대부분이 10만 토큰 초과 | Haiku 5.5 이점 재계산 | 전 항목 5배 |
| Haiku 4.5 사용 중 | 교체 계획 수립 | 은퇴 하한 2026-10-15 |
마무리
Claude Haiku 5.5는 10만 토큰 이하의 좁은 작업에서 Haiku 4.5 대비 토큰당 90% 싸고, Sonnet 5.5 캐시 읽기는 직전 단가 대비 50% 내려갔어요. 둘 다 조건이 붙은 숫자예요. 바꿀지는 내 호출 로그의 프롬프트 길이, 캐시 재사용 횟수, effort별 과제당 비용으로 정해져요.
어디서부터 손대야 할지 막막하다면 지금 쓰는 모델 호출 로그에서 프롬프트 길이가 10만 토큰을 넘는 비율부터 세어 보세요. 그 숫자 하나가 교체 판단의 시작점이에요.
자주 묻는 질문
Claude Code에서도 Haiku 5.5를 쓸 수 있나요?
확인하지 못했어요. Anthropic 공식 모델 스펙 페이지의 플랫폼 목록에 Claude Code가 없고 Claude Code 비용 문서에도 Haiku 5.5 언급이 없어서 지원된다고 말할 근거가 없어요. 확인된 건 Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry, Claude Platform on AWS 5개 표면에서 2026-10-07 출시 당일부터 쓸 수 있다는 점이에요.
Haiku 5.5가 Haiku 4.5보다 정말 90% 싼가요?
10만 토큰 이하 구간의 토큰당 단가 기준으로는 맞아요. Anthropic 가격 문서에서 입력은 $1.00이 $0.10으로, 출력은 $5.00이 $0.50으로 내려갔어요. 같은 글이 약 30% 더 많은 토큰으로 계산되는 점을 반영하면 같은 업무의 실효 비용은 약 87% 낮아지고(월 입력 100만·출력 10만 토큰 가정), 10만 토큰을 넘는 구간의 인하율은 50%예요.
Sonnet 5.5 캐시 쓰기 단가도 같이 내려갔나요?
아니요. 이번에 바뀐 건 읽기 단가 하나예요. Anthropic 가격 문서 기준으로 5분 TTL 쓰기는 $2.50, 1시간 TTL은 $4.00으로 그대로예요. 읽기만 0.1배에서 0.05배로 내려갔으니 한 번 쓰고 여러 번 읽는 패턴일수록 이득이 커요(읽기 100회 기준, 인하 전 캐시 비용 총액 대비 추가 절감 44.4%).
참고 자료
- Introducing Claude Haiku 5.5 (Anthropic 출시 공지, 2026-10-07)
- Pricing (Claude Platform Docs)
- Models overview (Claude Platform Docs)
- Claude Haiku 5.5 모델 스펙 페이지
- Claude Haiku 4.5 (Legacy) 스펙 페이지
- Prompt caching (Claude Platform Docs)
- Artificial Analysis: Claude Haiku 5.5 vs GPT-6 Luna
- Hacker News: Claude Haiku 5.5 (1030 points, 2026-10-07)

