
GPT-6 Sol·Luna 가격 반값이라던데, 진짜 그런가요? 2026 에이전트 비용 재설계
Free Resource
PDF · Free
AI 요금 '반값' 발표, 계산기부터 두드리세요 — 비개발자를 위한 쉬운 가이드
Get the practical guide first, before diving into the full article.
GPT-6 Sol·Luna 가격 반값이라던데, 진짜 그런가요? 2026 에이전트 비용 재설계
OpenAI가 하루 만에 GPT-6을 두 개나 더 낸 이유가 뭔가요?
결론부터 말하면, 이번 출시는 신제품 소식이 아니라 OpenAI 가격 정책과 AI 에이전트 비용 구조를 다시 짜라는 신호예요. 이 글을 쓰는 지금(2026-09-23) 기준으로, OpenAI는 하루 전인 2026-09-22 GPT-6 Sol과 GPT-6 Luna를 동시에 공개했어요. 발표 직후 개발자 커뮤니티에서 곧바로 논쟁이 붙은 지점도 같은 질문이었죠. "가격이 반값이라던데, 우리 에이전트 요금도 진짜 반으로 줄어드나요?" 당연히 나올 법한 질문이죠. 요금표만 보면 그렇게 보이니까요. 하지만 답은 "워크로드에 따라 다르다"예요. 지금부터 스펙과 가격, 벤치마크의 신뢰 범위, 그리고 실무에서 어떻게 나눠 써야 하는지 순서대로 짚어보겠습니다.
OpenAI가 하루 만에 GPT-6을 두 개나 더 낸 이유가 뭔가요?
이미지 출처: developers.openai.com
GPT-6 Sol과 Luna, 스펙과 가격은 어떻게 다른가요?
OpenAI 공식 모델 문서에 따르면 두 모델의 컨텍스트와 입출력 한도는 완전히 같고, 차이는 가격과 지식 컷오프뿐입니다.
GPT-6 Sol과 Luna, 스펙과 가격은 어떻게 다른가요?
자료: 본문 데이터 · QJC 재구성
| 항목 | GPT-6 Sol | GPT-6 Luna |
|---|---|---|
| 입력 | $2.00 / 1M 토큰 | $0.10 / 1M 토큰 |
| 출력 | $10.00 / 1M 토큰 | $0.50 / 1M 토큰 |
| 캐시된 입력 | $0.20 / 1M 토큰 | $0.01 / 1M 토큰 |
| 캐시 쓰기 | $2.50 / 1M 토큰 | $0.125 / 1M 토큰 |
| 컨텍스트 윈도우 | 1,050,000 토큰 | 1,050,000 토큰 |
| 최대 출력 | 128,000 토큰 | 128,000 토큰 |
| 지식 컷오프 | 2026-04-20 | 2026-05-18 |
프롬프트 캐싱: 같은 시스템 프롬프트나 코드베이스를 반복해서 보낼 때, 이전에 처리한 부분을 다시 계산하지 않고 저장된 결과를 재사용해 비용을 낮추는 방식을 말합니다.
직전 세대인 GPT-5.6 Sol($4/$20), GPT-5.6 Luna($0.20/$1.20)와 비교하면 토큰 단가는 정확히 절반입니다. OpenAI는 이 가격이 한시적 프로모션이 아니라 기본가라고 밝혔어요.
"가격 반값"이 곧 "비용 반값"은 아닙니다
여기가 이번 발표에서 가장 자주 오해되는 지점이에요. 가격표의 숫자와 실제 청구서의 숫자는 다를 수 있어요.
"가격 반값"이 곧 "비용 반값"은 아닙니다
자료: 본문 데이터 · QJC 재구성
reasoning effort(추론 강도): 답을 내기 전에 모델이 얼마나 깊이 생각할지 정하는 단계입니다. none·low·medium·high·xhigh·max 6단계이고 기본값은 medium이에요.
긴 에이전트 대화에서는 비용의 대부분이 새로 처리하는 입력 토큰이 아니라 캐시된 입력 토큰에서 나와요. 독립 개발자 Simon Willison은 2026-09-22 자신의 블로그에서 이렇게 적었어요. "긴 에이전트 대화에서는 입력 토큰의 90% 이상이 캐시 단가로 처리된다." 이 문장이 아래 논쟁의 판정 기준이 되죠.
Sol의 캐시된 입력 단가는 $0.20/M인데, 이 값은 같은 날 발표된 Claude Opus 5.5의 캐시 읽기 단가와 동일합니다. 다만 여기서 기준선을 갈라야 해요. GPT-5.6 Sol의 캐시 읽기는 $0.40/M이었으니, 직전 세대에서 옮기는 경우라면 캐시 비중과 상관없이 절감은 정확히 50%입니다. 체감폭이 줄어드는 건 Claude Opus 5.5에서 갈아탈 때예요. Hacker News의 GPT-6 발표 스레드(1,226포인트·626댓글)에서 사용자 Readerium은 이 점을 정확히 짚었습니다. "캐시 읽기는 $0.20/M으로 같다. 비용의 절반이 캐시 읽기라면 50%가 아니라 25% 인하에 가깝다." 이에 대해 다른 사용자 pinkgolem은 "유스케이스마다 다르다, 내 경우 보통 비용의 절반이 캐시 읽기"라고 재반박했고, 스레드는 결론 없이 마무리됐습니다. 결론이 안 났다는 사실 자체가 실무 힌트예요. 자기 워크로드의 캐시 적중률을 먼저 재보지 않고는 답이 나오지 않는다는 뜻이니까요.
272K 토큰 경계를 넘으면 무슨 일이 벌어지나요?
컨텍스트 윈도우가 1,050,000토큰이라고 해서 다 채워 넣어도 안전한 건 아닙니다. OpenAI 공식 가격 문서에 따르면 입력이 272,000토큰을 넘는 순간, 초과분만이 아니라 그 요청 전체에 입력·캐시 2배, 출력 1.5배 요금이 붙습니다. Sol 기준으로 캐시 읽기 단가가 $0.20에서 $0.40으로 뛰는 셈이죠. 코드베이스를 통째로 밀어 넣는 패턴을 쓰고 있다면, 요청을 272K 아래로 나눠 보내는 설계 하나만으로 비용이 절반 가까이 줄어들 수 있습니다.
272K 토큰 경계를 넘으면 무슨 일이 벌어지나요?
자료: developers.openai.com · QJC 재구성
다행히 캐싱 쪽 제약은 하나 풀렸어요. reasoning effort를 바꾸거나 툴을 켜고 끄는 것만으로 예전엔 캐시가 깨졌는데, GPT-6부터는 이런 변경에도 앞선 컨텍스트의 캐시가 유지됩니다. 쉬운 후속 질문에서 effort를 낮추는 전략을 이제 캐시 손실 걱정 없이 쓸 수 있어요.
벤치마크는 얼마나 믿을 수 있나요?
믿을 만한 참고 자료이긴 하지만, 그대로 벤더 전환 근거로 쓰기엔 일러요. 아래 수치는 전부 OpenAI 자체 발표문에 실린 값이고, 제3자가 같은 조건에서 재현한 결과가 아닙니다.
| 벤치마크 | GPT-6 Sol | GPT-6 Luna | 비교 |
|---|---|---|---|
| AutomationBench (업무 자동화) | 33.2% (xhigh) | 14.5% (high) | 2배 이상 격차 |
| DeepSWE (코드 수정) | 68.8% (max) | 66.6% (max) | 2.2%p 차이 |
AutomationBench에서는 Sol이 Luna보다 2배 넘게 높은 점수를 기록했지만, 실제 코드베이스 수정 과제인 DeepSWE에서는 두 모델 차이가 2.2%p에 그쳤습니다. 여러 API와 툴을 넘나들며 상태를 유지해야 하는 작업일수록 격차가 벌어지고, 단발성 코드 수정에서는 격차가 좁아진다는 뜻이에요.
한 가지 더 정정할 부분이 있어요. 팩추얼리티 평가에서 OpenAI는 Sol이 "Astra 수준 신뢰도에 근접(approaching)했다"고 표현했는데, 일부 매체가 이를 "도달(reaching)"로 옮겼습니다. 공식 문구는 근접이지 도달이 아닙니다. 그리고 OpenAI가 제시한 모든 비교 대상은 Claude Opus 5.5가 아니라 구형 Opus 5입니다. Opus 5.5는 OpenAI의 어떤 차트에도 등장하지 않고, 2026-09-23 기준으로 두 최신 모델을 같은 조건에서 돌린 직접 비교 데이터는 아직 없습니다.
프롬프트 인젝션 관련해서는 TechCrunch가 흥미로운 수치를 보도했어요. 비인가 지시가 심어진 모의 게시판 실험에서, Sol이 그 지시대로 행동한 비율이 51.9%에서 11.3%로 낮아졌다는 내용입니다.
Sol과 Luna를 어떻게 나눠 쓰나요?
"어려운 일은 Sol, 쉬운 일은 Luna"로 기준을 잡으면 실제로는 자주 틀려요. 벤치마크가 가리키는 진짜 갈림길은 난이도가 아니라 자율 단계 수예요.
Sol과 Luna를 어떻게 나눠 쓰나요?
이미지 출처: developers.openai.com
| 작업 성격 | 권장 모델 |
|---|---|
| 여러 API·툴을 넘나들며 상태를 유지하는 업무 자동화 | Sol |
| 실제 코드베이스의 단발성 수정·구현 | Luna 우선 검토 |
| 문서 요약·정보 추출·분류·태깅 | Luna |
| 장기 에이전틱 코딩, 다단계 검증이 필요한 작업 | Sol |
effort 설정은 별도 축이라 기본값 medium에서 시작하는 편이 안전해요. OpenAI 공식 발표문에 따르면 Luna는 Agents' Last Exam 평가에서 medium(46.8%)이 high(43.6%)보다 높은 점수를 냈고, Sol도 같은 유형의 평가에서 medium이 high보다 나은 구간이 있었습니다. effort를 올린다고 점수가 항상 좋아지는 건 아니라는 뜻이에요. 인접 단계 간 1~2%p 차이는 실행 간 변동일 가능성이 높으니, 최고 단계를 곧바로 고르기보다 자기 태스크로 두세 단계만 실측해보는 편이 비용과 품질 양쪽에서 나아요.
툴을 쓰는 에이전트라면 Responses API를 써야 해요. Chat Completions 엔드포인트에서는 reasoning_effort가 none일 때만 function calling이 동작하기 때문에, 추론과 툴 호출을 함께 쓰려는 에이전트에는 다른 선택지가 없습니다.
Astra를 계속 써야 하는 경우도 있나요?
있어요. OpenAI는 "Astra가 전 영역에서 여전히 최고 모델이며, 최상의 결과와 타협 없는 경험을 원할 때 선택하라"고 명시했고, 컴퓨터 사용 영역에서는 Astra가 최고라고 따로 못 박았습니다.
다만 실무에서 더 눈여겨볼 지점은 이거예요. AutomationBench에서 Sol의 xhigh 점수(33.2%)가 Astra의 low 점수(30.3%)보다 높았는데, 그 Astra low는 Sol보다 3.9배 비쌌습니다. 비용 때문에 Astra를 낮은 effort로 눌러 쓰고 있었다면, 그 자리는 Sol을 높은 effort로 쓰는 쪽이 점수와 비용 모두에서 유리해요. Astra를 유지할 이유는 결국 세 가지로 좁혀져요. effort를 충분히 줄 수 있는 소수의 고난도 작업, 컴퓨터 사용이 핵심인 워크플로, 그리고 비용보다 팩추얼리티가 최우선인 경우입니다.
도입 전에 확인할 것
- 2026-09-23 기준 GPT-6 Sol과 Luna는 일반 ChatGPT Chat에서 쓸 수 없습니다. ChatGPT Work와 Codex, API에서만 제공됩니다.
- Azure AI Foundry·AWS Bedrock 제공 여부는 Hacker News 사용자 보고로만 확인됐어요. 해당 클라우드를 쓴다면 벤더 공식 공지를 따로 확인해야 합니다.
- GPT-5.6 계열에는 2026년 11월 25% 가격 인상이 예정돼 있습니다. 5.6에 계속 머물 계획이었다면 이 일정을 비용 계획에 반영해야 해요.
- Batch·Flex 모드는 Standard 대비 50% 저렴합니다. 실시간성이 필요 없는 야간 배치 작업은 이 구간으로 옮기면 비용이 사실상 의사결정 변수에서 빠져요.
마무리
가격표만 보고 벤더를 바꾸는 결정은 아직 일러요. 지금 필요한 건 자기 팀 워크로드의 캐시 적중률을 재는 작업 하나예요. 지금 Claude Opus 5.5를 쓰고 있다면 그 숫자가 절감폭을 좌우합니다. GPT-5.6을 쓰고 있다면 어느 쪽이든 절반입니다. 우리 팀 상황에 맞는지부터 따져보셔도 충분합니다. 판단에 필요한 기준은 위에 정리해 뒀습니다.
자주 묻는 질문
GPT-6 Sol과 Luna, 지금 바로 써볼 수 있나요?
2026-09-23 기준으로는 아직 일반 ChatGPT Chat에서 쓸 수 없습니다. ChatGPT Work와 Codex, API에서 Plus·Pro·Business·Enterprise·Edu 사용자에게 제공되고, Free·Go 사용자는 데스크톱 앱에서 Luna만 쓸 수 있어요. OpenAI는 서비스 안정성을 위해 하루에 걸쳐 점진적으로 배포한다고 밝혔습니다.
캐시를 많이 쓰면 이번 가격 인하 효과가 줄어드나요?
지금 무엇을 쓰고 있느냐에 따라 다릅니다. GPT-5.6 Sol에서 옮기는 경우라면 줄어들지 않아요. 캐시 읽기 단가도 $0.40/M에서 $0.20/M으로 함께 절반이 됐기 때문에, 캐시 비중과 무관하게 입력·캐시·출력이 모두 절반입니다. 반면 Claude Opus 5.5에서 갈아타는 경우는 다릅니다. Opus 5.5의 캐시 읽기도 $0.20/M이라 Sol과 같아서, 비용에서 캐시 읽기 비중이 클수록 절감폭이 50%가 아니라 25~35% 수준으로 줄어듭니다.
GPT-6 Astra를 계속 써야 하는 경우도 있나요?
있어요. OpenAI는 Astra가 전 영역에서 여전히 최고 모델이라고 밝혔고, 특히 컴퓨터 사용 작업에서는 Astra가 앞선다고 못 박았습니다. effort를 충분히 줄 수 있는 고난도 작업이나 팩추얼리티가 최우선인 경우가 아니라면, 비용 절감 목적으로 Astra를 낮은 effort로 눌러 쓰던 자리는 Sol로 옮기는 편이 점수와 비용 모두에서 유리합니다.

