Skip to content
Back to Blog
GLM-5.3 오픈웨이트 모델, 보안 작업 거부당한 개발자가 몰려간 이유와 도입 기준 4가지
[REVIEW]

GLM-5.3 오픈웨이트 모델, 보안 작업 거부당한 개발자가 몰려간 이유와 도입 기준 4가지

퀀텀점프클럽 정상록퀀텀점프클럽 정상록10 min read3 views

Free Resource

PDF · Free

AI가 보안 작업을 거부하자 개발자들이 옮겨간 곳 — 비개발자를 위한 쉬운 가이드

Get the practical guide first, before diving into the full article.

GLM-5.3 오픈웨이트 모델, 보안 작업 거부당한 개발자가 몰려간 이유와 도입 기준 4가지

GLM-5.3은 벤치마크 3개 지표에서 1위를 기록했지만, 가중치와 API 단가가 아직 공개되지 않아 실제로 쓸 수 있는 방법은 구독형 코딩 플랜뿐입니다.

결론부터 말하면, GLM-5.3은 오늘 당장 써보는 모델이 아니라 언제 쓸지 미리 계산해두는 모델입니다. "GLM-5.3, 지금 바로 우리 팀에 써도 되나요?"라는 질문을 요즘 자주 받는데요, 벤치마크 표만 보면 당연히 궁금하실 만해요. 하지만 가중치도 API 단가도 아직 공개되지 않았습니다. 이 글에서는 GLM-5.3이 왜 이렇게 화제가 됐는지, 어디까지 확인된 사실이고 어디부터 추정인지, 그리고 지금 할 수 있는 일과 8월 말쯤에나 가능한 일을 구분해서 정리했습니다.

보안 작업을 거부당한 개발자들이 GLM-5.3으로 몰려간 진짜 이유

GLM-5.3 소식이 올라온 Hacker News 스레드는 2026-08-14 하루 만에 1,134 포인트, 댓글 557개가 붙었습니다. 그런데 정작 가장 뜨거웠던 논점은 성능 수치가 아니었어요. 미국 프론티어 모델이 보안 관련 요청을 거부한다는 실무 불만이었습니다.

댓글 하나를 그대로 옮겨봅니다.

"5.2도 꽤 견고했고 보안 감사 능력 벤치마크에서 Opus 4.8에 아슬아슬하게 못 미쳤다. 나는 주로 Kimi K3를 써왔다. 미국 벤더들은 평민에게 최고 모델로 보안 작업을 하게 두지 않으니까."

다른 댓글은 더 구체적이었어요.

"공격자만이 아니다. 내 프로젝트의 기본적인 이슈 분류조차 Kimi나 GLM으로 갈아타야 한다. 지금 가드레일은 터무니없다."

세 번째 댓글은 이주 과정을 그대로 보여줍니다.

"보안 작업용 하네스를 만들다가 Opus가 거부하기 시작해 GPT-5.5로 옮겼고, 5.6 Sol도 거부해서 결국 Kimi K3와 DeepSeek으로 갔다. 훨씬 싸기도 하고. GLM이 더 낫다면 갈아탈 것이다."

정리하면 채택 이유가 성능 우위가 아니라 "할 수 있는 일"과 "할 수 없는 일"의 차이였다는 거예요. 정당한 방어 목적의 취약점 분석·이슈 분류 같은 업무까지 가드레일에 막히니, 거부하지 않고 비용도 싼 오픈 모델로 옮긴 거죠. 같은 시기 r/LocalLLaMA에서도 "일어나 보면 또 중국 모델(i wake up → another chinese model)"이라는 댓글이 업보트 395개를 받으며 이 흐름을 압축해서 보여줬습니다.

이 대목이 GLM-5.3 기사에서 가장 자주 빠지는 부분이에요. 벤치마크 1위 항목보다, "우리 요청을 거부하지 않는가"가 실사용 결정을 갈랐다는 점입니다.

벤치마크는 공개됐는데, 왜 아직 아무도 못 쓸까

여기서 반전이 나옵니다. 그렇게 화제가 됐는데도, 2026-08-16 현재 GLM-5.3을 실제로 손에 쥔 사람은 없어요.

먼저 가중치입니다. Z.ai 공식 블로그는 "출시 2주 후, 안전성 평가와 하드닝이 끝나면 공개"라고 못박았습니다. 공개일이 2026-08-14였으니 예고대로면 2026-08-28경이에요(어디까지나 예고 기준이고 확정은 아닙니다). 실제로 huggingface.co/zai-org/GLM-5.3 주소는 2026-08-16 확인 시점 기준 HTTP 401을 반환했어요. 저장소는 만들어졌지만 비공개라는 뜻입니다. 같은 시각 GLM-5.2 저장소는 정상 접속(200)이었으니, 이건 실수가 아니라 의도적인 지연이에요.

가격도 마찬가지입니다. Z.ai의 공식 단가표(docs.z.ai)에는 2026-08-16 기준으로 GLM-5.3 행 자체가 없어요. 지금 GLM-5.3에 실제로 돈을 내는 유일한 방법은 토큰당 과금이 아니라 구독형 GLM Coding Plan(포인트 쿼터제)뿐입니다. Z.ai 공식 X 계정도 "API 접근과 오픈 가중치는 엄격한 안전성 평가를 거쳐 단계적으로 공개된다"고 밝혔죠.

정리하면 이렇습니다. 벤치마크 표는 공개, 가중치는 미공개, per-token 가격도 미공개. 지금 GLM-5.3과 관련해 실제로 존재하는 유료 접근 경로는 구독 플랜 하나뿐이에요.

가짜 "무료 무제한" 저장소를 조심하세요

관심이 몰리는 틈을 타 ZAI-GLM-5-3/glm-5.3이라는 저장소가 "공식 데스크톱 클라이언트"를 표방하며 "API 키 없이 100% 무료 무제한 GLM-5.3 API"를 광고하고 있어요. 이런 유혹에 넘어가 독점 코드베이스를 업로드하면 자격증명 탈취나 공급망 공격으로 이어질 수 있습니다. **Z.ai의 실제 조직 네임스페이스는 zai-org**뿐입니다. 이 이름이 아니면 일단 의심하시는 게 안전해요.

GLM-5.3, 정확히 어떤 모델인가

GLM-5.3이란: 중국 Z.ai(구 Zhipu AI)가 2026-08-14 공개한 오픈웨이트 코딩·보안·에이전트 특화 모델입니다. GLM-5.2와 같은 베이스 모델을 쓰고 사후학습만 확장했으며, 컨텍스트는 100만 토큰, 라이선스는 MIT(GLM-5.2 기준)입니다. 다만 2026-08-16 현재 가중치는 다운로드할 수 없습니다.

공식 블로그 첫 문장이 인상적이에요. "Scaling post-training is all we did for GLM-5.3(우리가 GLM-5.3에서 한 건 사후학습 스케일링이 전부다)"라고 밝혔거든요. 즉 새 베이스 모델이 아니라 GLM-5.2를 그대로 쓰고 학습 후 단계만 키운 겁니다. 이 점이 실무적으로 중요한데, 하드웨어 요구사양이나 컨텍스트 길이, 라이선스가 GLM-5.2와 사실상 같을 가능성이 높다는 뜻이에요.

항목확인 상태
개발사Z.ai (구 Zhipu AI / 智谱, 베이징)공식 블로그
공개일2026-08-14공식 블로그·공식 X
베이스 모델GLM-5.2와 동일 (사후학습만 확장)공식 블로그
아키텍처MoE + DSA 희소 어텐션 (GlmMoeDsaForCausalLM)GLM-5.2 config.json
총 파라미터약 740~750B급 (HF 실측 753B, GLM-5.2 기준)공식 미확정 — "743B"는 업계 통용 수치일 뿐
활성 파라미터약 40B으로 알려짐제3자 요약 기준, 미확정
컨텍스트1,048,576 토큰 (1M)GLM-5.2 config.json
라이선스MIT (GLM-5.2 기준)HF 모델 카드
가중치 공개미공개, 예고 기준 2026-08-28경공식 블로그

파라미터 수 표기가 헷갈릴 수 있어 짚고 갈게요. Z.ai는 GLM-5.3의 파라미터 수를 공식적으로 밝히지 않았습니다. 언론과 커뮤니티가 쓰는 "743B"는 GLM-5 계열 기술 보고서에서 파생된 추정치일 뿐이에요. 반면 Hugging Face API로 GLM-5.2의 safetensors를 직접 집계하면 753.3B가 나옵니다. 그래서 이 글에서는 "약 740~750B급" 또는 "HF 실측 753B(GLM-5.2 기준)"로만 표기했습니다.

GLM-5.3 벤치마크, 1위인 항목과 뒤처지는 항목

Z.ai 공식 블로그가 공개한 비교표는 총 16개 벤치마크로 구성돼 있어요. 별도 표기가 없으면 전부 Z.ai 자체 평가이고, 각주에서 제3자 측정으로 명시된 건 FrontierSWE(Proximal 수행)와 GDPval-AA v2(Artificial Analysis 수행) 딱 둘뿐입니다.

먼저 GLM-5.3이 표 전체 1위를 기록한 항목입니다.

벤치마크GLM-5.3GLM-5.2Kimi K3Claude Opus 4.8Fable 5GPT-5.6 Sol
CyberGym (사이버)84.577.280.078.183.883.6
AutomationBench v1.0.6 (에이전트)48.226.246.741.046.245.8
GDPval-AA v2 (에이전트, 제3자 측정)176915081682158817431730

반대로 코딩 핵심 지표에서는 클로즈드 모델에 여전히 뒤집니다. Z.ai 스스로도 본문에서 "GLM-5.3은 Max effort에서 39.5%인 Claude Fable 5에 여전히 뒤진다"고 인정했어요.

벤치마크GLM-5.3Fable 5GPT-5.6 Sol
Terminal Bench 3.028.333.734.6
DeepSWE v1.166.969.772.7
ExploitBench (사이버)54.478.076.5
FrontierSWE (제3자 측정)78.188.2-

표를 읽을 때 한 가지 더 봐야 할 게 있어요. 벤치마크 상당수를 Claude Code 2.1.207 하네스로 돌렸다고 각주에 적혀 있는데, 하네스 자체가 결과에 영향을 주는 항목이라 동일 조건 비교인지는 별도로 따져봐야 합니다. 커뮤니티에서도 이 부분을 그냥 넘기지 않았어요. r/LocalLLaMA에는 "새 벤치마크가 나오면 점수가 바닥이다가 다음 업데이트에서 갑자기 프론티어가 되는 흥미로운 패턴(Terminal Bench 3.0)"이라는 댓글이 업보트 33개를 받으며 4.6에서 28.3으로 뛴 점수를 냉소적으로 짚었습니다.

사이버 보안 실적은 이 모델의 진짜 차별점입니다. 중국 내 여러 보안팀과 협업해 269개 오픈소스 프로젝트에서 취약점 2,436건을 찾았다고 발표했어요. 심각도별로는 Critical 107건, High 990건, Medium 1,286건, Low 53건이고요, 이 중 Critical과 High를 합친 1,097건(107+990)이 "즉시 조치가 필요한 수준"으로 분류됩니다. 참고로 공식 블로그 본문에는 "중간~높음(medium-to-high) 심각도 1,097건"이라는 표현이 있는데, 원장 통계와 맞춰보면 실제로는 Medium(1,286건)이 빠진 Critical+High 합계로 읽는 게 산술상 정확해요. 2,436건 중 지금 공개된 건 53건뿐이고 나머지 2,383건은 엠바고 상태입니다. 가장 오래된 결함은 1981년에 유입돼 평균 26.6년간 발견되지 않았다고 하니, 이게 앞서 본 "보안 작업을 거부당한 개발자들"이 이 모델에 주목하는 배경이기도 합니다.

혼자 로컬로 돌릴 수 있을까 (GLM-5.2 기준 추정)

결론부터 말씀드리면 2026-08-16 현재 GLM-5.3은 로컬에서 돌릴 수 없습니다. 가중치가 없으니까요. 다만 GLM-5.2와 베이스가 같은 만큼, GLM-5.2의 실측 데이터로 로컬 실행 요구사양을 가늠해볼 수는 있어요. 아래 수치는 전부 GLM-5.2 기준 추정임을 먼저 밝힙니다.

혼자 로컬로 돌릴 수 있을까 (GLM-5.2 기준 추정)혼자 로컬로 돌릴 수 있을까 (GLM-5.2 기준 추정)

자료: 본문 데이터 · QJC 재구성

GLM-5.2 원본은 BF16 기준 약 1.51TB(1,506,693,036,946바이트, 282개 샤드)입니다. unsloth/GLM-5.2-GGUF에서 실측한 양자화별 용량은 이렇습니다.

양자화용량현실적 실행 환경
BF16 (원본)1,508 GB데이터센터급 다중 노드
Q8_0801 GB8×H100(640GB)로도 부족
UD-Q6_K626 GB다중 GPU 서버
UD-Q5_K_M561 GB다중 GPU 서버
UD-Q4_K_M466 GB512GB 통합 메모리에서 아슬아슬
UD-IQ4_XS365 GB512GB 통합 메모리에서 여유
UD-Q3_K_XL343 GB512GB급의 현실적 선택지
UD-IQ3_XXS282 GB384GB급
UD-Q2_K_XL254 GB256GB급
UD-IQ2_XXS239 GB256GB급
UD-IQ1_M229 GB256GB급 (품질 저하 큼)
UD-IQ1_S (최소)217 GB256GB급 (품질 저하 큼)

여기서 확실히 짚을 게 있어요. RTX 4090(24GB)이나 RTX 5090(32GB) 같은 소비자용 단일 GPU로는 불가능합니다. 가장 공격적인 1비트급 양자화조차 217GB가 필요해서 자릿수 자체가 다르거든요. 512GB급 통합 메모리(예: Mac Studio 최상위 구성)라면 Q3_K_XL(343GB)이나 IQ4_XS(365GB) 정도가 현실적인 선택지고요, 이마저도 1M 컨텍스트를 실제로 쓰면 KV 캐시가 더 붙으니 여유를 넉넉히 잡아야 합니다.

결국 로컬 실행 요구사양은 노트북 한 대의 문제가 아니라 서버 투자 결정에 가까워요. 그런데 이건 동시에 이 모델 계열이 갖는 가장 큰 가치이기도 합니다. 가중치가 실제로 공개되면 완전 오프라인 실행이 가능해져서 코드와 문서가 외부로 나가지 않으니까요.

API 가격이 아직 없다 (지금 유일하게 돈 내는 방법)

GLM-5.3 자체 단가는 미공개입니다. 2026-08-16 기준 Z.ai 공식 단가표에서 GLM-5.3 행을 찾을 수 없어요. 아래는 확인된 실제 숫자, 100만(1M) 토큰당 미국 달러 기준입니다.

모델입력캐시된 입력출력
GLM-5.3미공개미공개미공개
GLM-5.2$1.40$0.26$4.40
GLM-5.1$1.40$0.26$4.40
GLM-5$1.00$0.20$3.20
GLM-4.7$0.60$0.11$2.20

GLM-5.2 단가를 기준으로 다른 상용 모델과 견줘보면 이렇습니다(전부 100만 토큰당 USD).

모델입력출력GLM-5.2 대비 입력GLM-5.2 대비 출력
GLM-5.2 (Z.ai)$1.40$4.40기준기준
Claude Opus 4.8 / Opus 5$5.00$25.00약 3.6배약 5.7배
Claude Sonnet 5$2.00$10.00약 1.4배약 2.3배
Claude Fable 5 / Mythos 5$10.00$50.00약 7.1배약 11.4배
GPT-5.6 Sol$5.00$30.00약 3.6배약 6.8배

출력 토큰 비중이 큰 장시간 에이전트 워크로드일수록 이 차이가 크게 벌어져요. 다만 이건 어디까지나 GLM-5.2 단가이고, GLM-5.3의 실제 가격은 아직 아무도 모릅니다.

지금 GLM-5.3에 실제로 돈을 내는 방법은 per-token 과금이 아니라 구독형 GLM Coding Plan뿐입니다.

플랜월 결제연간 결제 시 월 환산비고
Lite$18$12.6기본
Pro$80$56Lite 사용량의 6배
Max$168$117.6Lite 사용량의 14배
팀(좌석당)$88$79.2 (10% 할인)-
팀 상위(좌석당)$188$169.2 (10% 할인)-

과금은 입력·캐시된 입력·출력을 각각 따로 계산하는 포인트 쿼터 방식이고요, 한국시간 기준 평일 15:00~19:00를 제외하면 포인트를 50%만 소모합니다. 주말은 종일 50%예요. Claude Code, OpenCode, Cline 같은 기존 코딩 에이전트에서도 이 플랜으로 GLM-5.3을 붙여 쓸 수 있습니다.

지금 쓸 수 있는 것과 2주 뒤에나 쓸 수 있는 것

여기까지 온 분이라면 도입 여부를 판단할 준비가 됐을 거예요. 조직에서 새 모델을 도입할 때 실제로 부딪히는 고민 네 가지에 맞춰 정리해봤습니다.

우리 팀에 특별한 기술이 필요한가: 지금은 구독 플랜을 기존 코딩 에이전트 도구에 연결하는 방식이라 진입장벽이 낮아요. 반면 로컬 실행은 최소 217GB(1비트급)에서 466GB(Q4급, GLM-5.2 기준 추정) 하드웨어가 필요해 사실상 서버 투자 결정입니다.

데이터를 밖으로 내보내도 되는가: 지금 API·구독 경로를 쓰면 데이터는 Z.ai(중국 기업) 서버로 갑니다. 고객사 코드나 계약 정보를 다루는 작업이라면 조직의 데이터 반출 정책과 충돌할 수 있어요. 가중치가 공개돼 완전 오프라인 실행이 가능해지기 전까지는 이 리스크가 그대로 남습니다.

구독료를 낼 만큼 효과가 있는가: GLM-5.2 단가 기준으로 출력 토큰이 Opus 대비 약 5.7배, GPT-5.6 Sol 대비 약 6.8배 저렴합니다. 다만 GLM-5.3의 실제 단가는 아직 없으니, 정확한 원가 산정은 구독 플랜 포인트 소모율을 실측한 뒤에 하시는 게 안전해요.

벤치마크를 믿고 결정해도 되는가: 16개 지표 중 제3자가 검증한 건 FrontierSWE와 GDPval-AA v2 둘뿐이고, 나머지는 Z.ai 자체 평가입니다. 독립 재현 결과는 아직 없어요. 벤치마크만 보고 결정하기보다는 자사 워크로드로 파일럿을 먼저 돌려보시는 걸 권합니다.

이 네 가지를 정리하면 지금 도입할지 기다릴지가 자연히 갈립니다.

지금 도입해도 되는 경우

  • 출력 토큰이 지배적인 대량 코딩·에이전트 워크로드로 비용에 민감한 경우
  • 정당한 방어 목적의 보안·취약점 분석 업무가 미국 모델 가드레일에 자꾸 막히는 경우
  • MIT 라이선스가 필요하고 상업적 이용·재배포 제약을 낮게 가져가고 싶은 경우(단, GLM-5.3 가중치 자체의 라이선스는 공개 시점에 재확인이 필요합니다)

아직 기다려야 하는 경우

  • 로컬·온프레미스 배포가 전제인 조직 (가중치가 없습니다. "2주 후"는 예고일 뿐이에요)
  • per-token 과금으로 정확한 예산을 짜야 하는 조직 (단가 자체가 없습니다)
  • 최고 난도 코딩·익스플로잇 작업이 핵심인 경우 (Fable 5, GPT-5.6 Sol과의 격차가 아직 큽니다)

마무리

GLM-5.3은 벤치마크로만 보면 오픈 모델 중 최상위권이지만, 손에 쥘 수 있는 건 아직 구독형 코딩 플랜 하나뿐입니다. 그리고 채택을 실제로 밀어붙이는 힘은 벤치마크 순위가 아니라 "이 모델은 우리가 부탁한 보안 작업을 거부하지 않는다"는 실무적 이유였어요. 가중치와 API 단가가 공개되는 8월 말 즈음에는 상황이 또 바뀔 겁니다. 우리 팀 상황에 맞는지부터 따져보셔도 충분합니다. 판단에 필요한 기준은 위에 정리해 뒀어요.


자주 묻는 질문 (FAQ)

Q: GLM-5.3 API 가격은 얼마인가요?

아직 공식 단가가 없습니다. 2026-08-16 기준 Z.ai 공식 단가표에 GLM-5.3 행 자체가 존재하지 않아요. 참고할 수 있는 건 같은 베이스인 GLM-5.2 단가(100만 토큰당 입력 $1.40, 출력 $4.40)뿐이고, 지금 실제로 결제할 수 있는 건 월 $18부터 시작하는 구독형 GLM Coding Plan입니다.

Q: GLM-5.3을 지금 로컬 서버에 설치해서 쓸 수 있나요?

아직은 불가능합니다. Z.ai는 "출시 2주 후" 가중치 공개를 예고했고 2026-08-16 확인 시점 기준 Hugging Face 저장소는 비공개(HTTP 401) 상태예요. 공개되더라도 GLM-5.2 기준으로 추정하면 최소 217GB, 안정적으로는 466GB급 하드웨어가 필요해 소비자용 GPU 한 대로는 돌릴 수 없습니다.

Q: 보안 작업에 왜 미국 모델 대신 중국 오픈 모델을 쓰나요, 데이터는 안전한가요?

Hacker News에서 가장 많이 나온 이유가 미국 프론티어 모델이 정당한 보안 분석 요청까지 가드레일로 거부한다는 불만이었어요. 다만 지금처럼 API·구독으로 GLM-5.3을 쓰면 데이터가 Z.ai(중국 기업) 서버로 전송되므로, 고객사 코드를 다루는 조직이라면 그 자체가 별도의 검토 대상입니다. 완전한 데이터 격리는 가중치가 공개되고 로컬 실행이 가능해진 뒤에나 가능합니다.


참고 자료