Skip to content
Back to Blog
Jev, 8라운드 심사하고도 왜 도입하지 않았을까요
[AI 자동화]

Jev, 8라운드 심사하고도 왜 도입하지 않았을까요

퀀텀점프클럽 정상록퀀텀점프클럽 정상록6 min read3 views

Free Resource

PDF · Free

Jev 막 도입하면 안 됩니다 (149건 4레인 채택 심사): 비개발자를 위한 쉬운 가이드

Get the practical guide first, before diving into the full article.

Jev, 8라운드 심사하고도 왜 도입하지 않았을까요? 149건 4레인 실측 기록 (2026년)

Jev는 확신 0.8 이상 구간에서 정밀도 1.00을 기록하고도 탈락했습니다. 같은 과제를 Claude가 117건 전부 맞혔고, 질문 설계 하나로 정확도가 62.6%에서 95.0%로 뒤집혔기 때문입니다.

System One 모델: 문장을 생성하지 않고 미리 정한 선택지 중 하나를 확률과 함께 돌려주는 판정 전용 AI를 말합니다.

목차

  • Jev가 어떤 모델인지
  • 149건 4레인 대결 결과
  • 진짜 수확은 왜 우리 훅이었나
  • 질문 설계가 결과를 뒤집은 이유
  • 신기술 도입 순서

Jev, 수치가 좋다는데 왜 아직 안 쓰시나요

Jev가 공개된 뒤로 저희 팀 채팅방은 그 이야기로 가득했어요. 확신 0.8 이상 구간에서 정밀도 1.00, 단가는 100만 토큰에 0.042달러. 숫자만 보면 당장 바꾸지 않을 이유가 없어 보였죠. 그런데 8라운드에 걸쳐 감사를 해보니 결론은 반대였습니다. 이 글은 그 판단의 이유와, 새 모델을 도입하기 전에 무엇을 봐야 하는지를 정리한 기록이에요.

Jev, 수치가 좋다는데 왜 아직 안 쓰시나요Jev, 수치가 좋다는데 왜 아직 안 쓰시나요

이미지 출처: typesafe.ai

Jev는 어떤 모델인가요

Jev는 TypeSafe AI가 2026년 9월 15일 공개한 System One 계열 모델이에요. 텍스트를 생성하지 않고 선택(최대 255개 옵션), 점수, 예/아니오 판단만 내립니다. TypeSafe는 2024년 설립된 샌프란시스코 스타트업으로, CEO 디오구 알메이다는 OpenAI에서 InstructGPT 공동 저자로 일한 이력이 있어요. 시드 투자는 4천만 달러, 포브스 보도 기준 기업가치는 2억 달러 수준이고요. 입력 토큰은 100만 개당 0.042달러, 출력은 무료예요. 다만 셀프 호스팅이나 오픈 웨이트는 제공하지 않고, 모든 판단이 미국 벤더 API 한 곳을 거쳐야 하죠.

Jev는 어떤 모델인가요Jev는 어떤 모델인가요

이미지 출처: typesafe.ai

왜 이렇게 빨리 화제가 됐을까요

Vercel AI Gateway 팀 발표에 따르면 Jev는 출시 24시간 안에 유료 팀의 약 13%가 최소 한 번 이상 호출한, 역대 가장 빠르게 채택된 모델이었습니다. 대기자 명단은 36시간 만에 14만 명을 넘었다고 TypeSafe가 자체 발표했어요. TypeSafe가 공개한 벤치마크에서는 Jev가 GPT-5.6 대비 193.6배 빠르고 444.6배 저렴하다는 수치까지 나왔습니다. 그런데 정작 이 수치를 만든 TypeSafe 스스로 기술 노트에 이렇게 적어뒀죠. "이 벤치마크 워크플로는 자사 모델역량팀이 만들었고 편향 가능성이 있으며, 이 수치는 실사용 결과의 상단에 가깝다"고요. 화제성과 신뢰성은 다른 축이라는 걸 벤더 스스로 인정한 셈이에요.

저희가 직접 149건을 테스트했습니다

저희는 자체 개발 환경에서 쓰는 행동 감지 훅 코퍼스 149건을 골라 네 가지 방식을 나란히 붙여봤어요. 정규식 훅은 117건 중 69건을 맞히고 오탐 43건을 냈습니다. 로컬 소형 모델(kev 0.5B)은 87건을 맞혔지만 확신 0.8 이상에서 정밀도 0.875에 커버리지는 0.07에 그쳤어요. Jev는 115건 중 106건을 맞혔고 오탐은 0건, 다만 9건은 답을 내지 않고 유보했습니다. 확신 0.8 이상 구간만 보면 정밀도 1.00, 그 구간이 전체의 60%를 차지했어요. 반면 Claude Haiku 4.5와 Sonnet 5는 117건 전부를 배치 처리로 맞혔죠. 가장 어려운 12건만 Jev와 같은 방식, 한 건씩 개별 질문으로 다시 물었더니 Claude도 12건 모두 맞혔는데, 표본이 12건뿐이라 통계적으로는 차이가 없다는 증거가 아니라 차이를 못 찾았다는 정도의 결과였습니다.

진짜 수확은 43건의 오탐이었습니다

테스트 도중 재미있는 일이 벌어졌어요. 감사 리포트 안에 인용된 예시 문장 하나가 그 자체로 저희 detail-page 훅을 발동시킨 거예요. 전수 조사해보니 detail-page 훅은 12건 중 12건, bizmodel 훅도 12건 중 12건이 오탐이었고, 부정문이나 인용문, 가정법을 구분하지 못하고 있었습니다. 동사만 보고 판단하면 "만들지 말고"의 "만들"에도 걸리는 식이었죠. 부정·가정·설명 표현을 창작 동사 앞에서 먼저 차단하는 2단 정규식으로 고쳤더니 오탐 42건이 0건으로 줄었고 새로운 미탐은 0건이었습니다. 이 수정은 2026년 9월 22일 실제 훅 4개에 반영됐어요. Jev를 붙이기 전에 기존 방식부터 재는 것, 이게 이번 감사에서 가장 값진 발견이었습니다.

그래서 무엇부터 해야 할까요

다른 팀들의 결론도 엇갈려요. 피싱 메일 2천 건을 대상으로 한 독립 벤치마크 PhishNChips에서는 한 번에 하나씩 물었을 때 Jev가 62.6%로 Haiku의 81.3%에 크게 뒤졌습니다. 그런데 다섯 개 질문으로 나눠 가중치를 조정하자 격차가 사라졌어요(95.0% 대 93.2%, 통계적으로 유의하지 않음).

평가 방식이 바뀌면 순위도 바뀝니다. 독립 벤치마크 JevBench의 2026년 9월 22일 개정판에서는 Jev가 종합 1위였지만, 같은 벤치마크의 9월 19일 GPU 라운드에서는 속도와 비용 가중치 때문에 8위로 밀려났습니다.

벤더도 한계를 숨기지 않아요. TypeSafe 공식 기술문서(model-jaggedness)는 Jev가 문장을 지나치게 문자 그대로 읽고, 부정문이나 암묵적 조건을 놓칠 수 있다고 스스로 밝혀뒀습니다. "제로 할루시네이션"이라는 표현도 실측치가 아니라 스키마를 벗어난 출력을 안 낸다는 뜻일 뿐, 라벨 자체는 틀릴 수 있다고 명시하고 있죠.

결론을 한 문장으로 남기면 이렇습니다.

"같은 답은 어느 LLM에서도 얻을 수 있다. 같은 숫자는 얻을 수 없다."

그래서 순서가 중요합니다. 어떤 모델을 붙이기 전에 지금 방식의 오탐률부터 재고, 훅을 하나로 합쳐 실행 비용을 줄이고, 중복 프롬프트를 정리한 다음에야 벤더 API 도입을 검토하는 거예요. 이번 감사에서 상위 3개 조치는 전부 Jev와 무관한 정비 작업이었습니다.

자주 묻는 질문

Jev는 나쁜 모델인가요?

아니요. 확신 0.8 이상 구간에서 정밀도 1.00을 기록한, 판단 전용 작업에 강한 모델이에요. 다만 저희의 훅 분류 작업 하나에는 맞지 않았을 뿐, 다른 작업에서는 충분히 좋은 선택일 수 있습니다.

왜 정확도가 높은데도 도입을 보류했나요?

정확도 자체보다 커버리지가 문제였어요. 전체 사례의 60%에만 확신을 가지고 답했고, 나머지 9건은 QJC 내부 고유명사를 인식하지 못해 유보했습니다. 저희가 필요했던 건 모든 사례에 답할 수 있는 판단기였어요.

어떤 작업에는 Jev가 적합한가요?

BorisLeMeec의 사례처럼 검색 랭킹이나 비용 절감이 핵심인 작업에서는 성과가 뚜렷했습니다(검색 정확도 P@1 0.96, 비용 30% 절감). 반대로 고정밀 단일 질문 분류처럼 놓치면 안 되는 작업에서는 아직 근거가 부족해요.

비용 비교는 공정했나요?

정직하게 말하면 아니었습니다. 저희가 처음 계산한 비용 배수는 하네스 오버헤드까지 섞여 있어 재측정이 필요한 상태예요. 단순 금액 기준으로 보면 Jev는 0.0024달러, Claude는 몇 달러 수준이었고, 9건의 정확도 차이가 그 차액만큼의 가치가 있는지가 진짜 질문이었습니다.

언제 다시 검토할 계획인가요?

교차 벤더 검증 레인이 할당량 소진으로 두 차례 실패해 2026년 9월 25일 이후 재가동을 기다리고 있어요. 그 검증이 끝나고 두 단계 가드가 운영 데이터를 더 쌓은 뒤 다시 판단할 예정입니다.

마무리

새 모델이 나올 때마다 갈아탈지 고민하게 됩니다. 이번 감사가 남긴 건 Jev 평가라기보다 AI 모델 도입을 판단하는 순서였어요.

먼저 지금 쓰는 방식의 결함을 셉니다. 저희는 그 단계에서 오탐 43건을 찾았고, 그게 전체에서 가장 값진 수확이었어요. 그다음 로컬에서 해결되는지 보고, 그래도 남으면 분류 모델을 로컬에 두고, 벤더 API는 맨 마지막에 봅니다.

AI 에이전트 시스템을 운영한다면 판정 지점이 생각보다 많을 거예요. 그 지점마다 "지금 뭐가 틀리고 있는지" 먼저 세어보세요. 모델을 바꾸지 않고 해결되는 경우가 많습니다.

관련 글

Jev가 어떤 모델이고 어떤 자리에 쓸 수 있는지 기본기부터 보고 싶다면 Jev AI 완벽 가이드: 판단 전용 모델, 언제 어떻게 써야 할까를 참고하세요.

참고자료