
마우스·키보드를 대신 움직이는 컴퓨터 사용 에이전트 cua, 업무 자동화 전 확인할 5가지
무료 자료
PDF · 무료
화면을 대신 눌러주는 AI, 어디까지 믿어도 될까 — 비개발자를 위한 쉬운 가이드
긴 글을 다 읽기 전에, 실무 가이드부터 먼저 챙겨가세요.
마우스·키보드를 대신 움직이는 컴퓨터 사용 에이전트 cua, 업무 자동화 전 확인할 5가지
trycua/cua는 에이전트가 아니라 컴퓨터를 조작할 화면을 빌려주는 오픈소스 인프라이며, 벤더가 낸 시험에서 최고 성적조차 24%에 그쳐 한국 업무 자동화 도입은 아직 파일럿 단계가 맞습니다.
trycua/cua는 지금 당장 회사 업무 전체를 맡길 도구가 아니라, 특정 화면 하나에 시험 삼아 붙여볼 만한 오픈소스 인프라입니다. "이거 우리 회사 시스템에도 바로 될까요?" 이 프로젝트를 접한 분들이 자주 묻는 질문인데요. API도 없는 낡은 사내 시스템을 매일 마주하는 입장이라면 당연히 궁금할 수밖에 없습니다. cua가 정확히 무엇인지부터 화제를 모은 초소형 모델의 진짜 실력, 그리고 컴퓨터 사용 에이전트를 한국 업무 자동화에 붙이기 전 확인해야 할 5가지까지 차례로 짚어보겠습니다.
cua가 정확히 무엇인가요: 에이전트가 아니라 컴퓨터를 빌려주는 인프라
trycua/cua(발음은 "쿠아")는 화면을 보고 마우스와 키보드를 직접 움직여 컴퓨터를 조작하는 AI, 이른바 컴퓨터 사용 에이전트를 위한 오픈소스 인프라입니다. 이 프로젝트 자체가 에이전트나 모델을 만들어주지는 않아요. 공식 소개 문구를 그대로 옮기면 이렇습니다.
Cua Fleets: isolated cloud desktops for your agents
이미지 출처: github.com
"에이전트와 모델은 당신이 가져오세요. 컴퓨터와 자동화 도구는 저희가 드립니다."
비유하자면 자동차와 시험 주행 코스를 빌려주는 쪽에 가깝습니다. 운전사(에이전트를 감싸는 실행 틀)와 두뇌(모델)는 사용자가 준비하고, cua는 차에 해당하는 가상 데스크톱과 핸들·페달에 해당하는 조작 드라이버, 주행 시험 코스에 해당하는 벤치마크를 내주는 거죠.
구성은 다섯 덩어리로 나뉩니다. 데스크톱을 직접 조작하는 Cua Driver, 격리된 가상 데스크톱을 띄우는 Cua Sandbox와 Fleets, 애플 실리콘 위에서 macOS·리눅스 가상머신을 돌리는 Lume, 평가·강화학습 환경인 Cua Bench, 그리고 양식 채우기 결정만 전담하는 소형 모델 CUA-S1입니다.
GitHub 지표를 보면 규모가 작지 않아요. 2026-09-21 오전 API 조회 기준 stars 25,104개, forks 1,726개, 라이선스는 MIT입니다. 저장소는 2025-01-31에 생성돼 오늘로 598일째고, 2026-09-20에도 코드가 올라왔으니 꾸준히 굴러가는 프로젝트인 셈이죠. 운영사는 Cua AI, Inc.이고, 2025-04-23 Hacker News 게시물 기준 와이 콤비네이터 X25 배치 출신입니다.
Computer-Use 2.0이란?: 소프트웨어 버전이 아니라 개념입니다. 에이전트가 코드 작성, 도구·API 호출, 사람처럼 화면 조작하기라는 세 가지 방식 중 상황에 맞는 것을 골라 쓴다는 뜻으로, cua 공식 문서가 정의합니다.
"Computer-Use 2.0"이 말하는 세 가지 선택지
cua 공식 문서 what-is-computer-use는 이 용어를 직접 정의합니다. 원래는 스크린샷을 해석해 마우스·키보드로 GUI를 조작하는 에이전트만 가리켰는데, cua는 이걸 더 넓게 씁니다. 에이전트가 코드를 쓰고 실행하는 것, 도구·API를 호출하는 것, 사람이 쓰는 화면을 직접 조작하는 것 사이에서 상황에 맞게 고른다는 뜻이에요.
저장소에 v2.0이라는 태그는 없습니다. 실제 릴리스는 컴포넌트별로 따로 매겨지고요. 문서가 구분하는 세 표면은 이렇습니다.
| 행동 표면 | 내용 | 적합한 경우 |
|---|---|---|
| 코딩 | 에이전트가 코드를 써서 실행 | 텍스트 중심 작업, 반복 실행, 다수 파일 처리 |
| 도구·API 호출 | 타입이 정해진 함수·MCP 서버 호출 | 외부 시스템에 특정 동작을 시킬 때 |
| 화면 조작(UI automation) | 사람처럼 클릭·타이핑·스크롤 | 쓸 만한 API가 없는 네이티브 앱·레거시 소프트웨어 |
문서는 "Computer use does not mean clicking through every task"라고 못 박아 둡니다. 화면 조작은 최후 수단이고, 가장 직접적인 인터페이스를 먼저 쓰라는 거예요. 계층 구조도 명확합니다.
모델 → 에이전트 실행 틀 → Cua Driver → 운영체제와 애플리케이션
Cua Driver는 화면 조작 계층일 뿐 모델을 고르거나 실행하지 않습니다. Claude Code나 Codex 같은 코딩 에이전트가 실행 틀 역할을 하고, 그 아래 Driver가 붙는 구조죠. API가 있으면 API를 쓰고 화면 조작은 API가 아예 없는 경계에만 쓰라는 뜻이라, 뒤에서 다룰 한국 사내 시스템 이야기와 바로 연결됩니다.
70만 파라미터 모델 하나가 만든 이번 화제
이번 급상승의 방아쇠는 CUA-S1입니다. 2026-09-18 공식 X 계정이 CUA-S1-FORMS를 오픈소스로 공개했고, 2026-09-19 Hacker News의 "Show HN" 게시물이 88 points(댓글 10개)를 받았습니다.
70만 파라미터 모델 하나가 만든 이번 화제
이미지 출처: huggingface.co
첫 체크포인트 cua-s1-form-v0는 양식(폼) 채우기 결정만 담당해요. 텍스트를 생성하는 모델이 아니라, UI 요소 하나와 선택지 목록을 입력받아 한 번의 순전파로 선택지별 확률만 돌려주는 방식입니다. 바이트 레벨 임베딩과 2층 트랜스포머 인코더(너비 128, 헤드 4개)에 옵션 어텐션 헤드를 얹은 구조고요.
학습된 파라미터는 706,048개, 체크포인트 용량은 2.8메가바이트입니다. 학습 데이터는 합성 폼 에피소드 10,000건이에요.
공개된 평가 수치는 이렇습니다.
- 합성 테스트(약 15,000건, 혼동 쌍 강제 포함): top-1 정확도 99.95%
- 실제 폼 3개·PDF 3개, 196번의 실제 결정: 100%
- 선택지 순서를 뒤섞은 대조군: 37% (모델이 요소를 실제로 읽는지 확인하는 검증용)
- 파인튜닝 없는 호스팅 API(Jev) 대조: 99.7% 대 83.6%
숫자만 보면 인상적이지만, 모델 카드가 스스로 한계를 적어 뒀습니다. "합성 폼 전체와 소규모(196건) 실제 평가로만 학습했고, 데모 세트 밖의 임의 실제 폼에는 검증되지 않았다", 그리고 "바이트 레벨 인코더에 영어 중심 라벨 어휘"라는 문장이에요. 뒤에서 다룰 한국어 라벨 이야기가 바로 이 지점입니다.
Hacker News 댓글 정서는 방향성에는 호의적이에요. "컴퓨터를 조작하는 데 셰익스피어를 쓸 능력까지는 필요 없다"는 댓글이 가장 많은 공감을 받았고요. 다만 "이걸로 뭘 만들 수 있나"라는 질문에는 "폼 행동을 분류하는 특화 분류기일 뿐, 전부는 아니다"라는 냉정한 답이 달렸습니다. 과열도 백래시도 없이, 방향은 맞지만 아직은 좁다는 온도입니다.
벤치마크 점수 85%를 실무 성공률로 읽으면 안 되는 이유
"벤치마크에서 85%면 우리 회사 화면에서도 85% 되는 거 아닌가요?" 이렇게 물으실 수 있는데, 그렇게 읽으면 안 됩니다.
cua가 직접 운영하는 벤치마크 사이트 cuabench.ai는 전문가가 만든 KiCad 회로설계 과제 25개 리더보드를 공개하고 있어요. 최고 성적은 Claude Fable 5와 GPT-5.5가 나란히 기록한 6/25, 24%입니다. 빈 화면에서 회로도를 끝까지 완성한 모델은 하나도 없었고요.
업계 표준인 OSWorld 벤치마크는 사람이 직접 풀어도 정답률 72.36%에 그칩니다. 서드파티 트래커 Steel.dev(2026-09-04 갱신)의 상위권 자기보고 점수는 85% 안팎인데, 이 페이지 자체가 대부분 벤더 자기보고이며 최대 스텝 수·OS 이미지·도구 권한이 제각각이라 직접 비교가 어렵다고 밝혀 둡니다. Epoch AI의 2025-10-30 분석은 더 냉정해요. OSWorld 태스크의 약 10%에 심각한 오류가 있고, 약 10%는 인터넷 라이브 데이터에 의존해 난이도가 시간에 따라 바뀐다는 내용입니다.
한 가지 짚어야 할 게 있어요. cua는 OSWorld 같은 벤치마크에서 자사 에이전트의 점수를 주장하지 않습니다. cua가 파는 건 채점받는 선수가 아니라 경기장과 심판이거든요. "cua의 OSWorld 점수"라는 건 애초에 존재하지 않습니다.
실무 해석은 이렇습니다. 표준 벤치마크의 80%대 점수는 "간단하고 잘 정의된 리눅스 작업" 이야기지, 고객사의 전문 업무 화면 이야기가 아니에요. 낯선 사내 화면에 한국어 라벨과 비표준 위젯까지 겹치면 KiCad 쪽 숫자(24%)에 가까워질 가능성이 더 높다고 보는 편이 안전합니다. 이건 추론이니, 도입 전 실제 화면으로 직접 파일럿 측정을 해 보는 게 맞습니다.
컴퓨터 사용 에이전트를 한국 업무 자동화에 붙이기 전 확인할 5가지
한국 기업 업무의 상당 부분은 API가 없는 화면 위에서 돌아갑니다. 수십 년 된 사내 ERP, 벤더 종속 그룹웨어, 엑셀 매크로로 굴러가는 내부 시스템이 대표적이에요. cua 공식 문서도 같은 이야기를 합니다. "쓸 만한 API를 제공하지 않는 네이티브 앱·웹 앱·레거시 소프트웨어에서는 GUI가 사용자에게 주어진 유일한 계약면인 경우가 많다"고요. 그래서 이 범주 자체는 한국에서 의미가 큽니다. 다만 업무 자동화 AI 에이전트를 사내 시스템에 실제로 연결하려는 담당자라면, 다음 5가지부터 확인해야 합니다.
-
영어 중심 라벨. CUA-S1 모델 카드가 스스로 "English-centric label vocabulary"라고 적어 뒀습니다. "휴대전화번호", "사업자등록번호" 같은 한국어 라벨이 붙은 사내 양식에 그대로 적용하면 성능이 보장되지 않아요. 저장소에 포함된 자체 합성 데이터 생성기로 재학습하는 경로가 현실적인 대안입니다.
-
한글 자모 조합 입력(IME) 미검증. 한글은 자모를 조합해 완성하는 방식이라 단순 키 이벤트 주입이 깨지는 경우가 있어요. 그런데 공식 문서 어디에도 한글이나 CJK IME에 대한 언급이 없습니다. 없다는 것 자체가 검증되지 않은 영역이라는 신호예요. 파일럿에서 가장 먼저 확인해야 할 항목입니다.
-
클라우드 이미지 가용성 불일치. 마케팅 페이지는 Linux·Windows·macOS·Android 4개 OS 지원을 내세우지만, 레퍼런스 문서 기준으로 클라우드 Fleet이 내장 지원하는 이미지는 Ubuntu 24.04와 Windows Server 2022 두 가지뿐입니다. macOS와 Android는 현재 Fleet 내장 입력으로 "거부"라고 적혀 있어요. 어느 쪽이 현행인지는 확인되지 않았으니, 실 도입 전 벤더에 직접 확인이 필요합니다.
-
비용 구조 이원화. 인프라 비용은 계산이 가능해요. CPU 시간당 vCPU당 0.044625달러, 메모리 시간당 GB당 0.0223125달러라서 4vCPU·8GB 데스크톱 한 시간이 약 0.357달러, 하루 8시간씩 20영업일이면 대략 57.1달러입니다. 문제는 이게 인프라 비용일 뿐이라는 거예요. 실제 비용을 좌우하는 건 스텝마다 화면을 캡처해 모델에 보내는 토큰 비용 쪽인데, 작업량과 붙이는 모델에 따라 크게 달라져 공식 수치가 없습니다. CUA-S1 같은 초소형 특화 모델이 존재하는 이유가 여기 있어요. 경계가 분명한 결정을 70만 파라미터 모델에 맡기면 프런티어 모델 호출을 줄일 수 있으니까요. 이 비용을 들일 명분은 "얼마를 아끼는가"가 아니라 "이 투자가 매출·시간으로 돌아오는가"로 따져야 정확합니다.
-
보안·권한과 고영향 행위 제외. macOS에서는 접근성과 화면 기록 권한이 필수라 회사 지급 맥에서 MDM 정책과 충돌할 수 있어요. 텔레메트리는 기본 활성 상태고("content-free" 표기,
cua-driver telemetry disable로 해제 가능), 컴플라이언스는 Type II가 아니라 Type I입니다. 공식 모델 카드는 화면 속 텍스트에 적대적 지시가 섞여 있을 수 있다는 프롬프트 인젝션 위험도 명시하고, 금융·법률·의료·고용·안전 관련 고영향 행위와 감독 없는 프로덕션 운영을 범위 밖으로 못 박아 뒀습니다. "우리 회사 데이터가 외부로 새는 거 아닌가요?"라는 질문에는, 최소한 결재·송금·계약 화면은 사람 승인 게이트 없이 맡기지 않는 것으로 답해야 합니다.
지금 써볼 수 있는 것과 아직은 이른 것
지금 만져볼 만한 조각은 Cua Driver입니다. 설치가 한 줄이고 관리자 권한도 필요 없어요. 가장 눈에 띄는 기능은 백그라운드 조작인데, 사용자의 마우스 커서를 뺏지 않고 지정한 창에만 입력을 보냅니다. 다른 일을 하는 동안 에이전트가 뒤에서 특정 창만 조작할 수 있다는 뜻이죠.
설계도 실무적으로 신뢰가 갑니다. 도구 호출이 실패하면 조용히 성공한 척하지 않고 "구조화된 거부"를 명시적으로 돌려줘요. 자동화 사고의 대부분은 안 됐는데 됐다고 기록되는 경우에서 나오거든요. 지원 등급 판정 기준도 "도구 호출이 성공을 반환했는지가 아니라 실제 앱 상태로 증명되는지"라서, 표시만 성공인 상태를 걸러냅니다. Claude Code 같은 기존 코딩 에이전트와 Cua Driver를 조합해 사내 화면 하나를 대상으로 파일럿을 도는 것, 이게 지금 단계에서 현실적인 시작점입니다.
반대로 지금은 유보할 것도 명확해요. 여러 업무를 한꺼번에 맡기는 자율 에이전트, 그리고 결재·정산처럼 고영향 화면의 자동화는 공식 모델 카드가 범위 밖으로 명시한 데다 KiCad 리더보드 24%라는 수치도 뒷받침합니다.
경계할 지점도 하나 있어요. cua-agent[omni]라는 선택 의존성에 포함된 ultralytics는 AGPL-3.0 라이선스입니다. 이 확장을 설치해 SaaS 형태로 서비스하면 AGPL의 네트워크 배포 조항이 걸릴 수 있어서, 상용 제품에 넣기 전 법무 검토가 필요해요. 기본 설치에는 포함되지 않는다는 점이 그나마 다행입니다.
마무리
컴퓨터 사용 에이전트 cua는 새로운 AI 에이전트가 아니라, 에이전트가 쓸 컴퓨터를 빌려주는 오픈소스 인프라입니다. 70만 파라미터짜리 작은 모델 하나로 화제를 모았지만, 정작 벤더가 낸 시험에서는 최고 성적 모델조차 25개 중 6개, 24%에 그쳤고요. 한국어 라벨과 한글 입력 처리는 아직 검증되지 않은 영역이라 전면 도입은 이릅니다.
어디서부터 손대야 할지 막막하시다면, 지금 팀의 반복 업무 중 API 없는 화면 하나를 골라 보세요. 그 하나가 시작점입니다.
자주 묻는 질문 (FAQ)
Q: browser-use와 뭐가 다른가요?
browser-use는 브라우저 안에서만 동작하는 에이전트 라이브러리로, 2026-09-21 GitHub API 기준 stars가 115,544개로 cua(25,104개)의 4.6배입니다. 웹 앱만 상대한다면 browser-use가 더 빠르고 가볍고요. 반면 cua는 브라우저뿐 아니라 macOS·Windows·Linux 네이티브 데스크톱 앱까지 다루는 컴퓨터 사용 에이전트 인프라라서, API가 없는 사내 프로그램을 자동화하려면 cua 쪽 범위가 필요합니다.
Q: 우리 회사 그룹웨어에 바로 붙일 수 있나요?
전면 적용보다는 화면 하나를 골라 파일럿부터 해 보시길 권합니다. CUA-S1 모델의 라벨 어휘가 영어 중심이라 한국어 라벨 그대로는 성능이 보장되지 않고, 한글 자모 조합 입력 처리에 대한 공식 언급도 아직 없거든요. Cua Driver 자체는 설치가 한 줄이고 관리자 권한도 필요 없으니, 그룹웨어 화면 하나로 먼저 검증해 보는 접근이 현실적입니다.
Q: 비용이 얼마나 드나요?
인프라만 보면 4vCPU·8GB 데스크톱을 한 시간 쓸 때 약 0.357달러입니다(CPU vCPU당 시간당 0.044625달러, 메모리 GB당 시간당 0.0223125달러, cua.ai 공식 가격 페이지 기준). 다만 실제 비용을 좌우하는 건 에이전트가 매 스텝 화면을 캡처해 모델에 보내는 토큰 비용 쪽이고, 이건 작업량과 붙이는 모델에 따라 달라져 공식 수치가 없습니다.

