Self-Operating Computer 평가: 영향력 있는 데스크톱 조작 실험과 큰 신뢰 경계
Self-Operating Computer는 멀티모달 모델이 화면을 보고 마우스와 키보드 조작을 고르는 오픈소스 Python 플랫폼이다. 2023년 11월 공개된 초기 computer-use 구현으로 영향력이 있지만, 지금은 완성된 개인 비서보다 연구·개발 기반으로 봐야 한다. 로컬 코드와 구성에 따라 외부 모델에 데스크톱을 관찰하고 입력하는 강한 권한을 준다.
최신 정식판은 v1.5.8(2025년 2월 28일)이다. 저장소는 archived 상태가 아니며 마지막으로 확인한 변경은 2025년 9월 19일 README 오타 수정이다. 이는 개발 중단의 증거도, 활발한 기능 개발의 증거도 아니다. 2026년 OS 권한, 의존성, 모델 접속점을 격리 환경에서 다시 검증해야 한다.
README는 macOS, Windows, X server가 있는 Linux를 언급하고 macOS Terminal에 Screen Recording과 Accessibility를 요구한다. 전자는 민감한 화면을 보는 권한이고 후자는 시스템 입력을 만드는 권한이다. 시연 성공은 화면 위치 맞춤의 예일 뿐 인가, 격리, 감사, 운영 신뢰성을 증명하지 않는다.
현재 프로젝트 상태
| 확인 항목 | 검증된 상태 | 판단 |
|---|---|---|
| 최신 정식판 | v1.5.8, 2025년 2월 28일 | 버전과 의존성을 고정한다 |
| 저장소 | archived 아님. 마지막 확인 변경 2025년 9월 19일 | 활발한 유지보수를 가정하지 않는다 |
| 라이선스 | MIT | 모델·서비스 약관은 별도 확인 |
| 지원 OS | README는 macOS, Windows, X server Linux 기재 | 격리 환경에서 재시험 |
| 로컬 모델 | Ollama/LLaVA 경로. README는 높은 오류율 경고 | 기밀성과 신뢰성을 따로 평가 |
| 외부 모델 | 여러 제공자 설정이 있으나 이름이 낡을 수 있음 | 현재 API, 가격, 보존 확인 |
| 데스크톱 권한 | Screen Recording과 Accessibility | 주 사용 컴퓨터에는 부여하지 않음 |
| 운영 통제 | 관리형 격리, 감사, 회복이 제한적 | 실험용으로 판단 |
조작 반복의 구조와 실패 지점
조작 반복은 화면 캡처, OCR 또는 Set-of-Mark, 멀티모달 판단, 클릭·입력·키 조작, 다음 화면 캡처 순서다. 앱 전용 API 없이도 움직이지만 해상도, 배율, 팝업, 애니메이션, 포커스, 다크 모드, 비슷한 아이콘 때문에 좌표가 쉽게 어긋난다.
OCR과 SoM은 위치 찾기를 개선해도 업무 의미나 권한을 이해하지 못한다. 보내기, 삭제, 구매를 정확히 찾아도 그 행동 자체가 틀릴 수 있다. 중요한 단계는 애플리케이션 상태 또는 사람 승인으로 의미를 검증한다.
README의 모델 목록에는 현재 이름과 과거 이름이 섞여 있고 로컬 LLaVA는 오류율이 높다고 명시한다. 화면 크기, 언어, 테마, 앱을 고정한 비공개 평가에서 성공, 오작동, 회복, 지연, 비용을 측정한다.
안전한 평가 절차
- 개인 인증정보, 파일, 동기화, 결제수단이 없는 일회용 VM과 시험 계정을 만든다.
- v1.5.8, Python, 의존성, OS, 화면 배율, 모델 ID를 고정한다.
- 필요한 Screen Recording과 Accessibility만 부여하고 시험 뒤 회수한다.
- 짧은 과제 30~50개를 만들고 시작 화면, 행동, 기대 종료 상태, 금지 행동을 정의한다.
- 읽기 전용 이동부터 시작해 행동 제안, 좌표, 지연, 토큰, 결과를 기록한다.
- 앱·도메인·행동 허용 목록, 단계·시간·비용 상한, 강제 중지, 확인을 추가한다.
- 팝업, 창 이동, 다크 모드, 여러 화면, 느린 페이지, 인젝션, 다른 계정을 시험한다.
- 성공, 오작동, 회복, 승인, 지연, 비용, 노출 데이터를 측정한다.
- 가역적인 쓰기만 격리 환경에서 시험하고 멱등성과 단계별 상태 확인을 쓴다.
- 같은 과제를 API, Playwright, RPA로 할 수 있으면 구조화 자동화를 우선한다.
보안, 개인정보와 운영 한계
| 위험 | 통제 | 승인 증거 |
|---|---|---|
| 잘못된 클릭·입력 | 짧은 과제, 상태 확인, 강제 중지 | 금지 행동 제로 |
| 민감 화면 전송 | 격리, 잘라내기, 가림, 알림 중지 | 이미지와 로그에 민감정보 없음 |
| 프롬프트 인젝션 | 관찰을 불신 입력으로 보고 허용 목록 적용 | 외부 지시로 정책 변경 없음 |
| 과도한 권한 | 최소 권한, 일회용 계정, 종료 후 회수 | 주요 인증정보 접근 불가 |
| 끝없는 반복 | 단계, 시간, 비용 상한과 강제 중지 | 모든 과제가 상한 안에서 종료 |
| 중복 실행 | 멱등성 키와 실행 후 대조 | 중복 보내기·구매·삭제 제로 |
| 의존성 노후화 | 버전 고정, 재현 빌드, 취약점 점검 | 새 환경에서 같은 결과 |
| 유지보수 정체 | 대안과 이탈 기준 기록 | 이식 가능한 과제 정의와 로그 |
첫 실행은 개인 인증정보, 파일, 동기화, 결제수단이 없는 일회용 VM이나 격리 계정에서 한다. 시험 사이트와 계정만 허용하고 끝난 뒤 Screen Recording과 Accessibility를 회수한다.
외부 모델로 보내는 화면에는 이메일, 인증 토큰, 의료·금융 기록, 알림이 들어갈 수 있다. 제공자, 처리 지역, 보존, 학습 사용을 확인하고 잘라내기·가림, 다른 앱과 알림 종료, 로컬 로그 삭제를 설정한다. 로컬 추론도 오작동과 프롬프트 인젝션 위험을 없애지 않는다.
웹, 이메일, 문서는 악성 지시를 담을 수 있는 신뢰하지 않는 관찰 대상이다. Terminal과 비밀번호 관리자를 차단하고 앱, 도메인, 동작을 허용 목록으로 제한한다. 로그인, 보내기, 구매, 삭제, 업로드, 권한, 법적 동의는 확인 후 실행하고 쓰기 뒤 상태를 다시 관찰한다.
대안과 독립 판단
| 선택 | 가장 맞는 용도 | 주요 차이 |
|---|---|---|
| Self-Operating Computer | 연구, 교육, 격리된 짧은 화면 조작 | 소스는 열려 있으나 관리 통제는 직접 구축 |
| OpenAI / Claude computer use | 현재 제공자 계약에서의 화면 조작 | 관리 기능은 제공 상태와 계약에 의존 |
| Browser Use | 브라우저 중심 에이전트 실험 | 전체 데스크톱보다 범위가 좁음 |
| Playwright | 알려진 웹 절차와 안정적 DOM | 화면 이미지보다 시험·선택·인가가 쉬움 |
| UiPath 등 RPA | 기업 반복 절차, 감사와 오케스트레이션 | 도입 부담은 크나 통제가 성숙 |
| 앱 전용 API | 구조화되고 인가 가능한 작업 | 대개 가장 신뢰성과 효율이 높음 |
독립 판단으로 computer-use 구조를 배우는 소스로는 가치가 있지만 알려진 절차는 Playwright, 네이티브 API, 선택자를 쓰는 RPA가 보통 더 빠르고 시험과 인가가 쉽다. 구조화 인터페이스가 없을 때만 화면 조작을 쓰며 주 사용 컴퓨터에서 시작하지 않는다.
현재 Claude/OpenAI computer use는 관리형 제공자 계약을, Browser Use는 브라우저 중심 구현을, UiPath/Playwright는 구조화 자동화를 제공한다. 이 프로젝트의 장점은 소스를 보고 모델을 선택하기 쉬운 점, 약점은 관리형 격리, 관측성, 복구 기능이 부족한 점이다.
자주 묻는 질문
주 사용 컴퓨터에서 안전한가?
첫 실행에는 쓰지 말고 인증정보를 제거한 격리 VM이나 계정을 사용한다.
현재 버전은 무엇인가?
확인된 최신 정식판은 v1.5.8(2025년 2월 28일)이다.
오프라인으로 가능한가?
Ollama/LLaVA 로컬 경로가 있지만 README는 높은 오류율을 경고한다.
왜 OS 권한 두 개가 필요한가?
하나는 화면을 보고 다른 하나는 입력을 만들기 때문에 신뢰 경계가 크다.
OCR은 운영에 충분한가?
위치 찾기는 돕지만 인가와 업무적 정확성을 판단하지 않는다.
Playwright와 차이는?
이 제품은 화면으로 여러 앱을 조작하고 Playwright는 DOM을 사용해 알려진 웹 절차에서 보통 안정적이다.
어떤 과제에 적합한가?
격리 환경의 저위험, 가역적, 짧은 과제다.
아직 유지보수되는가?
archived 상태는 아니지만 정식판은 2025년 2월에 멈춰 있어 호환성을 직접 확인해야 한다.
출처
- Official repository
- Official README and installation
- Official releases
- Official commit history
- MIT license
- PyPI package
- OpenAI computer-using agent
- Anthropic computer-use documentation
- Browser Use documentation
- OSWorld benchmark
독립 검토일: 2026년 8월 20일. 모델, API, 가격, OS 권한은 바뀔 수 있으므로 현재 공식 문서를 확인해야 한다.



