Self-Operating Computer
Self-Operating Computer

Self-Operating Computer

Self-Operating Computer는 화면 이미지, 마우스, 키보드로 데스크톱을 조작하는 MIT 라이선스 Python 플랫폼이다. v1.5.8, 유지보수, 권한, 보안 경계와 대안을 독립적으로 평가한다.

108

Views

0

Likes

Jan 2026

Added

github.com

프로젝트 링크

Tags

Self-Operating Computercomputer usedesktop automationmultimodal agentOCRPyAutoGUI

Product Preview

A quick visual look at Self-Operating Computer before you visit the official site.

Published 1/21/2026
Self-Operating Computer screenshot

Editorial Review

About Self-Operating Computer

Self-Operating Computer 평가: 영향력 있는 데스크톱 조작 실험과 큰 신뢰 경계

Self-Operating Computer는 멀티모달 모델이 화면을 보고 마우스와 키보드 조작을 고르는 오픈소스 Python 플랫폼이다. 2023년 11월 공개된 초기 computer-use 구현으로 영향력이 있지만, 지금은 완성된 개인 비서보다 연구·개발 기반으로 봐야 한다. 로컬 코드와 구성에 따라 외부 모델에 데스크톱을 관찰하고 입력하는 강한 권한을 준다.

최신 정식판은 v1.5.8(2025년 2월 28일)이다. 저장소는 archived 상태가 아니며 마지막으로 확인한 변경은 2025년 9월 19일 README 오타 수정이다. 이는 개발 중단의 증거도, 활발한 기능 개발의 증거도 아니다. 2026년 OS 권한, 의존성, 모델 접속점을 격리 환경에서 다시 검증해야 한다.

README는 macOS, Windows, X server가 있는 Linux를 언급하고 macOS Terminal에 Screen Recording과 Accessibility를 요구한다. 전자는 민감한 화면을 보는 권한이고 후자는 시스템 입력을 만드는 권한이다. 시연 성공은 화면 위치 맞춤의 예일 뿐 인가, 격리, 감사, 운영 신뢰성을 증명하지 않는다.

Self-Operating Computer 리뷰: 영향력 있는 desktop-control 실험과 큰 trust boundary
Self-Operating Computer는 screenshot, mouse, keyboard로 desktop을 조작하는 MIT Python framework다. v1.5.8, 유지보수, 권한, 보안 경계와 대안을 검토한다.

현재 프로젝트 상태

확인 항목검증된 상태판단
최신 정식판v1.5.8, 2025년 2월 28일버전과 의존성을 고정한다
저장소archived 아님. 마지막 확인 변경 2025년 9월 19일활발한 유지보수를 가정하지 않는다
라이선스MIT모델·서비스 약관은 별도 확인
지원 OSREADME는 macOS, Windows, X server Linux 기재격리 환경에서 재시험
로컬 모델Ollama/LLaVA 경로. README는 높은 오류율 경고기밀성과 신뢰성을 따로 평가
외부 모델여러 제공자 설정이 있으나 이름이 낡을 수 있음현재 API, 가격, 보존 확인
데스크톱 권한Screen Recording과 Accessibility주 사용 컴퓨터에는 부여하지 않음
운영 통제관리형 격리, 감사, 회복이 제한적실험용으로 판단

조작 반복의 구조와 실패 지점

조작 반복은 화면 캡처, OCR 또는 Set-of-Mark, 멀티모달 판단, 클릭·입력·키 조작, 다음 화면 캡처 순서다. 앱 전용 API 없이도 움직이지만 해상도, 배율, 팝업, 애니메이션, 포커스, 다크 모드, 비슷한 아이콘 때문에 좌표가 쉽게 어긋난다.

OCR과 SoM은 위치 찾기를 개선해도 업무 의미나 권한을 이해하지 못한다. 보내기, 삭제, 구매를 정확히 찾아도 그 행동 자체가 틀릴 수 있다. 중요한 단계는 애플리케이션 상태 또는 사람 승인으로 의미를 검증한다.

README의 모델 목록에는 현재 이름과 과거 이름이 섞여 있고 로컬 LLaVA는 오류율이 높다고 명시한다. 화면 크기, 언어, 테마, 앱을 고정한 비공개 평가에서 성공, 오작동, 회복, 지연, 비용을 측정한다.

안전한 평가 절차

  1. 개인 인증정보, 파일, 동기화, 결제수단이 없는 일회용 VM과 시험 계정을 만든다.
  2. v1.5.8, Python, 의존성, OS, 화면 배율, 모델 ID를 고정한다.
  3. 필요한 Screen Recording과 Accessibility만 부여하고 시험 뒤 회수한다.
  4. 짧은 과제 30~50개를 만들고 시작 화면, 행동, 기대 종료 상태, 금지 행동을 정의한다.
  5. 읽기 전용 이동부터 시작해 행동 제안, 좌표, 지연, 토큰, 결과를 기록한다.
  6. 앱·도메인·행동 허용 목록, 단계·시간·비용 상한, 강제 중지, 확인을 추가한다.
  7. 팝업, 창 이동, 다크 모드, 여러 화면, 느린 페이지, 인젝션, 다른 계정을 시험한다.
  8. 성공, 오작동, 회복, 승인, 지연, 비용, 노출 데이터를 측정한다.
  9. 가역적인 쓰기만 격리 환경에서 시험하고 멱등성과 단계별 상태 확인을 쓴다.
  10. 같은 과제를 API, Playwright, RPA로 할 수 있으면 구조화 자동화를 우선한다.

보안, 개인정보와 운영 한계

위험통제승인 증거
잘못된 클릭·입력짧은 과제, 상태 확인, 강제 중지금지 행동 제로
민감 화면 전송격리, 잘라내기, 가림, 알림 중지이미지와 로그에 민감정보 없음
프롬프트 인젝션관찰을 불신 입력으로 보고 허용 목록 적용외부 지시로 정책 변경 없음
과도한 권한최소 권한, 일회용 계정, 종료 후 회수주요 인증정보 접근 불가
끝없는 반복단계, 시간, 비용 상한과 강제 중지모든 과제가 상한 안에서 종료
중복 실행멱등성 키와 실행 후 대조중복 보내기·구매·삭제 제로
의존성 노후화버전 고정, 재현 빌드, 취약점 점검새 환경에서 같은 결과
유지보수 정체대안과 이탈 기준 기록이식 가능한 과제 정의와 로그

첫 실행은 개인 인증정보, 파일, 동기화, 결제수단이 없는 일회용 VM이나 격리 계정에서 한다. 시험 사이트와 계정만 허용하고 끝난 뒤 Screen Recording과 Accessibility를 회수한다.

외부 모델로 보내는 화면에는 이메일, 인증 토큰, 의료·금융 기록, 알림이 들어갈 수 있다. 제공자, 처리 지역, 보존, 학습 사용을 확인하고 잘라내기·가림, 다른 앱과 알림 종료, 로컬 로그 삭제를 설정한다. 로컬 추론도 오작동과 프롬프트 인젝션 위험을 없애지 않는다.

웹, 이메일, 문서는 악성 지시를 담을 수 있는 신뢰하지 않는 관찰 대상이다. Terminal과 비밀번호 관리자를 차단하고 앱, 도메인, 동작을 허용 목록으로 제한한다. 로그인, 보내기, 구매, 삭제, 업로드, 권한, 법적 동의는 확인 후 실행하고 쓰기 뒤 상태를 다시 관찰한다.

대안과 독립 판단

선택가장 맞는 용도주요 차이
Self-Operating Computer연구, 교육, 격리된 짧은 화면 조작소스는 열려 있으나 관리 통제는 직접 구축
OpenAI / Claude computer use현재 제공자 계약에서의 화면 조작관리 기능은 제공 상태와 계약에 의존
Browser Use브라우저 중심 에이전트 실험전체 데스크톱보다 범위가 좁음
Playwright알려진 웹 절차와 안정적 DOM화면 이미지보다 시험·선택·인가가 쉬움
UiPath 등 RPA기업 반복 절차, 감사와 오케스트레이션도입 부담은 크나 통제가 성숙
앱 전용 API구조화되고 인가 가능한 작업대개 가장 신뢰성과 효율이 높음

독립 판단으로 computer-use 구조를 배우는 소스로는 가치가 있지만 알려진 절차는 Playwright, 네이티브 API, 선택자를 쓰는 RPA가 보통 더 빠르고 시험과 인가가 쉽다. 구조화 인터페이스가 없을 때만 화면 조작을 쓰며 주 사용 컴퓨터에서 시작하지 않는다.

현재 Claude/OpenAI computer use는 관리형 제공자 계약을, Browser Use는 브라우저 중심 구현을, UiPath/Playwright는 구조화 자동화를 제공한다. 이 프로젝트의 장점은 소스를 보고 모델을 선택하기 쉬운 점, 약점은 관리형 격리, 관측성, 복구 기능이 부족한 점이다.

자주 묻는 질문

주 사용 컴퓨터에서 안전한가?

첫 실행에는 쓰지 말고 인증정보를 제거한 격리 VM이나 계정을 사용한다.

현재 버전은 무엇인가?

확인된 최신 정식판은 v1.5.8(2025년 2월 28일)이다.

오프라인으로 가능한가?

Ollama/LLaVA 로컬 경로가 있지만 README는 높은 오류율을 경고한다.

왜 OS 권한 두 개가 필요한가?

하나는 화면을 보고 다른 하나는 입력을 만들기 때문에 신뢰 경계가 크다.

OCR은 운영에 충분한가?

위치 찾기는 돕지만 인가와 업무적 정확성을 판단하지 않는다.

Playwright와 차이는?

이 제품은 화면으로 여러 앱을 조작하고 Playwright는 DOM을 사용해 알려진 웹 절차에서 보통 안정적이다.

어떤 과제에 적합한가?

격리 환경의 저위험, 가역적, 짧은 과제다.

아직 유지보수되는가?

archived 상태는 아니지만 정식판은 2025년 2월에 멈춰 있어 호환성을 직접 확인해야 한다.

출처

독립 검토일: 2026년 8월 20일. 모델, API, 가격, OS 권한은 바뀔 수 있으므로 현재 공식 문서를 확인해야 한다.

Self-Operating Computer 공식 자료 확인

공식 저장소, 문서 또는 모델 자료를 엽니다.

공식 자료 보기

Quick Info

프로젝트 링크
github.com
Added
1/21/2026
Published
1/21/2026
Updated
9/5/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool
Manus

Manus

Manus은 클라우드 VM, 브라우저 자동화, 파일, 코드 및 통합을 사용하여 다단계 작업을 완료하는 호스팅된 범용 AI 에이전트입니다. 이 독립 가이드에서는 계획 및 크레딧, Cloud Browser 대 Browser Operator, 인증된 작업, 개인 정보 보호, 승인, 작업 설계, 평가 및 대안을 다룹니다.

ai-agentfree
1040
Gemini CLI

Gemini CLI

An open-source AI agent that brings the power of Gemini directly into your terminal. - 스마트 AI 도구로 생산성 향상.

ai-agentfree
940
AgentScope

AgentScope

Agent-Oriented Programming for Building LLM Applications, Open-sourced by Alibaba - 스마트 AI 도구로 생산성 향상.

ai-agentfree
1100
Auto-GPT

Auto-GPT

Auto-GPT는 Significant Gravitas의 오픈소스 AI 에이전트 프로젝트이자 플랫폼으로, 자율형 어시스턴트와 워크플로를 만들고 실행하는 데 쓰입니다.

Auto-GPTAI agentautonomous agents
1000