Self-Operating Computer
Self-Operating Computer
Agent IAActive

Self-Operating Computer

Self-Operating Computer est un framework Python MIT contrôlant le bureau par screenshots, souris et clavier. Cette revue analyse v1.5.8, maintenance, permissions, sécurité et alternatives.

89

Views

0

Likes

Jan 2026

Added

github.com

Lien du projet

Tags

Self-Operating Computercomputer usedesktop automationmultimodal agentOCRPyAutoGUI

Product Preview

A quick visual look at Self-Operating Computer before you visit the official site.

Published 1/21/2026
Self-Operating Computer screenshot

Editorial Review

About Self-Operating Computer

Self-Operating Computer évalué : expérience influente avec une vaste frontière de confiance

Self-Operating Computer laisse un modèle multimodal observer des screenshots et choisir souris/clavier. Publié en novembre 2023, il fut un exemple précoce de computer use général. Aujourd’hui c’est surtout un framework de recherche : code local et modèle reçoivent une vue étendue du desktop et des droits d’input.

La dernière release vérifiée est v1.5.8 du 28 février 2025. Le repo n’est pas archived ; le dernier commit vérifié en septembre 2025 corrigeait un typo. Cela ne prouve ni abandon ni cadence active. Permissions OS, dépendances et endpoints doivent être retestés sur machine jetable.

README mentionne macOS, Windows et Linux avec X server. Sur macOS, Terminal demande Screen Recording et Accessibility : accès aux pixels sensibles et capacité d’input système. Une demo prouve le grounding, pas isolation, autorisation, audit ou production.

Self-Operating Computer évalué : expérience influente avec une vaste frontière de confiance
Self-Operating Computer est un framework Python MIT contrôlant le bureau par screenshots, souris et clavier. Cette revue analyse v1.5.8, maintenance, permissions, sécurité et alternatives.

État actuel

SignalVerified stateDecision
Latest releasev1.5.8 · 2025-02-28Pin version and dependencies; test on current OS
Latest commitfac568e · 2025-09-19 · README typoLow recent feature signal; inspect open issues
ArchivedNoNot the same as a support SLA
LicenseMITModel APIs, websites and data have separate terms
ObservationScreenshots; OCR and Set-of-Mark modesPixels may contain credentials and private data
ActionMouse and keyboard through local OS automationCan click, type, submit, delete or send
Models named in READMEGPT-4o/4.1, o1, Gemini, Claude 3, Qwen-VL, LLaVASome names/instructions are historical; verify live APIs
PlatformsmacOS, Windows, Linux + X serverPermissions and coordinates differ

Fonctionnement et échecs du loop

Le loop capture l’écran, ajoute OCR/Set-of-Mark, demande une action au modèle, exécute click/type/keypress puis observe. Il évite les APIs d’app, mais resolution, scaling, pop-up, animation, focus, dark mode et icônes ambiguës déplacent la cible.

OCR et SoM améliorent la position sans comprendre le sens métier. Cliquer correctement Send, Delete ou Buy peut rester une mauvaise action. Toute conséquence exige validation sémantique par état applicatif ou human approval.

README mélange noms actuels/historiques et avertit du taux d’erreur élevé de LLaVA local. Créez une eval privée avec display, langue, theme et apps exacts. Mesurez succès, fausse action, recovery, latence, coût et exposition ; un benchmark général ne suffit pas.

Évaluation sûre

  1. Créer VM/compte test sans données personnelles.
  2. Épingler v1.5.8, Python, dépendances, OS, display et modèle.
  3. Donner seulement les permissions nécessaires puis révoquer.
  4. Définir 30–50 tâches et actions attendues/interdites.
  5. Commencer read-only et tracer screenshot, action, coordonnée, latence, usage.
  6. Ajouter allowlist, limites, kill switch et approvals.
  7. Tester pop-up, fenêtres, dark mode, écrans, injection et mauvais compte.
  8. Mesurer succès, fausse action, recovery, approvals, coût et données.
  9. Tester seulement writes réversibles sandbox avec idempotence.
  10. Préférer API, Playwright ou RPA si disponible.

Sécurité, confidentialité et production

RiskControlResidual issue
Wrong coordinateFixed resolution, re-observe, post-action checkUI can move after screenshot
Prompt injectionTreat pixels as data; allowlist apps/actionsModel may follow hostile text
Credential exposureTest account, no password manager, screenshot redactionPixels can reveal secrets
Irreversible actionHuman approval and reversible sandboxClicks can submit immediately
Runaway loopStep/time/token/cost caps + kill switchRetries amplify mistakes
Cross-app driftSingle-app focus and process/window verificationOS focus may change
Supply chainPin package/hash and inspect dependenciesLocal automation code has desktop privilege
Weak auditStore action proposal/result without hidden reasoningScreenshots still need retention controls

Commencez dans VM/compte isolé sans fichiers personnels, browser sync, password manager, cloud drive, developer keys ou paiement. Limitez domaines/comptes test. Accessibility n’est pas une autorisation granulaire ; une règle de prompt reste faible après permission OS.

Les screenshots peuvent contenir emails, tokens, données médicales/financières et notifications. Définissez provider, région, retention, training ; crop/redact, fermez les apps et programmez suppression. Local change le réseau, pas le risque d’action.

Web, email et documents peuvent porter prompt injection. Ce sont des untrusted data. Interdisez terminal/password manager ; allowlist apps/domains/actions ; confirmez login, envoi, achat, suppression, upload, permission ou accord. Vérifiez state après chaque write.

Alternatives et verdict

AlternativeBest fitTrade-off
Self-Operating ComputerLearning and testing general desktop vision loopsOpen source/flexible; minimal production controls
Claude Computer UseCurrent Anthropic model/tool contract and reference implementationProvider dependency; still requires sandbox and approvals
OpenAI computer use / ChatGPT agentManaged current computer/browser capabilityHosted boundary and product limits
Browser UseOpen-source browser-focused agent workflowsLess suited to arbitrary native desktop apps
PlaywrightKnown web flows with DOM selectors and repeatable testsNot general visual desktop control
UiPath / enterprise RPAGoverned business automation, credentials and auditHigher setup/licensing; selectors still require maintenance
Native APIs / scriptsStable systems with supported interfacesMost reliable, but not available for every app

Verdict : excellent pour apprendre le loop visuel, mais Playwright, APIs natives ou RPA conviennent mieux aux processus connus. Utilisez le visuel seulement sans interface structurée et avec blast radius inférieur à la valeur de la tâche.

Claude/OpenAI computer use fournissent des contrats actuels ; Browser Use vise browser ; UiPath/Playwright l’automation structurée. Le projet offre source flexibility, mais peu d’isolation, observability et recovery gérées.

Questions fréquentes

Sûr sur le PC principal ?

Non ; utiliser d’abord VM isolée sans credentials.

Version actuelle ?

v1.5.8 du 28-02-2025 vérifiée.

Hors ligne ?

LLaVA/Ollama local, mais README avertit d’erreurs élevées.

Pourquoi les permissions ?

Observer écran et produire input système.

OCR production ?

Améliore position, pas autorisation ou sens.

Face à Playwright ?

Pixels multi-apps contre DOM structuré.

Tâches adaptées ?

Courtes, réversibles, faible risque, sandbox.

Maintenu ?

Non archived, release 2025-02 ; valider compatibilité.

Sources

Revue indépendante : 20 août 2026. Modèles, APIs, prix et permissions changent ; vérifiez la documentation active.

Vérifier Self-Operating Computer à la source officielle

Ouvre le dépôt, la documentation ou les ressources du modèle.

Ouvrir la source officielle

Quick Info

Lien du projet
github.com
Category
Agent IA
Added
1/21/2026
Published
1/21/2026
Updated
9/2/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool
Manus

Manus

Manus est un agent d'IA à usage général hébergé qui utilise des machines virtuelles cloud, l'automatisation du navigateur, des fichiers, du code et des intégrations pour effectuer des tâches en plusieurs étapes. Ce guide indépendant couvre les plans et les crédits, Cloud Browser vs Browser Operator, les actions authentifiées, la confidentialité, les approbations, la conception des tâches, l'évaluation et les alternatives.

ai-agentfree
1140
Gemini CLI

Gemini CLI

An open-source AI agent that brings the power of Gemini directly into your terminal. - Outil IA intelligent pour améliorer votre productivité.

ai-agentfree
910
AgentScope

AgentScope

Agent-Oriented Programming for Building LLM Applications, Open-sourced by Alibaba - Outil IA intelligent pour améliorer votre productivité.

ai-agentfree
1020
Auto-GPT

Auto-GPT

Auto-GPT est un projet et une plateforme open source de Significant Gravitas pour créer et exécuter des assistants IA et workflows agentiques.

Auto-GPTAI agentautonomous agents
1020