Self-Operating Computer évalué : expérience influente avec une vaste frontière de confiance
Self-Operating Computer laisse un modèle multimodal observer des screenshots et choisir souris/clavier. Publié en novembre 2023, il fut un exemple précoce de computer use général. Aujourd’hui c’est surtout un framework de recherche : code local et modèle reçoivent une vue étendue du desktop et des droits d’input.
La dernière release vérifiée est v1.5.8 du 28 février 2025. Le repo n’est pas archived ; le dernier commit vérifié en septembre 2025 corrigeait un typo. Cela ne prouve ni abandon ni cadence active. Permissions OS, dépendances et endpoints doivent être retestés sur machine jetable.
README mentionne macOS, Windows et Linux avec X server. Sur macOS, Terminal demande Screen Recording et Accessibility : accès aux pixels sensibles et capacité d’input système. Une demo prouve le grounding, pas isolation, autorisation, audit ou production.
État actuel
| Signal | Verified state | Decision |
|---|---|---|
| Latest release | v1.5.8 · 2025-02-28 | Pin version and dependencies; test on current OS |
| Latest commit | fac568e · 2025-09-19 · README typo | Low recent feature signal; inspect open issues |
| Archived | No | Not the same as a support SLA |
| License | MIT | Model APIs, websites and data have separate terms |
| Observation | Screenshots; OCR and Set-of-Mark modes | Pixels may contain credentials and private data |
| Action | Mouse and keyboard through local OS automation | Can click, type, submit, delete or send |
| Models named in README | GPT-4o/4.1, o1, Gemini, Claude 3, Qwen-VL, LLaVA | Some names/instructions are historical; verify live APIs |
| Platforms | macOS, Windows, Linux + X server | Permissions and coordinates differ |
Fonctionnement et échecs du loop
Le loop capture l’écran, ajoute OCR/Set-of-Mark, demande une action au modèle, exécute click/type/keypress puis observe. Il évite les APIs d’app, mais resolution, scaling, pop-up, animation, focus, dark mode et icônes ambiguës déplacent la cible.
OCR et SoM améliorent la position sans comprendre le sens métier. Cliquer correctement Send, Delete ou Buy peut rester une mauvaise action. Toute conséquence exige validation sémantique par état applicatif ou human approval.
README mélange noms actuels/historiques et avertit du taux d’erreur élevé de LLaVA local. Créez une eval privée avec display, langue, theme et apps exacts. Mesurez succès, fausse action, recovery, latence, coût et exposition ; un benchmark général ne suffit pas.
Évaluation sûre
- Créer VM/compte test sans données personnelles.
- Épingler v1.5.8, Python, dépendances, OS, display et modèle.
- Donner seulement les permissions nécessaires puis révoquer.
- Définir 30–50 tâches et actions attendues/interdites.
- Commencer read-only et tracer screenshot, action, coordonnée, latence, usage.
- Ajouter allowlist, limites, kill switch et approvals.
- Tester pop-up, fenêtres, dark mode, écrans, injection et mauvais compte.
- Mesurer succès, fausse action, recovery, approvals, coût et données.
- Tester seulement writes réversibles sandbox avec idempotence.
- Préférer API, Playwright ou RPA si disponible.
Sécurité, confidentialité et production
| Risk | Control | Residual issue |
|---|---|---|
| Wrong coordinate | Fixed resolution, re-observe, post-action check | UI can move after screenshot |
| Prompt injection | Treat pixels as data; allowlist apps/actions | Model may follow hostile text |
| Credential exposure | Test account, no password manager, screenshot redaction | Pixels can reveal secrets |
| Irreversible action | Human approval and reversible sandbox | Clicks can submit immediately |
| Runaway loop | Step/time/token/cost caps + kill switch | Retries amplify mistakes |
| Cross-app drift | Single-app focus and process/window verification | OS focus may change |
| Supply chain | Pin package/hash and inspect dependencies | Local automation code has desktop privilege |
| Weak audit | Store action proposal/result without hidden reasoning | Screenshots still need retention controls |
Commencez dans VM/compte isolé sans fichiers personnels, browser sync, password manager, cloud drive, developer keys ou paiement. Limitez domaines/comptes test. Accessibility n’est pas une autorisation granulaire ; une règle de prompt reste faible après permission OS.
Les screenshots peuvent contenir emails, tokens, données médicales/financières et notifications. Définissez provider, région, retention, training ; crop/redact, fermez les apps et programmez suppression. Local change le réseau, pas le risque d’action.
Web, email et documents peuvent porter prompt injection. Ce sont des untrusted data. Interdisez terminal/password manager ; allowlist apps/domains/actions ; confirmez login, envoi, achat, suppression, upload, permission ou accord. Vérifiez state après chaque write.
Alternatives et verdict
| Alternative | Best fit | Trade-off |
|---|---|---|
| Self-Operating Computer | Learning and testing general desktop vision loops | Open source/flexible; minimal production controls |
| Claude Computer Use | Current Anthropic model/tool contract and reference implementation | Provider dependency; still requires sandbox and approvals |
| OpenAI computer use / ChatGPT agent | Managed current computer/browser capability | Hosted boundary and product limits |
| Browser Use | Open-source browser-focused agent workflows | Less suited to arbitrary native desktop apps |
| Playwright | Known web flows with DOM selectors and repeatable tests | Not general visual desktop control |
| UiPath / enterprise RPA | Governed business automation, credentials and audit | Higher setup/licensing; selectors still require maintenance |
| Native APIs / scripts | Stable systems with supported interfaces | Most reliable, but not available for every app |
Verdict : excellent pour apprendre le loop visuel, mais Playwright, APIs natives ou RPA conviennent mieux aux processus connus. Utilisez le visuel seulement sans interface structurée et avec blast radius inférieur à la valeur de la tâche.
Claude/OpenAI computer use fournissent des contrats actuels ; Browser Use vise browser ; UiPath/Playwright l’automation structurée. Le projet offre source flexibility, mais peu d’isolation, observability et recovery gérées.
Questions fréquentes
Sûr sur le PC principal ?
Non ; utiliser d’abord VM isolée sans credentials.
Version actuelle ?
v1.5.8 du 28-02-2025 vérifiée.
Hors ligne ?
LLaVA/Ollama local, mais README avertit d’erreurs élevées.
Pourquoi les permissions ?
Observer écran et produire input système.
OCR production ?
Améliore position, pas autorisation ou sens.
Face à Playwright ?
Pixels multi-apps contre DOM structuré.
Tâches adaptées ?
Courtes, réversibles, faible risque, sandbox.
Maintenu ?
Non archived, release 2025-02 ; valider compatibilité.
Sources
- Official repository
- Official README and installation
- Official releases
- Official commit history
- MIT license
- PyPI package
- OpenAI computer-using agent
- Anthropic computer-use documentation
- Browser Use documentation
- OSWorld benchmark
Revue indépendante : 20 août 2026. Modèles, APIs, prix et permissions changent ; vérifiez la documentation active.



