Self-Operating Computer im Test: ein einflussreiches Desktop-Experiment mit großer Vertrauensgrenze
Self-Operating Computer lässt ein multimodales Modell Screenshots betrachten und Maus- oder Tastaturaktionen wählen. Das Projekt erschien im November 2023 als frühes Beispiel allgemeiner Computersteuerung. Heute ist es eher Forschungs- und Entwicklerframework als fertiger Assistent, weil lokaler Code und ein Modell umfassenden Einblick in den Desktop und Eingaberechte erhalten.
Das letzte verifizierte Release ist v1.5.8 vom 28. Februar 2025. Das Repository ist nicht archiviert; der letzte geprüfte Commit vom September 2025 korrigierte einen README-Tippfehler. Das beweist weder Aufgabe noch schnelle Weiterentwicklung. Aktuelle OS-Rechte, Dependencies und Modellendpunkte müssen auf einer Wegwerfmaschine geprüft werden.
Laut README werden macOS, Windows und Linux mit X-Server unterstützt. Auf macOS fordert Terminal Screen Recording und Accessibility. Damit kann der Prozess sensible Pixel sehen und Systemeingaben erzeugen. Eine Demo beweist visuelles Grounding, nicht Isolation, Autorisierung, Audit oder Produktionsreife.
Aktueller Projektstatus
| Signal | Verified state | Decision |
|---|---|---|
| Latest release | v1.5.8 · 2025-02-28 | Pin version and dependencies; test on current OS |
| Latest commit | fac568e · 2025-09-19 · README typo | Low recent feature signal; inspect open issues |
| Archived | No | Not the same as a support SLA |
| License | MIT | Model APIs, websites and data have separate terms |
| Observation | Screenshots; OCR and Set-of-Mark modes | Pixels may contain credentials and private data |
| Action | Mouse and keyboard through local OS automation | Can click, type, submit, delete or send |
| Models named in README | GPT-4o/4.1, o1, Gemini, Claude 3, Qwen-VL, LLaVA | Some names/instructions are historical; verify live APIs |
| Platforms | macOS, Windows, Linux + X server | Permissions and coordinates differ |
Wie der Loop arbeitet und scheitert
Der Loop erfasst den Bildschirm, ergänzt optional OCR-Koordinaten oder Set-of-Mark, lässt das Modell eine Aktion bestimmen, führt Click, Text oder Tastendruck aus und beobachtet erneut. Das funktioniert ohne App-API, ist aber empfindlich gegenüber Skalierung, Pop-ups, Animation, Fokus, Dark Mode und mehrdeutigen Symbolen.
OCR und SoM verbessern die Position, verstehen aber keine geschäftliche Bedeutung. Ein exakt getroffenes Send-, Delete- oder Buy-Element kann weiterhin falsch sein. Folgenreiche Schritte benötigen semantische Prüfung anhand des Anwendungszustands oder menschliche Freigabe, nicht nur Koordinatenvertrauen.
Die README mischt aktuelle und historische Modellnamen und warnt vor hoher Fehlerquote bei lokalem LLaVA. Bauen Sie ein privates Eval mit fixer Auflösung, Sprache, Theme und Anwendungen. Messen Sie Erfolg, falsche Aktionen, Recovery, Latenz, Kosten und Datenexposition; allgemeine Benchmarks ersetzen diesen Test nicht.
Sicherer Evaluationsablauf
- Wegwerf-VM/Testkonto ohne persönliche Daten anlegen.
- v1.5.8, Python, Dependencies, OS, Display und Modell pinnen.
- Nur nötige Screen-/Accessibility-Rechte geben und widerrufen.
- 30–50 kurze Tasks samt erlaubten/verbotenen Aktionen definieren.
- Read-only starten und Screenshot, Aktion, Koordinate, Latenz, Usage loggen.
- Allowlist, Schritt-/Zeit-/Kostenlimit, Kill Switch und Freigaben ergänzen.
- Pop-ups, Fensterwechsel, Dark Mode, Displays, Injection und falsches Konto testen.
- Erfolg, Falschaktionen, Recovery, Freigaben, Kosten und Daten messen.
- Nur reversible Writes im Sandbox mit Idempotenz testen.
- API, Playwright oder RPA bevorzugen, wenn möglich.
Sicherheit, Datenschutz und Produktion
| Risk | Control | Residual issue |
|---|---|---|
| Wrong coordinate | Fixed resolution, re-observe, post-action check | UI can move after screenshot |
| Prompt injection | Treat pixels as data; allowlist apps/actions | Model may follow hostile text |
| Credential exposure | Test account, no password manager, screenshot redaction | Pixels can reveal secrets |
| Irreversible action | Human approval and reversible sandbox | Clicks can submit immediately |
| Runaway loop | Step/time/token/cost caps + kill switch | Retries amplify mistakes |
| Cross-app drift | Single-app focus and process/window verification | OS focus may change |
| Supply chain | Pin package/hash and inspect dependencies | Local automation code has desktop privilege |
| Weak audit | Store action proposal/result without hidden reasoning | Screenshots still need retention controls |
Starten Sie in einer VM oder einem separaten OS-Konto ohne persönliche Dateien, Browser-Sync, Passwortmanager, Cloud Drive, Developer Keys oder Zahlungsdaten. Erlauben Sie nur Testdomains und Testkonten. Accessibility ist keine granulare Autorisierung; Promptregeln sind nach Erteilung des OS-Rechts eine schwache Grenze.
Screenshots an Hosted Provider können E-Mails, Token, Gesundheits- oder Finanzdaten und Benachrichtigungen enthalten. Klären Sie Provider, Region, Retention und Training. Nutzen Sie Crop/Redaction, schließen Sie andere Apps und definieren Sie Löschung. Ein lokales Modell ändert den Netzwerkpfad, nicht das Aktionsrisiko.
Webseiten und Dokumente können Prompt Injection enthalten. Beobachteter Inhalt ist untrusted data. Terminal und Passwortmanager bleiben gesperrt; Apps, Domains und Aktionen werden erlaubt. Login, Versand, Kauf, Löschen, Upload, Permission und Rechtsannahme benötigen Bestätigung. Nach jedem Write wird der Zustand neu geprüft.
Alternativen und Urteil
| Alternative | Best fit | Trade-off |
|---|---|---|
| Self-Operating Computer | Learning and testing general desktop vision loops | Open source/flexible; minimal production controls |
| Claude Computer Use | Current Anthropic model/tool contract and reference implementation | Provider dependency; still requires sandbox and approvals |
| OpenAI computer use / ChatGPT agent | Managed current computer/browser capability | Hosted boundary and product limits |
| Browser Use | Open-source browser-focused agent workflows | Less suited to arbitrary native desktop apps |
| Playwright | Known web flows with DOM selectors and repeatable tests | Not general visual desktop control |
| UiPath / enterprise RPA | Governed business automation, credentials and audit | Higher setup/licensing; selectors still require maintenance |
| Native APIs / scripts | Stable systems with supported interfaces | Most reliable, but not available for every app |
Urteil: Der Quellcode ist wertvoll zum Lernen von coordinate-based Computer Use. Für bekannte Abläufe sind Playwright, native APIs oder RPA-Selektoren schneller, testbarer und leichter zu autorisieren. Visuelle Steuerung gehört in Fälle ohne strukturierte Schnittstelle und mit kleinem Schadensradius.
Claude/OpenAI Computer Use liefern aktuelle Toolverträge, Browser Use fokussiert Browser, UiPath und Playwright strukturierte Automation. Self-Operating Computer bietet Quelloffenheit und Modellexperimente, aber wenig gemanagte Isolation, Observability und Recovery.
Häufige Fragen
Sicher auf dem Hauptrechner?
Nein; zuerst isolierte VM ohne Credentials.
Aktuelle Version?
Verifiziert: v1.5.8 vom 28.02.2025.
Offline möglich?
LLaVA/Ollama lokal, aber README warnt vor hoher Fehlerquote.
Warum die Rechte?
Sie erlauben Bildschirmbeobachtung und Systeminput.
OCR produktionsreif?
Es verbessert Position, nicht Autorisierung oder Bedeutung.
Unterschied zu Playwright?
Pixelsteuerung über Apps versus strukturierter DOM-Zugriff.
Geeignete Tasks?
Kurze, reversible, risikoarme Sandbox-Aufgaben.
Weiter gepflegt?
Nicht archiviert, aber letztes Release 2025-02; Kompatibilität selbst prüfen.
Quellen
- Official repository
- Official README and installation
- Official releases
- Official commit history
- MIT license
- PyPI package
- OpenAI computer-using agent
- Anthropic computer-use documentation
- Browser Use documentation
- OSWorld benchmark
Unabhängig geprüft am 20. August 2026. Modelle, APIs, Preise und OS-Berechtigungen ändern sich; prüfen Sie Live-Dokumentation.



