Self-Operating Computer
Self-Operating Computer
KI-AgentActive

Self-Operating Computer

Self-Operating Computer ist ein MIT-lizenziertes Python-Framework für Desktopsteuerung per Screenshot, Maus und Tastatur. Die unabhängige Prüfung behandelt v1.5.8, Wartung, Berechtigungen, Sicherheit und Alternativen.

100

Views

0

Likes

Jan 2026

Added

github.com

Projektlink

Tags

Self-Operating Computercomputer usedesktop automationmultimodal agentOCRPyAutoGUI

Product Preview

A quick visual look at Self-Operating Computer before you visit the official site.

Published 1/21/2026
Self-Operating Computer screenshot

Editorial Review

About Self-Operating Computer

Self-Operating Computer im Test: ein einflussreiches Desktop-Experiment mit großer Vertrauensgrenze

Self-Operating Computer lässt ein multimodales Modell Screenshots betrachten und Maus- oder Tastaturaktionen wählen. Das Projekt erschien im November 2023 als frühes Beispiel allgemeiner Computersteuerung. Heute ist es eher Forschungs- und Entwicklerframework als fertiger Assistent, weil lokaler Code und ein Modell umfassenden Einblick in den Desktop und Eingaberechte erhalten.

Das letzte verifizierte Release ist v1.5.8 vom 28. Februar 2025. Das Repository ist nicht archiviert; der letzte geprüfte Commit vom September 2025 korrigierte einen README-Tippfehler. Das beweist weder Aufgabe noch schnelle Weiterentwicklung. Aktuelle OS-Rechte, Dependencies und Modellendpunkte müssen auf einer Wegwerfmaschine geprüft werden.

Laut README werden macOS, Windows und Linux mit X-Server unterstützt. Auf macOS fordert Terminal Screen Recording und Accessibility. Damit kann der Prozess sensible Pixel sehen und Systemeingaben erzeugen. Eine Demo beweist visuelles Grounding, nicht Isolation, Autorisierung, Audit oder Produktionsreife.

Self-Operating Computer im Test: ein einflussreiches Desktop-Experiment mit großer Vertrauensgrenze
Self-Operating Computer ist ein MIT-lizenziertes Python-Framework für Desktopsteuerung per Screenshot, Maus und Tastatur. Die unabhängige Prüfung behandelt v1.5.8, Wartung, Berechtigungen, Sicherheit und Alternativen.

Aktueller Projektstatus

SignalVerified stateDecision
Latest releasev1.5.8 · 2025-02-28Pin version and dependencies; test on current OS
Latest commitfac568e · 2025-09-19 · README typoLow recent feature signal; inspect open issues
ArchivedNoNot the same as a support SLA
LicenseMITModel APIs, websites and data have separate terms
ObservationScreenshots; OCR and Set-of-Mark modesPixels may contain credentials and private data
ActionMouse and keyboard through local OS automationCan click, type, submit, delete or send
Models named in READMEGPT-4o/4.1, o1, Gemini, Claude 3, Qwen-VL, LLaVASome names/instructions are historical; verify live APIs
PlatformsmacOS, Windows, Linux + X serverPermissions and coordinates differ

Wie der Loop arbeitet und scheitert

Der Loop erfasst den Bildschirm, ergänzt optional OCR-Koordinaten oder Set-of-Mark, lässt das Modell eine Aktion bestimmen, führt Click, Text oder Tastendruck aus und beobachtet erneut. Das funktioniert ohne App-API, ist aber empfindlich gegenüber Skalierung, Pop-ups, Animation, Fokus, Dark Mode und mehrdeutigen Symbolen.

OCR und SoM verbessern die Position, verstehen aber keine geschäftliche Bedeutung. Ein exakt getroffenes Send-, Delete- oder Buy-Element kann weiterhin falsch sein. Folgenreiche Schritte benötigen semantische Prüfung anhand des Anwendungszustands oder menschliche Freigabe, nicht nur Koordinatenvertrauen.

Die README mischt aktuelle und historische Modellnamen und warnt vor hoher Fehlerquote bei lokalem LLaVA. Bauen Sie ein privates Eval mit fixer Auflösung, Sprache, Theme und Anwendungen. Messen Sie Erfolg, falsche Aktionen, Recovery, Latenz, Kosten und Datenexposition; allgemeine Benchmarks ersetzen diesen Test nicht.

Sicherer Evaluationsablauf

  1. Wegwerf-VM/Testkonto ohne persönliche Daten anlegen.
  2. v1.5.8, Python, Dependencies, OS, Display und Modell pinnen.
  3. Nur nötige Screen-/Accessibility-Rechte geben und widerrufen.
  4. 30–50 kurze Tasks samt erlaubten/verbotenen Aktionen definieren.
  5. Read-only starten und Screenshot, Aktion, Koordinate, Latenz, Usage loggen.
  6. Allowlist, Schritt-/Zeit-/Kostenlimit, Kill Switch und Freigaben ergänzen.
  7. Pop-ups, Fensterwechsel, Dark Mode, Displays, Injection und falsches Konto testen.
  8. Erfolg, Falschaktionen, Recovery, Freigaben, Kosten und Daten messen.
  9. Nur reversible Writes im Sandbox mit Idempotenz testen.
  10. API, Playwright oder RPA bevorzugen, wenn möglich.

Sicherheit, Datenschutz und Produktion

RiskControlResidual issue
Wrong coordinateFixed resolution, re-observe, post-action checkUI can move after screenshot
Prompt injectionTreat pixels as data; allowlist apps/actionsModel may follow hostile text
Credential exposureTest account, no password manager, screenshot redactionPixels can reveal secrets
Irreversible actionHuman approval and reversible sandboxClicks can submit immediately
Runaway loopStep/time/token/cost caps + kill switchRetries amplify mistakes
Cross-app driftSingle-app focus and process/window verificationOS focus may change
Supply chainPin package/hash and inspect dependenciesLocal automation code has desktop privilege
Weak auditStore action proposal/result without hidden reasoningScreenshots still need retention controls

Starten Sie in einer VM oder einem separaten OS-Konto ohne persönliche Dateien, Browser-Sync, Passwortmanager, Cloud Drive, Developer Keys oder Zahlungsdaten. Erlauben Sie nur Testdomains und Testkonten. Accessibility ist keine granulare Autorisierung; Promptregeln sind nach Erteilung des OS-Rechts eine schwache Grenze.

Screenshots an Hosted Provider können E-Mails, Token, Gesundheits- oder Finanzdaten und Benachrichtigungen enthalten. Klären Sie Provider, Region, Retention und Training. Nutzen Sie Crop/Redaction, schließen Sie andere Apps und definieren Sie Löschung. Ein lokales Modell ändert den Netzwerkpfad, nicht das Aktionsrisiko.

Webseiten und Dokumente können Prompt Injection enthalten. Beobachteter Inhalt ist untrusted data. Terminal und Passwortmanager bleiben gesperrt; Apps, Domains und Aktionen werden erlaubt. Login, Versand, Kauf, Löschen, Upload, Permission und Rechtsannahme benötigen Bestätigung. Nach jedem Write wird der Zustand neu geprüft.

Alternativen und Urteil

AlternativeBest fitTrade-off
Self-Operating ComputerLearning and testing general desktop vision loopsOpen source/flexible; minimal production controls
Claude Computer UseCurrent Anthropic model/tool contract and reference implementationProvider dependency; still requires sandbox and approvals
OpenAI computer use / ChatGPT agentManaged current computer/browser capabilityHosted boundary and product limits
Browser UseOpen-source browser-focused agent workflowsLess suited to arbitrary native desktop apps
PlaywrightKnown web flows with DOM selectors and repeatable testsNot general visual desktop control
UiPath / enterprise RPAGoverned business automation, credentials and auditHigher setup/licensing; selectors still require maintenance
Native APIs / scriptsStable systems with supported interfacesMost reliable, but not available for every app

Urteil: Der Quellcode ist wertvoll zum Lernen von coordinate-based Computer Use. Für bekannte Abläufe sind Playwright, native APIs oder RPA-Selektoren schneller, testbarer und leichter zu autorisieren. Visuelle Steuerung gehört in Fälle ohne strukturierte Schnittstelle und mit kleinem Schadensradius.

Claude/OpenAI Computer Use liefern aktuelle Toolverträge, Browser Use fokussiert Browser, UiPath und Playwright strukturierte Automation. Self-Operating Computer bietet Quelloffenheit und Modellexperimente, aber wenig gemanagte Isolation, Observability und Recovery.

Häufige Fragen

Sicher auf dem Hauptrechner?

Nein; zuerst isolierte VM ohne Credentials.

Aktuelle Version?

Verifiziert: v1.5.8 vom 28.02.2025.

Offline möglich?

LLaVA/Ollama lokal, aber README warnt vor hoher Fehlerquote.

Warum die Rechte?

Sie erlauben Bildschirmbeobachtung und Systeminput.

OCR produktionsreif?

Es verbessert Position, nicht Autorisierung oder Bedeutung.

Unterschied zu Playwright?

Pixelsteuerung über Apps versus strukturierter DOM-Zugriff.

Geeignete Tasks?

Kurze, reversible, risikoarme Sandbox-Aufgaben.

Weiter gepflegt?

Nicht archiviert, aber letztes Release 2025-02; Kompatibilität selbst prüfen.

Quellen

Unabhängig geprüft am 20. August 2026. Modelle, APIs, Preise und OS-Berechtigungen ändern sich; prüfen Sie Live-Dokumentation.

Self-Operating Computer an der offiziellen Quelle prüfen

Öffnet Repository, Dokumentation oder Modellressourcen.

Offizielle Quelle öffnen

Quick Info

Projektlink
github.com
Category
KI-Agent
Added
1/21/2026
Published
1/21/2026
Updated
9/7/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool
Manus

Manus

Manus ist ein gehosteter Allzweck-KI-Agent, der Cloud-VMs, Browserautomatisierung, Dateien, Code und Integrationen nutzt, um mehrstufige Aufgaben auszuführen. Dieser unabhängige Leitfaden behandelt Pläne und Credits, Cloud Browser vs. Browser Operator, authentifizierte Aktionen, Datenschutz, Genehmigungen, Aufgabendesign, Bewertung und Alternativen.

ai-agentfree
1000
Gemini CLI

Gemini CLI

An open-source AI agent that brings the power of Gemini directly into your terminal. - Intelligentes KI-Tool für mehr Produktivität.

ai-agentfree
850
AgentScope

AgentScope

Agent-Oriented Programming for Building LLM Applications, Open-sourced by Alibaba - Intelligentes KI-Tool für mehr Produktivität.

ai-agentfree
930
Auto-GPT

Auto-GPT

Auto-GPT ist ein Open-Source-Agentenprojekt und eine Plattform von Significant Gravitas zum Erstellen und Ausführen autonomer KI-Assistenten.

Auto-GPTAI agentautonomous agents
800