Self-Operating Computer
Self-Operating Computer

Self-Operating Computer

Self-Operating Computer es un framework Python MIT para controlar escritorio con screenshots, ratón y teclado. Esta revisión analiza v1.5.8, mantenimiento, permisos, seguridad y alternativas.

91

Views

0

Likes

Jan 2026

Added

github.com

Enlace del proyecto

Tags

Self-Operating Computercomputer usedesktop automationmultimodal agentOCRPyAutoGUI

Product Preview

A quick visual look at Self-Operating Computer before you visit the official site.

Published 1/21/2026
Self-Operating Computer screenshot

Editorial Review

About Self-Operating Computer

Self-Operating Computer a examen: experimento influyente con una gran frontera de confianza

Self-Operating Computer permite que un modelo multimodal observe screenshots y elija acciones de ratón y teclado. Publicado en noviembre de 2023, fue un ejemplo temprano de computer use general. Hoy encaja mejor como framework de investigación: código local y modelo reciben una vista amplia del escritorio y capacidad de input.

La última release verificada es v1.5.8 del 28-02-2025. El repo no está archived; el último commit revisado, septiembre de 2025, corrigió un typo. No demuestra abandono ni desarrollo rápido. Permisos OS, dependencias y endpoints deben validarse ahora en una máquina desechable.

README indica macOS, Windows y Linux con X server. En macOS Terminal solicita Screen Recording y Accessibility: puede ver píxeles sensibles y producir input del sistema. Una demo demuestra grounding visual, no aislamiento, authorization, audit ni producción.

Self-Operating Computer a examen: experimento influyente con una gran frontera de confianza
Self-Operating Computer es un framework Python MIT para controlar escritorio con screenshots, ratón y teclado. Esta revisión analiza v1.5.8, mantenimiento, permisos, seguridad y alternativas.

Estado actual

SeñalVerified stateDecision
Latest releasev1.5.8 · 2025-02-28Pin version and dependencies; test on current OS
Latest commitfac568e · 2025-09-19 · README typoLow recent feature signal; inspect open issues
ArchivedNoNot the same as a support SLA
LicenseMITModel APIs, websites and data have separate terms
ObservationScreenshots; OCR and Set-of-Mark modesPixels may contain credentials and private data
ActionMouse and keyboard through local OS automationCan click, type, submit, delete or send
Models named in READMEGPT-4o/4.1, o1, Gemini, Claude 3, Qwen-VL, LLaVASome names/instructions are historical; verify live APIs
PlatformsmacOS, Windows, Linux + X serverPermissions and coordinates differ

Cómo funciona y falla el loop

El loop captura pantalla, añade OCR o Set-of-Mark, pide acción al modelo, ejecuta click/type/keypress y vuelve a observar. No necesita API de cada app, pero resolution, scaling, pop-ups, animation, focus, dark mode e iconos ambiguos desplazan objetivos.

OCR y SoM mejoran ubicación, no significado de negocio. Acertar Send, Delete o Buy puede seguir siendo incorrecto. Toda acción con consecuencias requiere validación semántica por estado de aplicación o human approval.

README mezcla modelos actuales e históricos y avisa error alto con LLaVA local. Construya eval privada con display, idioma, theme y apps exactos. Mida éxito, acción falsa, recuperación, latencia, coste y exposición; benchmarks genéricos no bastan.

Evaluación segura

  1. Crear VM/cuenta test sin datos personales.
  2. Fijar v1.5.8, Python, dependencias, OS, display y modelo.
  3. Dar solo permisos necesarios y revocarlos.
  4. Definir 30–50 tareas, acciones esperadas y prohibidas.
  5. Empezar read-only y registrar screenshot, acción, coordenada, latencia y uso.
  6. Añadir allowlist, límites, kill switch y approvals.
  7. Probar pop-ups, ventanas, dark mode, pantallas, injection y cuenta errónea.
  8. Medir éxito, falsas acciones, recovery, approvals, coste y datos.
  9. Solo writes reversibles en sandbox con idempotencia.
  10. Preferir API, Playwright o RPA cuando existan.

Seguridad, privacidad y producción

RiskControlResidual issue
Wrong coordinateFixed resolution, re-observe, post-action checkUI can move after screenshot
Prompt injectionTreat pixels as data; allowlist apps/actionsModel may follow hostile text
Credential exposureTest account, no password manager, screenshot redactionPixels can reveal secrets
Irreversible actionHuman approval and reversible sandboxClicks can submit immediately
Runaway loopStep/time/token/cost caps + kill switchRetries amplify mistakes
Cross-app driftSingle-app focus and process/window verificationOS focus may change
Supply chainPin package/hash and inspect dependenciesLocal automation code has desktop privilege
Weak auditStore action proposal/result without hidden reasoningScreenshots still need retention controls

Use VM o cuenta aislada sin archivos personales, browser sync, password manager, cloud drive, keys ni pagos. Limite dominios y cuentas test. Accessibility no es autorización granular; tras concederla, una regla de prompt es una frontera débil.

Screenshots pueden contener email, tokens, datos médicos/financieros y notificaciones. Documente provider, región, retention y training; recorte/redacte, cierre apps y defina borrado. Modelo local cambia red, no riesgo de acción.

Web, email y documentos pueden insertar prompt injection. Son untrusted data. Bloquee terminal/password manager; permita apps/domains/actions; exija confirmación para login, envío, compra, borrado, upload, permisos o acuerdos. Verifique state después de writes.

Alternativas y veredicto

AlternativeBest fitTrade-off
Self-Operating ComputerLearning and testing general desktop vision loopsOpen source/flexible; minimal production controls
Claude Computer UseCurrent Anthropic model/tool contract and reference implementationProvider dependency; still requires sandbox and approvals
OpenAI computer use / ChatGPT agentManaged current computer/browser capabilityHosted boundary and product limits
Browser UseOpen-source browser-focused agent workflowsLess suited to arbitrary native desktop apps
PlaywrightKnown web flows with DOM selectors and repeatable testsNot general visual desktop control
UiPath / enterprise RPAGoverned business automation, credentials and auditHigher setup/licensing; selectors still require maintenance
Native APIs / scriptsStable systems with supported interfacesMost reliable, but not available for every app

Veredicto: es excelente para aprender el loop visual, pero Playwright, native API o RPA son mejores para procesos conocidos. Use control visual solo sin interfaz estructurada y con blast radius menor que el valor de la tarea.

Claude/OpenAI computer use ofrecen contratos actuales; Browser Use se centra en browser; UiPath/Playwright en automatización estructurada. Este proyecto ofrece flexibilidad del source, pero poca isolation, observability y recovery gestionadas.

Preguntas frecuentes

¿Seguro en el PC principal?

No; use primero VM aislada sin credenciales.

¿Versión actual?

Verificada v1.5.8 del 28-02-2025.

¿Offline?

LLaVA/Ollama local, pero README advierte errores altos.

¿Por qué permisos?

Permiten observar pantalla y generar input.

¿OCR productivo?

Mejora posición, no authorization ni significado.

¿Frente a Playwright?

Píxeles entre apps frente a DOM estructurado.

¿Tareas adecuadas?

Cortas, reversibles y de bajo riesgo en sandbox.

¿Mantenido?

No archived, release 2025-02; validar compatibilidad.

Fuentes

Revisión independiente: 20 de agosto de 2026. Modelos, APIs, precios y permisos cambian; verifique documentación activa.

Revisar Self-Operating Computer en su fuente oficial

Abre el repositorio, la documentación o los recursos del modelo.

Abrir fuente oficial

Quick Info

Enlace del proyecto
github.com
Category
Agente de IA
Added
1/21/2026
Published
1/21/2026
Updated
9/7/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool
Manus

Manus

Manus es un agente de IA alojado de propósito general que utiliza máquinas virtuales en la nube, automatización del navegador, archivos, código e integraciones para completar tareas de varios pasos. Esta guía independiente cubre planes y créditos, Cloud Browser vs Browser Operator, acciones autenticadas, privacidad, aprobaciones, diseño de tareas, evaluación y alternativas.

ai-agentfree
1430
Gemini CLI

Gemini CLI

An open-source AI agent that brings the power of Gemini directly into your terminal. - Herramienta de IA inteligente para mejorar tu productividad.

ai-agentfree
1170
AgentScope

AgentScope

Agent-Oriented Programming for Building LLM Applications, Open-sourced by Alibaba - Herramienta de IA inteligente para mejorar tu productividad.

ai-agentfree
1340
Auto-GPT

Auto-GPT

Auto-GPT es un proyecto y plataforma open-source de Significant Gravitas para crear y ejecutar asistentes y flujos de agentes autónomos.

Auto-GPTAI agentautonomous agents
1130