Self-Operating Computer a examen: experimento influyente con una gran frontera de confianza
Self-Operating Computer permite que un modelo multimodal observe screenshots y elija acciones de ratón y teclado. Publicado en noviembre de 2023, fue un ejemplo temprano de computer use general. Hoy encaja mejor como framework de investigación: código local y modelo reciben una vista amplia del escritorio y capacidad de input.
La última release verificada es v1.5.8 del 28-02-2025. El repo no está archived; el último commit revisado, septiembre de 2025, corrigió un typo. No demuestra abandono ni desarrollo rápido. Permisos OS, dependencias y endpoints deben validarse ahora en una máquina desechable.
README indica macOS, Windows y Linux con X server. En macOS Terminal solicita Screen Recording y Accessibility: puede ver píxeles sensibles y producir input del sistema. Una demo demuestra grounding visual, no aislamiento, authorization, audit ni producción.
Estado actual
| Señal | Verified state | Decision |
|---|---|---|
| Latest release | v1.5.8 · 2025-02-28 | Pin version and dependencies; test on current OS |
| Latest commit | fac568e · 2025-09-19 · README typo | Low recent feature signal; inspect open issues |
| Archived | No | Not the same as a support SLA |
| License | MIT | Model APIs, websites and data have separate terms |
| Observation | Screenshots; OCR and Set-of-Mark modes | Pixels may contain credentials and private data |
| Action | Mouse and keyboard through local OS automation | Can click, type, submit, delete or send |
| Models named in README | GPT-4o/4.1, o1, Gemini, Claude 3, Qwen-VL, LLaVA | Some names/instructions are historical; verify live APIs |
| Platforms | macOS, Windows, Linux + X server | Permissions and coordinates differ |
Cómo funciona y falla el loop
El loop captura pantalla, añade OCR o Set-of-Mark, pide acción al modelo, ejecuta click/type/keypress y vuelve a observar. No necesita API de cada app, pero resolution, scaling, pop-ups, animation, focus, dark mode e iconos ambiguos desplazan objetivos.
OCR y SoM mejoran ubicación, no significado de negocio. Acertar Send, Delete o Buy puede seguir siendo incorrecto. Toda acción con consecuencias requiere validación semántica por estado de aplicación o human approval.
README mezcla modelos actuales e históricos y avisa error alto con LLaVA local. Construya eval privada con display, idioma, theme y apps exactos. Mida éxito, acción falsa, recuperación, latencia, coste y exposición; benchmarks genéricos no bastan.
Evaluación segura
- Crear VM/cuenta test sin datos personales.
- Fijar v1.5.8, Python, dependencias, OS, display y modelo.
- Dar solo permisos necesarios y revocarlos.
- Definir 30–50 tareas, acciones esperadas y prohibidas.
- Empezar read-only y registrar screenshot, acción, coordenada, latencia y uso.
- Añadir allowlist, límites, kill switch y approvals.
- Probar pop-ups, ventanas, dark mode, pantallas, injection y cuenta errónea.
- Medir éxito, falsas acciones, recovery, approvals, coste y datos.
- Solo writes reversibles en sandbox con idempotencia.
- Preferir API, Playwright o RPA cuando existan.
Seguridad, privacidad y producción
| Risk | Control | Residual issue |
|---|---|---|
| Wrong coordinate | Fixed resolution, re-observe, post-action check | UI can move after screenshot |
| Prompt injection | Treat pixels as data; allowlist apps/actions | Model may follow hostile text |
| Credential exposure | Test account, no password manager, screenshot redaction | Pixels can reveal secrets |
| Irreversible action | Human approval and reversible sandbox | Clicks can submit immediately |
| Runaway loop | Step/time/token/cost caps + kill switch | Retries amplify mistakes |
| Cross-app drift | Single-app focus and process/window verification | OS focus may change |
| Supply chain | Pin package/hash and inspect dependencies | Local automation code has desktop privilege |
| Weak audit | Store action proposal/result without hidden reasoning | Screenshots still need retention controls |
Use VM o cuenta aislada sin archivos personales, browser sync, password manager, cloud drive, keys ni pagos. Limite dominios y cuentas test. Accessibility no es autorización granular; tras concederla, una regla de prompt es una frontera débil.
Screenshots pueden contener email, tokens, datos médicos/financieros y notificaciones. Documente provider, región, retention y training; recorte/redacte, cierre apps y defina borrado. Modelo local cambia red, no riesgo de acción.
Web, email y documentos pueden insertar prompt injection. Son untrusted data. Bloquee terminal/password manager; permita apps/domains/actions; exija confirmación para login, envío, compra, borrado, upload, permisos o acuerdos. Verifique state después de writes.
Alternativas y veredicto
| Alternative | Best fit | Trade-off |
|---|---|---|
| Self-Operating Computer | Learning and testing general desktop vision loops | Open source/flexible; minimal production controls |
| Claude Computer Use | Current Anthropic model/tool contract and reference implementation | Provider dependency; still requires sandbox and approvals |
| OpenAI computer use / ChatGPT agent | Managed current computer/browser capability | Hosted boundary and product limits |
| Browser Use | Open-source browser-focused agent workflows | Less suited to arbitrary native desktop apps |
| Playwright | Known web flows with DOM selectors and repeatable tests | Not general visual desktop control |
| UiPath / enterprise RPA | Governed business automation, credentials and audit | Higher setup/licensing; selectors still require maintenance |
| Native APIs / scripts | Stable systems with supported interfaces | Most reliable, but not available for every app |
Veredicto: es excelente para aprender el loop visual, pero Playwright, native API o RPA son mejores para procesos conocidos. Use control visual solo sin interfaz estructurada y con blast radius menor que el valor de la tarea.
Claude/OpenAI computer use ofrecen contratos actuales; Browser Use se centra en browser; UiPath/Playwright en automatización estructurada. Este proyecto ofrece flexibilidad del source, pero poca isolation, observability y recovery gestionadas.
Preguntas frecuentes
¿Seguro en el PC principal?
No; use primero VM aislada sin credenciales.
¿Versión actual?
Verificada v1.5.8 del 28-02-2025.
¿Offline?
LLaVA/Ollama local, pero README advierte errores altos.
¿Por qué permisos?
Permiten observar pantalla y generar input.
¿OCR productivo?
Mejora posición, no authorization ni significado.
¿Frente a Playwright?
Píxeles entre apps frente a DOM estructurado.
¿Tareas adecuadas?
Cortas, reversibles y de bajo riesgo en sandbox.
¿Mantenido?
No archived, release 2025-02; validar compatibilidad.
Fuentes
- Official repository
- Official README and installation
- Official releases
- Official commit history
- MIT license
- PyPI package
- OpenAI computer-using agent
- Anthropic computer-use documentation
- Browser Use documentation
- OSWorld benchmark
Revisión independiente: 20 de agosto de 2026. Modelos, APIs, precios y permisos cambian; verifique documentación activa.



