Open-LLM-VTuber es una capa de orquestación de código abierto para crear un personaje de IA interactivo por voz con un cuerpo Live2D. Combina reconocimiento de voz, un LLM o agente, texto a voz, control de expresión de avatar, interrupción de voz, visión de cámara o pantalla, registros de chat persistentes, clientes web y Electron, y un modo de mascota de escritorio opcional. Cada componente pesado puede ejecutarse localmente o ser reemplazado por una nube API, por lo que el proyecto se entiende mejor como una canalización de medios configurable en tiempo real que como un modelo único.
El sistema puede ejecutarse en Windows, macOS y Linux, con CPU, NVIDIA, AMD/ROCm, aceleración de Apple y combinaciones de servicios alojados según los módulos seleccionados. "Totalmente fuera de línea" se puede lograr solo cuando LLM, ASR, TTS, traducción, memoria y cualquier proveedor de herramientas o visión son todos locales y no se utilizan activos externos ni telemetría.
Estado actual del proyecto: v1 hoy, v2 después
El repositorio oficial afirma que los mantenedores se están centrando en una reescritura completa de la versión 2.0, actualmente en fase inicial de discusión y planificación. Piden a los usuarios que no abran nuevas solicitudes de funciones v1, mientras continúan corrigiendo errores y trabajando con solicitudes de extracción existentes. Eso no hace que la versión 1 sea inutilizable, pero crea riesgos arquitectónicos y de migración para los equipos que crean un producto duradero.
La documentación actual cubre la implementación de v1.x. Las versiones anteriores a la v1.0.0 requieren una nueva implementación porque la configuración y las dependencias cambiaron; la guía actual recomienda ultravioleta y un clon recursivo de Git porque la interfaz es un submódulo. Fije una versión y configuración probadas en lugar de implementar la rama principal móvil.
| Pregunta de estado | Evidencia actual | Acción práctica |
|---|---|---|
| ¿Está lista la versión 2 para producción? | No; El archivo README oficial lo llama una reescritura temprana de discusión/planificación. | No base las fechas de entrega en funciones v2 no enviadas |
| ¿Se abandona la v1? | La corrección de errores y el trabajo de relaciones públicas existente continúan | Utilice una versión probada y supervise los problemas de seguridad/compatibilidad |
| ¿Son compatibles las configuraciones antiguas? | v1.0.0 introdujo importantes cambios en la implementación y en el archivo conf.yaml | Vuelva a implementar y migrar configuraciones en lugar de copiar un entorno antiguo a ciegas |
| ¿Se incluye la memoria a largo plazo? | El historial de chat persiste; La compatibilidad con Letta aparece en los documentos v1.2, mientras que README observa cambios en la memoria | Verifique la liberación/agente exacto y mida la latencia agregada |
| ¿Se puede comercializar tal cual? | El código del proyecto es MIT, los activos de muestra Live2D incluidos tienen términos separados | Reemplazar o licenciar personajes, voces, música y otros activos |
El canal de conversación en tiempo real
| etapa | Ejemplos apoyados por el proyecto | Puerta de calidad primaria |
|---|---|---|
| Capturar | Micrófono, texto, cámara, captura de pantalla o pantalla compartida | Consentimiento del usuario, selección de dispositivo, eco/ruido y alcance de datos visuales |
| ASR | sherpa-onnx, FunASR, faster-whisper, Whisper.cpp, Groq o Azure | Error de palabra, detección de final de turno y latencia de transmisión |
| Agente/LLM | Ollama, OpenAI compatible con APIs, Claude, Gemini, Mistral, DeepSeek, vLLM, GGUF | Adhesión de la persona, factualidad, límites de herramientas y latencia del primer token |
| Memoria/herramientas | Historial de chat, interfaz de agente, integraciones compatibles con Letta/EVI y MCP | Relevancia de recuperación, permisos, resistencia a la inyección y eliminación. |
| tts | sherpa-onnx, Edge TTS, MeloTTS, GPT-SoVITS, CosyVoice, Fish Audio y otros | Latencia, inteligibilidad, derechos de voz e interrupción del primer audio |
| avatar | Live2D expresiones, tacto, mascota de escritorio, visualización de pensamientos/acciones | Mapeo de emociones, sincronización de labios, velocidad de fotogramas y licencia de recursos |
| Entrega | Chrome interfaz de usuario web, cliente Electron, acceso local/remoto e integraciones de transmisión | HTTPS, autenticación, exposición de red y política de plataforma |
Arquitectura de inicio rápido
La configuración inicial documentada utiliza Ollama para LLM, sherpa-onnx/SenseVoiceSmall para ASR y Edge TTS. Necesita Git, FFmpeg, Python 3.10–3.12 y las dependencias del proyecto. La guía oficial recomienda Chrome porque Edge y Safari tienen problemas conocidos. Se abre un servidor local en http://localhost:12393.
clon de git https://github.com/Open-LLM-VTuber/Open-LLM-VTuber --recursivo
disco compacto Open-LLM-VTuber
sincronización ultravioleta
cp config_templates/conf.default.yaml conf.yaml
# configurar LLM, ASR, TTS, carácter y credenciales
uv ejecutar run_server.py
# luego abra http://localhost:12393 en Chrome
No utilice el “Descargar ZIP” genérico de GitHub para esta arquitectura: la documentación del repositorio advierte que omite el submódulo de interfaz y los metadatos de Git que necesita el mecanismo de actualización. Utilice un archivo de lanzamiento previsto para el proyecto o un clon recursivo.
Cree un presupuesto de latencia antes de elegir modelos
Una interacción de voz natural se siente lenta mucho antes de que cualquiera de los componentes parezca desastroso. El tiempo de respuesta de un extremo a otro incluye detección de fin de turno, finalización de ASR, recuperación de contexto/memoria, primer token LLM, fragmentación de oraciones, primer audio TTS, transporte de red y almacenamiento en búfer de reproducción. Algunas etapas se superponen, pero los reintentos y las colas se acumulan.
| Métrica | Medir desde | Diagnóstico útil |
|---|---|---|
| Retraso al final del turno | El usuario deja de hablar → ASR confirma | Separa la detección de silencio del cálculo de transcripción |
| Primer token de LLM | Transcripción final enviada → primer token utilizable | Muestra contexto, modelo, API y costo de memoria. |
| TTS primer audio | Texto hablado listo → primera muestra audible | Revela opciones de inicio de síntesis y buffer. |
| Tiempo de interrupción | El usuario comienza a hablar → el audio del avatar se detiene | Fundamental para la irrupción natural y el control del eco |
| Completar el turno | El usuario se detiene → finaliza la respuesta final del avatar | Captura la experiencia completa y la verbosidad. |
| tiempo de recuperación | Fallo del proveedor/módulo → respaldo utilizable | Determina si una sesión en vivo sobrevive a los errores. |
Marcas de tiempo del instrumento en los límites del módulo. Un modelo local más pequeño puede superar a un modelo de nube más grande después de la latencia de red y cola, mientras que un TTS en la nube puede reducir la contención informática. Pruebe combinaciones, no componentes de forma aislada.
Interrupción de voz sin bucles de retroalimentación
El proyecto anuncia la interrupción sin auriculares, por lo que el asistente no debe tratar su propio discurso como una entrada de un nuevo usuario. Este es un problema de audio exigente: la cancelación del eco acústico, la geometría del micrófono/altavoz, el volumen, la reverberación de la sala, la detección de actividad de voz ASR y el estado de reproducción TTS interactúan. Pruebe habitaciones silenciosas, parlantes de computadoras portátiles, parlantes externos, auriculares, música, parlantes superpuestos y palabras de activación repetidas.
Mida las interrupciones falsas, las interrupciones omitidas, la autotranscripción y el tiempo necesario para detener tanto el audio como la generación ascendente. Cancelar la reproducción mientras LLM y TTS continúan consumiendo recursos genera costos ocultos y mensajes obsoletos.
Límites de privacidad y seguridad
- Mapee a cada proveedor. Un modelo Ollama local no desconecta el sistema si las herramientas Edge TTS, ASR en la nube, traducción, visión, Letta o MCP envían datos externamente.
- Proteger la configuración.
conf.yaml, las variables de entorno y los registros pueden contener API claves, URL de proveedores, contenido personal y transcripciones privadas. - Limite la captura de cámara y pantalla. Requiere un indicador activo obvio, selección granular, control de parada rápida y protección contra contraseñas, mensajes y datos de terceros.
- No exponga el servidor directamente. El acceso al micrófono remoto necesita HTTPS; agregue autenticación, límites de proxy inverso y controles de firewall en lugar de solo TLS.
- Trate el contenido como hostil. La voz, el texto en pantalla, los mensajes de chat, las páginas web y los resultados MCP pueden contener una inyección rápida.
- Restringir herramientas. Utilice listas de permitidos, entornos sandbox y aprobación explícita antes de archivos, shell, navegador, mensajes externos o acciones de cuenta.
- Proporcionar eliminación. Los usuarios deben localizar y borrar registros de chat, audio, capturas de pantalla, almacenes de memoria, cachés e historial del proveedor.
Persona, apego y moderación
Una voz encarnada y un carácter persistente pueden hacer que el resultado del modelo parezca más autoritario o emocionalmente recíproco que un cuadro de texto. Los productos deben revelar que el personaje es IA, evitar afirmar que tiene conciencia o dependencia exclusiva y establecer un lenguaje de escalada para temas médicos, legales, financieros y de crisis. Si la audiencia incluye menores, agregue un diseño apropiado para su edad, controles parentales y valores predeterminados de datos estrictos.
El habla proactiva necesita horas de silencio, límites de frecuencia y reglas de contexto. Los “pensamientos internos” son contenido de interfaz generado, no acceso al razonamiento oculto de un modelo, y nunca deben exponer indicaciones del sistema, secretos o cadenas de pensamiento privadas.
Lista de verificación de licencia
| Activo | Posible propietario de la licencia | Evidencia a retener |
|---|---|---|
| Open-LLM-VTuber código | Colaboradores de proyectos bajo el MIT | Aviso de licencia, revisión de fuente y modificaciones. |
| Muestras Live2D incluidas | Live2D Inc. bajo términos separados de material/muestra gratuita | Términos aplicables y elegibilidad comercial o prueba de eliminación |
| Arte/equipamiento de avatar personalizado | Artista, rigger, estudio o marca | Derechos comerciales, streaming, derivados, mercancías y territorios |
| Voz | Actor, proveedor de modelos y titular de derechos de grabación. | Consentimiento de clonación/síntesis, alcance del script y términos de revocación |
| Modelos LLM/ASR/TTS | Cada proveedor o editor de modelos | Licencia de modelo exacto, política de uso aceptable y plan de implementación |
| Música/fondo/medios | Creadores y licenciantes | Permiso de transmisión, plataforma y monetización. |
Un piloto práctico
- Comience con el ingreso de texto, un LLM y un carácter; Verifique la persona y los registros antes de agregar voz.
- Agregue ASR y cree un conjunto de pruebas de 100 expresiones con acentos, ruido, nombres e interrupciones.
- Agregue TTS usando una voz que esté autorizado a sintetizar; medir primero el audio y la pronunciación.
- Configure expresiones a partir de etiquetas de emociones explícitas en lugar de fugas incontroladas.
- Agregue acceso a cámara/pantalla solo para una tarea definida, con consentimiento visible y pruebas de redacción.
- Habilite la memoria o las herramientas al final; inyección, eliminación, permiso y aislamiento entre sesiones del equipo rojo.
- Ejecute una prueba de remojo en vivo de dos horas y registre CPU/GPU/RAM, desconexiones, colas, eco y caídas de fotogramas de avatar.
- Congele una versión, configuración, lista de modelos, manifiesto de activos y procedimiento de recuperación.
Alternativas
| Enfoque | Mejor ajuste | Compensación |
|---|---|---|
| Open-LLM-VTuber | Experimentación abierta integrada de voz/avatar con backends intercambiables | Configuración compleja, arquitectura en evolución y múltiples licencias |
| SillyTavern más extensiones de voz/avatar | Chat de personajes y amplias integraciones frontales. | Más ensamblaje de extensión y calidad de medios variable en tiempo real |
| VTube Studio más servicio de agente personalizado | Control de calidad de transmisión Live2D con inteligencia personalizada | Más ingeniería pero una separación más clara de las capas de avatar e IA |
| Asistente solo de voz | La conversación importa pero un avatar aporta poco valor | Menos presencia visual, complejidad de renderizado/licencia mucho menor |
| Plataforma de personajes gestionada | Lanzamiento rápido y operaciones alojadas | Menos control de backend, costos recurrentes y dependencia de datos/proveedores |
| Tubería WebRTC personalizada | Producto de producción que requiere latencia, seguridad y escala precisas. | Máximo esfuerzo y control de implementación |
Preguntas frecuentes
¿Se puede ejecutar todo sin conexión?
Sí, en principio, cuando cada componente LLM, ASR, TTS, traducción, memoria, visión y herramienta seleccionado es local. Audite la configuración real y el tráfico de red.
¿Está disponible la versión 2.0?
El repositorio oficial describe la v2 como una reescritura temprana de planificación/discusión. Los usuarios actuales deben evaluar el sistema v1.x documentado y el riesgo de migración.
¿Requiere una GPU?
No existe un mínimo absoluto de GPU porque los módulos pesados pueden usar APIs o CPU. Para un funcionamiento totalmente local con capacidad de respuesta, el proyecto recomienda un sistema Apple serie M o una GPU compatible y modelos más pequeños.
¿Qué navegador debo usar?
La guía de inicio rápido recomienda Chrome y señala problemas conocidos Edge/Safari. La captura de micrófono remoto requiere un contexto seguro como HTTPS o localhost.
¿Puedo utilizar comercialmente los modelos Live2D incluidos?
No lo asumas. Están excluidos de la licencia MIT del proyecto y se rigen por los términos de datos de muestra separados de Live2D, con posibles requisitos adicionales para uso comercial.
¿Recuerda conversaciones anteriores?
Los registros de chat persisten. La compatibilidad opcional con el agente de memoria depende de la versión y configuración exactas y puede agregar latencia; verificar el comportamiento en lugar de confiar en la lista general de características.
fuentes primarias
- Repositorio oficial, estado v1/v2 y matriz de características
- Guía oficial de inicio rápido e implementación
- Descripción general de la documentación oficial
- Licencia del proyecto MIT
- Aviso de licencia de activo incluido Live2D
- Requisitos de contexto seguro de MDN
- MCP mejores prácticas de seguridad para integraciones de herramientas
Última revisión el 25 de julio de 2026. El soporte del módulo y la arquitectura del proyecto cambian rápidamente; verifique la versión exacta, la configuración, los proveedores y las licencias de activos antes del uso en producción.
