Open-LLM-VTuber
Open-LLM-VTuber
Active

Open-LLM-VTuber

Open-LLM-VTuber es una pila complementaria modular de IA multiplataforma que combina ASR, un LLM o agente, TTS, Live2D, interrupción de voz, visión, historial de chat, clientes web/de escritorio y operación local opcional. Esta guía cubre el estado, la arquitectura, la latencia, la seguridad, las licencias y la implementación de v1/v2.

114

Views

0

Likes

Jun 2026

Added

github.com

Website

Tags

avatar de IALive2Dcompanero de IA offlineinteraccion por vozcodigo abierto

Product Preview

A quick visual look at Open-LLM-VTuber before you visit the official site.

Published 6/2/2026
Open-LLM-VTuber screenshot

Editorial Review

About Open-LLM-VTuber

Open-LLM-VTuber es una capa de orquestación de código abierto para crear un personaje de IA interactivo por voz con un cuerpo Live2D. Combina reconocimiento de voz, un LLM o agente, texto a voz, control de expresión de avatar, interrupción de voz, visión de cámara o pantalla, registros de chat persistentes, clientes web y Electron, y un modo de mascota de escritorio opcional. Cada componente pesado puede ejecutarse localmente o ser reemplazado por una nube API, por lo que el proyecto se entiende mejor como una canalización de medios configurable en tiempo real que como un modelo único.

El sistema puede ejecutarse en Windows, macOS y Linux, con CPU, NVIDIA, AMD/ROCm, aceleración de Apple y combinaciones de servicios alojados según los módulos seleccionados. "Totalmente fuera de línea" se puede lograr solo cuando LLM, ASR, TTS, traducción, memoria y cualquier proveedor de herramientas o visión son todos locales y no se utilizan activos externos ni telemetría.

Official Open-LLM-VTuber interface showing a voice-interactive Live2D AI companion
Captura de pantalla oficial del proyecto. El avatar visible es la superficie final de una tubería de varias etapas; La calidad conversacional depende de cada módulo ascendente y de cómo se coordinan sus estados de latencia y falla.

Estado actual del proyecto: v1 hoy, v2 después

El repositorio oficial afirma que los mantenedores se están centrando en una reescritura completa de la versión 2.0, actualmente en fase inicial de discusión y planificación. Piden a los usuarios que no abran nuevas solicitudes de funciones v1, mientras continúan corrigiendo errores y trabajando con solicitudes de extracción existentes. Eso no hace que la versión 1 sea inutilizable, pero crea riesgos arquitectónicos y de migración para los equipos que crean un producto duradero.

La documentación actual cubre la implementación de v1.x. Las versiones anteriores a la v1.0.0 requieren una nueva implementación porque la configuración y las dependencias cambiaron; la guía actual recomienda ultravioleta y un clon recursivo de Git porque la interfaz es un submódulo. Fije una versión y configuración probadas en lugar de implementar la rama principal móvil.

Pregunta de estadoEvidencia actualAcción práctica
¿Está lista la versión 2 para producción?No; El archivo README oficial lo llama una reescritura temprana de discusión/planificación.No base las fechas de entrega en funciones v2 no enviadas
¿Se abandona la v1?La corrección de errores y el trabajo de relaciones públicas existente continúanUtilice una versión probada y supervise los problemas de seguridad/compatibilidad
¿Son compatibles las configuraciones antiguas?v1.0.0 introdujo importantes cambios en la implementación y en el archivo conf.yamlVuelva a implementar y migrar configuraciones en lugar de copiar un entorno antiguo a ciegas
¿Se incluye la memoria a largo plazo?El historial de chat persiste; La compatibilidad con Letta aparece en los documentos v1.2, mientras que README observa cambios en la memoriaVerifique la liberación/agente exacto y mida la latencia agregada
¿Se puede comercializar tal cual?El código del proyecto es MIT, los activos de muestra Live2D incluidos tienen términos separadosReemplazar o licenciar personajes, voces, música y otros activos

El canal de conversación en tiempo real

etapaEjemplos apoyados por el proyectoPuerta de calidad primaria
CapturarMicrófono, texto, cámara, captura de pantalla o pantalla compartidaConsentimiento del usuario, selección de dispositivo, eco/ruido y alcance de datos visuales
ASRsherpa-onnx, FunASR, faster-whisper, Whisper.cpp, Groq o AzureError de palabra, detección de final de turno y latencia de transmisión
Agente/LLMOllama, OpenAI compatible con APIs, Claude, Gemini, Mistral, DeepSeek, vLLM, GGUFAdhesión de la persona, factualidad, límites de herramientas y latencia del primer token
Memoria/herramientasHistorial de chat, interfaz de agente, integraciones compatibles con Letta/EVI y MCPRelevancia de recuperación, permisos, resistencia a la inyección y eliminación.
ttssherpa-onnx, Edge TTS, MeloTTS, GPT-SoVITS, CosyVoice, Fish Audio y otrosLatencia, inteligibilidad, derechos de voz e interrupción del primer audio
avatarLive2D expresiones, tacto, mascota de escritorio, visualización de pensamientos/accionesMapeo de emociones, sincronización de labios, velocidad de fotogramas y licencia de recursos
EntregaChrome interfaz de usuario web, cliente Electron, acceso local/remoto e integraciones de transmisiónHTTPS, autenticación, exposición de red y política de plataforma

Arquitectura de inicio rápido

La configuración inicial documentada utiliza Ollama para LLM, sherpa-onnx/SenseVoiceSmall para ASR y Edge TTS. Necesita Git, FFmpeg, Python 3.10–3.12 y las dependencias del proyecto. La guía oficial recomienda Chrome porque Edge y Safari tienen problemas conocidos. Se abre un servidor local en http://localhost:12393.

clon de git https://github.com/Open-LLM-VTuber/Open-LLM-VTuber --recursivo
disco compacto Open-LLM-VTuber
sincronización ultravioleta
cp config_templates/conf.default.yaml conf.yaml
# configurar LLM, ASR, TTS, carácter y credenciales
uv ejecutar run_server.py
# luego abra http://localhost:12393 en Chrome

No utilice el “Descargar ZIP” genérico de GitHub para esta arquitectura: la documentación del repositorio advierte que omite el submódulo de interfaz y los metadatos de Git que necesita el mecanismo de actualización. Utilice un archivo de lanzamiento previsto para el proyecto o un clon recursivo.

Cree un presupuesto de latencia antes de elegir modelos

Una interacción de voz natural se siente lenta mucho antes de que cualquiera de los componentes parezca desastroso. El tiempo de respuesta de un extremo a otro incluye detección de fin de turno, finalización de ASR, recuperación de contexto/memoria, primer token LLM, fragmentación de oraciones, primer audio TTS, transporte de red y almacenamiento en búfer de reproducción. Algunas etapas se superponen, pero los reintentos y las colas se acumulan.

MétricaMedir desdeDiagnóstico útil
Retraso al final del turnoEl usuario deja de hablar → ASR confirmaSepara la detección de silencio del cálculo de transcripción
Primer token de LLMTranscripción final enviada → primer token utilizableMuestra contexto, modelo, API y costo de memoria.
TTS primer audioTexto hablado listo → primera muestra audibleRevela opciones de inicio de síntesis y buffer.
Tiempo de interrupciónEl usuario comienza a hablar → el audio del avatar se detieneFundamental para la irrupción natural y el control del eco
Completar el turnoEl usuario se detiene → finaliza la respuesta final del avatarCaptura la experiencia completa y la verbosidad.
tiempo de recuperaciónFallo del proveedor/módulo → respaldo utilizableDetermina si una sesión en vivo sobrevive a los errores.

Marcas de tiempo del instrumento en los límites del módulo. Un modelo local más pequeño puede superar a un modelo de nube más grande después de la latencia de red y cola, mientras que un TTS en la nube puede reducir la contención informática. Pruebe combinaciones, no componentes de forma aislada.

Interrupción de voz sin bucles de retroalimentación

El proyecto anuncia la interrupción sin auriculares, por lo que el asistente no debe tratar su propio discurso como una entrada de un nuevo usuario. Este es un problema de audio exigente: la cancelación del eco acústico, la geometría del micrófono/altavoz, el volumen, la reverberación de la sala, la detección de actividad de voz ASR y el estado de reproducción TTS interactúan. Pruebe habitaciones silenciosas, parlantes de computadoras portátiles, parlantes externos, auriculares, música, parlantes superpuestos y palabras de activación repetidas.

Mida las interrupciones falsas, las interrupciones omitidas, la autotranscripción y el tiempo necesario para detener tanto el audio como la generación ascendente. Cancelar la reproducción mientras LLM y TTS continúan consumiendo recursos genera costos ocultos y mensajes obsoletos.

Límites de privacidad y seguridad

  • Mapee a cada proveedor. Un modelo Ollama local no desconecta el sistema si las herramientas Edge TTS, ASR en la nube, traducción, visión, Letta o MCP envían datos externamente.
  • Proteger la configuración. conf.yaml, las variables de entorno y los registros pueden contener API claves, URL de proveedores, contenido personal y transcripciones privadas.
  • Limite la captura de cámara y pantalla. Requiere un indicador activo obvio, selección granular, control de parada rápida y protección contra contraseñas, mensajes y datos de terceros.
  • No exponga el servidor directamente. El acceso al micrófono remoto necesita HTTPS; agregue autenticación, límites de proxy inverso y controles de firewall en lugar de solo TLS.
  • Trate el contenido como hostil. La voz, el texto en pantalla, los mensajes de chat, las páginas web y los resultados MCP pueden contener una inyección rápida.
  • Restringir herramientas. Utilice listas de permitidos, entornos sandbox y aprobación explícita antes de archivos, shell, navegador, mensajes externos o acciones de cuenta.
  • Proporcionar eliminación. Los usuarios deben localizar y borrar registros de chat, audio, capturas de pantalla, almacenes de memoria, cachés e historial del proveedor.

Persona, apego y moderación

Una voz encarnada y un carácter persistente pueden hacer que el resultado del modelo parezca más autoritario o emocionalmente recíproco que un cuadro de texto. Los productos deben revelar que el personaje es IA, evitar afirmar que tiene conciencia o dependencia exclusiva y establecer un lenguaje de escalada para temas médicos, legales, financieros y de crisis. Si la audiencia incluye menores, agregue un diseño apropiado para su edad, controles parentales y valores predeterminados de datos estrictos.

El habla proactiva necesita horas de silencio, límites de frecuencia y reglas de contexto. Los “pensamientos internos” son contenido de interfaz generado, no acceso al razonamiento oculto de un modelo, y nunca deben exponer indicaciones del sistema, secretos o cadenas de pensamiento privadas.

Lista de verificación de licencia

ActivoPosible propietario de la licenciaEvidencia a retener
Open-LLM-VTuber códigoColaboradores de proyectos bajo el MITAviso de licencia, revisión de fuente y modificaciones.
Muestras Live2D incluidasLive2D Inc. bajo términos separados de material/muestra gratuitaTérminos aplicables y elegibilidad comercial o prueba de eliminación
Arte/equipamiento de avatar personalizadoArtista, rigger, estudio o marcaDerechos comerciales, streaming, derivados, mercancías y territorios
VozActor, proveedor de modelos y titular de derechos de grabación.Consentimiento de clonación/síntesis, alcance del script y términos de revocación
Modelos LLM/ASR/TTSCada proveedor o editor de modelosLicencia de modelo exacto, política de uso aceptable y plan de implementación
Música/fondo/mediosCreadores y licenciantesPermiso de transmisión, plataforma y monetización.

Un piloto práctico

  1. Comience con el ingreso de texto, un LLM y un carácter; Verifique la persona y los registros antes de agregar voz.
  2. Agregue ASR y cree un conjunto de pruebas de 100 expresiones con acentos, ruido, nombres e interrupciones.
  3. Agregue TTS usando una voz que esté autorizado a sintetizar; medir primero el audio y la pronunciación.
  4. Configure expresiones a partir de etiquetas de emociones explícitas en lugar de fugas incontroladas.
  5. Agregue acceso a cámara/pantalla solo para una tarea definida, con consentimiento visible y pruebas de redacción.
  6. Habilite la memoria o las herramientas al final; inyección, eliminación, permiso y aislamiento entre sesiones del equipo rojo.
  7. Ejecute una prueba de remojo en vivo de dos horas y registre CPU/GPU/RAM, desconexiones, colas, eco y caídas de fotogramas de avatar.
  8. Congele una versión, configuración, lista de modelos, manifiesto de activos y procedimiento de recuperación.

Alternativas

EnfoqueMejor ajusteCompensación
Open-LLM-VTuberExperimentación abierta integrada de voz/avatar con backends intercambiablesConfiguración compleja, arquitectura en evolución y múltiples licencias
SillyTavern más extensiones de voz/avatarChat de personajes y amplias integraciones frontales.Más ensamblaje de extensión y calidad de medios variable en tiempo real
VTube Studio más servicio de agente personalizadoControl de calidad de transmisión Live2D con inteligencia personalizadaMás ingeniería pero una separación más clara de las capas de avatar e IA
Asistente solo de vozLa conversación importa pero un avatar aporta poco valorMenos presencia visual, complejidad de renderizado/licencia mucho menor
Plataforma de personajes gestionadaLanzamiento rápido y operaciones alojadasMenos control de backend, costos recurrentes y dependencia de datos/proveedores
Tubería WebRTC personalizadaProducto de producción que requiere latencia, seguridad y escala precisas.Máximo esfuerzo y control de implementación

Preguntas frecuentes

¿Se puede ejecutar todo sin conexión?

Sí, en principio, cuando cada componente LLM, ASR, TTS, traducción, memoria, visión y herramienta seleccionado es local. Audite la configuración real y el tráfico de red.

¿Está disponible la versión 2.0?

El repositorio oficial describe la v2 como una reescritura temprana de planificación/discusión. Los usuarios actuales deben evaluar el sistema v1.x documentado y el riesgo de migración.

¿Requiere una GPU?

No existe un mínimo absoluto de GPU porque los módulos pesados pueden usar APIs o CPU. Para un funcionamiento totalmente local con capacidad de respuesta, el proyecto recomienda un sistema Apple serie M o una GPU compatible y modelos más pequeños.

¿Qué navegador debo usar?

La guía de inicio rápido recomienda Chrome y señala problemas conocidos Edge/Safari. La captura de micrófono remoto requiere un contexto seguro como HTTPS o localhost.

¿Puedo utilizar comercialmente los modelos Live2D incluidos?

No lo asumas. Están excluidos de la licencia MIT del proyecto y se rigen por los términos de datos de muestra separados de Live2D, con posibles requisitos adicionales para uso comercial.

¿Recuerda conversaciones anteriores?

Los registros de chat persisten. La compatibilidad opcional con el agente de memoria depende de la versión y configuración exactas y puede agregar latencia; verificar el comportamiento en lugar de confiar en la lista general de características.

fuentes primarias

Última revisión el 25 de julio de 2026. El soporte del módulo y la arquitectura del proyecto cambian rápidamente; verifique la versión exacta, la configuración, los proveedores y las licencias de activos antes del uso en producción.

Ready to try Open-LLM-VTuber?

Visit the official website to get started

Visit Open-LLM-VTuber

Quick Info

Added
6/4/2026
Published
6/2/2026
Updated
9/1/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool