Open-LLM-VTuber ist eine Open-Source-Orchestrierungsebene zum Erstellen eines sprachinteraktiven KI-Charakters mit einem Live2D-Körper. Es kombiniert Spracherkennung, einen LLM oder Agenten, Text-zu-Sprache, Avatar-Ausdruckskontrolle, Sprachunterbrechung, Kamera- oder Bildschirmsicht, dauerhafte Chatprotokolle, Web- und Electron-Clients sowie einen optionalen Desktop-Haustiermodus. Jede schwere Komponente kann lokal ausgeführt oder durch eine Cloud API ersetzt werden, sodass das Projekt besser als konfigurierbare Echtzeit-Medienpipeline und nicht als einzelnes Modell verstanden werden kann.
Das System kann unter Windows, macOS und Linux ausgeführt werden, mit Kombinationen aus CPU, NVIDIA, AMD/ROCm, Apple-Beschleunigung und gehosteten Diensten, abhängig von den ausgewählten Modulen. „Vollständig offline“ ist nur erreichbar, wenn LLM, ASR, TTS, Übersetzung, Speicher und alle Vision- oder Tool-Anbieter alle lokal sind und keine externen Ressourcen oder Telemetrie verwendet werden.
Aktueller Projektstatus: v1 heute, v2 später
Im offiziellen Repository heißt es, dass sich die Betreuer auf eine vollständige Neufassung der Version 2.0 konzentrieren, die sich derzeit in der frühen Diskussion und Planung befindet. Sie bitten Benutzer, keine neuen v1-Funktionsanfragen zu öffnen, während sie weiterhin Fehlerkorrekturen und bestehende Pull-Request-Arbeiten durchführen. Das macht Version 1 nicht unbrauchbar, birgt jedoch Architektur- und Migrationsrisiken für Teams, die ein langlebiges Produkt entwickeln.
Die aktuelle Dokumentation deckt die Bereitstellung von v1.x ab. Versionen vor v1.0.0 erfordern eine erneute Bereitstellung, da sich Konfiguration und Abhängigkeiten geändert haben. Aktuelle Leitlinien empfehlen UV und ein rekursiver Git-Klon, da das Frontend ein Submodul ist. Hängen Sie eine getestete Version und Konfiguration an, anstatt den verschobenen Hauptzweig bereitzustellen.
| Statusfrage | Aktuelle Beweise | Praktische Aktion |
|---|---|---|
| Ist v2 produktionsbereit? | Nein; Die offizielle README-Datei nennt es eine frühe Neufassung der Diskussion/Planung | Basieren Sie Liefertermine nicht auf nicht ausgelieferten v2-Funktionen |
| Ist v1 aufgegeben? | Fehlerbehebungen und bestehende PR-Arbeit werden fortgesetzt | Verwenden Sie eine getestete Version und überwachen Sie Sicherheits-/Kompatibilitätsprobleme |
| Sind alte Konfigurationen kompatibel? | v1.0.0 führte bahnbrechende Bereitstellungs- und conf.yaml-Änderungen ein | Stellen Sie Einstellungen erneut bereit und migrieren Sie sie, anstatt blind eine alte Umgebung zu kopieren |
| Ist das Langzeitgedächtnis enthalten? | Der Chatverlauf bleibt bestehen; Letta-Unterstützung erscheint in v1.2-Dokumenten, während README auf Speicheränderungen hinweist | Überprüfen Sie das genaue Release/den Agenten und messen Sie die zusätzliche Latenz |
| Kann es so wie es ist kommerzialisiert werden? | Der Projektcode lautet MIT, gebündelte Live2D-Beispielressourcen haben separate Bedingungen | Ersetzen oder lizenzieren Sie Charaktere, Stimmen, Musik und andere Assets |
Die Echtzeit-Konversationspipeline
| Bühne | Vom Projekt unterstützte Beispiele | Primäres Qualitätstor |
|---|---|---|
| Erfassen | Mikrofon, Text, Kamera, Screenshot oder Bildschirmfreigabe | Benutzereinwilligung, Geräteauswahl, Echo/Rauschen und visueller Datenumfang |
| ASR | sherpa-onnx, FunASR, faster-whisper, Whisper.cpp, Groq oder Azure | Wortfehler, End-of-Turn-Erkennung und Streaming-Latenz |
| Agent/LLM | Ollama, OpenAI-kompatible APIs, Claude, Gemini, Mistral, DeepSeek, vLLM, GGUF | Persona-Einhaltung, Faktizität, Tool-Grenzen und First-Token-Latenz |
| Speicher/Werkzeuge | Chatverlauf, Agentenschnittstelle, Letta/EVI- und MCP-kompatible Integrationen | Abrufrelevanz, Berechtigungen, Injektionsresistenz und Löschung |
| TTS | sherpa-onnx, Edge TTS, MeloTTS, GPT-SoVITS, CosyVoice, Fish Audio und andere | First-Audio-Latenz, Verständlichkeit, Stimmrechte und Unterbrechung |
| Avatar | Live2D Ausdrücke, Berührung, Desktop-Haustier, Anzeige von Gedanken/Aktionen | Emotion Mapping, Lippensynchronisation, Bildrate und Asset-Lizenz |
| Lieferung | Chrome Web-Benutzeroberfläche, Electron Client, lokaler/Remote-Zugriff und Streaming-Integrationen | HTTPS, Authentifizierung, Netzwerkexposition und Plattformrichtlinie |
Schnellstart-Architektur
Die dokumentierte Starterkonfiguration verwendet Ollama für das LLM, sherpa-onnx/SenseVoiceSmall für ASR und Edge TTS. Es benötigt Git, FFmpeg, Python 3.10–3.12 und die Projektabhängigkeiten. Der offizielle Leitfaden empfiehlt Chrome, da Edge und Safari bekannte Probleme aufweisen. Ein lokaler Server wird geöffnet unter http://localhost:12393.
Git-Klon https://github.com/Open-LLM-VTuber/Open-LLM-VTuber --rekursiv
cd Open-LLM-VTuber
UV-Synchronisierung
cp config_templates/conf.default.yaml conf.yaml
# LLM, ASR, TTS, Zeichen und Anmeldeinformationen konfigurieren
uv run_server.py ausführen
# dann öffnen Sie http://localhost:12393 in Chrome
Verwenden Sie für diese Architektur nicht das generische „Download ZIP“ von GitHub: In der Repository-Dokumentation wird gewarnt, dass darin das Frontend-Submodul und die Git-Metadaten fehlen, die für den Update-Mechanismus erforderlich sind. Verwenden Sie ein vom Projekt vorgesehenes Release-Archiv oder einen rekursiven Klon.
Erstellen Sie ein Latenzbudget, bevor Sie Modelle auswählen
Eine natürliche Sprachinteraktion fühlt sich langsam an, lange bevor eine einzelne Komponente katastrophal erscheint. Die End-to-End-Reaktionszeit umfasst End-of-Turn-Erkennung, ASR-Finalisierung, Kontext-/Speicherabruf, LLM-First-Token, Satz-Chunking, TTS-First-Audio, Netzwerktransport und Wiedergabepufferung. Einige Phasen überschneiden sich, aber Wiederholungsversuche und Warteschlangen verdichten sich.
| Metrisch | Messen Sie von | Nützliche Diagnose |
|---|---|---|
| Verzögerung am Ende der Runde | Der Benutzer hört auf zu sprechen → ASR-Commits | Trennt die Stilleerkennung von der Transkriptionsberechnung |
| LLM erster Token | Endgültiges Transkript gesendet → erster verwendbarer Token | Zeigt Kontext, Modell, API und Speicherkosten an |
| TTS erstes Audio | Sprechbarer Text bereit → erste Hörprobe | Zeigt Synthesestart- und Pufferoptionen an |
| Zeit für eine Unterbrechung | Der Benutzer beginnt zu sprechen → Avatar-Audio stoppt | Entscheidend für den natürlichen Einbruch und die Echokontrolle |
| Abschluss der Runde | Der Benutzer stoppt → die letzte Avatar-Antwort endet | Erfasst das gesamte Erlebnis und die Ausführlichkeit |
| Erholungszeit | Provider-/Modulausfall → nutzbarer Fallback | Bestimmt, ob eine Live-Sitzung Fehler übersteht |
Instrumentenzeitstempel an Modulgrenzen. Ein kleineres lokales Modell kann ein größeres Cloud-Modell nach Netzwerk- und Warteschlangenlatenz schlagen, während ein Cloud-TTS den Rechenkonflikt reduzieren kann. Testen Sie Kombinationen, nicht isolierte Komponenten.
Sprachunterbrechung ohne Rückkopplungsschleifen
Das Projekt wirbt mit Unterbrechungen ohne Kopfhörer, sodass der Assistent seine eigene Sprache nicht als neue Benutzereingabe behandeln sollte. Dies ist ein anspruchsvolles Audioproblem: akustische Echounterdrückung, Mikrofon-/Lautsprechergeometrie, Lautstärke, Raumhall, ASR-Sprachaktivitätserkennung und TTS-Wiedergabestatus interagieren alle. Testen Sie ruhige Räume, Laptop-Lautsprecher, externe Lautsprecher, Headsets, Musik, überlappende Lautsprecher und wiederholte Weckwörter.
Messen Sie falsche Unterbrechungen, verpasste Unterbrechungen, Selbsttranskription und die Zeit, die erforderlich ist, um sowohl Audio als auch die Upstream-Generierung zu stoppen. Das Abbrechen der Wiedergabe, während LLM und TTS weiterhin Ressourcen verbrauchen, führt zu versteckten Kosten und veralteten Nachrichten.
Datenschutz- und Sicherheitsgrenzen
- Ordnen Sie jeden Anbieter zu. Ein lokales Ollama-Modell macht das System nicht offline, wenn Edge TTS-, Cloud-ASR-, Übersetzungs-, Vision-, Letta- oder MCP-Tools Daten extern senden.
- Konfiguration schützen.
conf.yamlUmgebungsvariablen und Protokolle können API-Schlüssel, Anbieter-URLs, Persona-Inhalte und private Transkripte enthalten. - Beschränken Sie die Kamera- und Bildschirmaufnahme. Erfordern eine offensichtliche aktive Anzeige, granulare Auswahl, schnelle Stoppkontrolle und Schutz vor Passwörtern, Nachrichten und Daten Dritter.
- Stellen Sie den Server nicht direkt zur Verfügung. Für den Fernzugriff auf das Mikrofon ist HTTPS erforderlich. Fügen Sie Authentifizierung, Reverse-Proxy-Limits und Firewall-Kontrollen statt nur TLS hinzu.
- Behandeln Sie Inhalte als feindselig. Sprache, Bildschirmtext, Chat-Nachrichten, Webseiten und MCP-Ergebnisse können Prompt-Injection enthalten.
- Werkzeuge einschränken. Verwenden Sie Zulassungslisten, Sandboxen und explizite Genehmigungen vor Dateien, Shell, Browser, externen Nachrichten oder Kontoaktionen.
- Löschung bereitstellen. Benutzer müssen Chatprotokolle, Audio, Screenshots, Speicher, Caches und den Verlauf auf der Anbieterseite suchen und löschen.
Persona, Bindung und Moderation
Eine verkörperte Stimme und ein beharrlicher Charakter können dafür sorgen, dass die Modellausgabe maßgeblicher oder emotional reziproker wirkt als ein Textfeld. Produkte sollten offenlegen, dass es sich bei der Figur um eine KI handelt, den Anspruch auf Bewusstsein oder ausschließliche Abhängigkeit vermeiden und eine Eskalationssprache für medizinische, rechtliche, finanzielle und Krisenthemen festlegen. Wenn die Zielgruppe Minderjährige umfasst, fügen Sie altersgerechtes Design, Kindersicherung und strenge Datenstandards hinzu.
Proaktives Sprechen erfordert Ruhezeiten, Häufigkeitsbegrenzungen und Kontextregeln. „Innere Gedanken“ sind generierte Schnittstelleninhalte, kein Zugriff auf die verborgenen Argumente eines Modells und sollten niemals Systemaufforderungen, Geheimnisse oder private Gedankenketten preisgeben.
Lizenz-Checkliste
| Vermögenswert | Wahrscheinlicher Lizenzinhaber | Beweise, die es aufzubewahren gilt |
|---|---|---|
| Open-LLM-VTuber-Code | Projektmitarbeiter unter MIT | Lizenzhinweis, Quellrevision und Änderungen |
| Gebündelte Live2D Beispiele | Live2D Inc. unter separaten Bedingungen für kostenloses Material/Muster | Anwendbare Bedingungen und kommerzielle Berechtigung oder Nachweis der Entfernung |
| Benutzerdefinierte Avatar-Kunst/Rig | Künstler, Rigger, Studio oder Marke | Kommerzielle, Streaming-, Derivat-, Waren- und Gebietsrechte |
| Stimme | Schauspieler, Modelanbieter und Inhaber von Aufnahmerechten | Einwilligung zum Klonen/Synthese, Umfang des Skripts und Widerrufsbedingungen |
| LLM/ASR/TTS-Modelle | Jeder Anbieter bzw. Modellverlag | Genaue Modelllizenz, akzeptable Nutzungsrichtlinie und Bereitstellungsplan |
| Musik/Hintergrund/Medien | Urheber und Lizenzgeber | Sende-, Plattform- und Monetarisierungserlaubnis |
Ein praktischer Pilot
- Beginnen Sie mit der Texteingabe, einem LLM und einem Zeichen; Überprüfen Sie Persona und Protokolle, bevor Sie eine Stimme hinzufügen.
- Fügen Sie ASR hinzu und erstellen Sie einen Testsatz mit 100 Äußerungen mit Akzenten, Geräuschen, Namen und Unterbrechungen.
- Fügen Sie TTS mit einer Stimme hinzu, die Sie synthetisieren dürfen. Messen Sie zunächst Audio und Aussprache.
- Konfigurieren Sie Ausdrücke aus expliziten Emotions-Tags, anstatt unkontrollierte Eingabeaufforderungen zu verlieren.
- Fügen Sie Kamera-/Bildschirmzugriff nur für eine definierte Aufgabe hinzu, mit sichtbaren Zustimmungs- und Schwärzungstests.
- Speicher oder Tools zuletzt aktivieren; Red-Team-Injection, Löschung, Erlaubnis und sitzungsübergreifende Isolation.
- Führen Sie einen zweistündigen Live-Soak-Test durch und zeichnen Sie CPU/GPU/RAM, Verbindungsabbrüche, Warteschlangen, Echo und Avatar-Frame-Drops auf.
- Frieren Sie ein Release, eine Konfiguration, eine Modellliste, ein Asset-Manifest und ein Wiederherstellungsverfahren ein.
Alternativen
| Ansatz | Beste Passform | Kompromiss |
|---|---|---|
| Open-LLM-VTuber | Integrierte offene Sprach-/Avatar-Experimente mit austauschbaren Backends | Komplexes Setup, sich entwickelnde Architektur und mehrere Lizenzen |
| SillyTavern plus Sprach-/Avatar-Erweiterungen | Charakter-Chat und umfassende Frontend-Integrationen | Mehr Erweiterungsbaugruppe und unterschiedliche Echtzeit-Medienqualität |
| VTube Studio plus benutzerdefinierter Agentenservice | Live2D-Steuerung in Streaming-Qualität mit maßgeschneiderter Intelligenz | Mehr Technik, aber klarere Trennung von Avatar- und KI-Ebenen |
| Nur-Sprachassistent | Konversation ist wichtig, aber ein Avatar bietet wenig Mehrwert | Weniger visuelle Präsenz, viel geringere Rendering-/Lizenzierungskomplexität |
| Verwaltete Charakterplattform | Schneller Start und gehosteter Betrieb | Weniger Backend-Kontrolle, wiederkehrende Kosten und Daten-/Anbieterabhängigkeit |
| Benutzerdefinierte WebRTC-Pipeline | Produktionsprodukt, das präzise Latenz, Sicherheit und Skalierbarkeit erfordert | Höchster Implementierungsaufwand und Kontrolle |
Häufig gestellte Fragen
Kann alles offline laufen?
Im Prinzip ja, wenn alle ausgewählten LLM-, ASR-, TTS-, Übersetzungs-, Speicher-, Vision- und Tool-Komponenten lokal sind. Überwachen Sie die tatsächliche Konfiguration und den Netzwerkverkehr.
Ist v2.0 verfügbar?
Das offizielle Repository beschreibt Version 2 als eine frühe Neufassung der Planung/Diskussion. Aktuelle Benutzer sollten das dokumentierte v1.x-System- und Migrationsrisiko bewerten.
Ist eine GPU erforderlich?
Es gibt kein absolutes GPU-Minimum, da schwere Module APIs oder CPU verwenden können. Für einen reaktionsfähigen, vollständig lokalen Betrieb empfiehlt das Projekt ein System der Apple M-Serie oder unterstützte GPUs und kleinere Modelle.
Welchen Browser soll ich verwenden?
Die Kurzanleitung empfiehlt Chrome und weist auf bekannte Probleme mit Edge/Safari hin. Für die Remote-Mikrofonerfassung ist ein sicherer Kontext wie HTTPS oder Localhost erforderlich.
Kann ich die gebündelten Live2D-Modelle kommerziell nutzen?
Gehen Sie nicht davon aus. Sie sind von der MIT-Lizenz des Projekts ausgeschlossen und unterliegen den separaten Beispieldatenbedingungen von Live2D, wobei für die kommerzielle Nutzung zusätzliche Anforderungen möglich sind.
Erinnert es sich an frühere Gespräche?
Chat-Protokolle bleiben bestehen. Die optionale Unterstützung von Speicheragenten hängt von der genauen Version und Konfiguration ab und kann die Latenz erhöhen. Überprüfen Sie das Verhalten, anstatt sich auf die allgemeine Funktionsliste zu verlassen.
Primärquellen
- Offizielles Repository, v1/v2-Status und Funktionsmatrix
- Offizieller Schnellstart- und Bereitstellungsleitfaden
- Offizielle Dokumentationsübersicht
- Projekt-MIT-Lizenz
- Gebündelter Live2D Asset-Lizenzhinweis
- MDN-Sicherheitskontextanforderungen
- MCP Best Practices für die Sicherheit bei Tool-Integrationen
Zuletzt überprüft am 25. Juli 2026. Modulunterstützung und Projektarchitektur ändern sich schnell; Überprüfen Sie vor dem Produktionseinsatz die genaue Version, Konfiguration, Anbieter und Asset-Lizenzen.
