Open-LLM-VTuber
Open-LLM-VTuber
Active

Open-LLM-VTuber

Open-LLM-VTuber ist ein modularer, plattformübergreifender KI-Begleitstapel, der ASR, einen LLM oder Agenten, TTS, Live2D, Sprachunterbrechung, Vision, Chat-Verlauf, Web-/Desktop-Clients und optionalen lokalen Betrieb kombiniert. In diesem Leitfaden werden Status, Architektur, Latenz, Sicherheit, Lizenzierung und Bereitstellung von v1/v2 behandelt.

83

Views

0

Likes

Jun 2026

Added

github.com

Website

Tags

AI-AvatarLive2Doffline AI-BegleiterSprachinteraktionOpen Source

Product Preview

A quick visual look at Open-LLM-VTuber before you visit the official site.

Published 6/2/2026
Open-LLM-VTuber screenshot

Editorial Review

About Open-LLM-VTuber

Open-LLM-VTuber ist eine Open-Source-Orchestrierungsebene zum Erstellen eines sprachinteraktiven KI-Charakters mit einem Live2D-Körper. Es kombiniert Spracherkennung, einen LLM oder Agenten, Text-zu-Sprache, Avatar-Ausdruckskontrolle, Sprachunterbrechung, Kamera- oder Bildschirmsicht, dauerhafte Chatprotokolle, Web- und Electron-Clients sowie einen optionalen Desktop-Haustiermodus. Jede schwere Komponente kann lokal ausgeführt oder durch eine Cloud API ersetzt werden, sodass das Projekt besser als konfigurierbare Echtzeit-Medienpipeline und nicht als einzelnes Modell verstanden werden kann.

Das System kann unter Windows, macOS und Linux ausgeführt werden, mit Kombinationen aus CPU, NVIDIA, AMD/ROCm, Apple-Beschleunigung und gehosteten Diensten, abhängig von den ausgewählten Modulen. „Vollständig offline“ ist nur erreichbar, wenn LLM, ASR, TTS, Übersetzung, Speicher und alle Vision- oder Tool-Anbieter alle lokal sind und keine externen Ressourcen oder Telemetrie verwendet werden.

Official Open-LLM-VTuber interface showing a voice-interactive Live2D AI companion
Offizieller Projekt-Screenshot. Der sichtbare Avatar ist die letzte Oberfläche einer mehrstufigen Pipeline; Die Konversationsqualität hängt von jedem Upstream-Modul ab und davon, wie deren Latenz- und Fehlerzustände koordiniert werden.

Aktueller Projektstatus: v1 heute, v2 später

Im offiziellen Repository heißt es, dass sich die Betreuer auf eine vollständige Neufassung der Version 2.0 konzentrieren, die sich derzeit in der frühen Diskussion und Planung befindet. Sie bitten Benutzer, keine neuen v1-Funktionsanfragen zu öffnen, während sie weiterhin Fehlerkorrekturen und bestehende Pull-Request-Arbeiten durchführen. Das macht Version 1 nicht unbrauchbar, birgt jedoch Architektur- und Migrationsrisiken für Teams, die ein langlebiges Produkt entwickeln.

Die aktuelle Dokumentation deckt die Bereitstellung von v1.x ab. Versionen vor v1.0.0 erfordern eine erneute Bereitstellung, da sich Konfiguration und Abhängigkeiten geändert haben. Aktuelle Leitlinien empfehlen UV und ein rekursiver Git-Klon, da das Frontend ein Submodul ist. Hängen Sie eine getestete Version und Konfiguration an, anstatt den verschobenen Hauptzweig bereitzustellen.

StatusfrageAktuelle BeweisePraktische Aktion
Ist v2 produktionsbereit?Nein; Die offizielle README-Datei nennt es eine frühe Neufassung der Diskussion/PlanungBasieren Sie Liefertermine nicht auf nicht ausgelieferten v2-Funktionen
Ist v1 aufgegeben?Fehlerbehebungen und bestehende PR-Arbeit werden fortgesetztVerwenden Sie eine getestete Version und überwachen Sie Sicherheits-/Kompatibilitätsprobleme
Sind alte Konfigurationen kompatibel?v1.0.0 führte bahnbrechende Bereitstellungs- und conf.yaml-Änderungen einStellen Sie Einstellungen erneut bereit und migrieren Sie sie, anstatt blind eine alte Umgebung zu kopieren
Ist das Langzeitgedächtnis enthalten?Der Chatverlauf bleibt bestehen; Letta-Unterstützung erscheint in v1.2-Dokumenten, während README auf Speicheränderungen hinweistÜberprüfen Sie das genaue Release/den Agenten und messen Sie die zusätzliche Latenz
Kann es so wie es ist kommerzialisiert werden?Der Projektcode lautet MIT, gebündelte Live2D-Beispielressourcen haben separate BedingungenErsetzen oder lizenzieren Sie Charaktere, Stimmen, Musik und andere Assets

Die Echtzeit-Konversationspipeline

BühneVom Projekt unterstützte BeispielePrimäres Qualitätstor
ErfassenMikrofon, Text, Kamera, Screenshot oder BildschirmfreigabeBenutzereinwilligung, Geräteauswahl, Echo/Rauschen und visueller Datenumfang
ASRsherpa-onnx, FunASR, faster-whisper, Whisper.cpp, Groq oder AzureWortfehler, End-of-Turn-Erkennung und Streaming-Latenz
Agent/LLMOllama, OpenAI-kompatible APIs, Claude, Gemini, Mistral, DeepSeek, vLLM, GGUFPersona-Einhaltung, Faktizität, Tool-Grenzen und First-Token-Latenz
Speicher/WerkzeugeChatverlauf, Agentenschnittstelle, Letta/EVI- und MCP-kompatible IntegrationenAbrufrelevanz, Berechtigungen, Injektionsresistenz und Löschung
TTSsherpa-onnx, Edge TTS, MeloTTS, GPT-SoVITS, CosyVoice, Fish Audio und andereFirst-Audio-Latenz, Verständlichkeit, Stimmrechte und Unterbrechung
AvatarLive2D Ausdrücke, Berührung, Desktop-Haustier, Anzeige von Gedanken/AktionenEmotion Mapping, Lippensynchronisation, Bildrate und Asset-Lizenz
LieferungChrome Web-Benutzeroberfläche, Electron Client, lokaler/Remote-Zugriff und Streaming-IntegrationenHTTPS, Authentifizierung, Netzwerkexposition und Plattformrichtlinie

Schnellstart-Architektur

Die dokumentierte Starterkonfiguration verwendet Ollama für das LLM, sherpa-onnx/SenseVoiceSmall für ASR und Edge TTS. Es benötigt Git, FFmpeg, Python 3.10–3.12 und die Projektabhängigkeiten. Der offizielle Leitfaden empfiehlt Chrome, da Edge und Safari bekannte Probleme aufweisen. Ein lokaler Server wird geöffnet unter http://localhost:12393.

Git-Klon https://github.com/Open-LLM-VTuber/Open-LLM-VTuber --rekursiv
cd Open-LLM-VTuber
UV-Synchronisierung
cp config_templates/conf.default.yaml conf.yaml
# LLM, ASR, TTS, Zeichen und Anmeldeinformationen konfigurieren
uv run_server.py ausführen
# dann öffnen Sie http://localhost:12393 in Chrome

Verwenden Sie für diese Architektur nicht das generische „Download ZIP“ von GitHub: In der Repository-Dokumentation wird gewarnt, dass darin das Frontend-Submodul und die Git-Metadaten fehlen, die für den Update-Mechanismus erforderlich sind. Verwenden Sie ein vom Projekt vorgesehenes Release-Archiv oder einen rekursiven Klon.

Erstellen Sie ein Latenzbudget, bevor Sie Modelle auswählen

Eine natürliche Sprachinteraktion fühlt sich langsam an, lange bevor eine einzelne Komponente katastrophal erscheint. Die End-to-End-Reaktionszeit umfasst End-of-Turn-Erkennung, ASR-Finalisierung, Kontext-/Speicherabruf, LLM-First-Token, Satz-Chunking, TTS-First-Audio, Netzwerktransport und Wiedergabepufferung. Einige Phasen überschneiden sich, aber Wiederholungsversuche und Warteschlangen verdichten sich.

MetrischMessen Sie vonNützliche Diagnose
Verzögerung am Ende der RundeDer Benutzer hört auf zu sprechen → ASR-CommitsTrennt die Stilleerkennung von der Transkriptionsberechnung
LLM erster TokenEndgültiges Transkript gesendet → erster verwendbarer TokenZeigt Kontext, Modell, API und Speicherkosten an
TTS erstes AudioSprechbarer Text bereit → erste HörprobeZeigt Synthesestart- und Pufferoptionen an
Zeit für eine UnterbrechungDer Benutzer beginnt zu sprechen → Avatar-Audio stopptEntscheidend für den natürlichen Einbruch und die Echokontrolle
Abschluss der RundeDer Benutzer stoppt → die letzte Avatar-Antwort endetErfasst das gesamte Erlebnis und die Ausführlichkeit
ErholungszeitProvider-/Modulausfall → nutzbarer FallbackBestimmt, ob eine Live-Sitzung Fehler übersteht

Instrumentenzeitstempel an Modulgrenzen. Ein kleineres lokales Modell kann ein größeres Cloud-Modell nach Netzwerk- und Warteschlangenlatenz schlagen, während ein Cloud-TTS den Rechenkonflikt reduzieren kann. Testen Sie Kombinationen, nicht isolierte Komponenten.

Sprachunterbrechung ohne Rückkopplungsschleifen

Das Projekt wirbt mit Unterbrechungen ohne Kopfhörer, sodass der Assistent seine eigene Sprache nicht als neue Benutzereingabe behandeln sollte. Dies ist ein anspruchsvolles Audioproblem: akustische Echounterdrückung, Mikrofon-/Lautsprechergeometrie, Lautstärke, Raumhall, ASR-Sprachaktivitätserkennung und TTS-Wiedergabestatus interagieren alle. Testen Sie ruhige Räume, Laptop-Lautsprecher, externe Lautsprecher, Headsets, Musik, überlappende Lautsprecher und wiederholte Weckwörter.

Messen Sie falsche Unterbrechungen, verpasste Unterbrechungen, Selbsttranskription und die Zeit, die erforderlich ist, um sowohl Audio als auch die Upstream-Generierung zu stoppen. Das Abbrechen der Wiedergabe, während LLM und TTS weiterhin Ressourcen verbrauchen, führt zu versteckten Kosten und veralteten Nachrichten.

Datenschutz- und Sicherheitsgrenzen

  • Ordnen Sie jeden Anbieter zu. Ein lokales Ollama-Modell macht das System nicht offline, wenn Edge TTS-, Cloud-ASR-, Übersetzungs-, Vision-, Letta- oder MCP-Tools Daten extern senden.
  • Konfiguration schützen. conf.yamlUmgebungsvariablen und Protokolle können API-Schlüssel, Anbieter-URLs, Persona-Inhalte und private Transkripte enthalten.
  • Beschränken Sie die Kamera- und Bildschirmaufnahme. Erfordern eine offensichtliche aktive Anzeige, granulare Auswahl, schnelle Stoppkontrolle und Schutz vor Passwörtern, Nachrichten und Daten Dritter.
  • Stellen Sie den Server nicht direkt zur Verfügung. Für den Fernzugriff auf das Mikrofon ist HTTPS erforderlich. Fügen Sie Authentifizierung, Reverse-Proxy-Limits und Firewall-Kontrollen statt nur TLS hinzu.
  • Behandeln Sie Inhalte als feindselig. Sprache, Bildschirmtext, Chat-Nachrichten, Webseiten und MCP-Ergebnisse können Prompt-Injection enthalten.
  • Werkzeuge einschränken. Verwenden Sie Zulassungslisten, Sandboxen und explizite Genehmigungen vor Dateien, Shell, Browser, externen Nachrichten oder Kontoaktionen.
  • Löschung bereitstellen. Benutzer müssen Chatprotokolle, Audio, Screenshots, Speicher, Caches und den Verlauf auf der Anbieterseite suchen und löschen.

Persona, Bindung und Moderation

Eine verkörperte Stimme und ein beharrlicher Charakter können dafür sorgen, dass die Modellausgabe maßgeblicher oder emotional reziproker wirkt als ein Textfeld. Produkte sollten offenlegen, dass es sich bei der Figur um eine KI handelt, den Anspruch auf Bewusstsein oder ausschließliche Abhängigkeit vermeiden und eine Eskalationssprache für medizinische, rechtliche, finanzielle und Krisenthemen festlegen. Wenn die Zielgruppe Minderjährige umfasst, fügen Sie altersgerechtes Design, Kindersicherung und strenge Datenstandards hinzu.

Proaktives Sprechen erfordert Ruhezeiten, Häufigkeitsbegrenzungen und Kontextregeln. „Innere Gedanken“ sind generierte Schnittstelleninhalte, kein Zugriff auf die verborgenen Argumente eines Modells und sollten niemals Systemaufforderungen, Geheimnisse oder private Gedankenketten preisgeben.

Lizenz-Checkliste

VermögenswertWahrscheinlicher LizenzinhaberBeweise, die es aufzubewahren gilt
Open-LLM-VTuber-CodeProjektmitarbeiter unter MITLizenzhinweis, Quellrevision und Änderungen
Gebündelte Live2D BeispieleLive2D Inc. unter separaten Bedingungen für kostenloses Material/MusterAnwendbare Bedingungen und kommerzielle Berechtigung oder Nachweis der Entfernung
Benutzerdefinierte Avatar-Kunst/RigKünstler, Rigger, Studio oder MarkeKommerzielle, Streaming-, Derivat-, Waren- und Gebietsrechte
StimmeSchauspieler, Modelanbieter und Inhaber von AufnahmerechtenEinwilligung zum Klonen/Synthese, Umfang des Skripts und Widerrufsbedingungen
LLM/ASR/TTS-ModelleJeder Anbieter bzw. ModellverlagGenaue Modelllizenz, akzeptable Nutzungsrichtlinie und Bereitstellungsplan
Musik/Hintergrund/MedienUrheber und LizenzgeberSende-, Plattform- und Monetarisierungserlaubnis

Ein praktischer Pilot

  1. Beginnen Sie mit der Texteingabe, einem LLM und einem Zeichen; Überprüfen Sie Persona und Protokolle, bevor Sie eine Stimme hinzufügen.
  2. Fügen Sie ASR hinzu und erstellen Sie einen Testsatz mit 100 Äußerungen mit Akzenten, Geräuschen, Namen und Unterbrechungen.
  3. Fügen Sie TTS mit einer Stimme hinzu, die Sie synthetisieren dürfen. Messen Sie zunächst Audio und Aussprache.
  4. Konfigurieren Sie Ausdrücke aus expliziten Emotions-Tags, anstatt unkontrollierte Eingabeaufforderungen zu verlieren.
  5. Fügen Sie Kamera-/Bildschirmzugriff nur für eine definierte Aufgabe hinzu, mit sichtbaren Zustimmungs- und Schwärzungstests.
  6. Speicher oder Tools zuletzt aktivieren; Red-Team-Injection, Löschung, Erlaubnis und sitzungsübergreifende Isolation.
  7. Führen Sie einen zweistündigen Live-Soak-Test durch und zeichnen Sie CPU/GPU/RAM, Verbindungsabbrüche, Warteschlangen, Echo und Avatar-Frame-Drops auf.
  8. Frieren Sie ein Release, eine Konfiguration, eine Modellliste, ein Asset-Manifest und ein Wiederherstellungsverfahren ein.

Alternativen

AnsatzBeste PassformKompromiss
Open-LLM-VTuberIntegrierte offene Sprach-/Avatar-Experimente mit austauschbaren BackendsKomplexes Setup, sich entwickelnde Architektur und mehrere Lizenzen
SillyTavern plus Sprach-/Avatar-ErweiterungenCharakter-Chat und umfassende Frontend-IntegrationenMehr Erweiterungsbaugruppe und unterschiedliche Echtzeit-Medienqualität
VTube Studio plus benutzerdefinierter AgentenserviceLive2D-Steuerung in Streaming-Qualität mit maßgeschneiderter IntelligenzMehr Technik, aber klarere Trennung von Avatar- und KI-Ebenen
Nur-SprachassistentKonversation ist wichtig, aber ein Avatar bietet wenig MehrwertWeniger visuelle Präsenz, viel geringere Rendering-/Lizenzierungskomplexität
Verwaltete CharakterplattformSchneller Start und gehosteter BetriebWeniger Backend-Kontrolle, wiederkehrende Kosten und Daten-/Anbieterabhängigkeit
Benutzerdefinierte WebRTC-PipelineProduktionsprodukt, das präzise Latenz, Sicherheit und Skalierbarkeit erfordertHöchster Implementierungsaufwand und Kontrolle

Häufig gestellte Fragen

Kann alles offline laufen?

Im Prinzip ja, wenn alle ausgewählten LLM-, ASR-, TTS-, Übersetzungs-, Speicher-, Vision- und Tool-Komponenten lokal sind. Überwachen Sie die tatsächliche Konfiguration und den Netzwerkverkehr.

Ist v2.0 verfügbar?

Das offizielle Repository beschreibt Version 2 als eine frühe Neufassung der Planung/Diskussion. Aktuelle Benutzer sollten das dokumentierte v1.x-System- und Migrationsrisiko bewerten.

Ist eine GPU erforderlich?

Es gibt kein absolutes GPU-Minimum, da schwere Module APIs oder CPU verwenden können. Für einen reaktionsfähigen, vollständig lokalen Betrieb empfiehlt das Projekt ein System der Apple M-Serie oder unterstützte GPUs und kleinere Modelle.

Welchen Browser soll ich verwenden?

Die Kurzanleitung empfiehlt Chrome und weist auf bekannte Probleme mit Edge/Safari hin. Für die Remote-Mikrofonerfassung ist ein sicherer Kontext wie HTTPS oder Localhost erforderlich.

Kann ich die gebündelten Live2D-Modelle kommerziell nutzen?

Gehen Sie nicht davon aus. Sie sind von der MIT-Lizenz des Projekts ausgeschlossen und unterliegen den separaten Beispieldatenbedingungen von Live2D, wobei für die kommerzielle Nutzung zusätzliche Anforderungen möglich sind.

Erinnert es sich an frühere Gespräche?

Chat-Protokolle bleiben bestehen. Die optionale Unterstützung von Speicheragenten hängt von der genauen Version und Konfiguration ab und kann die Latenz erhöhen. Überprüfen Sie das Verhalten, anstatt sich auf die allgemeine Funktionsliste zu verlassen.

Primärquellen

Zuletzt überprüft am 25. Juli 2026. Modulunterstützung und Projektarchitektur ändern sich schnell; Überprüfen Sie vor dem Produktionseinsatz die genaue Version, Konfiguration, Anbieter und Asset-Lizenzen.

Ready to try Open-LLM-VTuber?

Visit the official website to get started

Visit Open-LLM-VTuber

Quick Info

Added
6/4/2026
Published
6/2/2026
Updated
9/1/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool