Open-LLM-VTuber Live2D ボディを持つ音声対話型 AI キャラクターを構築するためのオープンソース オーケストレーション レイヤーです。これは、音声認識、LLM またはエージェント、テキスト読み上げ、アバター表現制御、音声中断、カメラまたは画面ビジョン、永続的なチャット ログ、Web および Electron クライアント、およびオプションのデスクトップ ペット モードを組み合わせています。各重いコンポーネントはローカルで実行することも、クラウド API で置き換えることもできるため、このプロジェクトは単一のモデルというよりも、構成可能なリアルタイム メディア パイプラインとして理解される方がよいでしょう。
このシステムは、選択したモジュールに応じて、CPU、NVIDIA、AMD/ROCm、Apple アクセラレーション、ホスト型サービスの組み合わせを使用して、Windows、macOS、Linux 上で実行できます。 「完全なオフライン」は、LLM、ASR、TTS、翻訳、メモリ、およびビジョンまたはツールのプロバイダーがすべてローカルであり、外部資産やテレメトリが使用されていない場合にのみ実現できます。
現在のプロジェクトのステータス: 今日は v1、後で v2
公式リポジトリによると、メンテナは完全な v2.0 の書き換えに注力しており、現在初期の議論と計画が進められています。彼らはユーザーに対し、バグ修正と既存のプルリクエスト作業を継続する一方で、新しい v1 機能リクエストを開かないように求めています。これによって v1 が使用できなくなるわけではありませんが、耐久性のある製品を構築するチームにとってアーキテクチャ上および移行上のリスクが生じます。
現在のドキュメントでは、v1.x の展開について説明しています。 v1.0.0 より前のバージョンでは、構成と依存関係が変更されたため、再デプロイが必要です。現在のガイダンスでは推奨されています 紫外線 フロントエンドはサブモジュールであるため、再帰的な Git クローンになります。移動するメイン ブランチをデプロイする代わりに、テスト済みのリリースと構成を固定します。
| 状況に関する質問 | 現在の証拠 | 実際の行動 |
|---|---|---|
| v2 は本番環境に対応していますか? | いいえ。公式の README では、これを初期の議論/計画の書き直しと呼んでいます | 未出荷の v2 機能を納期の基準にしないでください |
| v1は放棄されたのでしょうか? | バグ修正と既存の PR 作業は継続します | テスト済みのリリースを使用し、セキュリティ/互換性の問題を監視する |
| 古い設定には互換性がありますか? | v1.0.0 では、破壊的なデプロイメントと conf.yaml の変更が導入されました | 古い環境をやみくもにコピーするのではなく、設定を再デプロイして移行する |
| 長期記憶は含まれますか? | チャット履歴は残ります。 Letta のサポートは v1.2 のドキュメントに記載されていますが、README にはメモリの変更が記載されています | 正確なリリース/エージェントを確認し、追加されたレイテンシを測定します |
| このまま商品化できるのでしょうか? | プロジェクト コードは MIT であり、バンドルされている Live2D サンプル アセットには別の用語があります | キャラクター、音声、音楽、その他のアセットを交換またはライセンス供与する |
リアルタイムの会話パイプライン
| ステージ | プロジェクトでサポートされている例 | 一次品質ゲート |
|---|---|---|
| キャプチャ | マイク、テキスト、カメラ、スクリーンショット、または画面共有 | ユーザーの同意、デバイスの選択、エコー/ノイズ、および視覚データの範囲 |
| ASR | sherpa-onnx、FunASR、faster-whisper、Whisper.cpp、Groq または Azure | 単語エラー、ターン終了検出、ストリーミング遅延 |
| エージェント/LLM | Ollama、OpenAI 互換の APIs、Claude、Gemini、Mistral、DeepSeek、vLLM、GGUF | ペルソナの遵守、事実性、ツールの境界、最初のトークンの待ち時間 |
| メモリ/ツール | チャット履歴、エージェント インターフェイス、Letta/EVI および MCP 互換の統合 | 取得の関連性、権限、注入耐性、および削除 |
| TTS | sherpa-onnx、Edge TTS、MeloTTS、GPT-SoVITS、CosyVoice、Fish Audio など | 第一音声の遅延、明瞭度、音声の権利および中断 |
| アバター | Live2D 表現、タッチ、デスクトップ ペット、思考/アクションの表示 | 感情マッピング、リップシンク、フレームレート、アセットライセンス |
| 配送 | Chrome Web UI、Electron クライアント、ローカル/リモート アクセス、ストリーミング統合 | HTTPS、認証、ネットワーク露出、およびプラットフォーム ポリシー |
クイックスタートアーキテクチャ
文書化されたスターター構成では、LLM には Ollama、ASR には sherpa-onnx/SenseVoiceSmall、および Edge TTS が使用されます。 Git、FFmpeg、Python 3.10 ~ 3.12、およびプロジェクトの依存関係が必要です。 Edge と Safari には既知の問題があるため、公式ガイドでは Chrome を推奨しています。ローカルサーバーが開かれます http://ローカルホスト:12393.
git clone https://github.com/Open-LLM-VTuber/Open-LLM-VTuber --recursive
cd Open-LLM-VTuber
UV同期
cp config_templates/conf.default.yaml conf.yaml
# LLM、ASR、TTS、文字および資格情報を構成します
uv 実行 run_server.py
# Chrome で http://localhost:12393 を開きます
このアーキテクチャには GitHub の汎用の「Download ZIP」を使用しないでください。リポジトリのドキュメントでは、更新メカニズムに必要なフロントエンド サブモジュールと Git メタデータが省略されていると警告しています。プロジェクトが意図したリリース アーカイブまたは再帰的クローンを使用します。
モデルを選択する前にレイテンシの予算を立てる
自然な音声インタラクションは、いずれかのコンポーネントが悲惨に見えるよりもずっと前に、遅く感じられます。エンドツーエンドの応答時間には、ターン終了の検出、ASR ファイナライゼーション、コンテキスト/メモリの取得、LLM の最初のトークン、センテンスのチャンク化、TTS の最初のオーディオ、ネットワーク トランスポート、および再生バッファリングが含まれます。一部のステージは重複しますが、再試行とキューが複雑になります。
| メトリック | から測定 | 役立つ診断 |
|---|---|---|
| ターン終了時の遅延 | ユーザーが話すのをやめた → ASR がコミット | 無音検出を文字起こしの計算から分離 |
| LLM の最初のトークン | 最終的なトランスクリプトを送信 → 最初に使用可能なトークン | コンテキスト、モデル、API、およびメモリ コストを表示します。 |
| TTS の最初のオーディオ | 読み上げ可能なテキストの準備完了 → 最初の音声サンプル | 合成のスタートアップとバッファの選択を明らかにします |
| 中断までの時間 | ユーザーが話し始める → アバターの音声が停止する | 自然なバージインとエコー制御に重要 |
| ターン完了 | ユーザーが停止 → アバターの最終応答が終了 | 完全なエクスペリエンスと冗長性をキャプチャします |
| 回復時間 | プロバイダー/モジュールの障害 → 使用可能なフォールバック | ライブセッションがエラー後に存続するかどうかを判断します |
モジュール境界での計測タイムスタンプ。ネットワークとキューの遅延を考慮すると、小規模なローカル モデルが大規模なクラウド モデルを上回る可能性があり、クラウド TTS はコンピューティング競合を軽減する可能性があります。コンポーネントを単独でテストするのではなく、組み合わせてテストします。
フィードバックループなしの音声中断
プロジェクトはヘッドフォンなしで中断することを宣伝するため、アシスタントは自分自身の音声を新しいユーザー入力として扱うべきではありません。これは、要求の厳しいオーディオの問題です。音響エコー キャンセル、マイク/スピーカーの形状、音量、部屋の残響、ASR 音声アクティビティ検出、および TTS 再生状態はすべて相互作用します。静かな部屋、ノートパソコンのスピーカー、外部スピーカー、ヘッドセット、音楽、スピーカーの重なり、ウェイクワードの繰り返しをテストします。
誤った中断、見逃した中断、自己転写、およびオーディオとアップストリーム生成の両方を停止するのに必要な時間を測定します。 LLM と TTS がリソースを消費し続けている間に再生をキャンセルすると、隠れたコストと古いメッセージが作成されます。
プライバシーとセキュリティの境界
- すべてのプロバイダーをマッピングします。 Edge TTS、クラウド ASR、翻訳、ビジョン、Letta または MCP ツールが外部にデータを送信する場合、ローカル Ollama モデルはシステムをオフラインにしません。
- 構成を保護します。
conf.yaml、環境変数とログには、API キー、プロバイダー URL、ペルソナ コンテンツ、プライベート トランスクリプトを含めることができます。 - カメラと画面キャプチャを制限します。 明確なアクティブインジケーター、詳細な選択、高速停止制御、およびパスワード、メッセージ、サードパーティデータに対する保護が必要です。
- サーバーを直接公開しないでください。 リモートマイクアクセスにはHTTPSが必要です。 TLS だけではなく、認証、リバース プロキシ制限、ファイアウォール制御を追加します。
- コンテンツを敵対的なものとして扱います。 音声、画面テキスト、チャット メッセージ、Web ページ、および MCP 結果には、プロンプト インジェクションが含まれる可能性があります。
- ツールを制限します。 ファイル、シェル、ブラウザ、外部メッセージ、またはアカウントのアクションの前に、ホワイトリスト、サンドボックス、および明示的な承認を使用します。
- 削除を提供します。 ユーザーは、チャット ログ、音声、スクリーンショット、メモリ ストア、キャッシュ、プロバイダー側の履歴を見つけて消去する必要があります。
ペルソナ、愛着、節度
具現化された音声と永続的なキャラクターにより、モデルの出力がテキスト ボックスよりも権威のあるものになったり、感情的に相互作用したりするように感じられます。製品は、キャラクターが AI であることを明らかにし、意識や独占的な依存を主張することを避け、医療、法律、財務、危機に関するトピックについてエスカレーション言語を確立する必要があります。視聴者に未成年者が含まれる場合は、年齢に応じたデザイン、ペアレンタルコントロール、厳格なデータデフォルトを追加します。
積極的に話すには、静かな時間、フリークエンシー キャップ、コンテキスト ルールが必要です。 「内なる思考」は生成されたインターフェイス コンテンツであり、モデルの隠された推論へのアクセスではなく、システム プロンプト、秘密、またはプライベートな思考連鎖を決して公開すべきではありません。
ライセンスチェックリスト
| 資産 | おそらくライセンス所有者 | 保管すべき証拠 |
|---|---|---|
| Open-LLM-VTuber コード | MIT のプロジェクト貢献者 | ライセンス通知、ソースの改訂および変更 |
| バンドルされた Live2D サンプル | Live2D Inc. は別個の無料素材/サンプル条件に基づく | 適用される条件と商業適格性または削除の証明 |
| カスタムアバターアート/リグ | アーティスト、リガー、スタジオまたはブランド | コマーシャル、ストリーミング、派生商品、商品および領土の権利 |
| 声 | 俳優、モデル提供者、録音権者 | クローン作成/合成の同意、スクリプトの範囲および取り消し条件 |
| LLM/ASR/TTSモデル | 各プロバイダーまたはモデル発行者 | 正確なモデルライセンス、使用許諾ポリシーおよび展開計画 |
| 音楽/背景/メディア | クリエイターとライセンサー | ブロードキャスト、プラットフォーム、収益化の許可 |
実践的なパイロット
- 1 つの LLM と 1 つの文字のテキスト入力から始めます。音声を追加する前にペルソナとログを確認してください。
- ASR を追加して、アクセント、ノイズ、名前、中断を含む 100 の発話テスト セットを構築します。
- 合成を許可された音声を使用して TTS を追加します。最初の音声と発音を測定します。
- 制御されていないプロンプトの漏れではなく、明示的な感情タグから表現を構成します。
- 定義されたタスクにのみカメラ/画面アクセスを追加し、同意と墨消しのテストを表示します。
- メモリまたはツールを最後に有効にします。レッドチームの挿入、削除、許可、およびセッション間の分離。
- 2 時間のライブ ソーク テストを実行し、CPU/GPU/RAM、切断、キュー、エコー、アバター フレーム ドロップを記録します。
- リリース、構成、モデルリスト、資産マニフェスト、およびリカバリ手順を凍結します。
代替案
| アプローチ | ベストフィット | トレードオフ |
|---|---|---|
| Open-LLM-VTuber | 交換可能なバックエンドを備えた統合されたオープン音声/アバター実験 | 複雑なセットアップ、進化するアーキテクチャ、および複数のライセンス |
| SillyTavern と音声/アバター拡張機能 | キャラクターチャットと広範なフロントエンド統合 | より多くの拡張機能アセンブリとさまざまなリアルタイムメディア品質 |
| VTube Studio とカスタム エージェント サービス | 特注のインテリジェンスを備えたストリーミング グレードの Live2D 制御 | よりエンジニアリングを強化しながらも、アバター層と AI 層をより明確に分離 |
| 音声のみのアシスタント | 会話は重要ですが、アバターにはほとんど価値がありません | 視覚的な存在感が減り、レンダリング/ライセンスの複雑さが大幅に軽減されます。 |
| マネージドキャラクタープラットフォーム | 高速起動とホストされた操作 | バックエンド制御の軽減、定期的なコスト、データ/ベンダーへの依存 |
| カスタム WebRTC パイプライン | 正確なレイテンシ、安全性、スケールが必要な製品 | 最大限の実装労力と管理 |
よくある質問
すべてをオフラインで実行できますか?
選択したすべての LLM、ASR、TTS、翻訳、メモリ、ビジョン、およびツール コンポーネントがローカルである場合、原則としてはい。実際の構成とネットワーク トラフィックを監査します。
v2.0は利用可能ですか?
公式リポジトリでは、v2 は初期の計画/ディスカッションのリライトであると説明されています。現在のユーザーは、文書化された v1.x システムと移行のリスクを評価する必要があります。
GPUは必要ですか?
重いモジュールは APIs または CPU を使用する可能性があるため、絶対的な GPU 最小値は存在しません。応答性の高い完全なローカル操作を実現するには、プロジェクトでは Apple M シリーズ システムまたはサポートされている GPU およびそれより小型のモデルを推奨します。
どのブラウザを使用すればよいですか?
クイックスタート ガイドでは、Chrome を推奨し、既知の Edge/Safari の問題について説明しています。リモート マイク キャプチャには、HTTPS や localhost などの安全なコンテキストが必要です。
バンドルされている Live2D モデルを商業的に使用できますか?
そう思い込まないでください。これらはプロジェクトの MIT ライセンスから除外され、Live2D の別個のサンプルデータ条項によって管理されますが、商用利用には追加の要件が必要となります。
以前の会話を覚えていますか?
チャットログは残ります。オプションのメモリ エージェント サポートは正確なリリースと構成に依存し、遅延が追加される可能性があります。一般的な機能リストに依存するのではなく、動作を検証します。
一次情報源
- 公式リポジトリ、v1/v2 ステータスおよび機能マトリックス
- 公式クイックスタートおよび導入ガイド
- 公式ドキュメントの概要
- プロジェクトMITライセンス
- バンドルされた Live2D アセット ライセンス通知
- MDN セキュアコンテキストの要件
- MCP ツール統合に関するセキュリティのベスト プラクティス
最終レビュー日は 2026 年 7 月 25 日です。モジュールのサポートとプロジェクトのアーキテクチャは急速に変化します。運用環境で使用する前に、正確なリリース、構成、プロバイダー、および資産ライセンスを確認してください。
