Open-LLM-VTuber 是一个开源编排层,用于构建具有 Live2D 身体的语音交互 AI 角色。它结合了语音识别、LLM 或代理、文本转语音、头像表情控制、语音中断、摄像头或屏幕视觉、持久聊天日志、Web 和 Electron 客户端以及可选的桌面宠物模式。每个重型组件都可以在本地运行或被云API取代,因此该项目可以更好地理解为可配置的实时媒体管道,而不是单个模型。
该系统可以在 Windows、macOS 和 Linux 上运行,根据所选模块,可使用 CPU、NVIDIA、AMD/ROCm、Apple 加速和托管服务组合。只有当 LLM、ASR、TTS、翻译、记忆以及任何视觉或工具提供商都位于本地且不使用外部资产或遥测时,“完全离线”才能实现。
当前项目状态:今天 v1,稍后 v2
官方存储库指出,维护者正在专注于完整的 v2.0 重写,目前处于早期讨论和规划中。他们要求用户不要提出新的 v1 功能请求,同时继续进行错误修复和现有的拉取请求工作。这并不会使 v1 无法使用,但它会给构建耐用产品的团队带来架构和迁移风险。
当前文档涵盖 v1.x 部署。 v1.0.0之前的版本需要重新部署,因为配置和依赖发生了变化;目前的指导建议 紫外线 以及递归 Git 克隆,因为前端是一个子模块。固定经过测试的版本和配置,而不是部署移动的主分支。
| 状态问题 | 目前的证据 | 实际行动 |
|---|---|---|
| v2 生产就绪了吗? | 不;官方自述文件称其为早期讨论/计划重写 | 不要将交付日期基于未交付的 v2 功能 |
| v1被放弃了吗? | 错误修复和现有公关工作仍在继续 | 使用经过测试的版本并监控安全/兼容性问题 |
| 旧配置兼容吗? | v1.0.0 引入了破坏性部署和 conf.yaml 更改 | 重新部署和迁移设置,而不是盲目复制旧环境 |
| 包括长期记忆吗? | 聊天记录仍然存在; Letta 支持出现在 v1.2 文档中,而 README 则记录了内存更改 | 验证确切的版本/代理并测量增加的延迟 |
| 可以直接商业化吗? | 项目代码是 MIT,捆绑的 Live2D 示例资产有单独的条款 | 替换或许可角色、声音、音乐和其他资产 |
实时对话管道
| 舞台 | 项目支持的示例 | 初级质量门 |
|---|---|---|
| 捕获 | 麦克风、文本、相机、屏幕截图或屏幕共享 | 用户同意、设备选择、回声/噪声和视觉数据范围 |
| 自动语音识别 | sherpa-onnx、FunASR、faster-whisper、Whisper.cpp、Groq 或 Azure | 字错误、回合结束检测和流延迟 |
| 代理/法学硕士 | Ollama、OpenAI 兼容 APIs、Claude、Gemini、Mistral、DeepSeek、vLLM、GGUF | 人物角色依从性、真实性、工具边界和第一个令牌延迟 |
| 内存/工具 | 聊天历史记录、代理界面、Letta/EVI 和 MCP 兼容集成 | 检索相关性、权限、抗注入和删除 |
| 语音合成 | sherpa-onnx、Edge TTS、MeloTTS、GPT-SoVITS、CosyVoice、Fish Audio 等 | 首音频延迟、清晰度、话权和中断 |
| 阿凡达 | Live2D 表情、触摸、桌面宠物、想法/动作显示 | 情感映射、口型同步、帧速率和资产许可 |
| 发货 | Chrome Web UI、Electron 客户端、本地/远程访问和流媒体集成 | HTTPS、身份验证、网络暴露和平台策略 |
快速启动架构
记录的入门配置对 LLM 使用 Ollama,对 ASR 使用 sherpa-onnx/SenseVoiceSmall,对 Edge TTS 使用。它需要 Git、FFmpeg、Python 3.10–3.12 和项目依赖项。官方指南建议使用 Chrome,因为 Edge 和 Safari 存在已知问题。本地服务器打开于 http://本地主机:12393.
git clone https://github.com/Open-LLM-VTuber/Open-LLM-VTuber --recursive
cd Open-LLM-VTuber
紫外同步
cp config_templates/conf.default.yaml conf.yaml
# 配置 LLM、ASR、TTS、字符和凭据
uv运行run_server.py
# 然后在 Chrome 中打开 http://localhost:12393
对于此架构,请勿使用 GitHub 的通用“下载 ZIP”:存储库文档警告它忽略了更新机制所需的前端子模块和 Git 元数据。使用项目预期的发布存档或递归克隆。
在选择模型之前建立延迟预算
早在任何一个组件看起来灾难性之前,自然的语音交互就感觉很慢。端到端响应时间包括回合结束检测、ASR 最终确定、上下文/内存检索、LLM 第一个令牌、句子分块、TTS 第一个音频、网络传输和播放缓冲。有些阶段会重叠,但重试和队列会复合。
| 公制 | 测量自 | 有用的诊断 |
|---|---|---|
| 回合结束延迟 | 用户停止说话 → ASR 提交 | 将沉默检测与转录计算分开 |
| LLM 第一个代币 | 发送的最终成绩单 → 第一个可用令牌 | 显示上下文、模型、API 和内存成本 |
| TTS 第一个音频 | 口语文本准备就绪 → 第一个声音样本 | 揭示合成启动和缓冲液选择 |
| 中断时间 | 用户开始说话 → 头像音频停止 | 对于自然插入和回声控制至关重要 |
| 转弯完成 | 用户停止→最终头像响应结束 | 捕捉完整的体验和冗长的内容 |
| 恢复时间 | 提供者/模块失败 → 可用的后备 | 确定实时会话是否能避免错误 |
模块边界处的仪器时间戳。在网络和队列延迟之后,较小的本地模型可能会击败较大的云模型,而云 TTS 可能会减少计算争用。测试组合,而不是孤立的组件。
无反馈循环的语音中断
该项目宣传无需耳机即可中断,因此助手不应将自己的语音视为新的用户输入。这是一个要求很高的音频问题:声学回声消除、麦克风/扬声器几何形状、音量、房间混响、ASR 语音活动检测和 TTS 播放状态都会相互作用。测试安静的房间、笔记本电脑扬声器、外部扬声器、耳机、音乐、重叠扬声器和重复的唤醒词。
测量错误中断、错过中断、自转录以及停止音频和上游生成所需的时间。在 LLM 和 TTS 继续消耗资源时取消播放会产生隐藏成本和过时的消息。
隐私和安全边界
- 绘制每个提供商的地图。 如果 Edge TTS、云 ASR、翻译、视觉、Letta 或 MCP 工具从外部发送数据,则本地 Ollama 模型不会使系统离线。
- 保护配置。
conf.yaml、环境变量和日志可以包含 API 密钥、提供者 URL、角色内容和私人转录本。 - 限制相机和屏幕捕获。 需要明显的活动指示器、精细的选择、快速停止控制以及针对密码、消息和第三方数据的保护。
- 不要直接暴露服务器。 远程麦克风访问需要HTTPS;添加身份验证、反向代理限制和防火墙控制,而不仅仅是 TLS。
- 将内容视为敌对内容。 语音、屏幕文本、聊天消息、网页和 MCP 结果可以包含提示注入。
- 约束工具。 在文件、shell、浏览器、外部消息或帐户操作之前使用白名单、沙箱和明确批准。
- 提供删除。 用户需要定位并删除聊天日志、音频、屏幕截图、内存存储、缓存和提供商端历史记录。
角色、依恋和节制
与文本框相比,具体的声音和持久的角色可以使模型输出感觉更权威或情感上更互惠。产品应披露该角色是人工智能,避免声称有意识或排他性依赖,并为医疗、法律、金融和危机主题建立升级语言。如果受众包括未成年人,请添加适合年龄的设计、家长控制和严格的数据默认设置。
积极主动的演讲需要安静的时间、频率上限和上下文规则。 “内心想法”是生成的界面内容,而不是访问模型隐藏的推理,并且永远不应该暴露系统提示、秘密或私人思想链。
许可清单
| 资产 | 可能的许可证所有者 | 保留证据 |
|---|---|---|
| Open-LLM-VTuber 代码 | 麻省理工学院项目贡献者 | 许可通知、源版本和修改 |
| 捆绑的 Live2D 样本 | Live2D Inc. 根据单独的免费材料/样品条款 | 适用条款和商业资格或移除证明 |
| 自定义头像艺术/装备 | 艺术家、装配工、工作室或品牌 | 商业、流媒体、衍生品、商品和领土权利 |
| 语音 | 演员、模特提供商和录音权持有者 | 克隆/合成同意、脚本范围和撤销条款 |
| LLM/ASR/TTS 模型 | 每个提供者或模型发布者 | 确切的模型许可证、可接受的使用政策和部署计划 |
| 音乐/背景/媒体 | 创作者和许可者 | 广播、平台和货币化许可 |
实用的飞行员
- 从文字输入开始,一个LLM和一个字符;在添加语音之前验证角色和日志。
- 添加 ASR 并构建包含口音、噪音、姓名和中断的 100 句话测试集。
- 使用您有权合成的语音添加 TTS;测量第一个音频和发音。
- 根据明确的情感标签配置表情,而不是不受控制的提示泄漏。
- 仅针对已定义的任务添加摄像头/屏幕访问权限,并进行可见的同意和编辑测试。
- 最后启用内存或工具;红队注入、删除、权限和跨会话隔离。
- 运行两小时的实时浸泡测试并记录 CPU/GPU/RAM、断开连接、队列、回声和头像帧丢失。
- 冻结版本、配置、模型列表、资产清单和恢复过程。
替代方案
| 方法 | 最适合 | 权衡 |
|---|---|---|
| Open-LLM-VTuber | 具有可互换后端的集成开放语音/化身实验 | 复杂的设置、不断发展的架构和多个许可证 |
| SillyTavern 加上语音/头像扩展 | 角色聊天和广泛的前端集成 | 更多扩展组件和不同的实时媒体质量 |
| VTube Studio 加上定制代理服务 | 具有定制智能的流媒体级 Live2D 控制 | 更多工程设计,但头像和 AI 层的分离更清晰 |
| 仅语音助手 | 对话很重要,但头像没有什么价值 | 更少的视觉存在,更低的渲染/许可复杂性 |
| 托管角色平台 | 快速启动和托管运营 | 减少后端控制、经常性成本和数据/供应商依赖性 |
| 自定义 WebRTC 管道 | 需要精确延迟、安全性和规模的生产产品 | 最高的实施工作量和控制力 |
常见问题
一切都可以离线运行吗?
原则上是的,只要每个选定的 LLM、ASR、TTS、翻译、记忆、视觉和工具组件都是本地的。审核实际配置和网络流量。
v2.0可用吗?
官方存储库将 v2 描述为早期规划/讨论重写。当前用户应评估记录的 v1.x 系统和迁移风险。
它需要 GPU 吗?
不存在绝对的 GPU 最小值,因为重型模块可以使用 APIs 或 CPU。为了实现响应式完全本地操作,该项目建议使用 Apple M 系列系统或支持的 GPU 以及较小的型号。
我应该使用哪个浏览器?
快速入门指南建议使用 Chrome 并注释已知的 Edge/Safari 问题。远程麦克风捕获需要安全上下文,例如 HTTPS 或本地主机。
我可以将捆绑的 Live2D 模型用于商业用途吗?
不要这样认为。它们被排除在该项目的 MIT 许可证之外,并受 Live2D 的单独样本数据条款管辖,并且可能有商业用途的附加要求。
它还记得之前的对话吗?
聊天记录仍然存在。可选的内存代理支持取决于确切的版本和配置,并且可能会增加延迟;验证行为而不是依赖一般功能列表。
主要来源
上次审核时间为 2026 年 7 月 25 日。模块支持和项目架构变化很快;在生产使用之前验证确切的版本、配置、提供商和资产许可证。
