Open-LLM-VTuber
Open-LLM-VTuber
Active

Open-LLM-VTuber

Open-LLM-VTuber은 ASR, LLM 또는 에이전트, TTS, Live2D, 음성 중단, 비전, 채팅 기록, 웹/데스크톱 클라이언트 및 선택적 로컬 작업을 결합한 모듈식 크로스 플랫폼 AI 동반 ​​스택입니다. 이 가이드에서는 v1/v2 상태, 아키텍처, 대기 시간, 안전, 라이선스 및 배포를 다룹니다.

90

Views

0

Likes

Jun 2026

Added

github.com

Website

Tags

AI 아바타Live2D오프라인 AI 동반자음성 상호작용오픈소스

Product Preview

A quick visual look at Open-LLM-VTuber before you visit the official site.

Published 6/2/2026
Open-LLM-VTuber screenshot

Editorial Review

About Open-LLM-VTuber

Open-LLM-VTuber Live2D 본문을 사용하여 음성 대화형 AI 캐릭터를 구축하기 위한 오픈 소스 오케스트레이션 레이어입니다. 음성 인식, LLM 또는 에이전트, 텍스트 음성 변환, 아바타 표현 제어, 음성 중단, 카메라 또는 화면 비전, 영구 채팅 로그, 웹 및 Electron 클라이언트 및 선택적인 데스크톱 애완 동물 모드를 결합합니다. 각각의 무거운 구성 요소는 로컬에서 실행되거나 클라우드(API)로 대체될 수 있으므로 프로젝트는 단일 모델보다 구성 가능한 실시간 미디어 파이프라인으로 더 잘 이해됩니다.

시스템은 선택한 모듈에 따라 CPU, NVIDIA, AMD/ROCm, Apple 가속 및 호스팅 서비스 조합을 통해 Windows, macOS 및 Linux에서 실행될 수 있습니다. "완전 오프라인"은 LLM, ASR, TTS, 번역, 메모리 및 비전이나 도구 제공자가 모두 로컬이고 외부 자산이나 원격 측정이 사용되지 않는 경우에만 달성 가능합니다.

Official Open-LLM-VTuber interface showing a voice-interactive Live2D AI companion
공식 프로젝트 스크린샷. 눈에 보이는 아바타는 다단계 파이프라인의 최종 표면입니다. 대화 품질은 모든 업스트림 모듈과 지연 시간 및 오류 상태가 조정되는 방식에 따라 달라집니다.

현재 프로젝트 상태: 현재 v1, 이후 v2

공식 저장소에는 관리자들이 현재 초기 논의 및 계획 중인 완전한 v2.0 재작성에 초점을 맞추고 있다고 명시되어 있습니다. 버그 수정 및 기존 풀 요청 작업을 계속하면서 사용자에게 새로운 v1 기능 요청을 열지 말 것을 요청합니다. 그렇다고 해서 v1을 사용할 수 없게 되는 것은 아니지만 내구성이 뛰어난 제품을 구축하는 팀에 아키텍처 및 마이그레이션 위험이 발생합니다.

현재 문서에서는 v1.x 배포에 대해 다룹니다. v1.0.0 이전 버전에서는 구성 및 종속성이 변경되었기 때문에 재배포가 필요합니다. 현재 지침은 권장합니다 자외선 프론트엔드가 하위 모듈이기 때문에 재귀적인 Git 클론입니다. 이동하는 기본 브랜치를 배포하는 대신 테스트된 릴리스 및 구성을 고정하세요.

상태 질문현재 증거실제적인 행동
v2는 프로덕션 준비가 되었나요?아니요. 공식 README에서는 이를 초기 토론/계획 재작성이라고 부릅니다.배송되지 않은 v2 기능을 기준으로 배송 날짜를 정하지 마세요.
v1이 포기되었나요?버그 수정 및 기존 홍보 작업은 계속됩니다테스트된 릴리스를 사용하고 보안/호환성 문제를 모니터링하세요.
이전 구성이 호환되나요?v1.0.0에는 배포 및 conf.yaml 변경 사항이 도입되었습니다.기존 환경을 맹목적으로 복사하는 대신 설정을 재배포하고 마이그레이션합니다.
장기기억도 포함되어 있나요?채팅 기록은 유지됩니다. Letta 지원은 v1.2 문서에 나타나고 README는 메모리 변경 사항을 기록합니다.정확한 릴리스/에이전트를 확인하고 추가된 지연 시간을 측정합니다.
그대로 상용화가 가능한가요?프로젝트 코드는 MIT이며 번들 Live2D 샘플 자산에는 별도의 용어가 있습니다.캐릭터, 음성, 음악 및 기타 자산 교체 또는 라이선스 부여

실시간 대화 파이프라인

무대프로젝트에서 지원하는 예시1차 품질 게이트
캡처마이크, 텍스트, 카메라, 스크린샷 또는 화면 공유사용자 동의, 장치 선택, 에코/잡음 및 시각 데이터 범위
ASRsherpa-onnx, FunASR, faster-whisper, Whisper.cpp, Groq 또는 Azure단어 오류, 턴 종료 감지 및 스트리밍 대기 시간
에이전트/LLMOllama, OpenAI 호환 APIs, Claude, Gemini, Mistral, DeepSeek, vLLM, GGUF페르소나 준수, 사실성, 도구 경계 및 첫 번째 토큰 대기 시간
메모리/도구채팅 기록, 에이전트 인터페이스, Letta/EVI 및 MCP 호환 통합검색 관련성, 권한, 주입 저항 및 삭제
TTSsherpa-onnx, Edge TTS, MeloTTS, GPT-SoVITS, CosyVoice, Fish Audio 및 기타첫 번째 오디오 대기 시간, 명료도, 음성 권한 및 중단
아바타Live2D 표현, 터치, 데스크톱 애완동물, 생각/행동 표시감정 매핑, 립싱크, 프레임 속도 및 자산 라이선스
배송Chrome 웹 UI, Electron 클라이언트, 로컬/원격 액세스 및 스트리밍 통합HTTPS, 인증, 네트워크 노출 및 플랫폼 정책

빠른 시작 아키텍처

문서화된 스타터 구성에서는 LLM의 경우 Ollama, ASR의 경우 sherpa-onnx/SenseVoiceSmall, Edge TTS을 사용합니다. Git, FFmpeg, Python 3.10–3.12 및 프로젝트 종속성이 필요합니다. 공식 가이드에서는 Edge 및 Safari에 알려진 문제가 있으므로 Chrome을 권장합니다. 로컬 서버가 다음 위치에 열립니다. http://localhost:12393.

자식 클론 https://github.com/Open-LLM-VTuber/Open-LLM-VTuber --재귀
CD Open-LLM-VTuber
자외선 동기화
cp config_templates/conf.default.yaml conf.yaml
# LLM, ASR, TTS, 문자 및 자격 증명을 구성합니다.
uv 실행 run_server.py
# 그런 다음 Chrome에서 http://localhost:12393을 엽니다.

이 아키텍처에는 GitHub의 일반 "ZIP 다운로드"를 사용하지 마십시오. 저장소 문서에서는 업데이트 메커니즘에 필요한 프런트엔드 하위 모듈과 Git 메타데이터가 생략되었다고 경고합니다. 프로젝트 또는 재귀적 복제에서 의도한 릴리스 아카이브를 사용하십시오.

모델을 선택하기 전에 지연 시간 예산을 구축하세요

자연스러운 음성 상호 작용은 어느 하나의 구성 요소가 비참해 보이기 오래 전에 느리게 느껴집니다. 엔드투엔드 응답 시간에는 턴 종료 감지, ASR 마무리, 컨텍스트/메모리 검색, LLM 첫 번째 토큰, 문장 청크, TTS 첫 번째 오디오, 네트워크 전송 및 재생 버퍼링이 포함됩니다. 일부 단계는 겹치지만 재시도와 대기열이 복합적으로 발생합니다.

미터법측정 대상유용한 진단
턴 종료 지연사용자가 말하기를 중지 → ASR 커밋전사 계산에서 침묵 감지를 분리합니다.
LLM 첫 번째 토큰최종 성적표 전송 → 첫 번째 사용 가능한 토큰컨텍스트, 모델, API 및 메모리 비용을 표시합니다.
TTS 첫 번째 오디오말할 수 있는 텍스트 준비 → 첫 번째 가청 샘플합성 시작 및 버퍼 선택 표시
중단 시간사용자가 말하기 시작 → 아바타 오디오 중지자연스러운 바지인 및 에코 제어에 중요
턴 완료사용자 중지 → 최종 아바타 응답 종료완전한 경험과 자세한 내용을 포착합니다.
회복 시간공급자/모듈 오류 → 사용 가능한 대체라이브 세션에서 오류가 지속되는지 여부를 결정합니다.

모듈 경계의 계측기 타임스탬프. 더 작은 로컬 모델은 네트워크 및 대기열 대기 시간 후에 더 큰 클라우드 모델을 능가할 수 있는 반면, 클라우드 TTS는 컴퓨팅 경합을 줄일 수 있습니다. 분리된 구성 요소가 아닌 조합을 테스트합니다.

피드백 루프 없이 음성 중단

프로젝트는 헤드폰 없이 중단을 광고하므로 어시스턴트는 자신의 음성을 새로운 사용자 입력으로 처리해서는 안 됩니다. 이는 까다로운 오디오 문제입니다. 음향 반향 제거, 마이크/스피커 구조, 볼륨, 실내 잔향, ASR 음성 활동 감지 및 TTS 재생 상태가 모두 상호 작용합니다. 조용한 방, 노트북 스피커, 외부 스피커, 헤드셋, 음악, 겹치는 스피커 및 반복되는 깨우기 말을 테스트합니다.

잘못된 중단, 중단 누락, 자체 전사 및 오디오와 업스트림 생성을 모두 중지하는 데 필요한 시간을 측정합니다. LLM 및 TTS가 리소스를 계속 사용하는 동안 재생을 취소하면 숨겨진 비용과 오래된 메시지가 생성됩니다.

개인 정보 보호 및 보안 경계

  • 모든 공급자를 매핑하십시오. Edge TTS, 클라우드 ASR, 번역, 비전, Letta 또는 MCP 도구가 외부로 데이터를 보내는 경우 로컬 Ollama 모델은 시스템을 오프라인으로 만들지 않습니다.
  • 구성을 보호합니다. conf.yaml, 환경 변수 및 로그에는 API 키, 공급자 URL, 페르소나 콘텐츠 및 개인 기록이 포함될 수 있습니다.
  • 카메라 및 화면 캡처를 제한합니다. 명확한 활성 표시기, 세분화된 선택, 빠른 중지 제어 및 비밀번호, 메시지 및 제3자 데이터로부터의 보호가 필요합니다.
  • 서버를 직접 노출하지 마십시오. 원격 마이크 액세스에는 HTTPS가 필요합니다. TLS 대신 인증, 역방향 프록시 제한 및 방화벽 제어를 추가합니다.
  • 콘텐츠를 적대적인 것으로 취급합니다. 음성, 화면 텍스트, 채팅 메시지, 웹 페이지 및 MCP 결과에는 프롬프트 삽입이 포함될 수 있습니다.
  • 도구를 제한합니다. 파일, 셸, 브라우저, 외부 메시지 또는 계정 작업 전에 허용 목록, 샌드박스 및 명시적 승인을 사용하세요.
  • 삭제를 제공합니다. 사용자는 채팅 로그, 오디오, 스크린샷, 메모리 저장소, 캐시 및 공급자 측 기록을 찾아 삭제해야 합니다.

페르소나, 애착 및 중재

구체화된 음성과 지속적인 캐릭터는 모델 출력이 텍스트 상자보다 더 권위 있고 감정적으로 상호적인 느낌을 줄 수 있습니다. 제품은 캐릭터가 AI임을 공개하고 의식이나 배타적 의존성을 주장하지 않으며 의료, 법률, 금융 및 위기 주제에 대한 에스컬레이션 언어를 설정해야 합니다. 대상에 미성년자가 포함된 경우 연령에 적합한 디자인, 자녀 보호 기능 및 엄격한 데이터 기본값을 추가하세요.

적극적으로 말하기 위해서는 조용한 시간, 빈도 제한 및 상황 규칙이 필요합니다. "내부 생각"은 모델의 숨겨진 추론에 대한 액세스가 아닌 생성된 인터페이스 콘텐츠이며 시스템 프롬프트, 비밀 또는 개인 사고 체인을 노출해서는 안 됩니다.

라이선스 체크리스트

자산라이선스 소유자일 가능성이 있음보유할 증거
Open-LLM-VTuber 코드MIT 산하 프로젝트 참여자라이센스 공지, 소스 개정 및 수정
번들로 제공되는 Live2D 샘플Live2D Inc.는 별도의 무료 자료/샘플 조건을 따릅니다.관련 조건 및 상업적 자격 또는 제거 증명
맞춤형 아바타 아트/리그아티스트, 리거, 스튜디오 또는 브랜드상업, 스트리밍, 파생상품, 상품 및 영토권
음성배우, 모델 제공자 및 녹음 권리 보유자복제/합성 동의, 스크립트 범위 및 철회 조건
LLM/ASR/TTS 모델각 제공자 또는 모델 게시자정확한 모델 라이센스, 사용 제한 정책 및 배포 계획
음악/배경/미디어제작자 및 라이센스 제공자방송, 플랫폼 및 수익화 권한

실용적인 파일럿

  1. 텍스트 입력, 하나의 LLM 및 하나의 문자로 시작하십시오. 음성을 추가하기 전에 페르소나와 로그를 확인하세요.
  2. ASR을 추가하고 악센트, 소음, 이름, 방해 요소가 포함된 100개 발화 테스트 세트를 구축하세요.
  3. 합성 권한이 있는 음성을 사용하여 TTS를 추가하세요. 첫 번째 오디오와 발음을 측정합니다.
  4. 통제되지 않은 프롬프트 유출이 아닌 명시적인 감정 태그로 표현을 구성합니다.
  5. 시각적 동의 및 편집 테스트를 통해 정의된 작업에 대해서만 카메라/화면 액세스를 추가합니다.
  6. 메모리나 도구를 마지막으로 활성화합니다. 레드팀 주입, 삭제, 권한 및 세션 간 격리.
  7. 2시간 동안 라이브 흡수 테스트를 실행하고 CPU/GPU/RAM, 연결 끊김, 대기열, 에코 및 아바타 프레임 드롭을 기록합니다.
  8. 릴리스, 구성, 모델 목록, 자산 목록 및 복구 절차를 동결합니다.

대안

접근최적의 핏트레이드오프
Open-LLM-VTuber상호 교환 가능한 백엔드를 사용한 통합 개방형 음성/아바타 실험복잡한 설정, 진화하는 아키텍처 및 다중 라이센스
SillyTavern 및 음성/아바타 확장캐릭터 채팅 및 광범위한 프런트엔드 통합더 많은 확장 어셈블리 및 다양한 실시간 미디어 품질
VTube Studio 및 맞춤형 에이전트 서비스맞춤형 인텔리전스를 통한 스트리밍 등급 Live2D 제어더 많은 엔지니어링을 수행하지만 아바타와 AI 레이어의 더 명확한 분리
음성 전용 비서대화는 중요하지만 아바타는 가치를 거의 추가하지 않습니다.시각적 존재감이 적고 렌더링/라이센스 복잡성이 훨씬 낮습니다.
캐릭터 관리 플랫폼빠른 실행 및 호스팅된 작업백엔드 제어 감소, 반복 비용 및 데이터/공급업체 종속성
커스텀 WebRTC 파이프라인정확한 대기 시간, 안전성 및 규모가 요구되는 생산 제품최고의 구현 노력과 통제

자주 묻는 질문

모든 것이 오프라인으로 실행될 수 있나요?

선택한 모든 LLM, ASR, TTS, 번역, 메모리, 비전 및 도구 구성 요소가 로컬인 경우 원칙적으로 예입니다. 실제 구성 및 네트워크 트래픽을 감사합니다.

v2.0을 사용할 수 있나요?

공식 저장소에서는 v2를 초기 계획/토론 재작성이라고 설명합니다. 현재 사용자는 문서화된 v1.x 시스템 및 마이그레이션 위험을 평가해야 합니다.

GPU가 필요합니까?

무거운 모듈은 APIs 또는 CPU를 사용할 수 있으므로 절대적인 GPU 최소값은 존재하지 않습니다. 반응성이 뛰어난 완전 로컬 작업을 위해 프로젝트에서는 Apple M 시리즈 시스템 또는 지원되는 GPU 및 더 작은 모델을 권장합니다.

어떤 브라우저를 사용해야 합니까?

빠른 시작 가이드에서는 Chrome을 권장하고 알려진 Edge/Safari 문제에 대해 설명합니다. 원격 마이크 캡처에는 HTTPS 또는 localhost와 같은 보안 컨텍스트가 필요합니다.

번들로 제공되는 Live2D 모델을 상업적으로 사용할 수 있습니까?

그렇게 가정하지 마십시오. 프로젝트의 MIT 라이센스에서 제외되며 Live2D의 별도 샘플 데이터 조건이 적용되며 상업적 용도로 사용할 수 있는 추가 요구 사항이 있습니다.

이전 대화를 기억하나요?

채팅 로그가 유지됩니다. 선택적 메모리 에이전트 지원은 정확한 릴리스 및 구성에 따라 다르며 대기 시간이 추가될 수 있습니다. 일반 기능 목록에 의존하기보다는 동작을 확인하십시오.

1차 소스

2026년 7월 25일에 마지막으로 검토되었습니다. 모듈 지원 및 프로젝트 아키텍처가 빠르게 변경됩니다. 프로덕션에 사용하기 전에 정확한 릴리스, 구성, 공급자 및 자산 라이센스를 확인하십시오.

Ready to try Open-LLM-VTuber?

Visit the official website to get started

Visit Open-LLM-VTuber

Quick Info

Added
6/4/2026
Published
6/2/2026
Updated
9/1/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool