Jun.
AI BLOG
2026-06-06更新於 2026-09-01AI-VTuber

AI VTuber 是什麼?——白話引導入門

情境:在直播平台上看到虛擬角色一邊玩遊戲一邊與觀眾即時互動,反應靈敏得像真人,讓我好奇背後的技術運作,以及個人是否能以極低預算搭建出來。 角色:我在這個專案中負責架構調研與硬體可行性評估,透過一人與 AI 協作開發的方式,探索如何以低成本的軟硬體組裝出自動化運作的系統。 成果速覽:

  • 規劃出一個只需一張家用舊型顯示卡、每月營運成本控制在台幣一千元以內的 AI 虛擬主播架構。
  • 驗證在僅有 6GB 顯示記憶體的舊型顯示卡上,透過雲端與在地混搭的分工模式,可流暢執行即時對話與語音合成。
  • 篩選出三套現成開源軟體框架,免去從零開發核心對話與角色驅動模組的繁瑣工作。

什麼是 AI 虛擬主播?

虛擬主播,也就是一般常說的 VTuber,是指在直播時不露臉,而是用一個二維或三維的卡通角色代替真人。這個卡通角色背後通常有真人進行配音與表情追蹤。

而 AI 虛擬主播,則是把背後的真人換成人工智慧。這意味著沒有真人操縱,角色的頭腦是由大語言模型,也就是類似 ChatGPT 的對話系統來代替,自己會思考、自己會說話,還能即時讀取並回覆觀眾的留言。

note技術細節:AI 虛擬主播的運作定義

AI VTuber 核心在於將「中之人」,也就是虛擬角色背後的真人操縱者,替換為基於大語言模型(LLM)的智能代理。角色透過串接直播平台 API 獲取觀眾留言,再透過語音合成(TTS)與動態驅動軟體完成即時互動。


把主播拆解成七個身體器官

要讓一個虛擬角色像真人一樣直播,我需要把它的系統拆解成七個互相配合的零件:

  1. 大腦:負責決定要說什麼。這就像是角色的靈魂,決定了她的個性和說話風格。
  2. 嘴巴:負責把大腦想好的文字念成聲音,還能模仿特定的音色。
  3. 耳朵:負責把聽到的聲音轉成文字。不過因為大部分主播是讀彈幕留言,這個器官通常可以先省略。
  4. 臉和身體:透過驅動軟體,讓一張平面的卡通圖片變得會眨眼、會動,並且在說話時嘴巴能跟著聲音開合。
  5. 看留言的眼睛:負責到直播平台即時抓取觀眾寫了什麼。
  6. 記憶力:讓角色記住幾分鐘前聊過的話,避免像金魚一樣轉頭就忘。
  7. 轉播車:負責把電腦上會動的角色畫面,打包傳送到直播平台上。
note技術細節:核心組件與驅動機制

系統核心組件包含 LLM(大語言模型)、TTS(文字轉語音)與 ASR(語音辨識)。角色外觀採用 Live2D 技術,並透過 VTube Studio 進行驅動。聲音與口型同步(Lip-sync)是利用虛擬音訊線(Virtual Audio Cable)將 TTS 的音訊訊號模擬為麥克風輸入,進而觸發 VTube Studio 的嘴型開合。


訊息是怎麼在身體裡跑完一圈的?

當觀眾在直播間送出一句留言,這七個零件就會像工廠流水線一樣,在短短幾秒內接力合作:

graph TD
    A(觀眾留言) --> B(眼睛:聊天室串接抓取)
    B --> C(大腦:模型生成回答)
    C --> D(嘴巴:語音合成轉為聲音)
    D --> E(身體:驅動軟體進行唇形同步)
    E --> F(轉播車:直播軟體推流上網)
note技術細節:資料流與延遲控制

訊息生命週期:YouTube Live Chat API -> LLM Inference -> TTS Generation -> Virtual Audio Cable -> VTube Studio -> OBS Studio -> RTMP Stream。為降低整體延遲,各模組多採非同步(Async)調用,並限制 LLM 輸出的最大 Token 數量以加速首字回應時間。


別從零造輪子,借用現成的半成品

我不需要自己從頭寫程式把這些零件接起來。這就像組裝樂高,網路上已經有許多開源,也就是免費公開且允許自由修改的現成組合包,我只需要挑選適合的來改裝即可:

  • AIRI:目前社群裡最活躍、開發目標最龐大的專案。
  • Open-LLM-VTuber:主打可以完全在個人電腦上離線執行,非常適合新手。
  • Ikaros-521:對於各大直播平台的支援度最廣泛。
note技術細節:開源框架技術棧

AIRI、Open-LLM-VTuber 與 Ikaros-521(AI-Vtuber)提供開箱即用的整合方案。開發者可透過設定檔調整其背後串接的模型 API。針對多角色與自動排程推流(Auto-streaming),需額外透過 Python 腳本或系統排程(Cron Job)調用 OBS 的 WebSocket 介面來實現自動化。


錢要花在刀口上

在預算有限的情況下,軟體基本上都可以使用免費方案,最大的成本其實在於硬體顯示卡。

我的個人電腦顯示卡記憶體只有 6GB,塞不下夠聰明的大腦。這就像想在小套房裡放一張特大號床,床本身沒問題,是房間放不下。

所以我採取「內外分工」的策略: 大腦部分,我透過網路連線到雲端的付費服務,付一點點過路費,請雲端幫忙思考;而珍貴的 6GB 本地顯示卡記憶體,則全部留給需要快速反應的語音合成系統。這樣不僅省下購買昂貴顯示卡的硬體成本,還能將每個月的營運費用控制在台幣一兩千元以內。

note技術細節:低 VRAM 算力分配策略

在 6GB VRAM(如 GTX 1660)環境下,無法同時部署 7B 級別的在地 LLM 與實時 TTS 模型(如 GPT-SoVITS)。折衷架構為:LLM 採用外部 API(如 OpenAI 或 DeepSeek),本地 GPU 專注執行 GPT-SoVITS 的推理。本地模型可採用 int4 或 int8 量化(Quantization)技術降低記憶體佔用。


接下來的計畫

看懂這張技術地圖後,我的動手順序如下:

  1. 第一階段:使用 Open-LLM-VTuber 框架,在我的電腦上跑出一個會講話、有畫面的角色。
  2. 第二階段:串接直播平台,進行短時間的開播測試。
  3. 第三階段(尚未驗證):研究如何讓多個角色輪流或同時自動開播,並解決斷線自動重連的技術。

AI-VTuber-MOC AI-LLM-MOC [[Hermes Desktop 設定 Gemma 4 E2B 教學]]

回到 AI BLOG