AI-VTuber 專案複盤
我想用幾年前的舊電腦,打造出能自己說話、自己直播的虛擬主播,而且每個月的花費要控制在一頓飯的錢。 我在這個專案中負責一人 AI 協作開發,包辦工具評估、成本規劃,並寫出第一版可運行的原型。
成果速覽
- 成功打通「文字輸入到虛擬角色開口說話並同步對嘴」的完整流程,單一角色可正常運作。
- 針對高達二十八秒的直播延遲,規劃出可縮短至四到五秒的優化路徑。
- 規劃出雲端與在地的混合模式,將每月營運成本控制在美金十元至六十元之間。
- 目前狀態:技術驗證已通過,預計近期上線。聲音模仿功能因電腦配備限制,目前暫時擱置。
舊電腦的極限生存戰:為什麼需要雲端與在地的混合大腦?
我的電腦顯示卡是幾年前的舊型號,記憶體空間只有 6GB,沒辦法在電腦裡直接運行足夠聰明的 AI。這就像在小套房裡想塞進一張特大號辦公桌,空間根本不夠。
為了解決這個硬體限制,我採取了「混合大腦」的策略。需要動腦思考的部分,我用網路連線到外部現成的雲端智慧服務,用多少付多少。而把文字轉成聲音的部分,因為比較不佔用資源,就直接在自己的電腦上運行。這樣既能維持虛擬主播的聰明程度,又能省下大筆的雲端語音費用,把每個月的開銷壓在一頓飯的錢。
note技術細節:硬體規格與混合架構配置
顯示卡為 GTX 1660(6GB VRAM,無 Tensor Core),無法承載本地 LLM。 推理採用 OpenRouter 的 API 降低成本,語音合成則在本地運行 GPT-SoVITS。 月度預算規劃在 10 到 60 美元之間。 延伸參考連結:AI-VTuber-MOC 與 [[AI-VTuber 是什麼-白話入門]]。
站在巨人的肩膀上:用現成框架快速做出原型
與其自己從零開始組裝一台跑車,不如先買一台市面上現成的半成品車,我只要負責改裝引擎和外殼就好。在開發的第一階段,我沒有花時間自己去寫所有的基礎程式。
市場上已經有許多熱心開發者整理好的開源工具包,它們把「讀取文字、轉成語音、控制虛擬人物對嘴」這條流水線都接好了。我直接使用這些現成的工具,快速把整套流程跑通。雖然中間一度想讓虛擬主播複製特定的聲音,但因為舊電腦的算力實在吃不消,這個聲音模仿的功能只能先放進冷凍庫。不過,目前虛擬角色已經可以看著文字,順暢地動起嘴巴說話了。
note技術細節:開源框架與對嘴實作
使用 AIRI 或 Open-LLM-VTuber 等開源框架快速搭建原型。 暫時擱置 GPT-SoVITS 的少樣本聲線克隆(VRAM 與 FP16 效能限制)。 成功實作 Live2D 的唇形同步(Lip-sync)流程。 參考指南:[[GPT-SoVITS 與 Live2D 接線安裝指南]]。
三個秘訣,讓虛擬主播動起來像個活人
如果 AI 每次只要關掉視窗就忘記你是誰,那他只是個客服機器人,而不是有靈魂的角色。要讓他像活人,我需要給他一本隨身筆記本、裝一個定時鬧鐘,最後再加上一套牢固的劇本。
要讓觀眾覺得螢幕裡的虛擬角色是個「活生生的人」,必須堆疊出三種工程設計:
第一是「記住聊天內容」。我幫他設計了一套像是隨身筆記本的機制,把重要的事情記錄下來,每次說話前先翻一下。
第二是「主動找話題」。如果沒人打字,主播就一直發呆,那直播間會非常尷尬。於局我裝了一個定時器,每隔一段時間就戳一下 AI,問他現在想聊什麼,他就會自己開啟新話題。
第三是「維持個性」。透過給 AI 明確的設定說明書,確保他不會聊著聊著就變成了另一個陌生人。
note技術細節:記憶與擬自主機制設計
記憶層級:起步採用「事實清單 + 滾動摘要」的純文字檔案做法。 主動迴圈:由排程器定時觸發 LLM 推理,解決被動響應問題。 人格一致性:透過系統提示詞(System Prompt)與檢索上下文維持設定。 深入細節見 [[AI VTuber 的記憶與自主性設計]]。
接下來的計畫:從單角色到一整個主播經紀公司
我的規劃分成三個步驟:首先是讓單一角色能夠順暢說話與對嘴,這一步我已經完成了。接下來,我打算把她送上網路直播平台,進行短時間的實測,並著手把畫面延遲的時間縮短。
最後的終極目標,是建立一個能夠自動調度多個角色的系統,讓好幾個虛擬主播能互相對話、互相吐槽。雖然市場上有些平台有著營利門檻的限制,但技術這條路已經完全打通,我很期待看到她們正式上線的那一天。
note技術細節:直播優化與多角色規劃
直播端實測延遲 28 秒,優化方案請見 [[直播延遲優化方案]]。 多角色編排涉及多 Agent 協同與音訊混音,目前市面無現成方案。 本專案整體複盤索引:專案複盤-MOC。