> For the complete documentation index, see [llms.txt](https://docs.vocu.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.vocu.ai/zh-hk/introduction/models.md).

# 模型介紹

我們的 **VOCU 語音大模型**已預先經過海量中文及多種語言音訊的訓練，訓練內容涵蓋多種類型，當中最多的是**有聲讀物**與**一般對話音訊**。若您提供的克隆音訊樣本以及目標文本屬此類內容，通常在生成語音時會取得較佳效果。我們的模型會盡量模仿克隆音訊樣本的**語調、語速、情感、停頓、響度、聲學環境、呼吸聲、口音、發聲方式**等特徵，盡可能理解目標文本的上下文，並綜合它們以產生最匹配的語音。

## Vocu 語音合成大模型 V3.1 <a href="#v2.9" id="v2.9"></a>

<sub>*發佈於 2025 年 12 月 6 日，V2 系列角色可手動升級至 V3.1 版本，V3.0-Alpha 角色已自動升級*</sub>

> 💡 升級提示：先前 V3.0-Alpha 版本的角色已自動升級至此版本。V2.X 角色需在詳情頁的「操作」選單中**手動升級**至本新版本。若您在升級現有角色後首次生成時等待時間較長，通常是系統正在自動升級該角色，請耐心等候。

對比 V3.0-Alpha 測試版，此版本帶來全新的**專業克隆**與**音色轉換能力**，並**全面提升各個場景與語言下**的**情感表現力、穩定性、相似度、自然度、語義感知能力**等，為您帶來更為驚艷的音訊生成效果。

而對比 V2 等早期版本，全新的 **V3 系列**語音合成大模型則帶來對**全球 30 餘種語言與方言**的全面支援，並在**情感張力、相似度、穩定性、自然度、語義理解能力**等各類表現上對比全球同類產品**大幅領先**，達到影視級性能。

#### 🎓 全新的**專業級語音克隆**能力正式上線

您可以提供**短至數十秒、長至數小時**的聲音樣本，我們的大模型會**深入訓練學習**您所提供聲音樣本的每一個**語調、發音方式、節奏、韻律、發聲習慣等各項細節**，實現**與原聲無法區分**的頂尖克隆合成效果。

#### 🎤 全新的**音色轉換能力**正式上線

您現在可以**將任意音訊的音色轉換為您所需的聲音**，以實現對聲音表現細節的**精確把控**，一人即可配製多個角色。並且，音色轉換能力與目前現有的**所有語音角色無縫兼容**，還支援**對歌聲進行轉換**，從而實現歌曲翻唱等相關創作。

#### 🧠 大模型核心能力全面提升

對比 **V3.0-Alpha** 測試版，V3.1 在面對**各個場景與語言的文本與角色**時，均能生成**情感表現力、穩定性、相似度、自然度、語義感知等能力更強**的音訊結果，讓您的聲音創作與應用效果更上一層樓。

#### 🔧 產品體驗改進與問題修復

除模型更新外，這段時間以來我們亦對產品體驗進行了**全面改進**，其中包括但不限於**大量 UI 設計改進與便利性重構、性能優化、問題修復**等變更。

由於變更量較大且篇幅有限，還望各位在產品使用過程中直接體驗，亦希望大家喜歡我們為各位帶來的這些新內容。

## VOCU 語音大模型 V3.0-Alpha <a href="#v2.9" id="v2.9"></a>

<sub>*發佈於 2025 年 8 月 26 日，V2 系列角色可手動升級至 V3 模型*</sub>

Vocu 語音大模型 V3.0-Alpha 是我們推出的全新跨度版本，作為全新階段的早期公測版本，帶來多項功能更新與能力增強，進一步拓展語音內容生成的表現力。具體更新如下：<br>

* 在 V3 版本中，**多語言樣本及跨語言生成能力**已可用。除早期已實現的中英文跨語言能力外，新增支援粵語、日語、韓語、法語、德語、西班牙語及葡萄牙語，以及這些語言共計 30 餘種口音變體。模型現已可直接處理這些語言的輸入與輸出。

*（需要注意的是，跨語種生成可能會因樣本發音而受到影響；使用該功能時建議採用清晰且對應語言的語音，以獲得最佳效果。）*

* **表現力與自然度提升**，在情感張力、相似度、穩定性、自然度、語義理解能力等多個維度上均顯著增強，新增支援多種複雜表現形式，包括嘶吼、Rap、撒嬌、ASMR 等，在極端情緒與細膩表達上亦可進行生成。
* 新增**生動表達**優化，支援為單一段落單獨啟用「生動表達」選項。啟用後，模型會基於對內容的理解自動調整語音細節，使語句更具表現力與感染力。（對於部分樣本可能導致結果不穩定）
* 新增**情感比例控制**優化，支援針對單一段落設定情感表達比例，可調整語句在生成時呈現更明確的情緒傾向，如憤怒、開心、傷感等。透過靈活控制情緒權重，模型輸出將具備更豐富的情感層次。
* **背景聲學特徵複刻優化**，樣本複刻能力大幅提升，不僅限於人聲特徵，還可智能還原**背景聲學特徵**，包括空間感、混響、音量等，使生成內容更貼近角色原聲質感。

## VOCU 語音大模型 V2.9 <a href="#v2.9" id="v2.9"></a>

*發佈於 2025 年 3 月 1 日，**目前為 V2 系列模型最新版本**，此前 V2.X 角色已自動升級至此兼容版本*

Vocu 語音大模型的最新版本。此版本引入大量來自開發中 V3 版本模型的功能與改進，在中文語音內容生成表現上達到了**全球範圍的 SOTA 水平**，相比此前版本更新內容如下：

* 大幅提升了\*\*非 Flash 模型（即高質素模式）\*\*下的生成音訊質素，並解決了長期以來生成結果可能出現電流鑲邊感的問題。
* 大幅提升了\*\*非 Flash 模型（即高質素模式）\*\*下的角色相似度與角色穩定性，且可在較大程度上還原角色原音訊樣本中的聲學環境（諸如空間感、混響、音量、錄音質感等）。
* 新增了全新的**全球首個**角色音色混合能力，可自由指定多個不同角色的音訊樣本，並按比例自由混合，以創造全新的角色音色。***（內部測試中，即將逐步開放）***
* 新增了全新的**全球首個**角色風格混合能力。在建立新的情感風格時，可以分別指定風格樣本與角色樣本進行融合，以創造全新的角色情感表現；例如，您可將相聲演員的風格與小女孩角色融合，為這個小女孩角色創造説相聲時的全新情感表現。***（內部測試中，即將逐步開放）***
* 新增了全新的**零門檻**角色智能翻配／翻唱能力，可以直接讓現有指定角色對已完成的生成結果重新翻配，或對您提供的任意語音或歌曲音訊內容進行翻配或翻唱，並在此過程中保留角色的許多風格特點，為您帶來更自由的新式音訊創作體驗。***（內部測試中，即將逐步開放）***

目前，該版本模型角色的生成點數消耗為 **`1 點數／字元`**

## VOCU 語音大模型 V2.5 <a href="#v2.5" id="v2.5"></a>

*發佈於 2024 年 11 月 26 日，**已棄用**，對應角色已自動升級至 V2.X 系列最新版本*

我們 V2.X 系列語音大模型的第二個正式版。此版本引入全新超參數與訓練策略，相比此前版本進一步提升了生成結果的自然度、韻律及情感表現，並在一定程度上提升了角色相似度、長篇內容穩定性，以及英文內容的生成表現。

## VOCU 語音大模型 V2.1 <a href="#v2.1" id="v2.1"></a>

*發佈於 2024 年 8 月 16 日，**已棄用**，對應角色已自動升級至 V2.X 系列最新版本*

我們 V2.X 系列語音大模型的首個正式版。此版本在自然情感表現力、生成效果、穩定性、即時克隆相似度等各項效果上相比過往版本大幅提升，並帶來更快的生成速度與更高的音訊質素，改進了英文生成效果，並改善及新增以下能力：

* **方言能力支援：** 得益於 Vocu 超強的人聲理解能力，我們現已能夠初步提供對部分種類方言口音的支援，包括河南話、東北話、重慶話等官話類方言口音及少部分非官話發音。
* **低延遲播放：** V2.1 版本的 Flash 模型現已支援最短 1 秒內開始播放生成結果，不限文本長度，滿足各類低延遲即時需求。在網頁端使用時選擇「低延遲模式」即可。
* **更精細的即時克隆能力：** 在即時克隆模式下，V2.1 對於較長樣本的理解力相比 V1.0 版本提升了 4 倍，能夠更深入地模仿較長樣本中藴含的各類表現。
* **更好的長上下文理解能力：** V2.1 版本對於較長生成文本的理解能力相比 V1.0 版本提升了 3 倍，可一次性理解更多文本，並生成更為貼合且更連貫的聲音表現。
* **Websocket 毫秒級生成：** 我們面向開發者增加了全新的 Websocket 生成通道，可實現串流生成請求與結果返回，且生成延遲最低可至 500ms，足以滿足各類高即時性需求。
* **更快的專業克隆速度：** 專業克隆所需時間大幅縮短；對於 30 分鐘的樣本，可在 3–5 分鐘內完成克隆任務。

## VOCU 語音大模型 V2.0Beta-3 <a href="#v2.0-beta-3" id="v2.0-beta-3"></a>

*發佈於 2024 年 7 月 8 日，**已棄用**，對應角色已自動升級至 V2.X 系列最新版本*

我們 V2.X 系列語音大模型的第三個測試版，相比第二個測試版進一步擁有以下改進：

* 電流音雜訊問題已得到極大改善，現在對於大部分音色樣本應無法感知到明顯電流音
* 穩定性大幅提升，現在對於長篇複雜內容的單次生成穩定性表現應得到較大改進
* 情感韻律表現獲得較大提升，現在對於非過於平淡樣本的情感表現應有明顯改善；建議搭配包含語氣詞及口語化表述的文本，以獲得最佳體驗
* 英文表現大幅改進，現基本已達到可用狀態
* Flash 模型串流生成延遲降低 50%+；在資源充足情況下，可固定在 500ms–1 秒內獲得可播放的生成結果
* 採用全新術策略，併發承載能力大幅提升，應有效改進此前因近期使用量增多導致的擠塞問題

對比 V1.0 版本的詳細更新內容請參見 V2.1 正式版介紹。

## VOCU 語音大模型 V2.0Beta-2-Flash <a href="#v2.0-beta-2-flash" id="v2.0-beta-2-flash"></a>

*發佈於 2024 年 6 月 25 日，**已隨 V2.0Beta-2 棄用**，後續版本均同步包含對應的 Flash 模型*

Vocu 語音大模型的首個低延遲 Flash 分支版本，由 V2.0Beta-2 衍生而來且互相兼容，帶來低延遲的生成時串流播放體驗，但相比主模型的音訊質素會有所下降；在資源充足的情況下，任意長度的內容透過該版本 Flash 模型均可在提交任務後 1–2 秒內開始聆聽生成結果。

## VOCU 語音大模型 V2.0Beta-2 <a href="#v2.0-beta-2" id="v2.0-beta-2"></a>

*發佈於 2024 年 6 月 18 日，**已棄用**，對應角色已自動升級至 V2.X 系列最新版本*

我們 V2.X 系列語音大模型的第二個測試版，在穩定性、可用性、音訊質素等各個方面相比第一個測試版均有進一步提升與改進。對比 V1.0 版本的詳細更新內容請參見 V2.1 正式版介紹。

## VOCU 語音大模型 V2.0Beta-1 <a href="#v2.0-beta-1" id="v2.0-beta-1"></a>

*發佈於 2024 年 6 月 10 日，**已棄用**，對應角色已自動升級至 V2.X 系列最新版本*

我們 V2.X 系列語音大模型的首個測試版。此版本的生成效果、穩定性、即時克隆相似度、生成速度與音訊質素相比 V1.0 版本有較大提升，但此時仍存在較多問題。對比 V1.0 版本的詳細更新內容請參見 V2.1 正式版介紹。

## VOCU 語音大模型 V1.0 <a href="#v1.0" id="v1.0"></a>

*發佈於 2024 年 1 月 11 日，**現已停止維護**，不支援建立新的 V1.0 角色；現有 V1.0 即時克隆角色可繼續生成，或一鍵升級至 V2.X 版本。*

我們首個正式發佈的模型版本，可在一定程度上理解文本上下文，並以與真人幾乎無異的表現力、情感、韻律和音色，基於文本生成人聲音訊，並且支援以極短樣本進行即時語音克隆。該版本模型亦帶來對英文語音合成及克隆的實驗性支援，但目前相較中文的穩定性與表現力可能較差。

目前，此模型的點數消耗量為 `1 點數／字元`。

## VOCU 語音大模型 V0.9Beta <a href="#v0.9" id="v0.9"></a>

*發佈於 2023 年 11 月，**已棄用**，對應角色已自動升級至 V1.X 系列最新版本*

我們第一個公開發佈的實驗性語音大模型，也是**全球首個具有中文本土化自然表現的生成式語音大模型**。此模型可以接近真人的語速、語調和語氣生成語音，更能模仿情緒上的變化，讓 AI 更加接近人類，並且支援即時語音克隆技術。目前僅支援中文。

此版本的語音模型 **(V0.9)** 仍然處於早期測試階段，存在較多已知問題。


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.vocu.ai/zh-hk/introduction/models.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
