Kitta Audio
產品
產品
產品概覽
探索一體化創作套件
聲音庫
適用於任意角色的音色
創建
文字轉語音
生成擬人化 AI 語音
多人對話
為多角色劇本生成對話音訊
語音轉文字
轉錄音訊和影片
聲音設計
生成專屬音色
變聲器
即將上線
用任意音色輸出音訊
人聲分離
提取清晰語音
語音克隆
克隆你的聲音
音效
即將上線
生成任意聲音
配音
即將上線
本地化音訊內容
音樂
即將上線
將創意變成歌曲
圖片
文字生成圖片
影片
用文字或圖片生成影片
S2
Fish Audio S2.1 Pro
支持多說話人、多輪生成,並可透過自然語言描述控制聲音表現。
API
平台
概覽文件API 參考文件API 金鑰API 價格API 調試台
API
文字轉語音
透過 API 生成語音
音樂
即將上線
透過 API 創作歌曲
語音轉文字
批量轉錄語音
音效
即將上線
透過 API 生成音效
即時語音轉文字
即時轉錄語音
語音克隆
克隆音色用於 TTS
語音引擎
即將上線
讓智能體具備語音能力
智能體
即將上線
幾分鐘內部署語音智能體
配音
即將上線
透過 API 翻譯影片和音訊
API
Fish Audio API 快速開始
線上調試語音生成、轉寫與帳戶金鑰
文字轉語音
將文本轉為自然流暢的語音,多模型可切換
語音轉文字
高精度音頻轉文字,支持多語種
聲音克隆
短樣本一鍵克隆聲音
配音廣場
瀏覽公開音色並選擇參考聲線
AI 圖片
提示詞生成高質量圖像
AI 視頻
文字描述生成視頻與風格
數字人 / 對口型
音畫同步,適用於虛擬人與講解
工作台
語音合成工作台,創建和管理您的配音項目
短視頻與配音
適合社媒、廣告與信息流內容
有聲書與播客
長文本朗讀與自然停頓
教育與培訓
課程講解與企業內訓話術
公司
關於博客
資源
Coze
Tavo
SillyTavern
Dify
Open WebUI
AnythingLLM
Home Assistant
n8n
推廣夥伴計劃
即將上線
API 在線調試
在線試用 REST 接口與示例請求
API 密鑰
在賬號中心創建與管理 API 密鑰
價格
聲音克隆教程

語音合成精細控制

對語音生成進行高級控制

開始使用

要使用精細控制功能,可能會降低閱讀數字、日期和URL的穩定性。您需要手動處理這些情況以獲得最佳效果。

音素控制

音素控制允許您為單詞或字符指定精確的發音。目前支持:

  • CMU Arpabet (英語)
  • 拼音 (中文)

使用音素控制時,請將所需發音包含在 <|phoneme_start|> 和 <|phoneme_end|> 標籤中。每個標籤應包含一個單詞或字符。

示例

標準(英): I am an engineer.

帶控制(英): I am an <|phoneme_start|>EH N JH AH N IH R<|phoneme_end|>.

標準: 我是一個工程師。

控制: 我是一個<|phoneme_start|>gong1<|phoneme_end|><|phoneme_start|>cheng2<|phoneme_end|><|phoneme_start|>shi1<|phoneme_end|>。

副語言控制

副語言控制允許您添加自然語音元素和停頓,使生成的語音聽起來更像人類。主要有兩種類型的控制:

停頓詞

您可以使用常見的停頓詞如"嗯"、"啊"、"um"、"uh"來控制語音的節奏。

特殊效果

以下特殊效果可以使用括號添加:

效果說明首次可用階段
(break)短暫停頓V2實驗性
(long-break)延長停頓V2實驗性
(breath)呼吸聲V2實驗性
(laugh)笑聲V2實驗性
(cough)咳嗽聲V2實驗性
(lip-smacking)咂嘴聲V2實驗性
(sigh)嘆息聲V2實驗性

效果 (laugh)、(cough)、(lip-smacking) 和 (sigh) 正在開發中。您可能需要重複多次以獲得更好的效果。

英文示例:

標準(英文): I am an engineer.

帶副語言(英文): I am, um, an (break) engineer.

中文示例:

標準: 我是一名工程師。

添加副語言: 我,嗯,是一名(break)工程師。

下一步

API Playground →
通過 API 集成
使用文本轉語音 API 構建語音應用,可在 Playground 中在線調試。
免費試用 →
在線免費聲音克隆
約 1 分鐘即可創建授權音色,無需信用卡,可從免費額度開始。