Kitta Audio
產品
產品
產品概覽
探索一體化創作套件
聲音庫
適用於任意角色的音色
創建
文字轉語音
生成擬人化 AI 語音
多人對話
為多角色劇本生成對話音訊
語音轉文字
轉錄音訊和影片
聲音設計
生成專屬音色
變聲器
即將上線
用任意音色輸出音訊
人聲分離
提取清晰語音
語音克隆
克隆你的聲音
音效
即將上線
生成任意聲音
配音
即將上線
本地化音訊內容
音樂
即將上線
將創意變成歌曲
圖片
文字生成圖片
影片
用文字或圖片生成影片
S2
Fish Audio S2.1 Pro
支持多說話人、多輪生成,並可透過自然語言描述控制聲音表現。
API
平台
概覽文件API 參考文件API 金鑰API 價格API 調試台
API
文字轉語音
透過 API 生成語音
音樂
即將上線
透過 API 創作歌曲
語音轉文字
批量轉錄語音
音效
即將上線
透過 API 生成音效
即時語音轉文字
即時轉錄語音
語音克隆
克隆音色用於 TTS
語音引擎
即將上線
讓智能體具備語音能力
智能體
即將上線
幾分鐘內部署語音智能體
配音
即將上線
透過 API 翻譯影片和音訊
API
Fish Audio API 快速開始
線上調試語音生成、轉寫與帳戶金鑰
文字轉語音
將文本轉為自然流暢的語音,多模型可切換
語音轉文字
高精度音頻轉文字,支持多語種
聲音克隆
短樣本一鍵克隆聲音
配音廣場
瀏覽公開音色並選擇參考聲線
AI 圖片
提示詞生成高質量圖像
AI 視頻
文字描述生成視頻與風格
數字人 / 對口型
音畫同步,適用於虛擬人與講解
工作台
語音合成工作台,創建和管理您的配音項目
短視頻與配音
適合社媒、廣告與信息流內容
有聲書與播客
長文本朗讀與自然停頓
教育與培訓
課程講解與企業內訓話術
公司
關於博客
資源
Coze
Tavo
SillyTavern
Dify
Open WebUI
AnythingLLM
Home Assistant
n8n
推廣夥伴計劃
即將上線
API 在線調試
在線試用 REST 接口與示例請求
API 密鑰
在賬號中心創建與管理 API 密鑰
價格
首頁/博客/教程
教程2026-03-13·8 分鐘閱讀

如何用 Fish Audio API 製作有聲書

Fish Audio 是目前最自然的 AI 語音模型之一。本文介紹如何通過 Kitta Audio(基於 Fish Audio API 構建)完成一本有聲書的完整製作流程。

為什麼選擇 Fish Audio 製作有聲書?

Fish Audio 的 S1 模型在 TTS-Arena2 基準測試中排名第一,以情感控制和自然度著稱。對於有聲書製作,它有三個關鍵優勢:

聲音克隆

使用本人或已授權音頻樣本創建旁白音色,保持整本書的聲音一致性。

情感表達

支持開放域情感描述,讓對話場景更生動,不再是機械朗讀。

40+ 語言

訓練一次聲音模型,即可用於多語言版本,輕鬆製作多語言有聲書。

製作流程:5 個步驟

1

準備參考音頻

錄製或收集 10–30 秒的清晰音頻樣本。音頻越乾淨(無背景噪音),克隆效果越好。支持 MP3、WAV、M4A 格式。

2

在 Kitta Audio 創建聲音模型

登錄 Kitta Audio,進入「聲音克隆」,上傳參考音頻,填寫聲音名稱,點擊開始克隆。約 1 分鐘完成訓練。

3

分段處理書稿

將書稿按章節分段,每段建議不超過 1000 字。使用 Kitta Audio 的長文本模式或批量模式,系統會自動分段處理。

4

生成並下載音頻

選擇克隆好的聲音模型,粘貼文本,點擊生成。支持批量生成多章節,完成後下載 MP3 文件。

5

後期處理(可選)

使用 Audacity 或 Adobe Audition 對各章節音頻進行音量均衡和拼接,導出最終有聲書文件。

提升質量的技巧

參考音頻中包含情感變化(不要只用平淡朗讀),克隆出的聲音表現力更強
對話場景可以在文本中加入情感提示詞,如「(激動地)」,Fish Audio 支持自然語言情感控制
長文本建議每段 500–800 字,避免單次生成過長導致質量下降
同一本書的所有章節使用同一個聲音模型,保持一致性

FAQ

Fish Audio API 適合製作有聲書嗎?

Fish Audio API 非常適合有聲書製作。它支持聲音克隆(只需 10 秒音頻樣本)、40+ 語言、批量文本處理,以及低延遲生成。Kitta Audio 基於 Fish Audio API 構建,提供更簡潔的操作界面。

用 Fish Audio 製作有聲書需要多少費用?

Fish Audio 提供免費套餐(每月 8000 積分,約 7 分鐘音頻)。通過 Kitta Audio 使用 Fish Audio 技術,免費套餐包含 1000 積分,付費套餐從每月 20000 積分起。

一本 10 萬字的有聲書需要多少積分?

以 Kitta Audio 的標準計費,10 萬字約需 10 萬積分(1 積分 = 1 字符)。Pro 套餐每月 20000 積分,製作完整有聲書建議選擇按需充值方案。

立即開始製作你的有聲書

Kitta Audio 基於 Fish Audio 技術,免費套餐即可體驗聲音克隆和有聲書製作。

免費開始 →API 在線調試

相關內容

Kitta Audio 首頁 →聲音克隆教程 →Fish Audio S2 模型介紹 →MiMo-V2-TTS 指南 →
產品
  • 文字轉語音
  • 多人對話
  • 語音轉文字
  • 聲音設計
  • 變聲器即將上線
  • 人聲分離
  • 聲音克隆
  • 音效即將上線
  • 配音即將上線
  • 音樂即將上線
  • 圖片
  • 影片
解決方案
  • 短視頻與配音
  • 有聲書與播客
  • 教育與培訓
研究
  • Fish Audio S2.1 Pro
  • Fish Audio S2 Pro
  • Fish Audio S1
資源
  • 文件
  • API 參考文件
  • 模型庫
  • 聲音克隆教程
  • 產品對比
公司
  • 關於
  • 博客

產品

  • 文字轉語音
  • 多人對話
  • 語音轉文字
  • 聲音設計
  • 變聲器即將上線
  • 人聲分離
  • 聲音克隆
  • 音效即將上線
  • 配音即將上線
  • 音樂即將上線
  • 圖片
  • 影片

解決方案

  • 短視頻與配音
  • 有聲書與播客
  • 教育與培訓

研究

  • Fish Audio S2.1 Pro
  • Fish Audio S2 Pro
  • Fish Audio S1

資源

  • 文件
  • API 參考文件
  • 模型庫
  • 聲音克隆教程
  • 產品對比

公司

  • 關於
  • 博客
Kitta Audio
© 2026 Kitta Audio。保留所有權利。Kitta AI|隱私政策|服務條款|舉報濫用|support@kittaai.com
support@kittaai.com

Kitta Audio 由 Kitta AI 獨立營運,非 Fish Audio 官方服務。