Kitta Audio
製品
製品
製品概要
一体型クリエイティブスイートを探索
音声ライブラリ
あらゆる役柄やキャラクター向けの声
作成
テキスト読み上げ
人間らしい AI 音声を生成
マルチスピーカー対話
複数キャラクターの台本から対話音声を生成
音声テキスト化
音声と動画を文字起こし
音声デザイン
カスタム音声を生成
ボイスチェンジャー
近日公開
任意の声で音声を出力
音声分離
クリアな音声を抽出
音声クローン
自分の声をクローン
効果音
近日公開
任意のサウンドを生成
吹き替え
近日公開
音声コンテンツをローカライズ
音楽
近日公開
アイデアを楽曲に変換
画像
テキストから画像を生成
動画
テキストや画像から動画を生成
S2
Fish Audio S2.1 Pro
複数話者、複数ターン生成に対応し、自然言語で音声表現を制御できます。
API
プラットフォーム
概要ドキュメントAPI リファレンスAPI キーAPI 料金API Playground
API
テキスト読み上げ
API で音声を生成
音楽
近日公開
API で楽曲を作成
音声テキスト化
音声を一括文字起こし
効果音
近日公開
API で効果音を生成
リアルタイム音声テキスト化
音声をリアルタイムで文字起こし
音声クローン
TTS 用の声をクローン
音声エンジン
近日公開
エージェントに音声機能を追加
エージェント
近日公開
数分で音声エージェントを展開
吹き替え
近日公開
API で動画と音声を翻訳
API
Fish Audio API クイックスタート
音声生成、文字起こし、アカウントキーをオンラインで試せます
テキスト読み上げ
Fish Audio、MiniMax、Qwen などで自然な音声に変換
音声テキスト化
アップロードした音声を高精度で文字起こし
音声クローン
短いサンプルから約 1 分で自分の声を再現
音声ギャラリー
公開モデルを閲覧し参照音声を選ぶ
AI 画像
主要モデルでプロンプトから画像生成
AI 動画
テキストとスタイルから動画を作成
リップシンク・デジタルヒューマン
アバターやプレゼン向けに音声と映像を同期
音声ワークスペース
音声合成のワークスペースでプロジェクトを管理
ショート動画・吹き替え
SNS、広告、UGC 向けに素早くナレーション
オーディオブック・ポッドキャスト
自然なテンポの長尺ナレーション
教育・研修
講座や社内コミュニケーション向けの明瞭な読み上げ
会社
会社情報ブログ
リソース
Coze
Tavo
SillyTavern
Dify
Open WebUI
AnythingLLM
Home Assistant
n8n
アフィリエイトプログラム
近日公開
API プレイグラウンド
API キーで REST をオンライン試行
API キー
トークンの作成と管理
料金
音声クローン チュートリアル

テキスト読み上げのきめ細かい制御

音声生成の高度な制御

はじめに

正規化を無効にすると、数字・日付・URL の読み上げが不安定になることがあります。最適な結果のため、これらは手動で調整してください。

音素制御

音素制御では、単語や文字の発音を正確に指定できます。現在サポートしているのは次のとおりです。

  • CMU Arpabet(英語)
  • ピンイン(中国語)

音素制御を使う場合は、発音を <|phoneme_start|> と <|phoneme_end|> で囲みます。各タグには単語または文字を 1 つだけ入れてください。

例

標準(英): I am an engineer.

制御あり(英): I am an <|phoneme_start|>EH N JH AH N IH R<|phoneme_end|>.

標準: 我是一个工程师。

制御: 我是一个<|phoneme_start|>gong1<|phoneme_end|><|phoneme_start|>cheng2<|phoneme_end|><|phoneme_start|>shi1<|phoneme_end|>。

パラ言語

パラ言語制御では、自然な発話要素や間を加え、より人間らしい音声にできます。主に次の 2 種類があります。

フィラー・間投詞

「um」「uh」「嗯」「啊」などの一般的なフィラーで、話すリズムを調整できます。

特殊効果

次の特殊効果は括弧で追加できます。

効果説明初対応段階
(break)短い間V2実験的
(long-break)長い間V2実験的
(breath)呼吸音V2実験的
(laugh)笑い声V2実験的
(cough)咳V2実験的
(lip-smacking)唇を鳴らす音V2実験的
(sigh)ため息V2実験的

(laugh)、(cough)、(lip-smacking)、(sigh) は開発中です。効果を出しやすくするには繰り返しを試してください。

英語の例:

標準: I am an engineer.

パラ言語あり: I am, um, an (break) engineer.

中国語の例:

標準: 我是一名工程师。

パラ言語を追加: 我,嗯,是一名(break)工程师。

次のステップ

API Playground →
API で統合
テキスト読み上げ API で音声アプリを構築。Playground でその場で試せます。
無料で試す →
オンラインで音声クローン
約 1 分で任意の声をクローン。クレジットカード不要で無料枠から始められます。