Kitta AI
Produtos
Produtos
Visão geral do produto
Explore o pacote criativo tudo em um
Biblioteca de vozes
Vozes para qualquer papel ou personagem
Criar
Texto para fala
Gere fala de IA natural
Diálogo multivoz
Crie áudio de diálogo a partir de roteiros com vários personagens
Fala para texto
Transcreva áudio e vídeo
Design de voz
Gere vozes personalizadas
Alterador de voz
Em breve
Produza áudio com qualquer voz
Isolamento de voz
Extraia fala clara
Clonagem de voz
Clone sua voz
Efeitos sonoros
Em breve
Gere qualquer som
Dublagem
Em breve
Localize conteúdo de áudio
Música
Em breve
Transforme ideias em músicas
Imagens
Gere imagens a partir de texto
Vídeo
Gere vídeo a partir de texto ou imagens
S2
Fish Audio S2.1 Pro
Geração multi-locutor e multi-turno com controle da voz por linguagem natural.
API
Plataforma
Visão geralDocumentaçãoReferência da APIChaves de APIPreços da APIAPI Playground
API
Texto para fala
Gere fala pela API
Música
Em breve
Crie músicas pela API
Fala para texto
Transcreva fala em lote
Efeitos sonoros
Em breve
Gere efeitos pela API
Fala para texto em tempo real
Transcreva fala em tempo real
Clonagem de voz
Clone vozes para TTS
Motor de fala
Em breve
Dê recursos de voz aos agentes
Agentes
Em breve
Implante agentes de voz em minutos
Dublagem
Em breve
Traduza vídeo e áudio pela API
API
Início rápido da Fish Audio API
Teste geração de voz, transcrição e chaves da conta online
Texto para fala
Converta texto em fala natural com Fish Audio, MiniMax, Qwen e mais
Fala para texto
Transcrição de alta precisão a partir de áudio enviado
Clonagem de voz
Clone sua voz em cerca de 1 minuto com amostras curtas
Galeria de vozes
Veja modelos públicos e escolha uma voz de referência
Imagem com IA
Gere imagens a partir de prompts com os principais modelos
Vídeo com IA
Crie vídeo a partir de texto e estilo
Sincronização labial e humano digital
Alinhe fala ao vídeo para avatares e apresentadores
Espaço de trabalho de voz
Espaço de trabalho para síntese de voz e gerenciamento de projetos
Vídeo curto e dublagem
Narração rápida para redes sociais, anúncios e UGC
Audiolivros e podcasts
Narração longa com ritmo natural
Educação e treinamento
Narração clara para cursos e comunicação interna
Empresa
SobreArtigos
Recursos
Coze
Tavo
SillyTavern
Dify
Open WebUI
AnythingLLM
Home Assistant
n8n
Programa de afiliados
Em breve
Playground da API
Teste endpoints REST online com sua chave de API
Chaves de API
Crie e gerencie tokens
Preços
Tutorial de clonagem de voz

Controle fino de texto para fala

Controle avançado da geração de voz

Primeiros passos

Sem normalização, números, datas e URLs podem soar instáveis — ajuste manualmente se necessário.

Controle de fonemas

O controle de fonemas define pronúncias exatas. Suporte atual:

  • CMU Arpabet (inglês)
  • Pinyin (chinês)

Envolva a pronúncia entre <|phoneme_start|> e <|phoneme_end|>. Cada tag deve ter só uma palavra ou caractere.

Exemplos

Padrão: I am an engineer.

Com controle: I am an <|phoneme_start|>EH N JH AH N IH R<|phoneme_end|>.

Padrão (ZH): 我是一个工程师。

Com controle: 我是一个<|phoneme_start|>gong1<|phoneme_end|><|phoneme_start|>cheng2<|phoneme_end|><|phoneme_start|>shi1<|phoneme_end|>。

Paralinguagem

Paralinguagem adiciona pausas e vícios de linguagem para soar mais humano. Dois tipos principais:

Palavras de preenchimento

Use "um", "uh", "嗯", "啊" etc. para marcar o ritmo.

Efeitos especiais

Estes efeitos usam parênteses:

EfeitoDescriçãoPrimeira versãoEstágio
(break)Pausa curtaV2Em teste
(long-break)Pausa longaV2Em teste
(breath)RespiraçãoV2Em teste
(laugh)RisadaV2Em teste
(cough)TosseV2Em teste
(lip-smacking)Som de lábiosV2Em teste
(sigh)SuspiroV2Em teste

(laugh), (cough), (lip-smacking) e (sigh) estão em desenvolvimento — repita se precisar.

Exemplo em inglês:

Padrão: I am an engineer.

Com paralinguagem: I am, um, an (break) engineer.

Exemplo em chinês:

Padrão: 我是一名工程师。

Com paralinguagem: 我,嗯,是一名(break)工程师。

Próximos passos

API Playground →
Integrar via API
Use a API de texto para fala em apps com voz. Teste no playground.
Experimentar grátis →
Clonagem de voz online grátis
Clone qualquer voz em menos de 1 minuto, sem cartão. Comece pelo plano gratuito.