Kitta AI
المنتجات
المنتجات
نظرة عامة على المنتج
استكشف مجموعة الإنشاء المتكاملة
مكتبة الأصوات
أصوات لأي دور أو شخصية
إنشاء
تحويل النص إلى صوت
أنشئ صوتاً بالذكاء الاصطناعي يشبه البشر
حوار متعدد المتحدثين
أنشئ صوت حوار من نصوص متعددة الشخصيات
تحويل الصوت إلى نص
فرغ الصوت والفيديو إلى نص
تصميم الصوت
أنشئ أصواتاً مخصصة
مغير الصوت
قريبًا
أخرج الصوت بأي نبرة
عزل الصوت
استخرج كلاماً واضحاً
استنساخ الصوت
استنسخ صوتك
المؤثرات الصوتية
قريبًا
أنشئ أي صوت
الدبلجة
قريبًا
وطن محتوى الصوت
الموسيقى
قريبًا
حول الأفكار إلى أغان
الصور
أنشئ صوراً من النص
الفيديو
أنشئ فيديو من النص أو الصور
S2
Fish Audio S2.1 Pro
توليد متعدد المتحدثين والجولات مع التحكم في الأداء الصوتي باللغة الطبيعية.
API
المنصة
نظرة عامةالوثائقمرجع APIمفاتيح APIأسعار APIAPI Playground
API
تحويل النص إلى صوت
أنشئ الصوت عبر API
الموسيقى
قريبًا
أنشئ أغان عبر API
تحويل الصوت إلى نص
فرغ الكلام دفعة واحدة
المؤثرات الصوتية
قريبًا
أنشئ مؤثرات عبر API
تحويل فوري للصوت إلى نص
فرغ الكلام في الوقت الفعلي
استنساخ الصوت
استنسخ أصواتاً لاستخدامها في TTS
محرك الصوت
قريبًا
أضف قدرات صوتية إلى الوكلاء
الوكلاء
قريبًا
انشر وكلاء صوتيين خلال دقائق
الدبلجة
قريبًا
ترجم الفيديو والصوت عبر API
API
البدء السريع مع Fish Audio API
اختبر توليد الصوت والتفريغ ومفاتيح الحساب عبر الإنترنت
تحويل النص إلى كلام
حوّل النص إلى كلام طبيعي عبر Fish Audio وMiniMax وQwen وغيرها
تحويل الكلام إلى نص
نسخ دقيق للصوت المرفوع
استنساخ الصوت
استنسخ صوتك في نحو دقيقة من عينات قصيرة
معرض الأصوات
تصفّح النماذج العامة واختر صوتاً مرجعياً
صورة بالذكاء الاصطناعي
أنشئ صوراً من الموجهات بأفضل النماذج
فيديو بالذكاء الاصطناعي
أنشئ فيديو من الوصف والأنماط
مزامنة الشفاه والإنسان الرقمي
زامن الكلام مع الفيديو للصور الرمزية والعروض
مساحة عمل الصوت
مساحة عمل لتركيب الصوت وإدارة مشاريعك
فيديو قصير ودبلجة
تعليق صوتي سريع لوسائل التواصل والإعلانات ومحتوى المستخدمين
كتب صوتية وبودكاست
سرد طويل بإيقاع طبيعي
التعليم والتدريب
سرد واضح للدورات والتواصل الداخلي
الشركة
من نحنالمدونة
الموارد
Coze
Tavo
SillyTavern
Dify
Open WebUI
AnythingLLM
Home Assistant
n8n
برنامج الشركاء
قريبًا
ساحة تجربة API
جرّب نقاط REST عبر الإنترنت بمفتاح API
مفاتيح API
إنشاء وإدارة الرموز
الأسعار
دورة استنساخ الصوت

تحكم دقيق في تحويل النص إلى كلام

تحكم متقدم في توليد الصوت

البدء

تعطيل التطبيع قد يقلل ثبات قراءة الأرقام والتواريخ والروابط — عالجها يدويًا عند الحاجة.

التحكم بالفونيمات

يتيح تحديد النطق بدقة. الدعم الحالي:

  • CMU Arpabet (الإنجليزية)
  • البينيين (الصينية)

ضع النطق بين <|phoneme_start|> و <|phoneme_end|>. كل وسم يحتوي كلمة أو حرفًا واحدًا.

أمثلة

قياسي: I am an engineer.

مع تحكم: I am an <|phoneme_start|>EH N JH AH N IH R<|phoneme_end|>.

قياسي (ص): 我是一个工程师。

مع تحكم: 我是一个<|phoneme_start|>gong1<|phoneme_end|><|phoneme_start|>cheng2<|phoneme_end|><|phoneme_start|>shi1<|phoneme_end|>。

شبه لغوي

تضيف وسوم شبه لغوية توقفات وكلمات حشو لتبدو الكلامة أكثر طبيعية. نوعان رئيسيان:

كلمات حشو

استخدم "um" و"uh" و"嗯" و"啊" وغيرها لضبط الإيقاع.

مؤثرات خاصة

تُضاف هذه المؤثرات بين أقواس:

المؤثرالوصفأول إصدارالمرحلة
(break)توقف قصيرV2تجريبي
(long-break)توقف أطولV2تجريبي
(breath)صوت تنفسV2تجريبي
(laugh)ضحكV2تجريبي
(cough)سعالV2تجريبي
(lip-smacking)صوت شفاهV2تجريبي
(sigh)تنهدV2تجريبي

المؤثرات (laugh) و(cough) و(lip-smacking) و(sigh) قيد التطوير — كررها عند الحاجة.

مثال إنجليزي:

قياسي: I am an engineer.

مع شبه لغوي: I am, um, an (break) engineer.

مثال صيني:

قياسي: 我是一名工程师。

مع شبه لغوي: 我,嗯,是一名(break)工程师。

الخطوات التالية

API Playground →
التكامل عبر API
استخدم واجهة TTS لبناء تطبيقات صوتية. جرّبها في Playground.
جرّب مجانًا →
استنساخ صوتي مجاني عبر الإنترنت
استنسخ أي صوت في أقل من دقيقة دون بطاقة. ابدأ بالطبقة المجانية.