نریشن طبیعی فارسی
برای تبلیغ، ویدیو و پادکست با احساس و مکث طبیعی.
مدلهای مناسب
شروع پیشنهادی: Fish روی سرعت Normal و latency Balanced؛ برای کنترل صریح زبان، MiniMax یا Gemini را روی فارسی بگذار.

۱۰ مدل مستقل برای نریشن فارسی، متن بلند، صدای بلادرنگ، طراحی گوینده و کلون صدا؛ زبانهای واقعاً پشتیبانیشده را از حالت Auto جدا ببین.
سه انتخاب مناسب فارسی، تا ۵۰هزار کاراکتر، دهها گوینده، کنترل سرعت، کیفیت، latency و نمونه صدای مرجع
انتخاب بر اساس خروجی
اول کاربرد را مشخص کن؛ بعد مدل و preset حداقلی پیشنهادی را ببین. برای جزئیات هر مدل، روی نام آن برو.
برای تبلیغ، ویدیو و پادکست با احساس و مکث طبیعی.
مدلهای مناسب
شروع پیشنهادی: Fish روی سرعت Normal و latency Balanced؛ برای کنترل صریح زبان، MiniMax یا Gemini را روی فارسی بگذار.
پایداری صدا در دهها هزار کاراکتر مهمتر از کمترین latency است.
مدلهای مناسب
شروع پیشنهادی: MiniMax Turbo برای پیششنوی و HD برای نسخه نهایی؛ متن را به بندهای منطقی تقسیم کن.
تاخیر پایین برای مکالمه، دستیار و تجربه تعاملی.
مدلهای مناسب
شروع پیشنهادی: Inworld Realtime یا Fish روی Low Latency؛ زبان را فقط از فهرست رسمی همان مدل انتخاب کن.
برای حجم بالا، نمونهسازی و خروجی چندگوینده در زبانهای رسمی مدل.
مدلهای مناسب
شروع پیشنهادی: سرعت Normal و زبان صریح؛ قبل از batch یک پاراگراف شامل عدد و نام خاص را تست کن.
بهجای انتخاب preset، سن، بافت، انرژی و لحن گوینده را با متن بساز.
مدلهای مناسب
شروع پیشنهادی: توصیف کوتاه و غیرمتناقض: «زن جوان، گرم، آرام، بیان مستند و مکثهای کوتاه».
یک نمونه صوتی و متن دقیق همان نمونه برای تقلید جنس صدا.
مدلهای مناسب
شروع پیشنهادی: صدای تمیز، یک گوینده، بدون موسیقی و متن نمونه کلمهبهکلمه مطابق فایل؛ فارسی در فهرست رسمی Qwen نیست.
معیار اصلی را پیدا کن و فقط مدلهایی را مقایسه کن که همان نیاز را پوشش میدهند.
Fish تشخیص خودکار چندزبانه دارد؛ MiniMax و Gemini گزینه صریح فارسی ارائه میکنند. Qwen، xAI و Inworld را برای فارسی تضمین نکن.
MiniMax Speech تا ۵۰هزار کاراکتر را میپذیرد و Turbo/HD دارد؛ برای متن بلند انتخاب عملیتری است.
Qwen VoiceDesign صدا را از توضیح میسازد و Qwen Base از نمونه کلون میکند؛ این دو workflow ورودی متفاوت دارند.
Inworld Realtime و Fish در حالت low latency برای پاسخ تعاملی مناسبتر از مدلهای HD هستند.
کاتالوگ فعال نقطه
همه ورودیها و گزینههای نمایشدادهشده واقعاً در استودیو قابل استفادهاند. قیمت شروع از تنظیمهای فعلی محاسبه میشود؛ قیمت ترکیب نهایی قبل از ساخت روی دکمه نمایش داده خواهد شد.
فیش آدیو اس ۲.۱ پرو
گفتار بسیار طبیعی چندزبانه با کنترل احساس داخل براکت و تشخیص خودکار زبان.
پیشفرض: Adrian · راوی مطمئن، طبیعی، تاخیر کم
خروجی MP3· فارسی آمادهمینیمکس اسپیچ ۲.۸
گفتار بلند تا 50 هزار کاراکتر با تقویت زبان فارسی و حالت Turbo/HD.
پیشفرض: اقتصادی · Turbo، زن آرام، تشخیص خودکار
خروجی MP3· فارسی آمادهگفتار ایکسایآی
گفتار کمهزینه xAI با شش گوینده و زبانهای رسمی مدل.
پیشفرض: Eve، انگلیسی
خروجی MP3اینورلد تیتیاس ۱.۵ مینی
گفتار سریع و اقتصادی برای اعلان، روایت و دیالوگ انگلیسی.
پیشفرض: Claire، طبیعی
خروجی MP3اینورلد ریلتایم تیتیاس ۲
نسخه بلادرنگ Inworld با زبانها و گویندههای رسمی مدل.
پیشفرض: Claire، انگلیسی، طبیعی
خروجی MP3اینورلد تیتیاس ۱.۵ مکس
نسخه باکیفیت Inworld برای روایت و صدای حرفهای.
پیشفرض: Claire، طبیعی
خروجی MP3کوئن ۳ تیتیاس کاستوم
گفتار Qwen با 9 گوینده آماده و دستور اختیاری برای لحن صدا.
پیشفرض: Vivian، تشخیص خودکار، طبیعی
خروجی MP3کوئن ۳ طراحی صدا
ساخت صدای تازه از توصیف سن، جنس، بافت، لحن و شیوه بیان.
پیشفرض: تشخیص خودکار، طبیعی
خروجی MP3کوئن ۳ شبیهسازی صدا
شبیهسازی صدا از نمونه صوتی با متن مرجع اختیاری.
پیشفرض: تشخیص خودکار، طبیعی
خروجی MP3گفتار گوگل
تبدیل متن فارسی به گفتار طبیعی.
پیشفرض: Zephyr · زن روشن، فارسی
خروجی MP3· فارسی آمادهعدد خام بهتنهایی قابل تصمیمگیری نیست. اثر هر گزینه روی خروجی، سرعت و هزینه را قبل از انتخاب بدان.
هر مدل بانک صدای خودش را دارد. یک متن تست ثابت با عدد، نام خاص و جمله پرسشی بساز تا مقایسه منصفانه باشد.
Auto به معنی پشتیبانی تضمینی همه زبانها نیست. برای فارسی از مدلهایی استفاده کن که تشخیص چندزبانه یا گزینه fa-IR/fa دارند.
Slow برای روایت احساسی، Normal برای نریشن عمومی و Fast برای اعلان کوتاه است. سرعت زیاد میتواند وضوح فارسی را کم کند.
Turbo پیششنوی ارزانتر و HD تحویل نهایی است. برای متن بلند ابتدا یک بند را در هر دو حالت مقایسه کن.
تاخیر کم برای مکالمه است؛ کیفیت پایدار برای فایل نهایی. پایینترین latency همیشه طبیعیترین خروجی را نمیدهد.
کلون صدا به فایل تمیز و transcript دقیق نیاز دارد. مجوز صاحب صدا و رضایت او الزامی است.
کیفیت فقط از مدل نیست؛ نشانهگذاری و قطعهبندی متن روی مکث و لحن اثر مستقیم دارد.
قالب پیشنهادی
[لحن یا تگ احساسی] متن با جملههای کوتاه، ویرگول برای مکث کوتاه، نقطه برای مکث کامل، املای آوایی نامهای خاص و عددهای نوشتهشده با حروف
نمونه کامل
[گرم و مطمئن] سلام. به نقطه خوش آمدید. اینجا میتوانید ایدهتان را، ساده و سریع، به یک خروجی حرفهای تبدیل کنید.
ابزارهای تخصصی
هر یک از این صفحهها فقط یک task مشخص را با ورودی و راهنمای خودش پوشش میدهد.
برای ساخت صدای مشابه از یک فایل مجاز، شبیهسازی صدا با نمونه صوتی شرایط ورودی، زبانها و رضایت را توضیح میدهد.
اگر هدف قطعه موسیقی است، ساخت موسیقی با هوش مصنوعی مسیر جداگانهای برای آهنگ باکلام و بیکلام دارد.
این محدودیتها بخشی از انتخاب حرفهای مدلاند و روی کیفیت، قیمت یا امکان استفاده از خروجی اثر دارند.
Fish Audio، MiniMax Speech و Gemini Voice انتخابهای این صفحه برای فارسیاند. Auto در Qwen یا فهرست زبان xAI/Inworld معادل پشتیبانی رسمی فارسی نیست.
Fish بر اساس بایت UTF-8 و بقیه مدلها عمدتاً بر اساس کاراکتر یا توکن قیمت میگیرند؛ متن فارسی ممکن است بایت بیشتری داشته باشد.
کلون یا تقلید صدای افراد بدون اجازه قابل قبول نیست. نمونه صوتی باید متعلق به خودت یا دارای مجوز روشن باشد.
پاسخ کوتاه به سوالهایی که قبل از انتخاب مدل و پرداخت کردیت مطرح میشوند.
Fish Audio برای طبیعیبودن و تشخیص چندزبانه، MiniMax Speech برای متن بلند و گزینه فارسی، و Gemini Voice برای تنوع گوینده و fa-IR مناسباند.
فارسی در فهرست زبانهای فعال این مدلها نیست؛ گزینه Auto را تضمین فارسی در نظر نگیر. برای فارسی از سه مدل مشخصشده استفاده کن.
Qwen Base نمونه صدا و transcript دقیق همان نمونه را میگیرد. فایل باید تمیز، تکگوینده و با رضایت صاحب صدا باشد.
MiniMax Speech 2.8 تا ۵۰هزار کاراکتر و دو حالت Turbo/HD دارد؛ متن را به بندها تقسیم و گوینده را ثابت نگه دار.
Fish Audio ورودی را بر اساس بایت UTF-8 حساب میکند و حروف فارسی چندبایتیاند. قیمت زنده قبل از ساخت از متن واقعی محاسبه میشود.
خیر؛ این صفحه مخصوص گفتار، گوینده، کلون و طراحی صداست. آهنگ و افکت در راهنمای مستقل موسیقی قرار دارند.
همان متن را با Fish، MiniMax و Gemini بساز؛ طبیعیبودن، تلفظ نامها و هزینه واقعی را کنار هم مقایسه کن.