تولید صدا و گویندگی با هوش مصنوعی در نقطه
راهنمای انتخاب مدل و قیمت زنده

تبدیل متن به صدا با هوش مصنوعی

۱۰ مدل مستقل برای نریشن فارسی، متن بلند، صدای بلادرنگ، طراحی گوینده و کلون صدا؛ زبان‌های واقعاً پشتیبانی‌شده را از حالت Auto جدا ببین.

سه انتخاب مناسب فارسی، تا ۵۰هزار کاراکتر، ده‌ها گوینده، کنترل سرعت، کیفیت، latency و نمونه صدای مرجع

مدل فعال
۱۰
گروه آپشن
۲۴
انتخاب قابل مقایسه
۱۸۷
آخرین به‌روزرسانی
۱۹ تیر ۱۴۰۵

انتخاب بر اساس خروجی

صدا را برای چه کاری می‌خواهی؟

اول کاربرد را مشخص کن؛ بعد مدل و preset حداقلی پیشنهادی را ببین. برای جزئیات هر مدل، روی نام آن برو.

نریشن طبیعی فارسی

برای تبلیغ، ویدیو و پادکست با احساس و مکث طبیعی.

مدل‌های مناسب

شروع پیشنهادی: Fish روی سرعت Normal و latency Balanced؛ برای کنترل صریح زبان، MiniMax یا Gemini را روی فارسی بگذار.

کتاب، مقاله و متن بلند

پایداری صدا در ده‌ها هزار کاراکتر مهم‌تر از کمترین latency است.

مدل‌های مناسب

شروع پیشنهادی: MiniMax Turbo برای پیش‌شنوی و HD برای نسخه نهایی؛ متن را به بندهای منطقی تقسیم کن.

پاسخ بلادرنگ و ایجنت صوتی

تاخیر پایین برای مکالمه، دستیار و تجربه تعاملی.

مدل‌های مناسب

شروع پیشنهادی: Inworld Realtime یا Fish روی Low Latency؛ زبان را فقط از فهرست رسمی همان مدل انتخاب کن.

گویندگی کم‌هزینه انگلیسی

برای حجم بالا، نمونه‌سازی و خروجی چندگوینده در زبان‌های رسمی مدل.

مدل‌های مناسب

شروع پیشنهادی: سرعت Normal و زبان صریح؛ قبل از batch یک پاراگراف شامل عدد و نام خاص را تست کن.

طراحی صدای جدید با توضیح

به‌جای انتخاب preset، سن، بافت، انرژی و لحن گوینده را با متن بساز.

مدل‌های مناسب

شروع پیشنهادی: توصیف کوتاه و غیرمتناقض: «زن جوان، گرم، آرام، بیان مستند و مکث‌های کوتاه».

کلون صدا از نمونه

یک نمونه صوتی و متن دقیق همان نمونه برای تقلید جنس صدا.

مدل‌های مناسب

شروع پیشنهادی: صدای تمیز، یک گوینده، بدون موسیقی و متن نمونه کلمه‌به‌کلمه مطابق فایل؛ فارسی در فهرست رسمی Qwen نیست.

قواعد انتخاب سریع

معیار اصلی را پیدا کن و فقط مدل‌هایی را مقایسه کن که همان نیاز را پوشش می‌دهند.

01

فارسی الزام قطعی است

Fish تشخیص خودکار چندزبانه دارد؛ MiniMax و Gemini گزینه صریح فارسی ارائه می‌کنند. Qwen، xAI و Inworld را برای فارسی تضمین نکن.

02

متن خیلی بلند است

MiniMax Speech تا ۵۰هزار کاراکتر را می‌پذیرد و Turbo/HD دارد؛ برای متن بلند انتخاب عملی‌تری است.

03

هویت صوتی اختصاصی می‌خواهی

Qwen VoiceDesign صدا را از توضیح می‌سازد و Qwen Base از نمونه کلون می‌کند؛ این دو workflow ورودی متفاوت دارند.

04

تاخیر پایین مهم است

Inworld Realtime و Fish در حالت low latency برای پاسخ تعاملی مناسب‌تر از مدل‌های HD هستند.

کاتالوگ فعال نقطه

مقایسه کامل ۱۰ مدل

همه ورودی‌ها و گزینه‌های نمایش‌داده‌شده واقعاً در استودیو قابل استفاده‌اند. قیمت شروع از تنظیم‌های فعلی محاسبه می‌شود؛ قیمت ترکیب نهایی قبل از ساخت روی دکمه نمایش داده خواهد شد.

Fish Audio S2.1 Pro

فیش آدیو اس ۲.۱ پرو

چندزبانه
کمترین

گفتار بسیار طبیعی چندزبانه با کنترل احساس داخل براکت و تشخیص خودکار زبان.

متن به گفتار
پرامپت یا متن ×۳٬۰۰۰

پیش‌فرض: Adrian · راوی مطمئن، طبیعی، تاخیر کم

خروجی MP3· فارسی آماده
قیمت زنده در استودیو
مشاهده همه ورودی‌ها و آپشن‌های فعال

ورودی‌ها

پرامپت یا متنالزامیتا ۳٬۰۰۰

صدا و گوینده(۸ انتخاب)

Adrian · راوی مطمئنSelene · آرامSarah · پرتعاملEthan · توضیح‌گوLaura · راوی قاطعJordan · انگیزشیHannah · مکالمه‌ایEgirl · جوان

سرعت تولید(۳ انتخاب)

آرامطبیعیسریع

تاخیر(۳ انتخاب)

تاخیر کممتعادلکیفیت پایدار

MiniMax Speech 2.8

مینی‌مکس اسپیچ ۲.۸

فارسی
حرفه‌ای

گفتار بلند تا 50 هزار کاراکتر با تقویت زبان فارسی و حالت Turbo/HD.

متن به گفتار
پرامپت یا متن ×۵۰٬۰۰۰

پیش‌فرض: اقتصادی · Turbo، زن آرام، تشخیص خودکار

خروجی MP3· فارسی آماده
قیمت زنده در استودیو
مشاهده همه ورودی‌ها و آپشن‌های فعال

ورودی‌ها

پرامپت یا متنالزامیتا ۵۰٬۰۰۰

کیفیت(۲ انتخاب)

اقتصادی · Turboباکیفیت · HD

صدا و گوینده(۶ انتخاب)

زن آراممرد مطمئنزن پرانرژیمرد ملایمزن عربی آراممرد عربی دوستانه

زبان(۵ انتخاب)

تشخیص خودکارفارسیانگلیسیعربیترکی

xAI Text-to-Speech

گفتار ایکس‌ای‌آی

ارزان
کمترین

گفتار کم‌هزینه xAI با شش گوینده و زبان‌های رسمی مدل.

متن به گفتار
پرامپت یا متن

پیش‌فرض: Eve، انگلیسی

خروجی MP3
قیمت زنده در استودیو
مشاهده همه ورودی‌ها و آپشن‌های فعال

ورودی‌ها

پرامپت یا متنالزامی

صدا و گوینده(۶ انتخاب)

EveUnaLeoAraSalRex

زبان(۱۰ انتخاب)

انگلیسیعربی مصرعربی سعودیفرانسویآلمانیاسپانیاییترکیروسیهندیژاپنی

Inworld TTS-1.5 Mini

این‌ورلد تی‌تی‌اس ۱.۵ مینی

اقتصادی

گفتار سریع و اقتصادی برای اعلان، روایت و دیالوگ انگلیسی.

متن به گفتار
پرامپت یا متن ×۲٬۰۰۰

پیش‌فرض: Claire، طبیعی

خروجی MP3
قیمت زنده در استودیو
مشاهده همه ورودی‌ها و آپشن‌های فعال

ورودی‌ها

پرامپت یا متنالزامیتا ۲٬۰۰۰

صدا و گوینده(۱۱ انتخاب)

ClaireLorettaDarleneHankCelesteLiamAbbyDiegoAsukaGarethGraham

سرعت تولید(۳ انتخاب)

آرامطبیعیسریع

Inworld Realtime TTS-2

این‌ورلد ریل‌تایم تی‌تی‌اس ۲

بلادرنگ
اقتصادی

نسخه بلادرنگ Inworld با زبان‌ها و گوینده‌های رسمی مدل.

متن به گفتار
پرامپت یا متن ×۲٬۰۰۰

پیش‌فرض: Claire، انگلیسی، طبیعی

خروجی MP3
قیمت زنده در استودیو
مشاهده همه ورودی‌ها و آپشن‌های فعال

ورودی‌ها

پرامپت یا متنالزامیتا ۲٬۰۰۰

صدا و گوینده(۱۱ انتخاب)

ClaireLorettaDarleneHankCelesteLiamAbbyDiegoAsukaGarethGraham

زبان(۱۲ انتخاب)

انگلیسیعربیاسپانیاییفرانسویآلمانیایتالیاییژاپنیکره‌ایچینیروسیهندیعبری

سرعت تولید(۳ انتخاب)

آرامطبیعیسریع

Inworld TTS-1.5 Max

این‌ورلد تی‌تی‌اس ۱.۵ مکس

حرفه‌ای
حرفه‌ای

نسخه باکیفیت Inworld برای روایت و صدای حرفه‌ای.

متن به گفتار
پرامپت یا متن ×۲٬۰۰۰

پیش‌فرض: Claire، طبیعی

خروجی MP3
قیمت زنده در استودیو
مشاهده همه ورودی‌ها و آپشن‌های فعال

ورودی‌ها

پرامپت یا متنالزامیتا ۲٬۰۰۰

صدا و گوینده(۱۱ انتخاب)

ClaireLorettaDarleneHankCelesteLiamAbbyDiegoAsukaGarethGraham

سرعت تولید(۳ انتخاب)

آرامطبیعیسریع

Qwen3-TTS 1.7B CustomVoice

کوئن ۳ تی‌تی‌اس کاستوم

کمترین

گفتار Qwen با 9 گوینده آماده و دستور اختیاری برای لحن صدا.

متن به گفتار
پرامپت یا متن ×۲٬۰۰۰لحن صدا (اختیاری)

پیش‌فرض: Vivian، تشخیص خودکار، طبیعی

خروجی MP3
قیمت زنده در استودیو
مشاهده همه ورودی‌ها و آپشن‌های فعال

ورودی‌ها

پرامپت یا متنالزامیتا ۲٬۰۰۰لحن صدا (اختیاری)اختیاری

صدا و گوینده(۹ انتخاب)

VivianRyanSerenaAidenDylanEricOno AnnaSoheeUncle Fu

زبان(۱۱ انتخاب)

تشخیص خودکارانگلیسیچینیژاپنیکره‌ایآلمانیفرانسویروسیپرتغالیاسپانیاییایتالیایی

سرعت تولید(۳ انتخاب)

آرامطبیعیسریع

Qwen3-TTS 1.7B VoiceDesign

کوئن ۳ طراحی صدا

طراحی صدا
کمترین

ساخت صدای تازه از توصیف سن، جنس، بافت، لحن و شیوه بیان.

متن به گفتارطراحی صدا با متن
پرامپت یا متن ×۲٬۰۰۰توصیف صدای دلخواه

پیش‌فرض: تشخیص خودکار، طبیعی

خروجی MP3
قیمت زنده در استودیو
مشاهده همه ورودی‌ها و آپشن‌های فعال

ورودی‌ها

پرامپت یا متنالزامیتا ۲٬۰۰۰توصیف صدای دلخواهالزامی

زبان(۱۱ انتخاب)

تشخیص خودکارانگلیسیچینیژاپنیکره‌ایآلمانیفرانسویروسیپرتغالیاسپانیاییایتالیایی

سرعت تولید(۳ انتخاب)

آرامطبیعیسریع

Qwen3-TTS 1.7B Base

کوئن ۳ شبیه‌سازی صدا

کلون صدا
کمترین

شبیه‌سازی صدا از نمونه صوتی با متن مرجع اختیاری.

متن به گفتارکلون یا مرجع صدا
پرامپت یا متن ×۲٬۰۰۰نمونه صدامتن نمونه صوتی

پیش‌فرض: تشخیص خودکار، طبیعی

خروجی MP3
قیمت زنده در استودیو
مشاهده همه ورودی‌ها و آپشن‌های فعال

ورودی‌ها

پرامپت یا متنالزامیتا ۲٬۰۰۰نمونه صداالزامیمتن نمونه صوتیالزامی

زبان(۱۱ انتخاب)

تشخیص خودکارانگلیسیچینیژاپنیکره‌ایآلمانیفرانسویروسیپرتغالیاسپانیاییایتالیایی

سرعت تولید(۳ انتخاب)

آرامطبیعیسریع

Gemini Voice

گفتار گوگل

گفتار
حرفه‌ای

تبدیل متن فارسی به گفتار طبیعی.

متن به گفتار
پرامپت یا متن ×۴٬۰۰۰

پیش‌فرض: Zephyr · زن روشن، فارسی

خروجی MP3· فارسی آماده
قیمت زنده در استودیو
مشاهده همه ورودی‌ها و آپشن‌های فعال

ورودی‌ها

پرامپت یا متنالزامیتا ۴٬۰۰۰

صدا و گوینده(۳۰ انتخاب)

Zephyr · زن روشنAchernar · زن نرمAchird · مرد دوستانهAlgenib · مرد خش‌دارAlgieba · مرد روانAlnilam · مرد محکمAoede · زن سبکAutonoe · زن درخشانCallirrhoe · زن راحتCharon · مرد اطلاعاتیDespina · زن روانEnceladus · مرد نفس‌دارErinome · زن شفافFenrir · مرد هیجان‌دارGacrux · زن بالغIapetus · مرد شفافKore · زن محکمLaomedeia · زن پرانرژیLeda · زن جوانOrus · مرد محکمPuck · مرد پرانرژیPulcherrima · زن مستقیمRasalgethi · مرد اطلاعاتیSadachbia · مرد سرزندهSadaltager · مرد داناSchedar · مرد یکنواختSulafat · زن گرمUmbriel · مرد راحتVindemiatrix · زن ملایمZubenelgenubi · مرد خودمانی

زبان(۹ انتخاب)

فارسیانگلیسیعربیترکیاردوفرانسویآلمانیاسپانیاییهندی
قیمت‌ها زنده و بدون وابستگی به پلن نمایش داده می‌شوند. تنظیم‌های واقعی و قابل استفاده در استودیو
معنی تنظیم‌ها

آپشن‌ها دقیقاً چه کاری می‌کنند؟

عدد خام به‌تنهایی قابل تصمیم‌گیری نیست. اثر هر گزینه روی خروجی، سرعت و هزینه را قبل از انتخاب بدان.

01

گوینده

هر مدل بانک صدای خودش را دارد. یک متن تست ثابت با عدد، نام خاص و جمله پرسشی بساز تا مقایسه منصفانه باشد.

02

زبان

Auto به معنی پشتیبانی تضمینی همه زبان‌ها نیست. برای فارسی از مدل‌هایی استفاده کن که تشخیص چندزبانه یا گزینه fa-IR/fa دارند.

03

سرعت

Slow برای روایت احساسی، Normal برای نریشن عمومی و Fast برای اعلان کوتاه است. سرعت زیاد می‌تواند وضوح فارسی را کم کند.

04

Turbo یا HD

Turbo پیش‌شنوی ارزان‌تر و HD تحویل نهایی است. برای متن بلند ابتدا یک بند را در هر دو حالت مقایسه کن.

05

Latency

تاخیر کم برای مکالمه است؛ کیفیت پایدار برای فایل نهایی. پایین‌ترین latency همیشه طبیعی‌ترین خروجی را نمی‌دهد.

06

نمونه صدا

کلون صدا به فایل تمیز و transcript دقیق نیاز دارد. مجوز صاحب صدا و رضایت او الزامی است.

متن مناسب برای TTS

کیفیت فقط از مدل نیست؛ نشانه‌گذاری و قطعه‌بندی متن روی مکث و لحن اثر مستقیم دارد.

  • عددهای حساس را با حروف بنویس.
  • هر پاراگراف یک حس و یک گوینده داشته باشد.
  • برای کلون فقط از صدایی استفاده کن که اجازه روشن و قابل اثبات داری.

قالب پیشنهادی

[لحن یا تگ احساسی] متن با جمله‌های کوتاه، ویرگول برای مکث کوتاه، نقطه برای مکث کامل، املای آوایی نام‌های خاص و عددهای نوشته‌شده با حروف

نمونه کامل

[گرم و مطمئن] سلام. به نقطه خوش آمدید. این‌جا می‌توانید ایده‌تان را، ساده و سریع، به یک خروجی حرفه‌ای تبدیل کنید.

ابزارهای تخصصی

کار تو دقیق‌تر از یک صفحه عمومی است؟

هر یک از این صفحه‌ها فقط یک task مشخص را با ورودی و راهنمای خودش پوشش می‌دهد.

برای ساخت صدای مشابه از یک فایل مجاز، شبیه‌سازی صدا با نمونه صوتی شرایط ورودی، زبان‌ها و رضایت را توضیح می‌دهد.

اگر هدف قطعه موسیقی است، ساخت موسیقی با هوش مصنوعی مسیر جداگانه‌ای برای آهنگ باکلام و بی‌کلام دارد.

قبل از ساخت نهایی بدان

این محدودیت‌ها بخشی از انتخاب حرفه‌ای مدل‌اند و روی کیفیت، قیمت یا امکان استفاده از خروجی اثر دارند.

01

پشتیبانی واقعی فارسی

Fish Audio، MiniMax Speech و Gemini Voice انتخاب‌های این صفحه برای فارسی‌اند. Auto در Qwen یا فهرست زبان xAI/Inworld معادل پشتیبانی رسمی فارسی نیست.

02

واحد قیمت

Fish بر اساس بایت UTF-8 و بقیه مدل‌ها عمدتاً بر اساس کاراکتر یا توکن قیمت می‌گیرند؛ متن فارسی ممکن است بایت بیشتری داشته باشد.

03

رضایت برای کلون

کلون یا تقلید صدای افراد بدون اجازه قابل قبول نیست. نمونه صوتی باید متعلق به خودت یا دارای مجوز روشن باشد.

پرسش‌های پرتکرار

پاسخ کوتاه به سوال‌هایی که قبل از انتخاب مدل و پرداخت کردیت مطرح می‌شوند.

بهترین مدل تبدیل متن فارسی به صدا چیست؟

Fish Audio برای طبیعی‌بودن و تشخیص چندزبانه، MiniMax Speech برای متن بلند و گزینه فارسی، و Gemini Voice برای تنوع گوینده و fa-IR مناسب‌اند.

آیا Qwen و xAI فارسی را پشتیبانی می‌کنند؟

فارسی در فهرست زبان‌های فعال این مدل‌ها نیست؛ گزینه Auto را تضمین فارسی در نظر نگیر. برای فارسی از سه مدل مشخص‌شده استفاده کن.

کلون صدا چگونه کار می‌کند؟

Qwen Base نمونه صدا و transcript دقیق همان نمونه را می‌گیرد. فایل باید تمیز، تک‌گوینده و با رضایت صاحب صدا باشد.

برای متن بلند چه مدلی بگیرم؟

MiniMax Speech 2.8 تا ۵۰هزار کاراکتر و دو حالت Turbo/HD دارد؛ متن را به بندها تقسیم و گوینده را ثابت نگه دار.

چرا قیمت متن فارسی ممکن است متفاوت باشد؟

Fish Audio ورودی را بر اساس بایت UTF-8 حساب می‌کند و حروف فارسی چندبایتی‌اند. قیمت زنده قبل از ساخت از متن واقعی محاسبه می‌شود.

موسیقی و افکت هم در این صفحه هستند؟

خیر؛ این صفحه مخصوص گفتار، گوینده، کلون و طراحی صداست. آهنگ و افکت در راهنمای مستقل موسیقی قرار دارند.

یک پاراگراف ثابت را با سه مدل فارسی تست کن.

همان متن را با Fish، MiniMax و Gemini بساز؛ طبیعی‌بودن، تلفظ نام‌ها و هزینه واقعی را کنار هم مقایسه کن.

شروع ساخت در نقطه