文字转语音
双引擎自由切换:自然流畅的「主力档」与情绪饱满的「情感配音档」;支持多音色、语速/音调/音量、多语种、情感风格、声音克隆与多说话人对话,导出 MP3/WAV 与字幕。基于开源 CosyVoice 3 与 IndexTTS-2 自部署,完全免费。
合成引擎
0 / 2000
加载预置音色中…
风格/情感对「声音克隆」和「自定义参考音色」效果最佳;预置命名音色以音色本身为准。
GPU 合成通常很快;首次或空闲后需先加载模型(约数秒)。
常见问题
用的是什么模型?要收费吗?
基于开源的 CosyVoice 3(自然主力)与 IndexTTS-2(情感配音)双引擎自部署,完全免费。提供每日免费合成次数,无需登录。
两种引擎怎么选?
「自然·主力」(CosyVoice 3) 更自然流畅、速度快,含多个预置音色,适合日常朗读、客服、播报;「情感·配音」(IndexTTS-2) 情绪更强、更戏剧化,适合有声书、角色配音、短视频旁白。可在页面顶部一键切换。
可以克隆我自己的声音吗?
可以。选择「声音克隆」并上传一段 5–15 秒清晰人声、填写对应文字,即可用该音色合成;两种引擎都支持克隆。参考音频仅用于本次合成,用完即删,不会留存。
支持哪些语言和情感?
支持中文、英语、日语、韩语、粤语等及跨语种合成。主力档可在「风格」里用自然语言指令,如「用开心的语气」「用四川话说」;切到「情感·配音」档后,在「情感」框直接填「开心/悲伤/愤怒/惊讶」等即可获得更强的情绪表现。
为什么合成需要等一会儿?
已采用 GPU 部署,通常很快;首次或空闲一段时间后需先加载模型(主力档约数秒,情感档约 20–40 秒)。长文本会逐句合成、流式返回,可先试听已完成的句子。
能做多人对话/播客吗?
可以。开启「多说话人」,按「角色:文本」分行输入,再为每个角色分配不同音色即可。
探索更多 AI 工具与产品