什么是 AI 文字转语音?
AI 文字转语音(AI TTS)用神经网络语音模型把文字变成语音。模型从大量真人录音中学会了说话的方式,生成时会整体判断一句话该怎么读:重音落在哪里、哪里换气、疑问句末尾怎样上扬。
因此,如今的 AI 语音已经能胜任旁白、短视频配音和课程讲解。但它仍是合成语音,遇到生僻人名、缩写和数字时可能读错,发布前请完整听一遍。
AI Text to Speech 是一款在线 AI 文字转语音工具。粘贴最多 4,000 个字符,从 MiniMax Speech 02 HD、OpenAI TTS-1 HD 和 Gemini 2.5 Flash TTS 的 365 种音色中选择,调好语速,几秒即可下载 MP3 或 WAV。每字符 1 积分,每 1,000 字符 0.06–0.10 美元;注册即送 5,000 个免费字符,生成失败自动退还积分。
三款顶尖语音模型,一个简单的输入框,按字符计价。
神经网络语音会按语义安排重音、停顿和气口,听起来是在“讲”,而不是在“念”。
旁白、主播、主持人和各类角色:MiniMax 的 326 种音色覆盖 24 种语言,另有 OpenAI 和 Gemini 的专属音色。
讲课可以放慢,短视频可以加快:MiniMax 和 OpenAI 均为 0.75–1.5 倍。
下载 MP3 或 WAV,直接用于视频、播客、网课、演示文稿和电话语音。
每字符 1 积分,生成前显示价格。每 1,000 字符 0.06–0.10 美元,积分在账号存续期间不会过期。
如果模型没有返回音频,这一段的积分会自动退回余额。
输入或粘贴最多 4,000 个字符,计数器会实时显示长度和价格。
默认的 MiniMax 音色最多;也可以切换到 OpenAI 或 Gemini,再挑选音色和语速。
几秒钟后就能在页面上播放。满意就下载,不满意改改文字再生成。
AI 文字转语音(AI TTS)用神经网络语音模型把文字变成语音。模型从大量真人录音中学会了说话的方式,生成时会整体判断一句话该怎么读:重音落在哪里、哪里换气、疑问句末尾怎样上扬。
因此,如今的 AI 语音已经能胜任旁白、短视频配音和课程讲解。但它仍是合成语音,遇到生僻人名、缩写和数字时可能读错,发布前请完整听一遍。
MiniMax Speech 02 HD 是默认模型:326 种音色覆盖 24 种语言,普通话和粤语音色尤其丰富,从新闻播报到温暖旁白都有。OpenAI TTS-1 HD 提供 9 种干净稳定的音色,最适合英文。Gemini 2.5 Flash TTS 有 30 种音色,能理解写在正文前面的语气提示,例如“Say warmly:”(用温暖的语气说)。
最快的选法是:拿同样的一两句话分别用两三个音色生成,对比着听。按字符计费,这样的短测试花不了几个积分。
语音模型会照着文字逐字朗读,下面几个习惯能让效果更好:
| MiniMax Speech 02 HD | OpenAI TTS-1 HD | Gemini 2.5 Flash TTS | |
|---|---|---|---|
| 音色 | 326 种,24 种语言录制 | 9 种,最适合英文 | 30 种,多语言 |
| 擅长 | 角色、旁白、中文等非英语内容 | 干净稳定的英文 | 用提示词控制语气 |
| 语速 | 0.75–1.5 倍 | 0.75–1.5 倍 | 仅自然语速 |
| 下载 | MP3 | MP3 | WAV |
| 价格 | 每字符 1 积分 | 每字符 1 积分 | 每字符 1 积分,每段至少 500 |
新账号注册即送 5,000 个免费字符,约够生成 20 分钟普通话,所有音色和下载格式都能用。用完后需要购买积分:积分包 4.99 美元起,月度套餐每月 9.99 美元起。除注册赠送外,不提供长期不收费的套餐,也不按天发放额度。
每字符 1 积分,按套餐或积分包不同,每 1,000 字符 0.06–0.10 美元。普通话 1,000 字大约能读 4 分钟。生成前就会显示价格,失败的生成自动退还积分。
三个。MiniMax Speech 02 HD(默认,326 种音色,覆盖 24 种语言)、OpenAI TTS-1 HD(9 种音色,最适合英文)和 Gemini 2.5 Flash TTS(30 种音色,能听懂语气提示)。三者都是每字符 1 积分;由于谷歌按次收费,Gemini 每段至少 500 积分。
在短篇和中等长度的文本上,最好的音色已经很难和真人录音区分。长稿仍可能出现小问题:个别重音不对、人名读错或数字读法不对。发布前请完整听一遍,读错的字可以改写成同音字后再生成。
可以,用于视频、播客、广告、课程和应用都行,但需遵守我们的条款和所用模型的使用政策。最重要的两条:不要把合成声音冒充成某个真实人物的声音;如果发布用 OpenAI 音色生成的音频,OpenAI 要求告知听众这是 AI 生成的声音。我们无法保证某个音色只归你使用,其他用户也能使用同样的音色。
MiniMax 的音色覆盖 24 种语言,包括英语、普通话、粤语、西班牙语、葡萄牙语、法语、德语、日语、韩语、印地语和阿拉伯语。OpenAI 和 Gemini 的音色也能读多种语言,其中 OpenAI 的音色读英文最自然。
你的文字会经由我们的模型网关发送给所选音色的服务商,仅用于生成音频。生成的音频保存在你的历史记录里,方便随时重听和下载;保存期限和删除方式见隐私政策。我们不出售你的数据,也不会用它训练模型。
最后更新:2026年10月6日