All models

tts-1

OpenAIAudio
133.91 Credits
Get your API key
tts-1

面向实时应用的预设声音文本转语音模型

tts-1 是 OpenAI 面向实时使用场景优化的文本转语音模型,将准备好的文字转换为可播放的语音。它适合应用提示、内容朗读和语音交互中的播报环节,提供六种预设声音,以及音频格式和语速选择。与侧重音质的 tts-1-hd 相比,tts-1 更适合把响应体验放在优先位置的任务。

OpenAI模型品牌
音频模型类型
音频任务能力

规格与接口特性

在选型前明确容量、输入输出与调用方式。

创作方式
文本转语音:输入文字,输出音频
原生定位
面向实时使用场景优化
预设声音
alloy、echo、fable、onyx、nova、shimmer
音频格式选项
mp3、opus、aac、flac、wav、pcm;默认 mp3
语速控制
speed 数值参数,默认 1.0
调用入口
POST /v1/audio/speech;显式指定 model="tts-1"

实时应用定位与预设声音属于公开原生能力,格式、语速和请求方式按本平台的语音生成入口使用。

核心能力

了解 tts-1 能为你的工作带来什么。

为及时播报而选择

tts-1 的核心取舍是面向实时使用,而不是把精细音质作为唯一目标。对于操作反馈、提示语和对话回答朗读,可以先准备简洁文本,再生成语音接入播放器。这种定位适合重视响应体验的应用,但不代表固定生成耗时。

用预设声音统一听觉风格

六种预设声音让应用可以在同一文本上进行试听,选择适合内容风格的声音,并在后续播报中保持一致。voice 使用固定名称,不需要上传录音。选型时宜用真实文案比较听感,而不是仅凭声音名称推断性别、口音或情绪。

音频交付与语速可配置

生成语音时可以选择音频格式,并通过 speed 调整播放节奏。默认 mp3 便于常见播放器接入,其他格式可按交付链路选择。返回内容是音频数据,应用应按所选格式保存或播放,而不是把结果作为聊天文本或下载地址解析。

适用场景

从具体任务出发,找到模型发挥作用的位置。

应用通知与操作引导

把订单状态、操作步骤或设备提示整理成明确短句,选择固定声音生成播报音频,交付给应用播放器。对于重复使用的提示,可以在业务侧保存已生成音频;动态信息则先完成文字校验,再进行语音生成,避免把错误内容直接读给用户。

文章与知识内容朗读

输入已编辑的文章段落、课程讲解或知识卡片,输出可播放的朗读音频。建议按语义段落组织内容,先用包含术语、数字和缩写的样稿试听,再确定声音与语速。交付物是文字对应的语音,内容改写和事实校对应在生成前完成。

语音助手的回答播报

在语音助手中,tts-1 可以承担回答文字到语音的最后一步:先由业务逻辑或对话模型得到答复,再将适合口头表达的文本提交生成。它负责说出既定内容,不承担录音识别或回答推理,适合构建职责清晰的语音交互流程。

如何选择这个模型

结合任务复杂度、输入材料与预期结果选择。

实时体验优先,选择 tts-1

如果任务是频繁出现的短提示、即时反馈或对话播报,且希望优先考虑响应体验,tts-1 的定位更匹配。评估时应使用真实文本,在目标设备上试听并测量完整播放链路;原生实时优化方向并不等于应用中的网络、排队和播放启动时间都有固定保证。

音质优先,与 tts-1-hd 对照试听

tts-1-hd 是侧重音质的独立型号,不是 tts-1 的声音选项或输出格式。对于反复播放的旁白和精修内容,可以用相同文稿比较两个型号,再根据听感与响应需求决定。选择更精细的格式也不等于切换到 HD 型号,声音、格式和模型应分别考虑。

开始使用

从一次小规模任务到正式接入。

01

准备任务与材料

明确目标、必要输入与输出要求,使用真实业务样例作为起点。

02

在 API 调试区试用

打开试用页,确认此入口支持的参数,再提交小规模任务查看结果。

03

按 API 文档接入

保留完整模型 ID,使用文档规定的请求格式,并在 Pricing 页确认计费规则。

使用边界

在正式使用前,了解输出质量与能力范围。

  • tts-1 是文本转语音模型,不是语音识别模型。应提交需要朗读的文字;录音转写、自动回答以及文案生成需要在其他环节完成。也不要把普通文字输入当成可精确控制情绪、表演方式或人物身份的专用指令。
  • 预设声音选择不等于声音克隆。这里的工作方式是通过 voice 选择固定声音,不应按上传参考录音、复刻某人音色或精确模仿口音来设计流程。正式使用前,应针对人名、专业术语和混合语言文本进行试听。
  • 实时使用定位不意味着固定延迟,也不保证任意长度文本一次完成。长内容适合按语义拆分并由应用管理拼接、播放与重试;语速调整后还应重新试听,检查数字、缩写和重要提示是否依然清楚。

常见问题

解答使用 tts-1 时的常见疑问。

tts-1 与 tts-1-hd 的主要区别是什么?

两者的主要区别是优化方向:tts-1 面向实时使用场景,tts-1-hd 侧重音质。即时提示和对话播报可优先考虑 tts-1;精修旁白则适合进行同文稿试听比较,不能仅凭文件格式判断使用了哪个型号。

tts-1 可以选择哪些声音?

可选择 alloy、echo、fable、onyx、nova、shimmer,默认声音为 alloy。建议使用实际业务文稿逐一试听,再固定声音。名称本身不构成口音、情绪或角色承诺,也不表示能够复刻任意人的声音。

如何明确调用 tts-1?

向 POST /v1/audio/speech 提交需要朗读的 input,并显式设置 model 为 tts-1;按需加入 voice、response_format 和 speed。显式选择模型可以让请求意图更清楚,收到结果后应按音频二进制数据处理。

能输出什么格式,语速能调整吗?

音频格式选项包括 mp3、opus、aac、flac、wav 和 pcm,默认 mp3;speed 默认值为 1.0。应根据播放器和音频处理流程选择格式,并在调整语速后试听,不把未明确的数值范围当作可用边界。

tts-1 能直接听录音并回答吗?

不能把 tts-1 当作完整语音对话模型。它接收文字并生成语音;如果用户输入录音,需要先完成转写,再生成回答文字,最后交给 tts-1 播报。这样也便于在播报前审核内容,并优化文字的口头表达。

模型资料 · 更新日期:2026-10-01。调用参数与计费规则请查看 API 和定价栏目。

把 tts-1 用到你的下一项任务

从清晰的目标开始,在实际结果中判断它是否适合你的工作。