阶跃发布 StepAudio 3 ,多款语音模型登顶 Artificial Analysis 全球榜单
9月15日,阶跃发布新一代语音大模型 StepAudio 3 系列,一次性推出 StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen 和 StepAudio 3 Music 五款模型,覆盖实时语音交互、语音识别、真人级语音生成和音乐创作等场景。其中,多款模型在 权威 第三方 AI 模型评测机构 Artificial Analysis 榜单中位列全球第一。
相比过去主要围绕语音识别或语音生成等单项能力展开竞争,StepAudio 3 将能力进一步延伸至语音理解与生成、实时推理、任务执行和音频创作的全栈能力,让 AI 不仅能够“听”和“说”,也能够理解声音背后的语义与情绪,并参与更完整的交互和内容生产过程。
其中,面向实时语音交互场景的 StepAudio 3 Realtime 支持原生全双工对话,可以在持续交流过程中判断何时回应、何时等待,并处理临时打断和连续反馈。在 Artificial Analysis Conversational Dynamics 榜单中,该模型以 98.9% 的综合得分排名全球第一。
与传统实时语音模型主要追求低延迟和自然对话不同,StepAudio 3 Realtime 还进一步加入了语音推理和任务执行能力。模型能够同时理解语义、语气、情绪及环境声音,并支持推理与语音生成并行;Tool Call 和长任务则可以异步执行,在任务运行期间不打断当前对话。其在 Artificial Analysis Speech Reasoning 榜单中同样位列全球第一。
在语音识别方面,StepAudio 3 ASR 将高精度识别与大语言模型的上下文理解和知识能力结合,不仅要解决“听清楚”,也进一步提升对专业术语、人名、地名、方言及复杂上下文的理解能力。
该模型支持中文、英文、方言、中英混说、长音频和专业领域等多类场景,并针对低声、快速语音、含糊连读以及背景音乐等复杂输入进行优化。在 Artificial Analysis 非流式语音识别准确性榜单中,StepAudio 3 ASR 的 WER(词错误率)为 1.7%,并列全球第一。WER 越低意味着转写错误越少,该成绩意味着模型在第三方综合测试中的语音识别准确率已处于全球第一梯队。
StepAudio 3 TTS 面向真人级语音生成,在音色、语调、节奏、停顿和情绪表达之外,还能够生成笑声、迟疑、重复、改口等真实交流中常见的副语言表现。该模型采用流式生成架构,可实现生成与播放同时进行,满足实时语音应用需求。
StepAudio 3 Gen 则进一步将人声、音效、环境声和背景音乐等原本分散的生成环节整合到在一起。用户可以通过自然语言描述角色、场景和剧情,一次生成包含多种声音元素的完整音频,并控制角色音色、情绪以及不同声音出现的时间与顺序,广泛适用于影视、动画、游戏、广播剧、有声书和短视频等内容生产场景。
面向音乐创作的 StepAudio 3 Music 不再局限于“一句话生成一首歌”,而是支持歌曲创作、清唱配乐、歌曲翻唱以及基于 ABC 记谱法的多轮交互创作。用户可以通过歌词、清唱、参考歌曲等不同形式与模型共同完成编曲和作品迭代,使 AI 更深入参与实际音乐生产流程。
过去一年,语音大模型正从单项的语音识别和生成能力,逐渐走向实时交互、声音理解与内容创作的融合竞争。随着 StepAudio 3 系列发布,阶跃音频模型的产品版图,已经全面覆盖了听、说、理解、推理和创作。
外星人真存在?美国公布首批UFO文件,画面曝光;梁文 ...
阶跃星辰发布 Step Plan 包月订阅方案,主打 OpenCl ...
阶跃星辰推出 StepClaw:一键安装“小龙虾”,普通人 ...
打破人类记录,狂揽5金2银6铜!合作共赢 助力天工交出硬核答卷
IFA 2026 倒计时 | 魔法原子以“本体+大脑+场景”全栈能力叩开欧洲工业大门
SenseNova U1.5 Lite正式版发布:支持超长指令,解锁原生4K真实视觉创作流
具身新贵昆仑行斩获 WorldArena单项冠军全球亚军,世界模型全面领先
WRC 2026|生数科技发布最新研究成果,提出通用世界模型五级发展路线
华为坤灵升级“4+10+N”场景化方案,发布“经纬计划”和50个样板点
碧桂园服务与支付宝全面深化合作,共筑“智慧物业”数字化新标杆
基元律动与无问芯穹达成战略合作,推进高质量Token供给与应用
清华稳准智能联合发布LimiX-2,结构化数据基础模型登顶国际评测榜单
大促GMV猛涨500%:激光雕刻设备靠"创意落地"出海东南亚