阶跃星辰Step-Audio 2 mini开源,语音模型SOTA

2025年9月1日,阶跃星辰发布开源端到端语音大模型Step-Audio 2 mini,多项测试取得SOTA成绩。

性能表现

综合评测

  • MMAU:73.2分(开源模型第一)
  • URO Bench:基础与专业赛道双第一
  • CoVoST 2:39.3分,超越GPT-4o Audio
  • 中文CER:3.19%,领先开源模型15%+

技术创新

真端到端架构

  • 突破传统ASR+LLM+TTS三级结构
  • 原始音频直接转语音响应
  • 时延更低,输出更快

副语言理解

  • 首次引入链式思维推理(CoT)
  • 理解情绪、语调、音乐等
  • 支持web检索等外部工具

产业落地

已搭载于吉利银河M9车型,实现行业首个端到端语音大模型量产上车。

模型已在GitHub、Hugging Face、魔搭社区开源。

本文源自「阶跃星辰官网