根据OneMillion_AI的监测,StepAudio发布了端到端实时语音大模型 StepAudio 2.5 Realtime,专注于实现「活人感」对话,支持全维度人设自定义和副语言(语调、停顿、叹息等非语言信号)识别。该模型已完全上线开放平台 API。
根据官方提供的五个维度评估结果(2026年4月测试),该模型在所有维度上均排名第一。其中,最能体现真实体验的主观评估(手机应用真人对话评分)为80.41,GPT-Realtime-1.5为68.01,Gemini Live为67.16。语音问答基准为79.80,几乎是GPT-Realtime-1.5(53.20)的1.5倍。副语言理解为82.18,通用对话为86.36,车载场景为84.80。
该技术路线包括三个关键设计。首先,基于1万多个原生人设,通过算法衍生出百万级人设特征矩阵,并结合大量实际对话语料进行训练,使模型能够在长尾小众话题上保持稳定。其次,针对角色扮演场景进行了专门的RLHF(基于人类反馈的强化学习)对齐,解决了AI在交谈中「人设崩塌」的问题。第三,理解与生成深度融合,继承了StepAudio 2.5 TTS的表现力,实现了全局场景的定调和句内细节的雕琢。
API兼容OpenAI Realtime API协议(基于WebSocket),开发者可以低成本迁移。定价为输入10元/百万token(缓存命中2元),输出70元/百万token,官方估计连续语音通话成本约为3.8元/小时。