在官方五个维度的测试中,Step Audio 2.5 Realtime 在所有类别中均排名第一。主观评估得分(真实用户手机应用对话)达到 80.41,而 GPT-Realtime-1.5 为 68.01,Gemini Live 为 67.16。语音问答基准得分为 79.80,几乎是 GPT-Realtime-1.5 的 1.5 倍(53.20)。API 定价:每百万输入 token 收取 10 元(缓存命中为 2 元),每百万输出 token 收取 70 元;持续语音通话预计为每小时 3.8 元。
