🎙️ 阶跃语音体验站 StepAudio 3

StepAudio 3 语音模型

基于阶跃星辰 StepFun 开放平台语音 API 构建的在线体验站,覆盖实时对话、语音合成、音频生成、音乐生成与语音识别五大能力,已适配手机端。

🔄 全双工实时对话🎵 音乐生成🎬 综合音频📝 语音识别🗣️ 语音合成
🗣️

实时语音对话

stepaudio-3-realtime-preview
限时免费

像真人一样聊天的全双工语音大模型。支持自然打断、附和识别、话权协调,能理解语气情绪,可边想边说。

  • WebSocket 双向流式,极低延迟
  • 服务端 VAD 自动断句,可随时打断
  • 38 种官方音色 + 人设定制
  • 支持文字 / 语音混合输入
进入体验 →
🎙️

语音合成 TTS

stepaudio-2.5-tts / 3-tts

真人级说话表现:音色、语调、节奏、气口停顿贴近自然口语,支持语境指令控制情绪与风格。

  • 38 种官方音色任意选择
  • 语速 / 音量 / 采样率可调
  • 自然语言指令控制演绎
  • 流式生成 + 逐词字幕高亮
进入体验 →
🎬

综合音频生成

stepaudio-3-gen-preview
限时免费

用自然语言编排角色、台词、音效、环境音与背景音乐,一次生成完整听觉作品。

  • 多角色对白 + 音色描述
  • 音效 / 环境声 / BGM 时序编排
  • 方言口音、副语言特征可控
  • 适合广播剧、短视频配音
进入体验 →
🎵

音乐生成

stepaudio-3-music-preview
限时免费

歌词成歌、纯音乐、歌曲翻唱、干声智能配乐,自然语言描述曲风情绪即可创作。

  • 四种任务类型一键切换
  • 歌词结构标签支持
  • 参考音频驱动翻唱 / 配乐
  • 异步任务 + 实时进度
进入体验 →
📝

语音识别 ASR

stepaudio-2.5-asr

高准确率语音转写:支持中英文、方言、中英混说,SSE 流式返回增量文本。

  • 手机录音或上传音频文件
  • 流式增量显示识别结果
  • 热词定制 + ITN 文本规范化
  • 会议记录、字幕好帮手
进入体验 →