昊梵体育网

每小时 0.70 美元,60 多种语言,一个模型搞定——Soniox 刚发布的

每小时 0.70 美元,60 多种语言,一个模型搞定——Soniox 刚发布的 TTS v2,把价格锚点钉在了所有正在拼装语音栈的开发者面前。受影响的是正在做实时语音智能体、跨境多语种应用的人:过去要在 STT、TTS、声音克隆、情感控制、对话打断恢复之间拼三四家供应商,现在被一个模型声称全部吞下。

真正决定选型的,是三件过去必须分开做的事第一次被压进同一个模型:文本里直接写 [whispering]、[excited]、[laughing] 这种音频标签控制语气,毫秒级字符时间戳让模型在被用户打断时知道停在哪、下一句从哪接,秒级样本克隆在 60 多种语言里保持同一声音身份,句中切语言也不串味。对做 Voice Agent 的人来说,这意味着工程链路被硬生生压缩。

但 0.70 美元这条线得读细。它是按 generated hour 计的合成价格,不含推理分发、克隆训练和声纹授权,整套 TCO 还要另算。资料只说“为实时语音智能体设计”,没给首字节时间、端到端延迟这些实时场景最在意的数字,商用许可、可用区域、是否兼容旧 v1 也都没说清。工程简化和成本冲击是真实的,落地数据还差一截。

可以把它当成“单模型统一”这个方向的明确信号,但别拿一个价格当全部成本,先拿真实延迟、可商用范围和克隆授权这三项去压供应商。

你做语音智能体时最想用一个模型统一掉的,是多语种切换、情感控制,还是打断恢复?