我一直在开发一个基于语音对话的游戏,目前遇到了一个声音方面的问题。

一旦开始有动态对话,感觉需要大量的语音线、SFX、音乐等。并且,如果希望这些声音在实时更新,成本会迅速增长。

我的第一个想法是使用 ElevenLabs,但我发现令牌使用量会迅速增加。

那些独立开发或小团队的开发者,如何处理声音、音效和音乐?你们是否使用像 ElevenLabs 的 API,还是使用本地/开源模型,或者是混合使用不同方法?

另外,有没有什么可以让成本在事前容易估算的方法?这可能是我最大的问题。比如我希望知道“X 小时游戏时间 = Y 成本”,而不是不断担心令牌耗尽。