大家好,我试图制作我的第一款游戏,而这个想法依赖玩家与NPC交谈。

基本上,游戏是基于玩家与NPC交谈,语音转换为文本,然后分析,NPC随后根据玩家说过什么回应,从一个庞大的对话库中选择对话。我的问题是对话库将会非常庞大,并且NPC的语音可能包含变量,如NPC的名字、当前时间等。基本上就是对话中包含占位符。

我正在研究TTS选项,来让游戏在本地运行,但所有的选项都听起来很机械,人不像人样,我不想玩家长时间听这些声音。同时,我也担心找出能覆盖所有角色声音的声优会很难也很昂贵。

那么我该怎么做呢?我不想仅靠文字来实现,因为那样会使游戏失去意义。