大家好,我想和大家分享一个我过去10个月一直在做的副业项目——https://www.captionsrush.com

简单来说,我是一名听障开发者,基于Overwolf打造了一个平台,能够实时转录VOIP语音。目前已有超过1500人加入,其中几十人是付费用户。

但这并不是我在这里发帖的原因。与现有产品(主要面向玩家端,与社区互动较少)不同,我今天要分享的是Unity SDK版本。帖子下方附有视频演示。

问题:在游戏中为听障人士提供转录和无障碍服务是一件复杂的事情。目前可用的VOIP提供商选择有限,提供的解决方案也很不完整,而那些能做的(比如Vivox)会要求你为游戏中每小时的转录支付整整1美元(!!)。这种模式不经济,开发者没有理由为此掏钱并集成。更重要的是,隐私、安全、GDPR等各种麻烦事也都令人头疼。这些大家都懂。

思路:把转录功能放到游戏内部,完全在客户端侧实现。

问题二:目前没有一种质量高、准确度合理且不耗尽玩家电脑资源的转录模型(Whisper + GPU,或表现糟糕的Windows转录引擎)。

解决方案:来自https://www.moonshine.ai/的优化模型,我与他们在游戏领域有密切合作。他们帮我用1000多小时的游戏片段训练了一个模型,使其即使在爆炸、音乐和枪声背景下也能听懂。这个模型在最高精度版本下最多只有200MB,仅运行在CPU上,100%隐私,零成本。它对用户CPU的占用几乎为零。转录质量出奇地好,甚至在某些方面的WER参数上超过了Whisper Large。

应用方式:你只需在我的SDK中使用一个简单的单例模式。在UI、音频管线连接等任何需要的地方设置简单的钩子即可。

为什么做这些? 首先,为了无障碍。请保持人性。如此庞大的人群(包括我)完全被排除在基于VOIP的竞争性在线游戏之外。第二个原因是,不久后欧盟和美国的无障碍法规将开始覆盖游戏行业。这不是“会不会”的问题,而是“什么时候”的问题。(***重要说明——这里指的是实时通信的无障碍,而非过场动画的字幕)我们可以争论,但大势所趋。

我寻求的帮助:我已经有一家工作室正在与我进行试点合作。我在寻找更多愿意尝试与我合作的独立开发者/工作室。如果你时间紧张、不想在开发上浪费精力,我愿意自费完成集成。

即使是和“朋友的朋友的朋友”认识的一位在德国做联机游戏的朋友搭上线也行。

有问题欢迎随时问我 🙂