大家好,

我正在尝试构建/实验一个类似Grok的Ani角色的交互式3D AI伴侣,希望能获得一些关于标准行业架构或开源技术栈的建议。

根据我的基本理解,这个流程需要连接:

  1. 大脑: 一个通过系统提示进行个性约束的LLM(可能是本地GGUF或云端API)。
  2. 音频管道: 低延迟STT → LLM响应 → TTS。
  3. 3D视觉: 处理虚拟形象(avatar)的实时引擎(Unity/Unreal/Three.js)。

我卡住的地方及需要建议的部分:

  • 延迟优化: 人们如何处理流式响应,让3D角色在等待完整句子生成时不至于静止不动?有没有人使用即时流式TTS分块的工具?
  • 情感驱动动画: 如何将文本/情感输出映射到物理3D行为?大家是用LLM输出的显式结构化JSON(例如{"text": "嘿!", "emotion": "挥动"}),还是在流中解析文本?
  • 口型同步: 有哪些主流的开源插件或库(如Oculus Lipsync、Audio2Face等)能连接音频输出与3D blendshape,实现实时口型同步?
  • 状态管理: 追踪“关系状态”或长期记忆向量数据库的最佳实践是什么?这些能影响角色在多次会话中的情绪/动画。

我计划在网页上构建这个,希望视觉效果比Ani更好,但保持动漫角色风格。我对LLM方面比较熟悉,但3D渲染是新手。我还没设计3D模型,因为我在ArtStation上找到了一些不错的Blender模型文件在出售。

能否详细说明3D方面的内容,比如动作、触摸或任何特定动作?

如果有人构建过类似的技术栈,或者知道可靠的开源框架可供学习,我将不胜感激!