这是一个使用 A-Frame(Three.js,WebXR)构建的项目,允许我用我的声音在虚拟现实头显中创建虚拟世界。我的麦克风连接到了 Claude Code,它又与项目代码库进行交互。

由于代理直接与代码进行交互,因此实现的可能性非常广泛,只是受限于底层 LLM 在 WebXR 中的能力。代理可以构建从简单对象到动画、交互能力到整个环境的所有内容,以满足请求。

这仍然远远不够完美。延迟非常高,依赖于请求复杂度,可能需要从几分钟到多分钟才能完成一个改变。代码库也不能很好地支持非前沿模型。从我的测试来看,Haiku 和 Sonnet 等模型无法跟上,Opus 5 只能在推理设置为至少 Low 时正常工作(大部分视频都是用 Opus 5 Low 记录的)。

但这个基础已经成为现实了,随着这些模型的改进,我可以看到它将变得非常强大。