我想分享我工作的角度:而不是要求一个AI来驱动一个编辑器,给它一个编译器——并且以一种它无法作弊的方式来测量它。
rigc(MIT,npm i -g spine-rigc) 将两个小的JSON规范——一个骨骼规范和一个运动规范——编译成一个Spine 4.3骨架,通过一个spine-core的回路验证以及~35个机器断言。想法是:让编译器来处理AIs不擅长的事情(格式细节,坐标约定,图集打包);用测量来评估它们的表现,而不是眼球。
我认为真正有创新的部分是 基准协议:
- 代理获得一个写好的简要说明和渲染的PNG帧——从来没有骨架答案。
- 禁止阅读列表:参考导出,转录,之前运行的测量。读取一个并且运行被标记为“未评分”。
check渲染候选者并且与帧进行比较:MAE(平均绝对误差)在参考的绘制像素上(所以绘制大透明精灵无法缩小分母),每个骨骼链的误差归因,帧动量差异。- 分数差异在 一次,在结束时。它的测量来自答案,所以在中途运行并且编辑后被标记为“基准辅助”——一个不同的类别,不能与干净的运行进行比较。
- 每个运行都被提交到其完整循环日志,并且一个Web查看器播放任何运行旁边的参考帧。
到目前为止的结果(所有在仓库中,包括日志):
- Claude Opus清除了简单的跑道。对一个完整的角色(spineboy)它完美地作者了 结构——18/18骨头,名不见实的树相似度1.000——但 运动可靠性 死锁:最差骨骼链漂移~14.6 px 对于一个0.7–3.3 px条带。经过三次尝试每次使用真实杠杆,我冻结了这个跑道作为一个评分门槛,而不是继续重跑。
- 上周我使用一个故意弱的模型(Gemini Flash)在一个试点中进行了测试。它在3小时无人值守中完成了一个干净的评分运行:结构与Opus名不见实的相同,运动约为其一半——并且每个失败都是从仪表板可读的,而不需要信任模型的自我报告。裁判的判决书也被提交了。
- 观看弱模型的挣扎产生了
docs/PROMPTING.md— 六个实际上很重要的提示子句(搜索循环的进度输出,稀疏键而不是每帧的键,……)。
它还无法做到:网格/物理/IK编译和验证,但没有基准运行证明了一个AI可以 作者 它们。多个关节角色上的运动可靠性是开放的问题。
仓库:https://github.com/firejune/rigc
我真诚地希望这个社区的意见——特别是这种诚实协议是否在对抗性阅读下保持有效,以及您将衡量什么我没有衡量。
评论 (0)