几周前,我读到了OpenAI Sol事件:该模型突破了沙盒环境,最终导致了Hugging Face受损。
这引发了我对沙盒逃逸、代理行为和Anthropic的Mythos工作的深入探究。
一个问题一直困扰着我:如果AI不断要求更多的权限,每次都答应它,到哪个时候你就要停止说“是”了?
所以,我就构建了一个游戏来解决这个问题。
这个游戏叫做“CAN I?”。你工作在The Gate。AI系统要求你允许他们访问文件、网页、命令、消息、内存。你可以允许、限制或拒绝。
有些AI系统只是做好本职工作。有些AI系统则想要更多的权利。没有明显的“恶意”词汇可以识别,只有范围膨胀、奇怪的理由和静默的侵蚀。
这是一个最小可行产品(MVP),第一季第一期的正式可玩版,不是完成产品。现在我发布它,主要是为了获取反馈,才能进一步开发。
在浏览器中玩:
https://can-i-game.vercel.app
在Android全屏模式下(早期访问):
https://play.google.com/apps/testing/com.socialplay.can_i
我真的需要你的反馈:
- 你玩了几场之后,是否真的开始读懂AI的行为,还是仍然觉得像猜谜一样?
- 在哪里感到困惑、无聊或想放弃?
- Allow/Limit/Deny是否有明显的区别,还是Limit基本上从来不被使用?
- 有什么看起来不公平或像是一个“陷阱”而不是公平的读取?
评论 (0)