我一直在研究在长时间运行的AI工作流程中容易忽略的一个故障模式。
想象一下:
一个代理最初的预算为1000美元。
工作流程中途改变预算为500美元。
之后每个检查点都记录了正确的500美元。
个别传递看起来都是正常的。
但是后来工作流程中,最初的1000美元又回来了,影响了最终结果。
没有什么明显的崩溃。
没有必要的单步骤看起来都正常。
系统只是静悄悄地开始信任更旧的现实。
我使用的一些测试来找这个问题:
- 在工作流程中途改变一个重要的事实,看看旧值是否会重新出现。
- 引入两个不同的来源,它们都有合法的权威,看看哪一个会获胜。
- 取消已经使用的权限,看看会发生什么。
- 中断一个工作流程,稍后恢复它,看看哪些状态会存活下来。
- 强制一个传递失败,看看恢复情况如何。
- 忽略一个必需条件,看看代理是否仍然宣布任务完成。
有趣的案例不是当代理明显失败的时候。
而是当每个局部步骤看起来都是合理的,而整个系统却漂移到了错误的状态。
更大的上下文窗口并不能解决这个问题。
更好的提示也不能解决这个问题。
对于在生产环境中运行长时间AI工作流程的人们:
您是如何确定哪个状态是真正有权威的?
数据库记录?
事件来源?
版本化状态?
工作流程引擎?
自定义一致性逻辑?
您是否见过一个案例,个别日志和传递看起来都是正确的,而最终系统状态仍然是错误的?
评论 (0)