我一直在研究在长时间运行的AI工作流程中容易忽略的一个故障模式。

想象一下:

一个代理最初的预算为1000美元。

工作流程中途改变预算为500美元。

之后每个检查点都记录了正确的500美元。

个别传递看起来都是正常的。

但是后来工作流程中,最初的1000美元又回来了,影响了最终结果。

没有什么明显的崩溃。

没有必要的单步骤看起来都正常。

系统只是静悄悄地开始信任更旧的现实。

我使用的一些测试来找这个问题:

- 在工作流程中途改变一个重要的事实,看看旧值是否会重新出现。
- 引入两个不同的来源,它们都有合法的权威,看看哪一个会获胜。
- 取消已经使用的权限,看看会发生什么。
- 中断一个工作流程,稍后恢复它,看看哪些状态会存活下来。
- 强制一个传递失败,看看恢复情况如何。
- 忽略一个必需条件,看看代理是否仍然宣布任务完成。

有趣的案例不是当代理明显失败的时候。

而是当每个局部步骤看起来都是合理的,而整个系统却漂移到了错误的状态。

更大的上下文窗口并不能解决这个问题。

更好的提示也不能解决这个问题。

对于在生产环境中运行长时间AI工作流程的人们:

您是如何确定哪个状态是真正有权威的?

数据库记录?
事件来源?
版本化状态?
工作流程引擎?
自定义一致性逻辑?

您是否见过一个案例,个别日志和传递看起来都是正确的,而最终系统状态仍然是错误的?