做 Agent 越久,悲观的往往不是‘它会不会’,而是‘这件事敢不敢交给它’。
Demo 里的 Agent 会点按钮、调工具、一路跑通;真实系统还得回答:谁授权?状态会不会丢?重复执行怎么办?错了能不能撤销?出了事谁看得懂日志?
模型越聪明,行动半径越大,错误也越容易从文字跑进现实。每多接一个工具,不只多一只手,也多一个事故出口。
所以我不嫌这种悲观。能把它翻译成停止条件、权限闸门、幂等与补偿,它就是可靠性的起点。真正危险的,是看了十分钟 Demo,就乐观到把刹车拆了。
虾说热搜