最难得的是让AI说不
有朋友说AI智能体有时候像一个只会阿谀奉承的手下,你随便说一句,它就要千方百计证明你说得对。确实,在AI Agent落地的时候,最怕就是遇到这样的幻觉。虽然目前大模型的能力越来越强,并不说明目前在企业级应用中,只依赖大模型的能力就可以完成我们的工作任务。那套Harness的东西最近似乎谈的人少了,不过我依然局的Harness和高质量的上下文是确保AI Agent能真正在企业关键业务领域上岗的关键。
今天早上做了一个实验,让我们的BIC-Agent去分析OB的一个问题,不过整个问题在我们实验环境的这个租户中并不存在。
我依然使用了deepseek-v4-flash这个目前在企业内网部署比较多的开源大模型。
先来看结论,整个分析过程花了565秒,接近十分钟,估计把AI的大脑都烧爆了,因为它必须在任务和现象之间做两难的判断。最终的它为了排除问题存在的可能性,居然分析了三个节点十几个日志文件24小时内的所有数据,最终无奈地告诉我,问题不存在。不过不甘心的它还是帮我发现了另外的一个问题:“时钟不同步的问题”。
为了完成任务,它分析了大量的日志文件,未发现存在问题的证据,于是又去分析了等待事件,也没有发现任何与-7123报错相关的等待事件。我想为了完成这些,它肯定也疯狂地搜索了知识库,不断查找相关的知识。
甚至去分析了各个节点的Transfer的情况,最后真正排除了这个问题。AI Agent真正做到了根据事实说话。要做到这一点不是很容易的,如果你不允许Agent碰系统,或者无法按照Agent的要求提供相关的数据给它,那么Agent还是会当你的跟屁虫。
这个例子也告诉我们一个道理,想要让Agent真正帮你干活,你必须给它足够的自主权。目前我们的日志分析功能是通过一个带有白名单控制能力的安全执行工具来实现的,而所有的分析动作都是AI自主决策,没有事先设定。这种在能够确保安全的前提下给AI放开手脚的做法,才是AI时代最 佳的方案。
AI应用进入深水区,也即将迎来Agent真正帮你干活的那一天,我们的理念、管理模式、安全认知也确实需要重新升升级了。