Agentic AI时代,数据库“AI自治”真的要来了
云原生与AI技术飞速迭代的当下,数据库架构越来越复杂,传统依赖人工运维的弊端日益凸显,行业该如何跳出被动救火、低效运维的困境?数据库运维智能化究竟走到了哪一步,AI自治又将为行业、DBA从业者带来怎样的变革?
图(左)为达梦数据云数据库产品线副总经理 季武雄
在第17届中国数据库技术大会(DTCC2026)上,我们采访了达梦数据云数据库产品线副总经理季武雄,他分享了数据库运维在云与AI时代的困境、数据库运维智能化发展现状与趋势,并结合启云数据库的发展谈到了数据库“AI自治”的发展之路。
数据库运维困局:复杂度高、效率低、DBA被动式救火
凌晨两点,监控系统突然弹出一条数据库连接数飙升的告警。值班DBA从睡梦中被电话叫醒,匆忙登录系统,发现慢查询堆积、CPU占用逼近阈值,而业务侧还在不断涌入流量。他一边手动排查SQL执行计划,一边协调扩容,等问题最终定位并恢复时,已经过去了四十多分钟,这恐怕是无数数据库运维团队最熟悉的“救火”日常。这背后,是数据库运维长期面临的四重困局。
运维低效。在日常工作中,DBA超过50%至70%的时间被手动巡检、备份校验、容量评估和弹性扩容等重复性工作占据,真正用于架构优化和性能调优的精力被严重挤压。当运维团队疲于应付基础操作时,效率瓶颈就成了系统性问题。很多问题往往不是DBA不够专业,而是重复劳动吞噬了创造价值的时间。
复杂度高。数据库架构早已从单机时代演进到分布式、云原生和多模态并存的新格局。一个中大型企业往往同时运行着关系型、NoSQL、时序、向量等多种数据库,部署在公有云、私有云和本地机房的异构环境中。数据孤岛随之产生,跨实例、跨引擎的统一管理难度呈指数级提升。
专家经验断层。一名资深DBA的培养周期长达五年以上,从SQL优化到故障诊断、从架构设计到容量规划,大量经验依赖口传心授,难以固化为可复用的知识资产。一旦核心人员流失,系统稳定性立刻面临考验,故障定位时间大幅增加,团队不得不重新走过一遍“踩坑— 积累”的循环。
被动式“救火”。大多数团队仍依赖静态阈值进行监控,告警规则僵化,无效告警比例居高不下,真正的风险反而被淹没在噪音中。当故障真正发生时,MTTR(平均恢复时间)往往超过30分钟,人工排查不仅耗时,还容易在高压下出现误操作,让小问题演变成大事故。
达梦数据云数据库产品线副总经理季武雄介绍,传统数据库运维更多面向单套系统、固定环境和人工经验,新时代的数据库运维面对的是多实例、多租户、分布式架构、弹性资源、容器化部署和更高的SLA要求,其挑战早已不只是“把数据库管起来”,而是要在复杂环境下持续完成监控、告警、备份、扩缩容、性能优化、安全审计和故障恢复的全链路闭环。
“当前的数据库运维主要矛盾十分清晰:数据库规模越来越大、架构越来越复杂,但专家经验和人工排查的效率已经跟不上,运维模式必须从被动救火转向主动预测、智能诊断和自动处置。”季武雄说,云数据库已经从资源托管、自动化管理,进入到“智能决策与自治运行”的新阶段。过去用户更关注数据库能不能上云、能不能弹性扩展,现在更关注能不能少依赖人工、能不能提前发现风险、能不能自动诊断和优化。
数据库自治说了这么多年,Agentic AI时代,数据库“AI自治”真的要来了。
智能运维破局:达梦启云数据库的“AI自治”之路
随着AI等新技术的发展,数据库运维的智能化经历了从“托管运维”到“AI自治”的智能跃迁,整体经历了三个阶段:
第一阶段是自动化运维,即脚本化阶段。通过编写脚本和工具,将重复性的运维操作自动化,比如自动备份、自动巡检、自动扩容。这个阶段解决了“手动操作太累”的问题,但本质上还是“人设定规则,机器执行规则”,系统没有自主决策能力。
第二阶段是小模型运维,即规则加AI的阶段。在自动化的基础上引入机器学习和小模型,用于异常检测、性能预测、参数推荐等场景。这个阶段系统开始具备一定的“感知”和“预测”能力,但仍然局限于特定任务,缺乏对复杂问题的理解和推理能力。
第三阶段是大模型与Agent运维,即认知智能阶段,也就是真正的AI自治阶段。大模型具备强大的自然语言理解、知识推理和任务规划能力,结合Agent框架,可以实现感知、规划、执行、反思的完整闭环。系统不再只是执行预设规则,而是能够理解上下文、自主拆解任务、调用工具执行修复,并根据结果进行反思和优化。
在第三阶段的早期,AI还只是能做到“智能辅助”,随着Agentic AI时代到来,会走向“多Agent协同自治”,通过专家智能体、统一编排、沙箱验证和可回滚执行,形成闭环,实现自感知与自愈。
“实现自治的关键,是建议必须可验证、过程必须可审计、执行必须可控、失败必须可回滚。”季武雄强调,真正意义上的AI自治,不只是系统给建议,而是要能完成“感知、诊断、决策、验证、执行、回滚、学习”的闭环。
现在数据库自治行业整体还处在从“智能辅助”向“人机协同自治”过渡的阶段,部分领先的数据库产品已经在特定场景中实现了较高程度的自治,比如自动参数调优、异常自动检测、慢SQL自动优化等。但离真正的“全AI自治”,即系统能够独立应对所有运维场景、无需人工干预,还有相当的距离。关键生产变更、复杂故障处置、架构级优化和安全合规判断,仍然需要DBA参与。
达梦启云数据库的智能化AI自治发展也经历了从自动化运维到如今多Agent协同自治的发展之路,逐步打造自治体系,加速迈向智能运维AI自治,让DBA不再受困于被动式“救火”。目前,围绕智能运维、性能优化和数据探查形成了一批AI能力,包括AI小助手、自然语言查数、SQL生成、SQL优化与改写、参数推荐、时序预测、容量评估、故障诊断、根因分析和智能报告等。
据悉,启云数据库的AI自治能力在很多场景中已经落地,典型应用场景覆盖事前预测、事中分析、事后优化的数据库运维全生命周期。比如,事前预测CPU、内存、磁盘和表空间风险,提前给出扩容建议;事中分析锁等待、会话堆积和慢SQL,缩短故障定位时间;事后对慢日志和执行计划进行优化分析,给出索引和改写建议。
季武雄介绍,今年启云数据库在AI自治方面的重点是继续把AI能力从“单点功能”推向“体系化自治”。一方面增强多Agent协同能力,让参数调优、时序预测、SQL优化、故障诊断、数据探查等智能体通过统一入口协作;另一方面注重知识沉淀与经验技能复用,推动AI Agent自进化,让系统在实战中不断积累智慧;同时加强沙箱验证、负载回放、灰度执行和回滚机制,让AI建议不只是能生成,还能在可控环境中验证效果。整体目标是要提升智能诊断准确性、扩大场景覆盖面,并逐步把低风险、标准化、高频的运维任务交给系统自动完成。
数据库AI自治:分清自动化边界,守住人工决策底线
我们知道,数据库自治场景下,并非所有任务都可交由系统全权处理。数据库作为企业核心关键底座,部分高风险操作不能完全交由AI自主执行,必须依靠人工把关、复核与决策。企业在落地AI驱动的数据库自治能力时,哪些工作可交由系统自动化完成、哪些环节必须保留人的介入,以及如何构建高效的人机协作模式,都需要审慎权衡、细致规划。
季武雄指出,在数据库AI自治的实践中,高频、标准化、可回滚、风险边界清晰的任务,例如日常巡检、告警聚合、容量预测、慢SQL初筛、报告生成、参数建议、SQL改写建议和沙箱验证等,可以优先交给系统来完成。而涉及业务优先级、生产高风险变更、数据安全、灾备切换、架构调整和责任边界判断的任务,则必须由人把关。
“更好的协作方式是人机协同闭环:系统负责发现问题、形成证据、提出方案、验证效果。DBA负责设定策略、审批关键动作、判断业务影响,并把经验反哺给系统。”季武雄说。实现数据库AI自治的核心价值是把DBA的经验沉淀进系统,让系统能够更早发现问题、更快定位原因、更稳妥地给出处置建议。
与此同时,随着数据库AI自治不断发展,DBA也在经历一场深刻的变革。季武雄认为,数据库AI自治的发展不会让DBA消失,但会改变DBA的工作重心。过去DBA大量时间消耗在巡检、查日志、看指标、写脚本和处理重复故障上,未来这些工作会逐步被平台和AI承担。DBA的价值会更多体现在架构设计、性能治理、数据安全、故障复盘、自动化规则建设和AI结果评估上。面对AI革命,DBA要从“操作型专家”转向“策略型专家”,既懂数据库原理,也能理解云原生、自动化、可观测性和AI工具,用AI扩大自己的能力半径。