数据库 频道

AI引发软件范式变革:从“程序+数据”走向“智能体+知识”,数据库该怎么走?

编者按:数据库智能化发展分为DB for AI和AI for DB两个方向,AI for DB关心如何用AI让数据库开发、使用、交付、运维得更好,而DB for AI关心在AI浪潮中,数据库发挥什么样的作用,应该往哪里走,这对于数据库厂商、数据库行业的影响更为深远和广泛。

本文编辑整理自深圳计算科学研究院旗下崖山智能总经理王南在DTCC2026大会的主题演讲《软件定义,从“程序+数据”走向“智能体+知识”》,重点关注DB for AI方面。AI时代,IT迎来范式变革,软件重新定义,AI应用未实现大规模爆发,缺了什么?数据库在新技术栈里将扮演什么角色?未来将如何演进?

整体分为以下四部分:

  • AI引发软件范式革命

  • AI应用未大规模爆发,缺什么?

  • AI缺知识、不懂业务,怎么办?

  • AI时代,数据库往哪走?

以下为正文:

AI时代,迎来软件定义新革命

1、作为冯·诺依曼范式时代产物,数据库正在AI 时代重新寻找方向

早期传统IT是软硬件一体,程序和数据也耦合在一起。随着晶体管、大规模集成电路发展,硬件与软件实现分离。之后软件内部,又将代码指令和数据拆分开,形成了冯・诺依曼体系下经典IT架构,这套架构支撑了行业数十年的发展。

有老师在DTCC2026大会演讲中提到IT演进的比喻——《吞食天地》,讲的就是程序和数据随着软件技术的发展不断此消彼长,最开始程序和数据不分离,后来因信息化快速发展,数据大量增加,软硬件处理能力不够,应用逻辑向数据计算抽象下沉,包括Oracle在内的很多数据库厂商因此发展起来。再往后出现了存储过程,把应用的逻辑下沉到数据库里做计算。随着大数据与AI不断发展,包括过去十年的国产化替代浪潮,原先下沉到数据库层的数据逻辑和计算,又重新回到应用层解决,降低了对数据库层复杂度的依赖和负载,让数据库变得更简单。现在增量软硬架构里大家很少用存储过程,复杂的业务逻辑会在应用层面解决,这样对数据库的高可用能力、扩展能力、复杂性能调优能力的要求会变低,这些能力曾是传统时代数据库的关键。

在AI和智能体发展起来后,“程序+数据”这种面向过程的计算逻辑被颠覆。AI从大量的数据和现象中统计和提炼出规则和逻辑,也就是知识,沉淀在参数中,在应用阶段通过推理来表达物理世界规则的计算。

但还有很多数据没办法获取并表达为知识,比如不断新产生的数据,无法在训练阶段获取。因此在推理阶段,这些没有获取的知识又通过RAG等方式输入给大模型进行访问。

这种新的计算模型下,数据库开始产生迷茫,当下自己在什么位置?

AI时代,软件运行的范式从传统的“程序+数据”的过程驱动,转变为“模型+知识”的目标驱动模型。传统软件生命周期,是描述清楚每个业务流程的目标、转化为需求、再进行编码开发、然后进行场景化定制并部署交付运行;但 AI 的运行逻辑,是构建业务知识建模后,大模型基于知识直接进行计算,不再需要传统的应用软件开发流程。

因此市场上也出现了“SaaS终将走向消亡”的观点,“智能体+知识”如果发展得足够好,在很多场景下会替代软件开发流程,而不是仅仅辅助软件产品做得更好。

新的软件开发范式下,“知识构建过程”=“业务开发过程”,软件生产效率发生了颠覆性革命。

原来在技术栈最核心的C位的数据库,在新的架构下价值能走向何方?

2、AI是HI的硅基镜像,大脑运行本质是物理世界规则的建模

人工智能(Artificial Intelligence)本质是对人类智能(Human Intelligence)的模仿,二者底层运行逻辑高度一致。HI依托大脑神经元的计算能力,通过认知现实物理世界及关系,提炼自然与社会规则,将物理世界表达抽象成公理、定律、公式等逻辑和规则,也就是知识,形成对世界的认知、理解与运算。

AI完全COPY了这个运作机制,人类神经元计算替换为GPU运算,把人类积累的经验、知识与各类结构化数据、碎片的非结构化语料等,通过训练转化为大模型参数,形成AI认知的逻辑规则与知识体系。 无论是HI还是AI,都是在不断“训练积累知识、场景落地应用、推理迭代升级”的闭环中不断成长的过程。

当前AI底层技术已日趋成熟,算力硬件、大模型、多模态技术、智能体、知识图谱等核心技术均实现走向成熟及可规模复制,大模型软件工程生态也逐步完善,大幅降低了AI应用的搭建门槛,普通人也能快速搭建AI应用原型。

但目前AI仍未在产业端实现大规模落地应用,核心痛点并非单一技术短板,而是各类成熟技术未能有机融合、形成完整体系。 单一技术无法适配复杂的现实产业场景、无法搭建业务闭环,这也是当下AI产业突破落地瓶颈、实现最后一公里应用爆发需要解决的核心问题。

AI应用未大规模爆发,缺什么?

1、人类大脑运行的三大基石,AI解决了吗?

HI分为躯体执行和大脑运算两大能力,我们先仅聚焦大脑运算这个话题。人类大脑实现认知与运算,依托三大分工明确、各司其职的核心能力,分别是思考推理、知识与记忆、协作与控制,且三类能力由大脑不同区域专属承载。

第一是思考推理能力。主要由大脑皮层、额叶等区域负责,核心作用是完成算力运算与逻辑推理,对应AI模型的基础计算能力,目前这一层面的基础技术问题已基本得到解决。

第二是协作控制能力。由小脑、脑干、垂体等部位承载,主要负责调度、协同大脑各区域及人体各类器官的运作,统筹整体执行工作。对应到AI领域,是大模型软件工程,也就是Harness能力,正在快速发展。

第三是知识与记忆能力。大脑依靠视觉、触觉、痛觉等等各类感官,将物理世界的知识转化为大脑可识别的脑电波信号模型,完成对事物的认知,形成知识构建、存储和检索。同时,大脑具备短期记忆与长期记忆,短期记忆通过反复强化形成长期记忆存储在海马体等区域,反复供给大脑皮层在思考时调用。这也是部分感官障碍人群存在认知或记忆缺陷的核心原因。对应到AI领域,如何认知知识、构建知识、存储和检索知识,这个领域的发展仍然处于非常早期阶段,未形成成熟方案。

在AI体系中,大模型对应大脑的思考能力,Harness则对应大脑的协作调度功能,知识建模、存储与检索则匹配大脑的认知和记忆机制。

2、一朵小乌云:AI训练和推理都无法获取足够有效的知识/数据

AI技术迭代速度极快,各类开源、闭源产品不断涌现,很多基础能力已实现落地应用。但AI在知识建模、知识表达、存储与检索领域仍存在极大短板,这也是当前AI产业落地的核心瓶颈,知识认知在模型训练与推理阶段都没有得到真正解决。

在模型训练阶段,难题主要是数据层面的多重缺陷,语料的质量和数据的质量会影响到训练过程对模型参数能力和正确性表达。

首先是语料数量与质量参差不齐。大模型虽能获取海量互联网数据与开源代码数据,但众多行业领域的信息化、数字化程度不足,大量行业知识与业务能力未通过数字化系统沉淀,可采集的优质语料极少,而且不断有新增和变化的数据在训练阶段无法获取,这会直接影响模型参数训练的准确性与覆盖度。

其次是数据壁垒与合规限制。金融、工业制造、政务等核心领域的数据具备极强的安全与合规要求,不同国家、区域也存在数据管控壁垒,模型无法获取这类关键行业数据。整体而言,大模型所能获取到的公开知识,相较于各行各业、物理世界的全部知识体系,不过是九牛一毛,极度匮乏的训练数据,让AI难以完整、真实地表达现实世界的知识与运行逻辑。

最难跨越的障碍是无法获取各类暗知识。大量人类的经验、决策逻辑与情感认知,本身都还没有通过语言、文字、音频、视频、数据等形式数字化表达。例如企业经营中需求优先级判定、业务发展方向抉择、资源调配等复杂商业决策、工程师多年形成的“经验、传统产业未信息化的能力等等。同时,人类细腻的情感差异、主观感受等内容,也无法被数字化记录与采集。这些未被数字化表达的个人经验、隐性能力,是AI无法学习的暗知识,它们在物理世界中仍然占据绝对庞大的体量。

因此,受数据质量、数据壁垒、暗知识缺失三重因素制约,在未来短期内甚至数年的中长期展望,AI仍然难以通过训练形成对物理世界的完整的认知。

正由于如此,大家也思考出在推理应用阶段,依靠RAG技术外挂知识的方式是否能够解决问题。比如企业私有数据,将企业规章制度、办公输出、制造流程等等数据,通过向量化构建成知识库方式,补足模型的覆盖不足。但该技术存在明显局限性,向量表达的能力十分有限,仅能通过向量相似度进行简单的信息查询与浅层知识调用,无法承载长链条、场景化和逻辑语义等高阶逻辑,大量复杂知识无法通过向量库构建实现。这意味着RAG只能解决部分简单问题,无法根本补齐这部分能力短板。

3、模型参数表达框架下,逻辑和知识被混为一谈

我们尝试进一步理清现有大模型使用参数表达能力的框架下,长期混淆讲述的两大核心概念: 逻辑与知识。

大模型的参数表达框架中,同时承载着逻辑与知识两个概念,二者意义不同。其中,逻辑指代可被模型归纳、抽象的各类规则。无论是物理世界的自然规律、科学原理,还是编程解题、事务处理等通用行为规则,都可以通过海量样本统计学习,让模型提炼出固定运行逻辑,这也是当前大模型相对成熟的能力。

而知识则是另一类完全不同的内容,特指事物本体的属性、定义、特征与关联信息。例如“人属于动物、具备特定外形、拥有专属行为”这类具象定义与底层信息,属于典型知识范畴。当前大模型虽能从海量语料中提取部分知识,本质仍是基于有限数据集的统计语义,无法形成清晰、完整、有逻辑的知识定义,存在极大认知漏洞。

基于此,我们可以将知识划分为两类: 一是可被模型学习、能固化在参数中的显性知识,也就是“知识1”;二是模型尚未覆盖、无法精准表达,以及现实中持续新增、未被采集的隐性与增量信息,也就是“知识2”。我们将“知识2”的承载与调取能力,定义为知识的记忆。

我们重新审视一下当前的几个关键挑战:1,大模型的知识认知仍远远无法覆盖物理世界,因此它应用在生产中会出现幻觉、错误和胡说八道;2,模型厂商仍在持续迭代数据与算法,不断将外部知识转化为模型参数,但模型知识迭代速度远远跟不上现实世界海量的知识存量,大量知识仍然长期无法转化到模型中;3,这些知识目前也无法被模型理解、调用与访问。

这就引出了AI产业落地的关键难题:现实世界绝大部分知识与场景逻辑,AI在长期内都无法完整覆盖。以软件行业为例,当前AI仅能掌握编程的基础逻辑,却无法理解软件企业的业务上下文、产业上下游的完整运作体系。这意味着AI可以替代单一程序员的编码工作,无法覆盖软件开发业务全流程。这就是制约AI在产业端大规模落地、深度赋能生产场景的核心症结。

AI缺知识、不懂业务,怎么办?

面对上述短板,想要突破瓶颈,核心思路是为大模型补齐缺失的知识体系,逻辑由模型表达,而知识应该单独记忆,将模型无法覆盖的隐性、动态、创造性知识,通过标准化建模方式转化为AI可理解、可存储、可检索的知识,作为大模型的能力补充,助力AI真正落地生产场景。

可用于补齐模型短板的知识来源主要分为三类。 第一类是传统IT系统沉淀的结构化数据,是多年信息化、数字化、大数据建设积累的核心数据资源,体系规整、可直接调用。 第二类是非结构化企业数据,涵盖企业管理制度、生产流程规范、会议纪要、办公沟通信息等,以文本、PPT、图片、音视频等多种形式存在,这类数据体量远超结构化数据,是企业知识的重要组成部分。 第三类是储存在人类大脑中的暗知识,也就是行业资深从业者的经验直觉,例如资深医生的病理判断经验、老技师的生产研判经验等,这类知识无法录入业务系统,却具备极高的产业价值,需要通过专属路径完成转化沉淀。

想要完成三类知识的转化落地,需要依托标准化知识表达模型。物理世界的一切事物与规则,均可抽象为对象、关系、行为三大基础元素。其中,对象包含所有实体与虚拟事物,设备、程序、产品等均在此列;关系指代不同对象之间的层级、关联等各类联系;行为则是对象具备的功能与可执行的动作,对应事物的运作方式。无论是物理规则、行业知识还是业务逻辑,都能通过这三大元素完成底层抽象,生产线的设备构成、工艺流程、零件属性等核心内容,也可依托这套体系完成标准化建模。

1、知识构建:如何进行知识表达和转化?

整体可将AI知识构建体系清晰划分为三层:数据源层、底层物理建模层、上层语义建模层,不同类型的数据源可通过对应的路径完成标准化转化。

首先是结构化数据的转化建模。企业传统IT系统沉淀的结构化数据均自带完整元数据,通过数据表、字段名称、系统关联结构,可清晰明确每张数据表、每个字段的业务含义。基于这类原生信息,通过语义映射与逻辑提炼,就能梳理出结构化数据背后的业务关系与运行规则。同时依托数据库直连的方式完成模型映射,将传统结构化数据转化为AI可识别、可查询的统一知识模型。

其次是非结构化数据的转化建模。针对文本、图片、会议资料、各类文档等海量非结构化数据,通过大模型与多模态模型及规则和逻辑完成知识提取。模型能够从碎片化内容中提炼出各类业务对象,识别生产流程环节、业务节点之间的依赖关系,完成物理模型的构建。同时结合文本、表格、图文内容中的业务描述,萃取对应的语义信息,为物理对象绑定真实业务语境,实现物理建模与语义建模的同步落地。

更重要的是,结构化与非结构化数据完成统一建模后,需要形成汇聚和统一的知识融合,且保障物理模型与语义模型的一致性。如果两类知识体系相互割裂,显示业务流程无法和物理知识模型映射关联,端到端的完整生产流程需要业务流、业务实体和知识模型的关联,才能完成业务理解和执行。只有实现两类知识的统一表达、深度融合,才能支撑AI适配复杂、完整的产业生产场景。

最后是暗知识的构建能力。针对行业构建定义语言。可通过KDL语言及NLP自然语言输入的方式,将病理诊断、设备运维、业务流程、应急研判等长期实操经验录入统一知识引擎。将这些个性化经验统一转化为标准化知识模型,与结构化、非结构化数据知识模型汇聚融合,形成覆盖产线、流程、组织、业务的完整企业知识体系。

通过上述三类数据持续积累、迭代完善,企业知识模型的完整度与准确率会形成极强的完整性和准确性极限,并通过持续构建形成积累,逐步达到可深度支撑生产落地的应用水平。相较于依靠大模型厂商全域训练、打通行业数据壁垒的方式,这套本地化知识建模、迭代升级的路径,成本更低、落地更快、可实施性更强。

在落地工程层面,整套转化体系搭建了专属的知识流水线。结构化数据可直接对接建模工具,完成实体定义、属性调整、关系梳理等类ETL的标准化加工,最终输出统一的物理与语义知识引擎。非结构化数据则全面兼容各类文件格式,支持各类数据源和多种数据类型,摒弃传统RAG仅生成离散向量的局限,构建具备完整语义关联的知识体系。同时,系统支持自定义建模语言、自然语言口述、文字输入等多种方式,适配各类生产流程的知识定义与录入需求。

2、知识构建的关键问题,怎么转化成记忆并检索?

知识转化完成后,必须匹配高效的存储和检索能力,才能高效利用。 复杂的知识表达形式,需要多模态存储底座实现高效存储、记忆与调用,不同类型的知识形态需要不同的数据模型与存储结构:流程关系、业务依赖适合图模型存储,文本等知识命中类场景适合向量存储,日常办公、游戏等适合文档存储,客群区域、地理信息适配空间存储,音视频素材适配文件存储,彻底突破单一向量存储的能力局限。依托崖山数据库的多模态、分布式、高可用引擎,可在统一数据库内兼容各类数据类型,实现多模数据一体化存储。

这套统一存储检索架构的核心价值之一,还在于支持多模异构化统一语义查询。无需搭建多个数据库实例、编写复杂关联代码,仅通过一条SQL语句,即可关联调取所有类型的知识数据,自然语言可快速转化为可执行的解释性SQL查询语句,让用户能够通过自然语言实时精准检索各类沉淀知识,而不是传统方式通过应用编码来从多种数据源检索数据并融合语义逻辑,真正解决AI生产应用中实时性检索复杂知识的核心难题。

AI时代,数据库往哪走?

基于这个智能知识引擎框架,我们进一步思考AI时代下数据与数据库的核心关系,以及数据库行业的未来发展趋势。

这里有一个需要厘清的判断:AI时代,数据库是变得更重要了,还是不重要了?我们的观点是——不是不重要了,而是要求更高了。

当下有一种说法认为“数据才是核心,数据库只是工具”,这个判断只看到了表象。AI时代数据与知识的价值确实在放大,但要让数据与知识被模型高效获取、理解、检索和使用,离不开一个强大的数据底座。数据库不会“退化”,而是需要承担更多角色——从传统的存储与计算,扩展到知识的承载、表达与检索。

AI的核心诉求,是将能够获取并将海量数据转化为模型可理解、可检索、可调用的知识,而数据库正是这条链路中不可或缺的承载底座。

1、AI对数据库提出更高要求,而非削弱

传统数据架构分为应用层、数据层、底层存储层,大模型场景下,应用层与数据层会逐步迭代为模型层与知识表达层,数据的形态与位置也会重新定义。

在新的架构中,数据库不再仅仅是数据存放的地方,而是数据与知识统一的承载底座。模型需要的不再是简单的数据读写,而是具备知识建模、多模态融合与统一语义查询能力的数据库。

以前数据库最核心的复杂查询优化、分区策略、高可用、分布式扩展、生态兼容等核心能力,对传统应用层来讲是刚需。在AI场景下,这些能力依然是基础,同时还需要在知识表达、多模态处理与统一语义查询等方面实现突破。

长期占据主导地位的关系模型,作为经过数十年验证的成熟体系,依然是数据管理的基石。但在AI场景下,单一关系模型确实难以独立承载复杂知识的完整表达,需要与图模型、向量模型、文档模型等多模数据能力打通融合。多模数据建模成为最 优解,未来数据形态将从以关系数据为绝对主体,转变为“多模态数据为主、关系数据为辅”的全新格局。数据库的核心发展方向,也从“优化数据存储与计算性能”,进一步扩展为“构建数据与知识的统一承载底座”。

2、崖山科技的AI探索实践:“平台+知识模板”助力AI落地

崖山智能已经打造了完整适配AI落地的产品解决方案,形成可商用、可落地的技术体系,聚焦于数据与知识的建模、处理与服务,核心分为平台能力与知识模板能力知识引擎与行业知识模板两大板块。

第一是知识引擎核心能力。知识引擎承担大脑认知与记忆的核心功能,可完成全类型知识的抽取、建模、转换、表达与智能检索,解决大模型幻觉、信息不准、隐性知识无法获取等核心问题。通过MCP协议对接各类智能体,企业只需接入业务系统、导入全量文件,即可让模型精准识别、沉淀、运用各类业务知识,修正原有认知错误,解锁传统场景无法实现的能力。AI工程化与智能体调度方面,基于MCP协议对接外部智能体生态,支撑知识在各类场景中的落地应用。

第二是行业知识模板能力。平台厂商构建底层能力,行业场景和业务积累构建知识资产。针对各行业同质化场景,如运营商各省业务、企业跨区域通用流程等,我们会与客户、合作伙伴、FDE共同构建,通过深耕标杆场景、搭建标准化知识引擎模型,沉淀出可复用的行业知识模板。模板可快速复制落地,无需每个客户从零搭建知识体系,随着落地场景不断积累,逐步形成各行业通用的知识服务能力,实现规模化赋能。

当然,生产级落地还须配套执行引擎与安全引擎。执行引擎为AI补齐“手脚”,让具备认知能力的AI真正接入生产流程完成业务落地;安全引擎实现全流程的审核、审批、审计与风险管控,筑牢生产落地的安全底线。

区别于纯做模型或Agent的平台厂商,崖山的独特优势在于——智能知识引擎与崖山AI数据库的深度融合。知识引擎的建模、存储与检索能力,直接建立在崖山自研的多模数据库底座之上,一套SQL即可统一调取关系、向量、图、文档等多模态知识数据,实现“数据库级”的知识服务能力。这不是简单的外部对接,而是从底层打通的深度集成,是只有数据库厂商才能提供的差异化竞争力。

AI会重构世界,AI 仍面临断崖。崖山智能面对这个断崖,聚焦数据与知识领域,以智能知识引擎为核心,深度融合崖山AI数据库,帮助AI真正走向生产落地,帮助用户真正走向智能化。

崖山智能,为企业提供端到端的闭环AI落地方案,用户不需要掌握复杂 AI 技术栈、海量业务建模技术,不需要投入大量资源及时间,即可快速完成传统 IT 的智能化改造。让 GPU 真正地读懂CPU时代数据,一站式构建传统软件与IT系统转型 AI业务能力,让 AI 真正走向落地和生产。

0
相关文章