数据尚未就绪,企业级AI需要解决的“第一公里”瓶颈
企业AI领域正酝酿着危机,IT领导者们面临两难境地:如何在保护企业品牌的同时,提升AI项目的成效并降低成本?毕竟,高管层越来越频繁地将AI作为裁减20%或更多员工的核心理由。公司董事会和投资者正大力敦促高管们证明巨额AI投资(大型企业每年投入高达1000万美元)所带来的实际收益和切实效益。
总体而言,AI的投资回报率目前仍难以证明。麻省理工学院(MIT)的研究发现,95%的生成式AI试点项目未能带来可衡量的财务回报;而Gartner预测,到2027年底,超过40%的自主AI项目将被取消。
尽管投资回报率滞后和高失败率背后存在诸多因素,但数据质量是分析师们一致指出的障碍。迄今为止,AI行业一直专注于推理层,而在主流AI讨论中,数据准备层却相对受到较少关注。
此外,关于数据准备的讨论往往局限于“最后一公里”的层面:将文档分块、生成嵌入向量、加载向量数据库、构建检索管道。这种讨论方式假设数据在进入管道时已经过清理、分类、治理且相关性强,但事实往往并非如此。调查一再表明,数据孤岛、治理问题以及整体数据质量正制约着企业的发展。Databricks的一项调查发现,仅有37%的高管认为其生成式AI应用已具备投入生产的能力。
这一差距正是AI领域的“第一公里”难题:寻找数据、理解数据、对数据进行分类,并决定哪些数据根本不应进入模型。
AI面临的非结构化数据挑战
如果你询问云服务商或大型语言模型(LLM)平台如何使用非结构化数据,他们几乎总是会首先建议你将文件导入S3存储桶或数据Lakehouse。然而,随着文件和对象数据的持续激增,以及AI应用带来的成本和安全风险不断累积,这种做法正在迅速改变。
非结构化数据占企业新数据的80%至90%,其增长速度约为结构化数据的三倍,现已成为每个企业AI项目不可或缺的原材料。然而,大多数IT团队仍然无法明确指出这些数据的具体位置、具体内容,以及如何在AI应用中安全地使用它们。
管理海量非结构化数据的挑战涉及多方面,包括:
多年来积累的NAS文件共享,以及分散在各云服务提供商之间的对象存储;
数十亿种各不相同的文件,包括文档、扫描的PDF、CAD图纸、电子邮件存档、多媒体文件、仪器数据等;
泛滥的重复数据、孤立数据、无用数据以及“僵尸”或无效数据,这些数据不仅占用存储空间,还阻碍了数据可见性;
不一致的文件夹结构,以及缺乏结构、上下文和丰富的元数据,导致难以发现和整理非结构化数据;
由于这些数据未存储在数据库中、分散在各个数据孤岛中,且识别特征稀少,因此查询起来十分费力。
解析“第一公里”差距
为了使数据能够用于AI,需要进行几个关键的预处理步骤:跨多厂商存储系统的索引、数据发现、清理和去重、通过元数据丰富与提取进行分类、敏感数据检测,以及将治理和安全策略纳入AI数据工作流。
这一缺口在Komprise发布的《2026年非结构化数据管理现状》调查中得以体现:56%的IT基础设施总监将非结构化数据的分类和标记列为AI准备工作的首要挑战,这一比例较前一年的41%有所上升。治理与安全以46%的比例位居第二。
造成这一“第一公里”缺口的根本原因在于,AI已从面向大众市场的消费级聊天机器人,演变为利用企业数据开展的战略性、大规模企业级项目。
AI“沙盒”神话:直到最近,大多数企业 AI 项目还只是孤立的实验或小型概念验证。当处理500份企业文档时,可以手动选择它们,将其上传到数据湖仓(Lakehouse)并运行RAG管道。然而,随着AI应用场景不断扩展,这种方式无法应对可能涉及10万份甚至更多文件的工作负载——其中尚有未知比例的文件并不适合该任务。
向量过滤的迷思:人们一直存在一种误解,认为向量数据库会自动过滤掉冗余或过时的内容。实际上,如果一家公司有十几份相同的旧版政策文件分散在各个存储系统中,用户搜索时同一条查询结果中就会出现多个相互冲突的版本。AI工程师们并未意识到,将大量过时、冗余或低质量的数据输入AI模型,会导致严重的“幻觉”现象、查询响应时间变慢,以及令token费用激增。
缺乏文件级治理工具:传统数据存储工具是为存储管理员构建的,其设计初衷是用于备份、分层和归档,而非为数据科学家部署数据工作流。目前缺乏能够将干净、有序的企业遗留文件共享资源安全高效地交付给数据科学管道的工具。这些工作流中还需整合对数据使用合规性的管理需求,包括检测敏感数据和受监管数据,并在必要时采取缓解措施。
所有权的经济性:涉及收入的业务应用程序(如CRM、ERP和面向客户的系统)具有损益(P&L)考量和高管支持,因此能获得资金支持。而非结构化数据大多归属于不同的预算项目:IT基础设施和存储,这是一个没有收入来源的成本中心。从大多数角度来看,查找重复、过时或受监管的文件是一个更棘手的工程难题,但它不像新的CRM功能那样拥有业务推动者。 然而,IT团队现在逐渐意识到,AI依赖于高质量且受管控的数据,而数据准备工作需要大量的预算投入。
湖仓(Lakehouse)无法弥合这一差距
AI提升了“数据湖仓”的重要性——这种架构结合了数据湖的低成本存储与数据仓库的治理能力。Databricks和Snowflake等公司如今已成为市值达数十亿美元的企业,并处于AI讨论的核心位置。但在为AI整理非结构化数据方面,数据湖湖仓仍存在局限性。
数据湖仓是一个理想的目标,但它无法替代预先决定哪些数据应存入其中的决策。
首先,数据湖仓仍要求您将原始数据先存入某个位置,其治理层才能对其进行处理。大多数实施方案遵循分阶段模式(通常称为“奖章架构”),即在对原始数据进行清洗和结构化处理之前,先将其存入“青铜层”。对于从CRM中提取的行数据,这一步骤成本较低。但对于分散在本地NAS、多个云平台和边缘位置的PB级文件型数据而言,情况则不然,而且海量数据早已成为常态。
其次,用于将数据迁移至这些平台的工具(如ETL和ELT)并非为分散在数据孤岛中的大型非结构化数据集而设计。
这正是“零移动”方法的合理性所在:在数据原生位置进行索引和分类,在数据传输前过滤掉冗余、过时和琐碎(ROT)的数据,并仅迁移工作负载所需的受管控子集。“湖仓”是一个理想的目标,但若不预先确定哪些数据应存入其中,它便无法成为有效的替代方案。
迈向Zero阶段
迁移所有数据的财务成本仅是问题的一半。另一半问题体现在AI系统的输出结果上:向模型输入低质量或重复的内容,往往会产生一个“自信满满”却错误的答案。此外还存在治理成本。文件级访问控制的存在自有其道理,而当原始数据被整批复制到新环境时,这些控制措施并不总能随之转移。
分块、解析和向量嵌入仍然必要,但应置于流程的末端。我们需要在这些步骤之前设立一个“零阶段”:先查明现有数据及其位置,按内容和敏感程度进行分类,过滤掉过时、冗余和无用(ROT)的数据,并在任何数据迁移到模型或湖仓之前,强制执行治理和访问规则。
以下是AI数据管道的工作流和工具集正在演变的方向:
用于跨数据孤岛查找内容的发现与分类工具。
用于元数据、策略和数据迁移的非结构化数据管理平台。
用于保障安全与数据血缘的治理和访问控制层。
用于将文件转换为可用内容的解析、OCR和数据增强工具。
用于支持AI工作负载的检索和向量层。
展望未来,IT和数据团队必须将数据索引、发现和分类视为基础设施,而非事后考虑。这使组织能够有效剔除重复文件、非权威数据和无关数据,同时了解受合规与安全法规约束的数据的具体要求。
那些成功跨越“第一公里”障碍的企业,最终将减少传输给AI的数据量,从而节省token、存储、计算和数据传输成本,同时确保仅将用例所需的正确数据进行摄取,绝不冗余。
希望AI实现大规模应用并获得可观投资回报率的企业,需要首先提出一个不同的问题:不是“我们应该使用哪种嵌入模型”,而是“我们的非结构化数据存储在哪里、其中实际包含什么内容,以及如何在治理框架下提供这些数据”。
作者:Kumar Goswami是 Komprise 的联合创始人兼首席执行官。他是一位连续创业者,拥有超过20年的创业经验.
原文链接:https://www.hpcwire.com/bigdatawire/2026/08/10/your-data-is-not-ready-solving-the-first-mile-gap-for-enterprise-ai/
