企业级AI信任危机:上下文鸿沟并非检索难题,而是治理挑战
本刊研究揭示,企业AI智能体正面临“上下文鸿沟”信任危机,近六成智能体曾因上下文不一致给出自信却错误的答案。这一核心问题并非单纯的检索量不足,而是对受治理、一致且具备访问权限的上下文管理能力的挑战。
本刊最新研究覆盖百余家企业,发现为AI智能体提供业务上下文的基础设施建设速度,已远超其所能获得的信任。检索增强生成(RAG)已成为获取上下文的默认方式,而领先模型服务商与云平台内置的检索工具,正悄然超越了曾定义这一类别的专业向量数据库。然而,多数企业却已遭遇智能体因上下文缺失或不一致而给出自信却错误的答案。一套受治理的语义层正浮出水面,被视为解决方案,但大部分仍在建设中;业界正趋向采用混合检索架构;尽管内置工具在实际应用中占据主导,仍有相当比例的企业表示倾向于保持最佳实践的独立工具。这一切导致了“上下文鸿沟”——智能体听起来权威可靠,但其赖以运行的基础却尚未完全获得所有者的信任。
本期研究深入探讨了企业级检索增强生成(RAG)及其上下文层:究竟是什么为AI智能体提供了业务上下文?企业运行着哪些检索系统?它们如何采购和衡量这些系统?架构的未来走向如何?以及,最关键的是,这些上下文在多大程度上已然失效?
核心发现便是“上下文鸿沟”——即企业智能体给出答案的自信程度,与其背后上下文的实际可靠性之间的差距。过半数(57%)的企业报告称,过去六个月内,其AI智能体曾给出自信但错误的答案,经追溯发现问题出在缺失或不一致的业务上下文上,其中超过半数表示这种情况不止发生一次。这并非边缘性故障:检索是38%企业主要上下文来源,远超其他任何方法,因此当检索内容不足或不一致时,由此产生的错误便会侵蚀智能体的权威性。解决这一问题的基础设施正在构建中——58%的企业已运行或正在建设受治理的语义层——但对大多数而言,它尚未投入生产。
市场底层正在以一种令人意外的方向整合。领先模型服务商的文件搜索功能(40%)和主流云服务商的AI搜索功能(38%)已超越所有专业的向量数据库,占据主导地位。企业预计,到2026年底,混合检索将占据主导(34%)。然而,仍有相当比例(36%)的企业表示倾向于保持最佳实践的独立工具,而非整合到模型服务商的内置上下文堆栈上,同时超过半数(57%)计划在一年内切换或增加提供商。意向与实际使用正在背道而驰——市场正在采购内置服务,却又坚持想要独立性。
研究方法论
本刊的最新研究聚焦于企业级检索增强生成(RAG)基础设施和上下文层——即为AI智能体提供信息的检索系统、语义层和上下文来源。本调查筛选了员工人数超过100人的组织(n=101);由于员工人数100人及以下的组织未提供任何回复,因此所有样本都符合资格。所有回复均来自2026年第二季度(6月)的单次调查波次,因此本报告采取横断面分析,不推断月度趋势。部分问题为多选题,因此其百分比总和可能超过100%。
按组织规模划分,样本集中在中型市场:员工人数251-1,000人(31%)和101-250人(31%)占主导,其上是1,001-5,000人(20%)、5,001-10,000人(12%)和10,001人以上(7%)。按角色划分,涵盖了经理(39%)、个人贡献者(27%)、C级高管(16%)以及副总裁和总监(14%);在采购权限方面,报告具有买家信誉,46%为最终决策者,另有26%为推荐者或影响者。技术/软件是最大的行业,占20%,其次是医疗保健/生命科学(11%),其他广泛分布于零售、交通、金融服务、制造和教育等行业。
本次调查的样本量为101位受访者,规模适中,应将其视为方向性信号而非精确测量;它是一个自选样本,并非概率样本。本报告最适合解读为那些积极部署检索增强生成(RAG)和上下文基础设施的组织的观点,而非大型运营商的看法。
发现一:自信而错误
超过半数企业将智能体错误追溯至不佳的上下文
我们询问了企业在过去六个月内,是否曾将智能体自信却错误的答案追溯至缺失或不一致的业务上下文。大多数企业都遇到过。
这是本报告中最具决定性的数字。超过半数(57%)的企业已经遭遇过AI智能体因不佳的上下文(错误的指标、过时的定义或缺失的文档)而给出自信但错误的答案,其中超过半数表示这种情况不止发生一次。仅有28%的企业报告未出现此类故障,而少数剩余企业要么未在企业数据上运行智能体,要么未密切追溯根本原因以了解情况。
这种故障模式具体且危险:模型并非明显幻觉,它之所以自信地犯错,是因为为其提供信息的上下文内容薄弱或不一致。本报告中的其他所有内容——企业检索什么、如何治理以及计划构建什么——都源于这一核心问题。
发现二:检索增强生成(RAG)是默认上下文来源
检索为更多智能体提供信息,超越其他任何方法
我们询问了企业的AI智能体主要使用何种方式来理解其数据。检索方式遥遥领先。
检索是企业上下文的支柱。对于38%的组织而言,通过文档或向量索引进行的检索增强生成(RAG)是智能体理解业务的主要方式——几乎是次之方法(受治理的语义层或本体论,21%)的两倍。混合方法(14%)、直接实时系统查询(10%)和长上下文加载(6%)构成了其余部分,仅有2%的企业让智能体仅依靠模型的通用知识运行。这种集中度在发现一的背景下显得尤为重要:由于大量企业上下文通过检索流动,检索的质量直接决定了答案的质量。当检索增强生成(RAG)成为默认来源时,薄弱的检索并非边缘情况——它已成为主要的故障界面。
在这些答案中,有一种方法因其缺席而引人注目:定制模型权重,亦称微调。所有主要的业务上下文来源都是在运行时注入的。我们最近一次对微调的直接测量来自4月至5月的调查波次(另一项调查,n=136),其中微调能力在模型选择的六个因素中排名末位,仅占5%——尽管该样本中仍有26%的企业认为微调和定制是他们预计会增长的投资。微调已退出主要的模型选择考量,上下文注入才是企业让智能体了解其业务的方式。
发现三:领先模型服务商和云平台内置检索功能已超越专业向量数据库
主流服务商的文件搜索和AI搜索功能领先于专用工具
我们询问了企业目前在生产环境中运行哪些检索系统。答案倾向于模型服务商和超大规模云服务商,而非专业提供商。
专业向量数据库不再是检索增强生成(RAG)堆栈的核心。领先模型服务商的文件搜索功能(40%)和主流云服务商的AI搜索功能(38%)占据领先地位——这些内置检索功能超越了所有专门构建的向量数据库。在专业提供商中,使用最多的是企业因其他原因已在运行的工具(如广泛采用的搜索与分析平台,20%)和开源嵌入式选项(如流行的开源嵌入式数据库,12%);而定义这一类别的纯粹向量数据库产品——包括特定向量数据库提供商——各自处于个位数到低两位数的使用率。值得注意的是,13%的企业表示他们尚未运行任何生产环境下的检索增强生成(RAG)。与并行基础设施浪潮中的平台趋势类似,企业正倾向于购买与其现有工具捆绑的检索功能。
这一发现的趋势在第二季度的两次调查波次中保持一致。在4月至5月的调查(n=161)中,模型服务商或云平台内置的检索功能同样在使用率上领先,而所有专业的向量数据库仍处于边缘地位——使用最多的独立向量数据库在该样本中仅达到8%——并且混合、多元化未来已是普遍共识(34%预计混合检索将占据主导,另有29%预计将根据用例采用多种架构)。两次调查波次,结果一致:定义“向量数据库”这一类别的产品正被企业已采购的平台所整合。
发现四:但企业表示希望保持最佳实践的独立工具
多数企业抵制整合到模型服务商的内置堆栈
我们询问了企业将如何应对模型服务商将其检索、记忆和编排功能捆绑到平台中的趋势。它们的意向与其当前的使用情况相悖。
这正是堆栈核心的张力所在。即使内置检索功能在实践中占据主导(发现三),仍有相当比例的企业(36%)表示,他们打算保持最佳实践的独立工具,而非整合到模型服务商的内置上下文堆栈上——这一比例远高于计划整合的企业(21%)。另有21%预计会采用混合模式,9%打算自行构建和拥有这一层。企业实际运行情况与其所声称意愿之间的差距是该类别的战略性问题:它们出于便利性而采用捆绑式检索,却又坚持要保持独立性。究竟是模型服务商捆绑的吸引力,还是对模块化控制的明确偏好会胜出,将比任何单一工具更能塑造检索市场。
发现五:混合检索是业界共识
纯向量检索已被视为不足
我们询问了企业预计哪种检索架构将在2026年底主导其生产环境的检索增强生成(RAG)系统。业界正在趋于一致——但仍有很大比例不确定。
架构正在趋于混合。三分之一(34%)的企业预计混合检索——即嵌入与重排和访问控制相结合——将主导其生产系统,这一比例是预计纯向量检索将占主导的企业(11%)的三倍。这是一个值得关注的信号:曾经开启这一类别的纯向量搜索方法,已被视为不足以独立存在,已被添加了重排以提高准确性、以及添加了访问控制以实现治理的管道所取代——正是访问控制的缺失导致了发现一中的故障。值得注意的是,第二大答案是不确定性:17%的企业表示不清楚,另有14%预计将完全超越专用向量层,转向工具优先或长上下文检索。共识并非单一工具,而是一个分层管道——它尚未完全成形。
发现六:受治理的上下文层正在建设中
多数企业正在运行或建设语义层——但投入生产的甚少
我们询问了企业是否使用受治理的语义或上下文层,以使智能体和商业智能对数据有共同的理解。多数企业正在这条路上,但真正到达终点的却不多。
上下文鸿沟的解决方案正在建设中。超过一半的企业(58%)要么在生产环境中运行受治理的语义层(25%),要么正在试点和建设中(34%),另有17%正在积极评估——这意味着四分之三的企业正以某种形式参与这一概念。但这种平衡很有说服力:正在建设中的多于已投入使用的,因此对大多数企业而言,能够防止发现一中“自信但错误”故障的共享、受治理的定义层,仍处于建设阶段。语义层是业界解决上下文不一致问题的答案;本次调查正值其建设中期,雄心远超实际生产。
发现七:采购看重摄入与简易性,监控关注正确性
选择偏向可操作性;监控偏向正确性和安全性
我们询问了企业在选择检索系统时最看重什么,以及系统运行后会跟踪哪些指标。两个答案都倾向于实用性。
企业在选择检索系统时看重可操作性。数据摄入的简易性(36%)、延迟和性能(32%)以及操作简便性(29%)是主要的评选标准——领先于检索准确性和访问控制(各占23%),而这两者正是与发现一中故障最直接相关的因素。一旦系统运行,重点便转向信任:最常跟踪的指标是响应正确性(42%)和安全与访问控制(38%),领先于延迟(28%)、操作稳定性(27%)和答案相关性(23%)。
对现有系统的满意度处于中等偏上,但并非热情洋溢——在五分制评分中,总体满意度平均为4.0,实施简易性和投资回报率均接近3.9。企业购买系统是为了其运行的便捷性,而监控它则是为了确保其值得信赖。
发现八:检索格局重组在即
多数企业计划更换提供商——专业向量数据库正获得更多关注
我们询问了企业是否计划更换或增加检索提供商,以及他们正在考虑哪些。正在考虑的范围与当前的堆栈有所不同。
检索堆栈尚未尘埃落定。虽然43%的企业没有更换计划,但略多于一半(57%)的企业打算在十二个月内切换或增加提供商,其中四分之一(26%)计划在未来三个月内进行。考察范围的差异则变得有趣:领先模型服务商和云平台内置检索功能仍主导企业评估(领先模型服务商22%,主流云服务商21%),但开源向量数据库专家超越了其当前的市场份额——特定开源向量数据库产品正在吸引比其现有使用率(分别为10%和6%)更高的切换兴趣(分别为14%和13%)。结合发现四来看,画面是一个正在变化的市场:企业目前运行着模型服务商内置的检索功能,但正在评估更广阔的领域,并表示希望保持选择的开放性。即将到来的重组将考验最佳实践的独立性意图能否经受住捆绑便利性的冲击。
核心洞察:上下文鸿沟并非检索数量问题,而是治理挑战
员工超过100人的组织正在以超出其信任保障的速度,将AI智能体接入其业务。检索已成为企业上下文的默认来源,并且越来越多地来自模型服务商和超大规模云服务商,而非专业的向量数据库。然而,大多数企业已经目睹智能体因上下文薄弱或不一致而给出自信但错误的答案。这种失败并非罕见,而是将听起来权威的智能体指向不可靠基础的可预测结果。
业界给出的解决方案——一个受治理的语义层、包含重排和访问控制的混合检索——正在建设中,但大多尚未投入生产。企业在模型服务商内置捆绑方案的便利性,以及保持最佳实践独立性的明确偏好之间徘徊。本次调查基于单次第二季度波次中101位受访者,结果应被视为方向性信号,且偏向中型市场——但方向清晰:上下文层是AI堆栈中下一个竞争激烈的领域,目前智能体正领先于它。上下文鸿沟并非检索量的问题,并非仅靠增加文档或扩大索引就能解决;它是一个关于受治理、一致且具备访问权限的上下文问题。对于后续的调查波次而言,一个悬而未决的问题是,企业能否在“自信但错误”的失败从实验室蔓延至关乎重要决策之前,完成这一层的建设。
本报告基于对101名符合资格的企业受访者(员工100人以上)的调查回复,数据来源于2026年第二季度(6月)的单次调查波次。鉴于样本量,结果应被视为方向性信号而非精确测量——这是一个自选样本,并非概率样本,且偏向中型市场。受访者包括经理、个人贡献者、副总裁/总监和C级高管,拥有较强的采购权限,行业涵盖技术、医疗保健、零售、交通、金融服务、制造和教育等。